强化学习算法工程师
岗位职责
- 1. 研究并落地 PPO、GRPO 等强化学习与对齐算法,服务于大模型、多模态模型或 Agent 的后训练。
- 2. 设计训练目标、奖励机制、数据策略和评测方案,提升模型长思考、通用推理和 Agent 能力。
- 3. 优化强化学习训练框架和分布式训练链路,提升训练吞吐、稳定性与资源利用率。
- 4. 跟踪学术与工业前沿,针对实际训练问题完成算法分析、实验验证和工程改进。
任职要求
- 1. 计算机科学、人工智能、机器学习、数学、统计学或相关专业硕士及以上学历。
- 2. 熟练掌握强化学习经典算法,并具备实际项目经验。
- 3. 熟悉 PyTorch 或 TensorFlow,以及 verl、OpenRLHF、TRL、NeMo-Aligner 等强化学习训练框架中的至少一种。
- 4. 了解 DeepSpeed、FSDP、Megatron 等大规模分布式训练技术。
- 5. 具备扎实的 Python 编程、数据结构和算法基础。
- 6. 具备较强的学习能力、实验分析能力和复杂问题解决能力。
简历投递邮箱HR@skyengen.com
