研发上海

强化学习算法工程师

岗位职责

  • 1. 研究并落地 PPO、GRPO 等强化学习与对齐算法,服务于大模型、多模态模型或 Agent 的后训练。
  • 2. 设计训练目标、奖励机制、数据策略和评测方案,提升模型长思考、通用推理和 Agent 能力。
  • 3. 优化强化学习训练框架和分布式训练链路,提升训练吞吐、稳定性与资源利用率。
  • 4. 跟踪学术与工业前沿,针对实际训练问题完成算法分析、实验验证和工程改进。

任职要求

  • 1. 计算机科学、人工智能、机器学习、数学、统计学或相关专业硕士及以上学历。
  • 2. 熟练掌握强化学习经典算法,并具备实际项目经验。
  • 3. 熟悉 PyTorch 或 TensorFlow,以及 verl、OpenRLHF、TRL、NeMo-Aligner 等强化学习训练框架中的至少一种。
  • 4. 了解 DeepSpeed、FSDP、Megatron 等大规模分布式训练技术。
  • 5. 具备扎实的 Python 编程、数据结构和算法基础。
  • 6. 具备较强的学习能力、实验分析能力和复杂问题解决能力。

简历投递邮箱HR@skyengen.com

← 在招岗位