蔚来|大规模仿真强化学习实习生

蔚来 · 数字技术 - 算法 · 北京 · 更新时间:2026-07-06

岗位职责

参与大规模自博弈强化学习训练实验,设计和构建大规模、高吞吐量的批处理仿真器,十亿级仿真训练吞吐的驾驶经验生成 ;并改进 PPO 等高效的在策略(On-Policy)强化学习算法进行大规模训练 。 辅助算法的鲁棒性与泛化性验证。 参与攻坚仿真到现实的迁移 (Sim2Real),参与研究和评估策略的Sim2Real迁移性能,探索域随机化(Domain Randomization)、系统辨识(System ID)等技术,以提升策略对真实世界变化的适应能力。协助团队将训练好的策略部署到真实世界的车辆平台上进行验证。

任职要求

(必要条件) 教育背景: 计算机科学、人工智能、机器人学或相关领域的在读27届及之后毕业的博士/硕士研究生/优秀本科生。 对以下至少两个领域有扎实的知识基础和相关的项目/研究经验: 强化学习: 熟悉多智能体RL、自博弈、PPO、SAC等主流算法。 生成式模型: 熟悉 Diffusion 模型、GANs 等,并有相关实践经验。 Sim2Real: 对仿真到现实的迁移问题有了解或实践经验。 编程与系统能力: 精通 Python 和 PyTorch/Jax,具备训练和调试复杂强化学习算法的能力。 拥有构建或使用高性能、批处理仿真环境(如 Isaac Gym/Lab)的经验 。 具备优秀的系统设计和性能优化能力,熟悉 GPU 编程者优先。 算法知识: 精通 PPO 等主流深度强化学习算法,并理解其在大型分布式系统中的应用 。 加分项(优先条件) 对 GIGAFLOW、AlphaGo 等大规模自博弈领域的里程碑式研究有深入理解者是我们的首选。 在 NeurIPS, ICML, ICLR, CoRL, ICRA 等顶级会议上发表过相关领域论文者。 具备强大的 C/C++ 技能,能够将性能关键的仿真部分从 Python 移植到 C/C++ 以追求极致效率。 有在真实机器人或智能辅助驾驶系统上部署和迁移(Sim-to-Real)强化学习策略的经验 。

蔚来招聘实习生:大规模仿真强化学习实习生岗位来自蔚来招聘官网,具体内容以蔚来招聘官网为准。