蔚来|强化学习实习生(认知计算团队)

蔚来 · 数字技术 - 算法 · 北京 · 更新时间:2026-07-06

岗位职责

负责强化学习算法的研究与开发,包括但不限于PPO、DPO、GRPO、DAPO等算法; 构建仿真环境,设计奖励机制,训练并调优智能体策略; 与产品和工程团队紧密合作,将RL算法落地到实际业务场景; 跟踪学术界和工业界最新RL研究进展,持续优化模型性能与训练效率; 撰写技术文档,参与代码评审,推动团队技术能力提升。

任职要求

计算机、人工智能、自动化、数学等相关专业硕士及以上学历; 扎实的强化学习理论基础,熟悉MDP、Bellman方程、策略梯度、值函数逼近等核心概念; 熟练掌握Python,熟悉PyTorch/TensorFlow等深度学习框架,具备独立实现RL算法的能力; 有强化学习项目经验(如游戏AI、推荐系统、机器人控制、仿真环境训练等)者优先; 具备良好的问题分析能力、团队协作能力和技术沟通能力。 加分项: 在NeurIPS、ICML、ICLR、AAAI等顶会发表过RL相关论文;

蔚来招聘实习生:强化学习实习生(认知计算团队)岗位来自蔚来招聘官网,具体内容以蔚来招聘官网为准。