
蔚来|强化学习实习生(认知计算团队)
岗位职责
负责强化学习算法的研究与开发,包括但不限于PPO、DPO、GRPO、DAPO等算法;
构建仿真环境,设计奖励机制,训练并调优智能体策略;
与产品和工程团队紧密合作,将RL算法落地到实际业务场景;
跟踪学术界和工业界最新RL研究进展,持续优化模型性能与训练效率;
撰写技术文档,参与代码评审,推动团队技术能力提升。
任职要求
计算机、人工智能、自动化、数学等相关专业硕士及以上学历;
扎实的强化学习理论基础,熟悉MDP、Bellman方程、策略梯度、值函数逼近等核心概念;
熟练掌握Python,熟悉PyTorch/TensorFlow等深度学习框架,具备独立实现RL算法的能力;
有强化学习项目经验(如游戏AI、推荐系统、机器人控制、仿真环境训练等)者优先;
具备良好的问题分析能力、团队协作能力和技术沟通能力。
加分项:
在NeurIPS、ICML、ICLR、AAAI等顶会发表过RL相关论文;
蔚来招聘实习生:强化学习实习生(认知计算团队)岗位来自蔚来招聘官网,具体内容以蔚来招聘官网为准。
