中国电信|强化学习系统研发工程师

中国电信 · 中国电信人工智能研究院 · 上海 · 更新时间:2026-08-21

岗位职责

1. 负责维护和开发内部强化学习后训练(Post-training)框架,支持 Reasoning、Agentic 等方向的文本及多模态 RL 训练; 2. 探索算法、框架、硬件的协同设计,提升大规模 RL 训练的稳定性和效率; 3. 解决大模型 RL 中的实际工程痛点,如训推不一致、Rollout 阶段的长尾延迟等问题。 4. 解决Agentic RL中的痛点问题,如Agent trajectory 收集、回放,Agent 长周期任务的上下文压缩与摘要等。

任职要求

1. 扎实的工程算法基础,熟练掌握 PyTorch 及性能调试工具; 2. 深入了解 Megatron、DeepSpeed、SGLang、vLLM 等主流训推引擎; 3. 具备扎实的 RL 算法基础(PPO/DPO/GRPO等)与实际大规模训练经验; 4. 加分项:为 Slime、VeRL、OpenRLHF 等开源框架提交过重要 PR;或在 RL 稳定性、环境工程等方向发表过顶会论文。

中国电信校园招聘:强化学习系统研发工程师岗位来自中国电信招聘官网,具体内容以中国电信招聘官网为准。