中国移动|算法开发岗(智能体与强化学习)-金种子(北京)

中国移动 · 数智事业部(九天公司|九天研究院) · 北京 · 更新时间:2026-09-03

岗位职责

1、负责大模型智能体能力建设,负责智能体轨迹数据与RL训练环境体系搭建,分析真实用户场景与任务特性,提取典型任务流程与交互规则,设计构建可复现的容器化、沙箱化任务镜像,探索可验证任务数据生成与自动化评测方法,搭建贴近真实场景的智能体训练与执行环境; 2、深耕大模型智能体与强化学习前沿算法创新,跟踪复现LLM Agent与RL前沿技术,研究PPO、GRPO等算法在大规模语言模型中的应用,探索RL scaling、多任务强化学习、Agentic RL、长时序推理、多步规划、工具调用等核心能力,优化训练稳定性、样本效率与计算效率; 3、研发长程智能体核心能力,设计并优化智能体记忆与检索体系,搭建短期工作记忆与长期外部记忆的分层架构,研究记忆写入、更新、遗忘、冲突消解、上下文压缩等技术,结合RAG、Agentic Retrieval实现智能体主动知识检索,降低长交互Token开销,提升多轮对话状态一致性; 4、聚焦Long Horizon长时序强化学习训练系统研发,攻克百轮级长交互场景下稀疏奖励、信用归因、目标漂移、错误累积等核心难题,结合Critic Model、过程奖励模型(PRM)与环境反馈机制设计有效奖励策略,探索长上下文强化学习、搜索规划融合、自我反思与多Agent协作等优化方案; 5、研究长上下文复杂推理与任务规划技术,实现复杂问题分解、多文档信息整合、长程任务动态规划与状态纠错,解决上下文干扰、关键信息遗漏、跨文档依赖等问题,结合微调、偏好优化与强化学习优化智能体决策与执行闭环; 6、建设智能体与强化学习评测体系,围绕前沿Benchmark与真实业务场景设计自动化评测流程,持续跟踪Agentic RL、长程决策、奖励建模等前沿技术,具备论文复现、Benchmark分析与工程落地优化能力。

任职要求

1、博士学历,计算机科学、人工智能、机器学习、自然语言处理、数学、自动化等相关专业,具备大模型、智能体、长上下文建模或强化学习相关研究与项目经历; 2、具备扎实的深度学习与NLP基础,深刻理解Transformer架构、注意力机制及大模型训练推理全流程,熟悉长上下文建模、长程依赖、位置外推、上下文干扰等核心技术难点; 3、熟练掌握Python、PyTorch,熟悉大模型后训练全流程,深入理解强化学习原理,熟悉PPO、GRPO等主流RL算法及其应用范式,熟悉VeRL、Slime、ROLL等RL训练框架,熟悉常见的分布式训练与推理加速工具; 4、具备完整智能体系统设计能力,熟练掌握Function Calling、Tool Use、ReAct、多步推理等核心能力,了解RAG、上下文压缩、智能体记忆检索、Agentic Retrieval、Critic Model、过程奖励建模等相关技术; 5、具备完善的数据治理与工程落地能力,可独立完成语料清洗、轨迹标注、数据集构建、实验验证与算法迭代,熟悉长时序信用分配、稀疏奖励优化、长程任务评测体系搭建,具备大规模强化学习管线搭建优化经验; 6、具备良好的科研探索与问题攻坚能力,有NeurIPS、ICML、ICLR、ACL、EMNLP、NAACL等顶会论文、ACM/ICPC等算法竞赛获奖、开源项目贡献或大模型科研项目经验者优先。

中国移动校园招聘:算法开发岗(智能体与强化学习)-金种子(北京)岗位来自中国移动招聘官网,具体内容以中国移动招聘官网为准。