中国电信|【2027校招】语义大模型强化学习算法工程师

中国电信 · 中电信人工智能科技(北京)有限公司 · 北京 · 更新时间:2026-08-21

岗位职责

1. 参与Agentic RL训练工作,包括复杂 Agent 任务中的策略优化、上下文管理、工具调用、多步规划等,与 Infra 团队协同优化训练与推理效率,提升大规模训练稳定性与资源利用率。 2. 参与Reasoning RL训练工作,研究基于 RLVR 的强化学习范式;提升模型复杂推理能力,探索思维链长度控制等方向,提升单位 token 的智能效率。 3. 参与General RL训练工作,研究通用强化学习方向,包括 Generative Reward Model、Rubric Reward Model 等奖励机制;探索可扩展、可泛化的奖励建模与强化学习训练方法。 4. 参与Mixed Training工作,研究混合训练范式,包括 On-policy Distillation 等前沿技术;探索 SFT、RL、OPD 等多阶段训练策略的协同优化。

任职要求

1. 硕士及以上学历,计算机、电子信息、人工智能等相关专业,博士优先; 2. 熟悉 Python,具备较强的工程实现与问题定位能力,熟练使用 Linux 开发环境; 3. 熟悉 Claude Code、OpenClaw 等主流 Agent 工具,了解 VeRL、Slime 等强化学习训练框架; 4. 对大模型强化学习、Reasoning、Agent 或 Reward Model 方向有深入兴趣与实践经验; 5. 有以下经历者优先:在大模型、强化学习等领域有高质量论文、技术博客或开源项目;有大尺寸模型训练经验或大规模 GPU 集群使用经验。

中国电信校园招聘:【2027校招】语义大模型强化学习算法工程师岗位来自中国电信招聘官网,具体内容以中国电信招聘官网为准。