
中国电信|【2027校招】语义大模型强化学习算法工程师
岗位职责
1. 参与Agentic RL训练工作,包括复杂 Agent 任务中的策略优化、上下文管理、工具调用、多步规划等,与 Infra 团队协同优化训练与推理效率,提升大规模训练稳定性与资源利用率。
2. 参与Reasoning RL训练工作,研究基于 RLVR 的强化学习范式;提升模型复杂推理能力,探索思维链长度控制等方向,提升单位 token 的智能效率。
3. 参与General RL训练工作,研究通用强化学习方向,包括 Generative Reward Model、Rubric Reward Model 等奖励机制;探索可扩展、可泛化的奖励建模与强化学习训练方法。
4. 参与Mixed Training工作,研究混合训练范式,包括 On-policy Distillation 等前沿技术;探索 SFT、RL、OPD 等多阶段训练策略的协同优化。
任职要求
1. 硕士及以上学历,计算机、电子信息、人工智能等相关专业,博士优先;
2. 熟悉 Python,具备较强的工程实现与问题定位能力,熟练使用 Linux 开发环境;
3. 熟悉 Claude Code、OpenClaw 等主流 Agent 工具,了解 VeRL、Slime 等强化学习训练框架;
4. 对大模型强化学习、Reasoning、Agent 或 Reward Model 方向有深入兴趣与实践经验;
5. 有以下经历者优先:在大模型、强化学习等领域有高质量论文、技术博客或开源项目;有大尺寸模型训练经验或大规模 GPU 集群使用经验。
中国电信校园招聘:【2027校招】语义大模型强化学习算法工程师岗位来自中国电信招聘官网,具体内容以中国电信招聘官网为准。
