阿里巴巴|日常实习生-大模型算法(Agentic RL / Reward 方向)-Qwen基础模型

阿里巴巴 · Token Foundry · 北京/杭州/上海 · 更新时间:2026-08-03

岗位职责

你将加入 Qwen 团队,深度参与大模型在 Agent 与 Coding 场景下的前沿算法研究。核心方向是构建支撑大规模 Agentic RL 训练的奖励信号体系,提升模型的对齐质量与 RL 训练上限。具体包括:1. Coding Reward System:参与面向 Code Agent 的 Reward System 研发,探索 Outcome 与 Process Level 的自动化 Rewarding 机制,助力解决长程 Coding Trajectory 下的 Credit Assignment 与 Reward 稀疏性问题。2. Agentic User Experience Reward:参与 Agent 任务的用户体验建模与 Reward 优化研究,协助探索 User Reward Modeling,为弥合 Benchmark 指标与用户实际体验之间的鸿沟提供数据与算法支持。3. Reward 评估与数据迭代:以 Reward 信号为核心,参与数据筛选、难例挖掘与合成迭代实验。你将获得:1. 顶级算力资源与工程基础设施,直接参与 Qwen 基座模型核心训练流程。2. 资深算法工程师带教,深入 Agentic RL 与 Reward System 最前沿方向。3. 实习期间的工作成果有机会落地到 Qwen 正式版本。

任职要求

1. 学历:计算机、人工智能、数学等相关专业本科及以上在读。2. 编程基础:精通 Python,熟练使用 PyTorch;具备扎实的机器学习与深度学习基础。3. LLM 认知:对大语言模型的基本原理有一定了解,使用过或过主流 LLM。4. RL 兴趣:对强化学习与大模型对齐有浓厚兴趣,了解 PPO / GRPO 等基本流程。加分项(非硬性要求,有以下任一经历优先):1. 有 Agent 框架使用经验(如 LangChain、LangGraph 等)或 Coding Agent 相关项目经验。2. 做过 RL 相关课程项目、论文复现,或参与过 Reward Shaping / Credit Assignment 方向的探索。3. 有 Kaggle 等竞赛经历,或在顶会发表过相关论文。4. 有开源项目贡献经历。

阿里巴巴招聘实习生:日常实习生-大模型算法(Agentic RL / Reward 方向)-Qwen基础模型岗位来自阿里巴巴招聘官网,具体内容以阿里巴巴招聘官网为准。