shopee|【实习】LLM-大模型算法实习生RL-SH

shopee · 上海 · 更新时间:2026-07-28

岗位职责

团队介绍: Shopee 大模型团队致力于通用大语言模型(LLM)的训练与能力突破,聚焦强化学习、后训练(Post-training)与对齐等核心方向,追求模型推理、对齐与泛化能力的上限。在这里,你将依托大规模算力与海量数据,深耕 RL / RLHF / RL Infra 前沿算法与系统的研究与工程落地,与世界级团队一起推动下一代大模型的研究与突破。 岗位职责: 1. 参与大模型的强化学习训练,包括 RLHF、奖励模型(Reward Model)设计、偏好对齐与前沿 RL 算法的优化与实战落地。 2. 研究与改进强化学习核心算法,包括策略优化(GRPO / GSPO 等前沿算法)、奖励建模、采样与探索策略、训练稳定性与收敛性优化,提升大模型在复杂任务上的推理与对齐能力。 3. 推理 RL(reasoning):参与 o1 / R1 / Qwen 这类长思维链(long CoT)推理的 RL 训练,探索 test-time scaling、过程奖励等提升模型复杂推理能力的方法。 4. Agentic RL:研究多轮工具调用、智能体(Agent)RL 训练与多智能体协作等方向,提升模型在交互式与长程任务中的决策能力。 5. 参与 RL 训练框架与基础设施(RL Infra)建设,包括分布式训练、异步训练(async RL)、Rollout / 采样加速、训练-推理一体化、奖励服务与数据流水线的设计与性能优化,支撑大规模 RL 训练高效稳定运行。 6. 评测体系:为 RL 训练搭建 eval / benchmark,量化评估模型能力并驱动算法迭代。 ​ 岗位要求: 1. 计算机、电子信息、人工智能、自动化、数学或相关专业在读本科生 / 硕士 / 博士。 2. 扎实的代码能力与数据结构、基础算法功底,熟练掌握 Python(C/C++ 优先),熟练使用 PyTorch。 3. 熟悉机器学习与大模型基础原理,了解前沿强化学习算法(如 GRPO、GSPO 等),有 RLHF / RLVR / 大模型预训练 / 微调 / 知识蒸馏 / Agent 搭建经验者优先。 4. 出色的问题分析与解决能力,能独立攻克复杂技术问题,并具备良好的团队协作意识。​

任职要求

- 在 NeurIPS、ICML、ICLR、ACL、EMNLP、KDD、SIGIR 等顶会顶刊以一作发表过论文。 - 在 ACM/ICPC、Kaggle、Top Coder 等竞赛中有优异表现或获奖经历。

shopee招聘实习生:【实习】LLM-大模型算法实习生RL-SH岗位来自shopee招聘官网,具体内容以shopee招聘官网为准。