商汤|大模型训练实习生

商汤 · 深圳 · 更新时间:2026-09-03

岗位职责

1、参与多模态理解生成一体模型的 Pre-training / SFT / Post-training 训练,研究数据配比、训练策略、Loss 与采样策略对模型能力的影响; 2、参与多模态模型强化学习训练,实践 PPO / GRPO / DPO 等 RL / Preference Learning 方法,设计 RL Training Pipeline,分析并解决 Reward Hacking、训练不稳定、策略退化等问题; 3、负责 / 参与 Reward Model 的设计与训练,针对图文一致性、视觉质量、信息准确性、指令遵循等维度构建 Reward 4、探索 VLM-as-a-Judge 与自动化 Reward; 5、构建 RL / Reward 数据闭环,参与 Badcase 分析、实验设计与模型迭代; 6、跟踪前沿研究,复现论文方法并结合实际模型进行改进。

任职要求

1、扎实的机器学习 / 深度学习基础 2、较强的 Coding 能力 3、较强的实验设计与问题分析能力 4、对大模型训练 / 强化学习有强烈兴趣 5、实习时间稳定 加分项: 有 LLM / VLM / MLLM 训练经验,或相关方向 paper / 开源项目; 有 SFT / RLHF / RLAIF / DPO / PPO / GRPO 实践经验; 有 Reward Model / Preference Model 训练或 Reward Engineering 经验; 有 VLM-as-a-Judge、图文生成、视觉推理相关项目经验; 熟悉 Transformers、DeepSpeed、FSDP、Megatron、vLLM,有多 GPU 分布式训练经验; 数学基础好,对优化、强化学习理论感兴趣; 能快速阅读英文论文。

商汤招聘实习生:大模型训练实习生岗位来自商汤招聘官网,具体内容以商汤招聘官网为准。