
商汤|大模型训练实习生
岗位职责
1、参与多模态理解生成一体模型的 Pre-training / SFT / Post-training 训练,研究数据配比、训练策略、Loss 与采样策略对模型能力的影响;
2、参与多模态模型强化学习训练,实践 PPO / GRPO / DPO 等 RL / Preference Learning 方法,设计 RL Training Pipeline,分析并解决 Reward Hacking、训练不稳定、策略退化等问题;
3、负责 / 参与 Reward Model 的设计与训练,针对图文一致性、视觉质量、信息准确性、指令遵循等维度构建 Reward
4、探索 VLM-as-a-Judge 与自动化 Reward;
5、构建 RL / Reward 数据闭环,参与 Badcase 分析、实验设计与模型迭代;
6、跟踪前沿研究,复现论文方法并结合实际模型进行改进。
任职要求
1、扎实的机器学习 / 深度学习基础
2、较强的 Coding 能力
3、较强的实验设计与问题分析能力
4、对大模型训练 / 强化学习有强烈兴趣
5、实习时间稳定
加分项:
有 LLM / VLM / MLLM 训练经验,或相关方向 paper / 开源项目;
有 SFT / RLHF / RLAIF / DPO / PPO / GRPO 实践经验;
有 Reward Model / Preference Model 训练或 Reward Engineering 经验;
有 VLM-as-a-Judge、图文生成、视觉推理相关项目经验;
熟悉 Transformers、DeepSpeed、FSDP、Megatron、vLLM,有多 GPU 分布式训练经验;
数学基础好,对优化、强化学习理论感兴趣;
能快速阅读英文论文。
商汤招聘实习生:大模型训练实习生岗位来自商汤招聘官网,具体内容以商汤招聘官网为准。
