
腾讯|混元多模态-多模态强化学习研究实习
岗位职责
课题背景:
近年来,多模态模型快速发展,包括生成模型(Diffusion Models)和理解模型(VLMs),但如何通过强化学习(RL)实现高质量后训练(post-training)来提升模型能力仍是开放问题。本课题将探索面向多模态生成与理解模型的强化学习训练框架,包括生成模型(文生图/视频)与视觉语言理解模型的RL后训练方法,并构建可扩展的RL Infra与Reward系统,以提升模型生成质量、推理效率与任务泛化能力。
课题挑战:
1、多模态RL训练框架搭建:如何构建可扩展的RL Infra,统一训练引擎、推理引擎与reward server,支持生成模型与VLM的高效后训练;
2、生成模型RL算法研究:设计适用于diffusion/生成模型的RL算法,例如dense reward、multi-reward优化及off-policy稳定训练;
3、高效生成与推理优化:探索Sparse/Linear Attention、Quantization、feature cache等技术以加速图像/视频生成;
4、生成蒸馏与RL结合:研究diffusion step reduction与distillation算法,并与RL训练流程融合;
5、多任务reward系统构建:设计reward hub与pipeline,为不同任务构建高质量reward信号。
具体工作:
参与多模态强化学习研究,包括RL Infra搭建、生成模型RL算法设计、推理加速与蒸馏方法研究,以及多任务reward系统构建与实验验证。
任职要求
1、计算机相关专业的博士、硕士、以及特别优秀的高年级本科生;
2、工程代码能力强或理论功底扎实;
3、发表过一作顶会论文,包括ICML/NeurIPS/ICLR、CVPR/ICCV/ECCV。
加分项:
1、有diffusionmodels(image/videogeneration)相关工作发表,并具备一定的大规模训练经验;
2、有RLinfra相关工程搭建经验,熟悉常用的trainingengine(FSDP/Megatron)和inferenceengine(vllm/SGLang),并对生成模型有一定的了解;
3、有VLMagent/tooluse、rewardserver相关工程搭建经验。
【加分项或注意事项】
此课题同时招聘应届实习生和低年级实习生。
腾讯招聘实习生:混元多模态-多模态强化学习研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
