
腾讯|优图实验室—原生多模态后训练技术研究实习
岗位职责
课题背景:
近来,业界大模型的发展已经从纯语言模型为重点变成以原生多模态模型为重点,从之前纯pretrain的scaling到pretrain+rl的scaling。 随着模型结构的原生、多个模态的融合、理解生成任务的统一,大模型的后训练也面临更大的挑战。本课题旨在探索原生多模态模型下后训练技术的演进策略,构建能够解决现实复杂场景问题的、具备持续学习能力的原生多模态模型。
课题挑战:
1、原生多模态深度推理能力: 如何设计类似于文本长COT的后训练策略,使模型能够自发产生带图/视频/音频的多模态、跨模态思考数据,提升模型跨模态深度推理能力;
2、原生多模态奖励系统:针对不同模态的输入输出、理解和生成任务,如何构建统一公平稳定的奖励系统
3、原生多模态强化学习算法:探索理解生成一体化的多任务统一的强化学习算法;提升超大规模RL训练的稳定性和效率;
4、原生多模态后训练范式:针对后训练中不同模态的输入输出场景、理解和生成任务的场景,系统性的探索SFT/OPD/RL等全流程训练范式;
具体工作:
你将参与到原生多模态基座模型的研发,包括但不限于:超高质量多模态对齐数据、推理数据构建、多模态奖励系统和强化学习算法的研究等。
任职要求
1、计算机科学、人工智能、视觉计算、自然语言处理等相关专业的博士;
2、深度理解多模态前沿进展,熟悉 ViT, Diffusion Models, Autoregressive Models 等技术路径,在 CVPR, ICLR, NeurIPS 等顶会有相关研究成果者优先;
3、具备极强的工程能力,精通 PyTorch 框架,熟悉分布式训练技术(如 DeepSpeed, Megatron-LM),熟悉PPO/GRPO等强化学习技术,有超大规模参数模型训练经验者优先;
4、熟练掌握 Python 编程,熟悉高性能算子开发或底层架构优化(如 CUDA 编程)者更佳;
5、对技术有强烈的好奇心,具备解决底层复杂系统问题的韧性与出色的团队协作能力。
腾讯招聘实习生:优图实验室—原生多模态后训练技术研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
