腾讯|混元多模态-全模态Reasoning Model研究实习

腾讯 · TEG · 工作地点:北京 · 更新时间:2026-06-01

岗位职责

课题背景: 随着多模态大模型能力持续提升,研究重点正由感知与理解逐步拓展至复杂推理。面向视觉、音频、音视频等多模态场景,构建具备长思维链推理能力的全模态 Reasoning Model,使模型能够在推理过程中持续利用多模态信息完成分析、判断与决策,已成为多模态智能的重要研究方向。 课题挑战: 本课题的主要挑战在于,如何在长思维链推理过程中保持对多模态输入的持续关注与有效利用,避免模型随推理链条加深而逐渐脱离原始视觉、音频或音视频证据,进而产生事实性偏差;同时,如何在思维链中有效引入多模态信息,构建“Think with Multimodal”的推理范式,使模型能够将跨模态感知信息与中间推理过程有机结合。 具体工作: 参与全模态长思维链推理数据构建,开展后训练数据设计,研究 Think with Multimodal 的后训练方法与流程,并完成实验评测与结果分析。

任职要求

学历与专业: 来自计算机科学、人工智能、电子信息、信号处理等相关专业的博士/硕士同学,具备扎实的机器学习理论基础,有多模态方向研究经验者优先。 技能要求: 精通PyTorch框架与Python编程;深度掌握Transformer架构及主流MLLM(如LLaVA,Qwen-Audio,Qwen-Omni)原理;熟悉PPO、GRPO等强化学习算法及DeepSpeed/Megatron分布式训练工具。 软性素质: 具备较强的问题分解与独立研究能力;能在模糊问题定义上给出清晰的拆解思路和方法。 【加分项或注意事项】 此课题同时招聘应届实习生和低年级实习生。

腾讯招聘实习生:混元多模态-全模态Reasoning Model研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。