
腾讯|多模态模型架构和训练方案探索实习
岗位职责
课题背景:
随着人工智能向物理世界与通用智能迈进,单一文本模态的语言模型已难以满足复杂的真实世界交互需求,研究前沿正全面转向涵盖文本、视觉、语音及动作的原生多模态与端到端融合架构。尽管当前模型在基础图文交互上表现尚可,但在端到端语音对话、长时序多模态时空推理以及具身智能的物理规律理解上,仍面临模态间特征冲突、级联误差及训练效率低下等瓶颈。本课题聚焦于突破多模态架构壁垒,探索以原生全模态融合、语音-视觉-文本联合训练及跨模态强化学习为核心的训练方案与评测体系。
课题挑战:
1、端到端原生融合与跨模态对齐: 如何打破传统 “语音识别 - 文本大模型 - 语音合成” 的级联范式,设计低 “对齐税” 的统一原生架构(如连续 / 离散混合 Tokenizer),实现图、文、音、控等 Any-to-Any 的高效映射,并精准保留语音中的情感、韵律等非文本特征;
2、复杂时空交互与跨模态泛化: 在包含实时动态语音指令与长周期视觉输入的复杂场景中,如何克服模态间信息异步与逻辑断裂问题,并通过多模态强化学习机制提升模型在真实环境中的全双工拟人化交互与精准指令遵循能力。
具体工作:
参与新一代原生多模态模型(涵盖图/文/音/视频/Action)的基础架构设计与统一对齐方案研究;主导或参与大规模跨模态(重点关注端到端语音交互、视觉理解等)预训练与 SFT 数据构建闭环;探索多模态强化学习策略的调优;推动前沿多模态 Agent 系统的工程落地与系统性评测。
任职要求
1、包含但不限于计算机、人工智能、信息工程、计算机视觉、自然语言处理、应用数学等专业的博士和优秀硕士;
2、熟练掌握多模态大模型的基本原理与架构,熟悉视觉预训练、跨模态对齐、RLHF等核心方法,具备大模型训练/微调的实践经验;
3、熟悉PyTorch、DeepSpeed、Hugging Face Transformers等主流深度学习框架,掌握Python编程,具备较强的实验设计与消融分析能力;
4、加分项:在计算机视觉、多模态学习等领域发表过顶会论文(如CVPR、NeurIPS、ICLR、ECCV等);有多模态开源项目维护经验;有游戏/内容领域多模态应用经历。
【加分项或注意事项】
此课题同时招聘应届实习生和低年级实习生。
腾讯招聘实习生:多模态模型架构和训练方案探索岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
