腾讯|混元多模态-图音视频理解技术研究实习

腾讯 · TEG · 工作地点:深圳总部 · 更新时间:2026-06-01

岗位职责

课题背景: 多模态大模型正向着原生图音视频融合方向演进。本课题旨在提升腾讯混元大模型对复杂视频、长音视频、复杂图片、多图以及图文交错等场景的深度理解能力,为下一代原生多模态大模型奠定算法基础。 课题挑战: 1、跨模态对齐与联合建模:高分辨率高帧率视频、音频、文本的细粒度跨模态对齐与联合建模; 2、幻觉控制与长上下文建模:在超长视频或音频流中保持理解的准确性,降低模型幻觉,突破现有架构的上下文长度瓶颈; 3、Agentic探索:原生多模态单模型存在先天短板,通过Agentic弥补短板实现综合提升; 4、理解生成一体化下的理解任务,探索生成如何帮助理解。 具体工作: 面向生图生视频场景,研究如何提升多模态大模型的图音视频的理解能力,为图音视频提供全面准确的caption描述,工作包括后训练、强化、架构设计优化、数据管线搭建等。

任职要求

学历和专业要求: 来自计算机、人工智能、自动化等相关专业的博士/优秀硕士同学。 技术技能要求:扎实的深度学习基础,熟练掌握PyTorch、transformers、verl、Megatron、ms-swift等主流框架;熟悉主流多模态大模型的结构与预训练后训练方法,有相关实践经验和相关top论文。 【加分项或注意事项】 此课题同时招聘应届实习生和低年级实习生。

腾讯招聘实习生:混元多模态-图音视频理解技术研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。