
腾讯|混元多模态-全模态音视频理解研究实习
岗位职责
课题背景:
随着多模态大模型的发展,内容理解任务正由单一模态建模逐步演进为对视频、语音、背景声及上下文等多源异构信息的统一建模。面向真实复杂场景,构建具备跨模态感知、对齐、推理与表达能力的全模态音视频理解框架,已成为多模态智能领域的重要研究方向。
课题挑战:
本课题的主要挑战在于构建面向全模态音视频理解的高质量数据生产与验证链路,涵盖多模态信息对齐、全模态 caption 构造、Query-Answer 数据设计,以及数据有效性评估。同时,还需解决多模态长时序依赖建模、跨模态语义融合及复杂场景泛化等关键问题,以提升模型对复杂音视频内容的综合理解能力。
具体工作:
参与全模态 caption 与 Query-Answer 数据构建,设计并完善数据生产与验证链路,开展全模态理解模型的预训练与后训练,并支持模型评测与实验分析。
任职要求
学历与专业:
来自计算机科学、人工智能、电子信息、信号处理等相关专业的博士/硕士同学,具备扎实的机器学习理论基础,有多模态方向研究经验者优先。
技能要求:
精通PyTorch框架与Python编程;深度掌握Transformer架构及主流MLLM(如LLaVA,Qwen-Audio,Qwen-Omni)原理;熟悉PPO、GRPO等强化学习算法及DeepSpeed/Megatron分布式训练工具。
软性素质:
具备较强的问题分解与独立研究能力;能在模糊问题定义上给出清晰的拆解思路和方法。
【加分项或注意事项】
此课题同时招聘应届实习生和低年级实习生。
腾讯招聘实习生:混元多模态-全模态音视频理解研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
