腾讯|混元多模态-视觉编码器技术研究实习

腾讯 · TEG · 工作地点:深圳总部 · 更新时间:2026-06-01

岗位职责

课题背景: 视觉编码器作为多模态模型的核心基础组件,直接决定了生成质量与模态融合效率。但当前视觉编码器仍存在诸多局限:难以兼顾细粒度视觉特征提取与模型训练效率,跨模态语义对齐精度不足等。视觉编码器的性能升级的突破,将直接提升混元多模态模型的核心竞争力,相关核心技术亟需深入探索与攻克。 课题挑战: 当前多模态大模型视觉编码器的技术研发仍面临诸多亟待突破的难题,具体包括: 1、如何设计高效的视觉编码器架构,在保证高频信息保持能力的前提下,同时兼顾生成模型训练效率,实现两者的平衡; 2、如何优化视觉编码器的跨模态语义对齐能力,让视觉特征与文本、语音等模态特征实现更精准的映射,提升多模态生成的一致性; 3、如何探索适配新一代原生多模态架构的视觉编码器方案,支持视觉理解与生成的统一表征。 具体工作: 将参与上述课题的前沿学术研究,并且深度参与混元多模态基模视觉编码器的版本迭代与性能优化,全程参与工业级多模态大模型核心组件从研发、调试到落地应用的完整流程。

任职要求

学历和专业要求: 来自计算机、人工智能、自动化等相关专业的优秀博士/硕士。 技术技能要求:熟悉深度学习,有扎实的深度学习实践基础;熟练掌握视觉编码器技术、图像&视频生成模型原理。并有相关实践经验和相关顶会论文发表;代码能力强,熟练掌握PyTorch。 【加分项或注意事项】 此课题同时招聘应届实习生和低年级实习生。

腾讯招聘实习生:混元多模态-视觉编码器技术研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。