腾讯|微信-多模态感知大模型实习

腾讯 · WXG · 工作地点:深圳总部北京 · 更新时间:2026-06-01

岗位职责

课题背景: 随着多模态大模型进入规模化应用阶段,产业侧对模型能力的要求正由“图文语义理解”升级为“细粒度感知与复杂场景解析”。相比通用多模态问答模型,真实业务场景更加关注目标定位、区域理解、属性识别、OCR、grounding及时序跟踪等能力。当前主流模型虽具备一定图文理解能力,但在精细定位、跨模态对齐、复杂场景泛化和部署效率方面仍存在明显不足,难以直接支撑真实业务需求。因此,亟需构建面向真实场景的多模态感知基础模型,打通从感知到理解的统一建模链路,形成兼具精度、效率与落地能力的新一代视觉感知底座。 课题挑战: 1、细粒度感知与统一建模难兼顾 检测、分割、OCR、grounding、时序跟踪等任务输出形式差异大,现有方法往往采用多头拼接式设计,难以形成统一的感知表征与任务范式。 2、跨模态对齐停留在粗粒度语义层 现有多模态模型更擅长全局语义匹配,但在区域级、实例级、像素级对齐上能力不足,难以支撑复杂视觉场景中的精确定位与细粒度理解。 3、复杂场景下感知鲁棒性不足 在密集目标、小目标、遮挡、长尾类别、文本密集区域及多目标交互场景中,模型容易出现漏检、误检、边界不准和关系理解错误等问题。 4、感知精度与推理效率难以平衡 多模态感知任务普遍需要高分辨率输入、多尺度建模与跨模态交互,带来显著的计算与部署开销,难以满足业务侧对时延与成本的要求。 具体工作: 聚焦多模态感知基础模型构建,围绕统一感知表征、跨模态精细对齐与高效部署展开系统研究,全链路参与模型研发。

任职要求

1、包含但不限于计算机、信息工程、模式识别、人工智能、自动化、软件工程、电子工程、统计学、应用数学、物理学/量子计算、信息安全、信号与信息处理等相关专业的优秀硕士和博士; 2、在CVPR、ICCV、ECCV、NeurIPS、 ICLR等顶会发表一作论文 3、有丰富的大模型方向项目或实习经验 【加分项或注意事项】 此课题同时招聘应届实习生和低年级实习生。

腾讯招聘实习生:微信-多模态感知大模型岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。