腾讯|ARC Lab-感知与理解模型研究实习

腾讯 · IEG · 工作地点:北京 · 更新时间:2026-06-01

岗位职责

课题背景: 感知和理解世界是多模态模型的根本,不仅本身有着巨大的价值,也是多模态生成模型的起点。本课题旨在开发多模态模型,实现对场景几何结构、语义信息及动态变化的高精度、多颗粒度理解与状态估计,在推动长视频,长剧理解的基础上推动世界模型和可控、交互视频生成模型模型的发展。 课题挑战: 1、多粒度时空表征建模: 如何在处理长视频数据时,同时兼顾宏观语义逻辑与微观几何结构的精确捕捉,实现跨时空的特征对齐。 2、长序列状态演化的连贯性: 针对数十分钟乃至数小时的视频,如何设计高效的记忆机制与推理架构,确保模型对场景动态变化的长期追踪与理解。 3、物理常识与因果推理融合: 如何将物理定律(如重力、遮挡、碰撞)融入理解框架,使模型不仅能“看到”画面,更能理解动作背后的因果关系。 4、高质量理解-生成闭环数据构建: 如何自动化合成包含高精度标注的长视频理解数据,用于支撑世界模型的联合预训练与强化学习优化。 具体工作: 参与本课题的同学将主要负责: 1、研发视频时空表征建模方法; 2、构建支持超长时序(如长剧、电影)的深层语义建模与关系推理框架; 3、建立模型对视频中物体状态迁移及动态演化的估计能力;

任职要求

1、相关专业(计算机、人工智能等)在读博士; 2、卓越的研究背景,在顶级学术会议或期刊(如CVPR,ICCV,NeurIPS,ICML,ICLR,SIGGRAPH等)发表过2篇以上高水平论文; 3、在开源社区有显著贡献,核心项目在GitHub上获得累计100+stars。 【加分项或注意事项】 此课题同时招聘应届实习生和低年级实习生。

腾讯招聘实习生:ARC Lab-感知与理解模型研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。