
腾讯|ARC Lab-感知与理解模型研究实习
岗位职责
课题背景:
感知和理解世界是多模态模型的根本,不仅本身有着巨大的价值,也是多模态生成模型的起点。本课题旨在开发多模态模型,实现对场景几何结构、语义信息及动态变化的高精度、多颗粒度理解与状态估计,在推动长视频,长剧理解的基础上推动世界模型和可控、交互视频生成模型模型的发展。
课题挑战:
1、多粒度时空表征建模: 如何在处理长视频数据时,同时兼顾宏观语义逻辑与微观几何结构的精确捕捉,实现跨时空的特征对齐。
2、长序列状态演化的连贯性: 针对数十分钟乃至数小时的视频,如何设计高效的记忆机制与推理架构,确保模型对场景动态变化的长期追踪与理解。
3、物理常识与因果推理融合: 如何将物理定律(如重力、遮挡、碰撞)融入理解框架,使模型不仅能“看到”画面,更能理解动作背后的因果关系。
4、高质量理解-生成闭环数据构建: 如何自动化合成包含高精度标注的长视频理解数据,用于支撑世界模型的联合预训练与强化学习优化。
具体工作:
参与本课题的同学将主要负责:
1、研发视频时空表征建模方法;
2、构建支持超长时序(如长剧、电影)的深层语义建模与关系推理框架;
3、建立模型对视频中物体状态迁移及动态演化的估计能力;
任职要求
1、相关专业(计算机、人工智能等)在读博士;
2、卓越的研究背景,在顶级学术会议或期刊(如CVPR,ICCV,NeurIPS,ICML,ICLR,SIGGRAPH等)发表过2篇以上高水平论文;
3、在开源社区有显著贡献,核心项目在GitHub上获得累计100+stars。
【加分项或注意事项】
此课题同时招聘应届实习生和低年级实习生。
腾讯招聘实习生:ARC Lab-感知与理解模型研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
