腾讯|优图实验室—视频全模态理解基础技术研究实习

腾讯 · CSIG · 工作地点:上海 · 更新时间:2026-06-01

岗位职责

课题背景: 随着多模态大模型的快速发展,视频理解已成为模型感知与推理能力的核心赛道。然而,当前主流模型在视频理解领域仍面临显著瓶颈:音频与视频模态缺乏深度融合、对复杂时序事件的动态感知能力不足,以及长视频场景下 Encoder 计算效率极低。与此同时,以视频为输入的 GUI Agent 作为新兴应用方向,对视频的时序理解与跨帧感知提出了更高要求。本课题聚焦上述核心问题,旨在构建面向真实复杂场景的高效、强感知视频理解大模型,推动模型从"看懂图片"向"真正理解并操控视频世界"跨越。 课题挑战: 1、音视频深度融合与跨模态交互: 如何设计统一的音视频联合建模架构,使模型能够精准捕捉语音内容、音频事件与视觉场景之间的语义对应与互补关系,而非各模态独立编码后简单拼接; 2、细粒度时序事件感知: 视频中事件往往具有精确的时间边界与因果关联,如何使模型具备对短时动作、跨镜头事件演化、时间戳定位的高精度感知能力,是当前视频理解的核心难题; 3、高效视频原生 Encoder 设计: 标准 ViT 在处理长视频时面临 Token 数量爆炸问题,如何设计原生支持视频输入的 Encoder 架构(如线性注意力、稀疏采样、时空因式分解等),在不显著损失语义信息的前提下大幅压缩计算开销,是实现实用化长视频理解的关键工程挑战; 4、视频 GUI Agent 的时序决策与界面感知: 以视频流为输入的 GUI Agent 需要实时理解界面状态变化、跨帧追踪操作轨迹,并基于历史交互序列做出精准的下一步动作预测;如何将视频理解能力与 Agent 决策链路深度耦合,实现从"理解屏幕视频"到"自主完成复杂操作任务"的端到端闭环,是本方向的核心挑战。 具体工作: 你将参与音视频融合 Encoder 架构设计、长视频高效建模与时序感知算法研究、视频 GUI Agent 框架与评估系统建设、视频理解指令数据构建等工作,推动大模型在视频理解与智能体方向的能力突破。

任职要求

1、计算机科学、人工智能、信号处理、模式识别、电子工程等相关专业的博士及优秀硕士;具有视频理解、多模态学习或音视频处理方向研究背景者优先; 2、深入理解视频/多模态理解前沿进展,熟悉 ViT、Video Transformer、Audio Encoder(如 Wav2Vec、Whisper)等技术路径;精通 PyTorch,熟悉分布式训练框架(如 DeepSpeed、Megatron-LM);在 CVPR、ICLR、NeurIPS、ACM MM 等顶会有相关成果者优先;熟悉 CUDA 编程或高性能算子优化者更佳; 3、对视频理解技术有强烈的研究热情与探索欲;具备较强的工程落地能力和问题抽象能力;沟通协作能力强,能在大规模团队协作中高效推进课题;具备面对复杂系统问题的韧性与独立解决问题的能力。

腾讯招聘实习生:优图实验室—视频全模态理解基础技术研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。