腾讯|腾讯云—多模态大模型驱动的智能媒体处理平台研究实习

腾讯 · CSIG · 工作地点:上海 · 更新时间:2026-06-01

岗位职责

课题背景​: 在短视频、直播、影视等内容产业爆发的背景下,传统音视频处理技术在复杂语义场景下面临理解不足、生成失真等瓶颈。为应对这一挑战,本项目致力于融合AIGC生成模型与多模态大模型,开展面向“感知-理解-生成”全链路的垂直媒体AI技术研究,旨在推动视听内容在修复、编辑、翻译、检索等场景的智能化升级,提升信息处理效率与用户体验。 课题挑战​: 课题需攻克四大核心难点:一是在复杂动态场景下实现高精度视觉内容修复与生成,包括水印与遮挡物的无痕擦除、超分辨与风格迁移;二是实现长视频的深度语义理解,包括跨模态高光识别、时序建模与语义检索;三是构建鲁棒高效的跨语言同传系统,实现音、视频、文本的语义对齐与时序同步;四是为保障技术落地,需对扩散模型、大语言模型等进行轻量化与工程优化,以支持高并发、低延迟的云端业务部署。 具体工作​: 加入课题后,同学将主要参与以下方向的研究与实现:复杂场景视觉编辑算法研发、多模态视频理解与检索系统构建、跨语言同传技术探索,以及模型轻量化与工程部署等相关工作。

任职要求

1、熟练掌握深度学习原理,对 Diffusion Model、Transformer、VAE、GAN 等生成框架有深入研究; 2、熟悉视频时序建模(如 Temporal Attention、3D-Conv)或 ASR/NLP 大模型; 3、在 CV 垂直领域(视频编辑、视频理解、多模态检索)或 语音大模型有实际落地项目经验。 4、熟悉 ControlNet、LoRA、Adapter 等插件化微调技术。 5、在 CVPR、ICCV、ECCV、NeurIPS、ACL、ICASSP 等顶会发表过论文。 6、对媒体 AI 行业趋势敏感,具备解决复杂工程问题(如 AI infra算力优化、大规模数据清洗)的热情。

腾讯招聘实习生:腾讯云—多模态大模型驱动的智能媒体处理平台研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。