
腾讯|腾讯云—多模态大模型驱动的智能媒体处理平台研究实习
岗位职责
课题背景:
在短视频、直播、影视等内容产业爆发的背景下,传统音视频处理技术在复杂语义场景下面临理解不足、生成失真等瓶颈。为应对这一挑战,本项目致力于融合AIGC生成模型与多模态大模型,开展面向“感知-理解-生成”全链路的垂直媒体AI技术研究,旨在推动视听内容在修复、编辑、翻译、检索等场景的智能化升级,提升信息处理效率与用户体验。
课题挑战:
课题需攻克四大核心难点:一是在复杂动态场景下实现高精度视觉内容修复与生成,包括水印与遮挡物的无痕擦除、超分辨与风格迁移;二是实现长视频的深度语义理解,包括跨模态高光识别、时序建模与语义检索;三是构建鲁棒高效的跨语言同传系统,实现音、视频、文本的语义对齐与时序同步;四是为保障技术落地,需对扩散模型、大语言模型等进行轻量化与工程优化,以支持高并发、低延迟的云端业务部署。
具体工作:
加入课题后,同学将主要参与以下方向的研究与实现:复杂场景视觉编辑算法研发、多模态视频理解与检索系统构建、跨语言同传技术探索,以及模型轻量化与工程部署等相关工作。
任职要求
1、熟练掌握深度学习原理,对 Diffusion Model、Transformer、VAE、GAN 等生成框架有深入研究;
2、熟悉视频时序建模(如 Temporal Attention、3D-Conv)或 ASR/NLP 大模型;
3、在 CV 垂直领域(视频编辑、视频理解、多模态检索)或 语音大模型有实际落地项目经验。
4、熟悉 ControlNet、LoRA、Adapter 等插件化微调技术。
5、在 CVPR、ICCV、ECCV、NeurIPS、ACL、ICASSP 等顶会发表过论文。
6、对媒体 AI 行业趋势敏感,具备解决复杂工程问题(如 AI infra算力优化、大规模数据清洗)的热情。
腾讯招聘实习生:腾讯云—多模态大模型驱动的智能媒体处理平台研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
