
腾讯|腾讯视频-统一多模态视频生成和编辑模型研究实习
岗位职责
课题背景:
统一多模态模型已经在多模态内容生成和编辑方面展现出非常巨大的潜力,图像领域有Nano Banana为代表的模型正在深入行业应用,视频领域也有Seedance 2.0模型正崭露头角,统一多模态模型已经成为视频模型的大势所趋,并在重塑整个视频内容行业。
课题挑战:
视频领域的统一多模态生成和编辑模型研究主要挑战来自于高质量数据构造,统一架构模型设计;细粒度可控与编辑能力等。
具体工作:
主要研究重点一是高质量数据集的构建和评估,解决统一模型训练数据的高成本构造问题,二是统一的模型架构和多输入融合,构建在一个模型结构上实现音视频融合、主体场景等多参考输入和指令编辑的统一范式,三是提高统一模型的细粒度编辑能力,实现空间和时间的一致性控制,保证严格按照指令只修改该改的部分,并保持模型的多样性和泛化性。
任职要求
1、具备较强的学习能力、清晰的逻辑思维能力和出色的沟通能力,有强烈的好奇心;
2、具有扎实的计算机视觉和机器学习算法基础,有图像、音视频生成和编辑方向顶级论文者优先。
【加分项或注意事项】
此课题同时招聘应届实习生和低年级实习生。
腾讯招聘实习生:腾讯视频-统一多模态视频生成和编辑模型研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
