
腾讯|混元-视频生成 SOTA 开源数据集实习
岗位职责
课题背景:
当前视频大模型在处理复杂一致性与音视频协同任务时泛化性不足,核心瓶颈在于缺乏高质量、大规模且任务多样化的数据集。现存开源视频数据不仅规模受限,且往往仅聚焦于单/多镜头或视频编辑等单一特征。为弥补工业界与学术界在海量视频数据上的鸿沟,并为未来多模态视频生成的统一建模提供坚实底座,亟需构建一个涵盖全任务维度的超大规模视频数据集。
课题挑战:
1、全场景海量数据构建难度大:打造规模达 50M+ 且涵盖单/多镜头切换、音画同步、时空一致性及精细编辑等多维度的全场景数据集,对底层数据的动态打分、多维清洗及对齐算法提出了极高的工程挑战;
2、统一 Caption 范式设计复杂:针对极其多样的视频形态,需从零构建一套能精准融合并描述视频动态演化、空间一致性、声学特征以及 Meta/ASR 等多模态信息的全能描述范式,实现文本与视频内容的极高质量对齐;
3、Omni 统一建模与极致指标追求:在复杂多任务数据底座上训练全能型生成模型,使其在时空一致性、视频质量(FVD、IS)及跨任务迁移能力上全面超越当前 SOTA 模型,存在巨大的架构调优与模型收敛挑战。
具体工作:
参与 50M+ 超大规模视频数据集(OmniVideo-50M)的构建、清洗与多维打分;设计并实现全场景统一 Caption 范式及多模态对齐;协助训练 Omni 视频生成大模型,跑通评测链路并冲击 SOTA 指标。
任职要求
1、计算机/软件工程等相关专业硕士以上学历,拥有博士学位者优先;
2、熟悉计算机视觉、多模态领域的相关研究工作和算法,需要以第一作者身份发表多篇顶会论文,顶级研究机构或一线互联网工作经验加分;
3、熟练使用Python、PyTorch和CUDA等语言及工具,具备快速阅读和复现论文的能力;
4、具备优秀的分析和解决问题能力,良好的团队合作精神及沟通意识。
腾讯招聘实习生:混元-视频生成 SOTA 开源数据集岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
