
腾讯|混元-视频编辑和统一生成模型探索实习
岗位职责
课题背景:
目前业界视频编辑、视频参考生成与原生视频生成多处于独立链路状态,这种割裂导致难以在统一的模型框架和潜在空间下实现对视频内容的精细化操控与理解对齐。
课题挑战:
1、高质量数据极其稀缺:极度缺乏基于“视频-指令-编辑后视频”三元组的高质量、逻辑绝对对齐数据;
2、统一空间对齐:在同一个模型框架与潜空间下,既要保证原生生成的高保真度,又要完美融合理解能力以实现精准的指令编辑与参考生成,理解与生成的底层对齐机制跨度极大。
具体工作:
构建海量“视频-指令-编辑后视频”三元组高质量对齐数据集;研发并优化理解与生成在统一潜空间下的深度对齐策略。
任职要求
1、计算机/软件工程等相关专业硕士以上学历,拥有博士学位者优先;
2、熟悉计算机视觉、多模态领域的相关研究工作和算法,需要以第一作者身份发表多篇顶会论文,顶级研究机构或一线互联网工作经验加分;
3、熟练使用Python、PyTorch和CUDA等语言及工具,具备快速阅读和复现论文的能力;
4、具备优秀的分析和解决问题能力,良好的团队合作精神及沟通意识。
腾讯招聘实习生:混元-视频编辑和统一生成模型探索岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
