
腾讯|PCG大数据平台部-视频生成与编辑统一模型应用研究实习
岗位职责
课题背景:
随着Seedance2.0、Kling-O3、SkyReels-V4等模型的发布,AIGC技术正在从专家模型到统一多模态模型前进,引发影视制作领域的应用变革,为内容创作开辟全新可能性。而当前AIGC影视制作技术面临三大
核心挑战:
1)缺乏统一基模,当前模型主要以闭源为主,缺乏统一自研基模,
2)语义冲突,当前模型同时支持文本、图像、视频、音频模态输入,在信息冲突时,容易影响生成结果,
3)画质问题,当前模型输出分辨率低,造成输出镜头模糊。本课题旨在基于AIGC技术创新,通过自研统一多模态基模,提升影视制作与编辑业务效果与效率,提供高质量和高艺术性影视内容。
课题挑战:
1、统一模型框架设计:如何设计支持多模态输入、音视频双路输出的统一模型框架,利用不同模态预训练base模型,进行高效组合;
2、多模态对齐训练:如何筛选、清洗现有的海量视频数据,或通过创新的方法合成V2V训练数据,以提升基座模型对多模态信息的对齐与生成能力;
3、高效率训练研究:如何设计高效率训练框架,提升大规模训练效率;
4、强化学习策略优化:对于复杂的多镜头、V2V编辑任务,需要结合reward模型,设计多策略的奖励信号以优化模型效果。
具体工作:
你将参与到视频生成与编辑统一模型框架设计、训练数据合成与清洗、高效率训练、强化学习策略优化等流程中,提升视频模型能力。
任职要求
1、包含但不限于计算机、信息工程、模式识别、人工智能、自动化、软件工程、电子工程、统计学、应用数学、物理学/量子计算、信息安全、信号与信息处理等专业的博士和优秀硕士;
2、熟练掌握计算机视觉和图像处理相关的基本算法及应用,熟悉caffe、tensorflow,pytorch等至少一个深度学习框架;
3、较强的工程实现能力,熟练掌握C/C++编程,熟悉Shell/Python/Matlab至少一种编程语言;
4、有相关顶会或top团队实习经验同学优先。
腾讯招聘实习生:PCG大数据平台部-视频生成与编辑统一模型应用研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
