
腾讯|混元多模态-视频后训练技术研究实习
岗位职责
课题背景:
视频生成大模型正逐渐从学术研究走向应用落地,业界前沿视频生成模型已融合了多镜头、音画一致、参考生成等多种能力。如何在复杂多模态、多复杂任务的模型上做统一的后训练是一个极具挑战的课题。
课题挑战:
1、多镜头、音画一致、参考生成等多种任务的reward model构建;
2、时序感知友好的运动reward model构建,提升运动合理性;
3、id一致性保持:提升长时跨镜头视频生成场景下的id保持能力。
具体工作:
参与或负责上述课题的技术探索,优秀的方法和成果将直接应用到混元视频基模发版实验,成为核心贡献者。
任职要求
学历和专业要求:
来自计算机、人工智能、自动化、数学等相关专业的优秀博士/硕士。
技术技能要求:
熟悉图像/视频等后训练技术与方法,有相关实践经验和相关顶会论文发表;代码能力强,熟练掌握PyTorch/verl/Megatron;有相关实习经验者优先,有竞赛获奖经历优先。
【加分项或注意事项】
此课题同时招聘应届实习生和低年级实习生。
腾讯招聘实习生:混元多模态-视频后训练技术研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
