
腾讯|优图实验室—面向专业影视制作场景的Router Agent RL研究实习
岗位职责
课题背景:
图像视频生成模型发展快速,已达到可用于专业影视制作场景的要求,但不同的模型在能力、推理成本、响应延迟及擅长领域上存在显著的能力分层。需要借助智能体(Agent)通过规划、反思、工具调用等功能探索综合最优方案。因此,本课题聚焦于 Agentic RL(智能体强化学习) 在模型调度中的应用,旨在探索如何将大型模型与强化学习深度结合,构建一个具备决策能力的 Router Agent。
课题挑战:
1、多模态意图理解与状态表征:如何设计高效的 Router 算法,精准理解包含长文本、复杂图像甚至视频的输入请求,以支持多轮、复杂的决策
2、多目标权衡下的强化学习策略优化:真实场景中,多目标可能存在冲突,且长上下文任务存在奖励稀疏问题。如何设计奖励以稳定决策轨迹
3、智能体决策的自动化评估与对齐:如何构建可信鲁棒的评估系统,对智能体在多模态任务中的决策有效性以及与人类意图的对齐程度进行评估
具体工作:
你将参与到多模态智能体决策系统的核心算法研发与框架构建、智能体自动评估、构建具有多模态任务交互的复杂决策环境,致力于提升大模型在真实环境的多模态任务中的自主决策成功率。并将其用于专业影视制作领域。
任职要求
1、包含但不限于计算机、信息工程、模式识别、人工智能、自动化、软件工程、电子工程、统计学等专业的博士和优秀硕士;有RL等相关研究经验者优先;
2、具备扎实的深度学习基础,了解 LLM / VLM 等模型结构。较强的工程实现能力,熟悉Shell/Python等编程语言,熟练使用各种LLM训练和推理加速框架;
3、较强的大模型学术能力,在ACL、ICLR、NeurIPS、ICML等顶级会议上有LLM / VLM 相关论文发表,或有国内外主流LLM / VLM 模型的开发经验;
4、对图像生成、视频生成等多模态生成模型有一定的了解。
腾讯招聘实习生:优图实验室—面向专业影视制作场景的Router Agent RL研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
