
腾讯|ARC Lab-决策与行动模型实习
岗位职责
课题背景:
视觉-动作(VA)大模型在具身智能与复杂游戏和交互视频智能体领域展现出巨大潜力,是迈向通用人工智能的核心路径。然而,当前 VLA 策略的训练与评测高度依赖于手工搭建的物理仿真引。而成式世界模型其能够通过海量无标注视频数据,隐式学习物理世界的时空动态规律。本课题旨在研究能和世界模型无缝交互的VA智能体并探索两者的双向交互机制。
课题挑战:
1、如何构建高效且可执行的视频动作模型:现有的端到端模型往往面临推理延迟高、动作空间映射不精确的问题,难以在实时交互视频或高频具身控制中应用。
2、如何利用视频动作模型解决长程复杂任务:智能体在长路径规划中极易产生“错误累积”,导致在完成分步骤、跨时域的复杂任务(如长达数分钟的游戏关卡或连续家庭作业)时失效。
3、面向复杂交互的多智能体协同机制:在开放世界或复杂交互视频中,智能体并非孤立存在。多智能体间的动作干预、资源竞争与信息非对称,使得协同策略的训练极具挑战。
具体工作:
通过解决高效执行、长程推理及群体协作等关键科学问题,确立新一代具身智能的技术范式。本项研究不仅旨在产出具有国际影响力的顶会成果,更力求在模型性能上突破 SOTA 瓶颈,为构建具备世界模型能力的交互智能体提供核心理论与技术支撑
任职要求
1、相关专业(计算机、人工智能等)在读博士;
2、卓越的研究背景,在顶级学术会议或期刊(如CVPR,ICCV,NeurIPS,ICML,ICLR,SIGGRAPH等)发表过2篇以上高水平论文;
3、在开源社区有显著贡献,核心项目在GitHub上获得累计100+stars。
【加分项或注意事项】
此课题同时招聘应届实习生和低年级实习生。
腾讯招聘实习生:ARC Lab-决策与行动模型岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
