
腾讯|元宝—面向真实复杂任务的全栈VLM Agent研究实习
岗位职责
课题背景:
在 AI 迈向通用智能体的进程中,仅具备“文本理解”能力的模型已无法满足日益复杂的数字化生存需求。传统 Agent 往往局限于单一的 API 调用或特定的软件环境,难以像人类专家一样跨越浏览器、代码工具与底层文件系统进行协同办公。随着 VLM(视觉语言模型)的成熟,技术路径正在从“解析后台代码”转向“理解原始像素”。面对复杂、动态且非标的数字化环境,亟需构建一个具备全栈操作能力的 VLM Agent,打通从“视觉感知”到“真实执行”的闭环,解决真实世界中的长链路问题。
课题挑战:
要实现高可靠的数字化 Agent,我们需要在工程与算法层面解决以下实际难题:
跨模态动作生成的精度:重点在于如何将 VLM 提取的模糊视觉意图,精准转化为像素级的鼠标点击或结构化的 Bash 命令,减少执行时的“误触”与“偏移”。
长时程任务的错误恢复:在涉及浏览器与系统多步交互的长流程中,如何有效识别环境反馈中的报错(如网页加载失败、指令权限不足),并具备自主重试或路径修正的能力。
异构工具链的协同决策:研究如何让模型在“视觉感知”与“系统反馈”双重信号下,理性判断何时该用浏览器搜索,何时该用代码计算,确保跨工具调用逻辑的连贯性。
具体工作:
构建跨工具真实长链评估集,研发具备 UI 感知与 CoT 对齐能力的高精度 VLM,并引入推理侧经验回放机制,通过在线总结与召回实现无需训练的即时纠错,全面提升 Agent 在复杂环境下的意图理解与多工具协同执行效率。
任职要求
学历和专业要求:
来自计算机、人工智能、自动化、电子信息或数学等相关专业的博士/硕士同学。在多模态大模型(VLM)、智能体(Agent)或视觉推理等领域有深厚学术背景或顶会(CVPR、ICLR、NeurIPS等)论文发表经历者优先。
技术技能要求:
掌握多模态表征、思维链(CoT)、强化学习(DPO/PPO)等算法及应用;熟悉 GUI 自动化或代码驱动的视觉处理技术。精通 Python 语言,熟练掌握 PyTorch 等主流深度学习框架及大模型训练推理工具。
软性素质要求:
具备卓越的自驱动力与逻辑拆解能力,能够从复杂现象中提炼科学问题;沟通协作能力强,拥有极佳的学术视野,能快速研读并复现前沿论文,对探索通用人工智能(AGI)具有强烈的热情。
腾讯招聘实习生:元宝—面向真实复杂任务的全栈VLM Agent研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
