腾讯|元宝—基于视觉思维链的深层逻辑推理VQA框架研究实习

腾讯 · CSIG · 工作地点:北京 · 更新时间:2026-06-01

岗位职责

课题背景: 在 AI 迈向强人工智能的进程中,视觉问答(VQA)正从“直觉式描述”转向“逻辑式推演”。现有的 VQA 模型往往倾向于根据图像全局特征直接给出预测,这种“一步位”的模式在面对需要多步空间变换、隐喻理解或因果分析的复杂问题时,极易产生逻辑断层。随着 VLM 基础能力的跃迁,技术路径正在从“端到端预测”转向“Think with Images”式的启发式推理。面对高复杂度、高逻辑要求的视觉任务,亟需构建一个具备视觉思维链能力的 VQA 框架,打通“局部观测-中间推论-全局结论”的思考链路,解决视觉推理过程中的不可解释性难题。 课题挑战: 要实现具备“思维链”的高可靠 VQA,我们需要在模型推理质量与逻辑闭环层面解决以下实际难题: 视觉中间态的稳定性:重点在于如何确保模型在利用代码工具进行“Think with Images”的过程中,生成的中间图像或视觉表征不发生语义偏移,避免推理路径因图像处理不当而“跑题”。 多维空间感知与心理旋转:挑战模型在处理复杂 3D 转换或遮挡关系时的思维能力,确保模型在主动调整视角的推演过程中,具备精准的空间守恒性与物理常识约束。 逻辑坍塌的自我纠偏:研究如何建立视觉思维的反馈评价机制,当 Agent 意识到基于调整后图像得出的中间结论与原始全局信息发生矛盾时,能够像人类一样进行“回溯重思考”,确保最终答案的严谨性。 具体工作: 构建含空间与物理推演的复杂 VQA 评估集,研发代码驱动的感知增强模型,并引入推理侧回溯纠偏机制,通过语义一致性检验实现逻辑矛盾时的自主路径重构,提升 VLM 在复杂时空约束下的推演深度、空间守恒性与逻辑严谨性。

任职要求

学历和专业要求: 来自计算机、人工智能、数学或自动化相关专业的博士/硕士同学。深耕视觉问答(VQA)、多模态逻辑推理或计算机视觉(CV)领域,在顶会(CVPR、ICCV、NeurIPS等)有高水平论文发表经历者优先。 技术技能要求: 掌握多模态推理、视觉逻辑建模、3D 空间几何变换等算法;熟悉 VLM 思维链(CoT)及代码驱动的图像处理算子调用。精通 Python 语言,熟练使用 PyTorch 等主流框架及大模型训练推理工具。 软性素质要求: 具备极强的逻辑推演与空间想象力,能敏锐发现并解决模型推理中的逻辑断层。沟通协作能力强,具备独立开展前沿课题研究的韧性,对探索具备人类水平逻辑的可解释视觉智能有浓厚兴趣。

腾讯招聘实习生:元宝—基于视觉思维链的深层逻辑推理VQA框架研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。