腾讯|腾讯金融科技-多模态 coding 生成研究与UI自动化底座优化、场景拓展与融合实习

腾讯 · CDG · 工作地点:深圳总部 · 更新时间:2026-06-01

岗位职责

课题背景: 随着企业数字化转型的深入,无论是移动端APP还是PC端软件,图形用户界面依然是用户交互的核心载体。在软件测试、RPA(机器人流程自动化)以及业务风控等领域,对UI的自动化操作需求日益迫切。 当前挑战: 传统的UI自动化依赖控件ID或坐标脚本编写,存在版本迭代维护成本高、跨平台兼容性差、易被UI布局变动破坏等问题。虽然近年来大语言模型展现了强大的推理能力,但视觉语言模型的出现,为我们提供了直接“看懂”屏幕并进行操作的可能性--即赋予机器人类似的视觉感知与决策能力,实现真正意义上的“所见即所得”式自动化导航。 工作内容: 1、负责VLM在GUI智能体场景下的全流程优化,包括多模态数据Pipeline构建、GUI-Sandbox仿真环境搭建、模型后训练(Post-training)等。 2、深入GUI交互与多模态理解方向,进行模型调优与技术创新,覆盖视觉定位、界面元素理解、跨模态工具调用等。 3、跟踪多模态大模型与具身智能领域的技术动态,评估其在GUI自动化、智能助手等场景的应用潜力。 4、参与多模态系统架构设计,确保系统的高性能、可扩展性与稳定性。

任职要求

1、熟练掌握PyTorch、Swift、VeRL等一种或多种深度学习框架,具备多模态模型(如VLM)开发与调优经验; 2、熟悉多模态大模型训练技术,包括增量预训练(CPT)、有监督微调(SFT)、强化学习(RL)等,具备分布式训练实践经验; 3、熟悉RLVR(可验证奖励强化学习)流程,有多模态任务强化学习项目经验者优先; 4、具备计算机视觉、自然语言处理或多模态学习相关项目经验,熟悉常见VLM架构与评测基准; 5、计算机科学、人工智能、机器学习等相关专业硕士及以上学历,或在CVPR、ECCV、NeurIPS、ICML等多模态/视觉相关顶会发表论文者优先。

腾讯招聘实习生:腾讯金融科技-多模态 coding 生成研究与UI自动化底座优化、场景拓展与融合岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。