商汤|Agent Benchmark Research Intern实习

商汤 · 深圳 · 更新时间:2026-09-03

岗位职责

1、Benchmark研究与构建:负责Agent及大模型能力评测体系建设,围绕代码、复杂推理、长程任务、多Agent协作等方向设计Benchmark,持续提升评测覆盖度与区分度。 2、评测框架研发:参与评测平台与工程体系建设,包括Sandbox环境、任务调度、Judge设计、Trace采集、自动化评测Pipeline等,推动评测流程标准化、自动化。 3、模型能力分析:结合Benchmark结果开展模型能力分析与Badcase挖掘,定位能力瓶颈,形成可指导训练优化的数据分析报告,推动模型能力持续迭代。 4、数据与评测闭环:参与高质量评测数据集建设,包括任务设计、数据构造、评测标准制定、失败样本回流等工作,持续完善模型训练与评测闭环。 5、学术研究:持续跟踪国内外Agent、Reasoning、Evaluation等前沿工作,探索更科学、更稳定、更细粒度的大模型评测方法。

任职要求

1、计算机、人工智能、软件工程、数学等相关专业本科及以上学历,具有扎实的数据结构、算法及系统基础。 2、具备良好的Python开发能力,熟悉Linux开发环境,具有较强工程实现能力,能够独立完成功能开发或系统搭建。 3、熟悉大语言模型基本原理,了解Agent、Reasoning、Tool Calling、Benchmark、RL/Post-training等相关方向,对模型能力分析具有浓厚兴趣。 4、具备良好的科研阅读能力,能够阅读并理解英文论文,关注OpenAI、Anthropic、Google DeepMind等前沿技术发展。 5、具备优秀的问题分析能力和学习能力,能够快速理解复杂系统,从模型能力、数据、评测等多个角度定位问题并提出解决方案。 6、熟悉Claude Code、Cursor、Hermes等AI编程工具,并能够将AI工具融入日常开发流程,提高研发效率。 加分项 有Agent、LLM RL/Evaluation、Benchmark建设相关项目经验; 有模型评测或轨迹数据分析,数据集构建经验; 熟悉SWE-bench、AA、Terminal-bench、BrowseComp、Humanity's Last Exam、LiveCodeBench、GAIA、WebArena等Benchmark; 有开源项目、竞赛(ACM、CCPC、Kaggle等)或科研经历; 对模型能力评估、Benchmark设计或Evaluation Research方向有持续关注。

商汤招聘实习生:Agent Benchmark Research Intern岗位来自商汤招聘官网,具体内容以商汤招聘官网为准。