
商汤|大模型评测实习生(AI PPT)
岗位职责
1、Benchmark研究与构建:负责AI PPT生成及大模型能力评测体系建设,围绕PPT内容生成、版式设计、复杂推理、长程任务、多Agent协作等方向设计Benchmark,持续提升评测覆盖度与区分度。
2、评测框架研发:参与评测平台与工程体系建设,包括Sandbox环境、任务调度、Judge设计、Trace采集、自动化评测Pipeline等,推动PPT生成评测流程标准化、自动化。
3、模型能力分析:结合Benchmark结果开展模型能力分析与Badcase挖掘,定位AI PPT生成中的能力瓶颈(如内容准确性、版式合理性、逻辑连贯性等),形成可指导训练优化的数据分析报告,推动模型能力持续迭代。
4、数据与评测闭环:参与高质量PPT评测数据集建设,包括任务设计、数据构造、评测标准制定、失败样本回流等工作,持续完善模型训练与评测闭环。
5、学术研究:持续跟踪国内外Agent、Reasoning、Evaluation、AI生成内容等前沿工作,探索更科学、更稳定、更细粒度的大模型评测方法。
任职要求
1、计算机、人工智能、软件工程、数学等相关专业本科及以上学历,具有扎实的数据结构、算法及系统基础。
2、具备良好的Python开发能力,熟悉Linux开发环境,具有较强工程实现能力,能够独立完成功能开发或系统搭建。
3、熟悉大语言模型基本原理,了解Agent、Reasoning、Tool Calling、Benchmark、RL/Post-training等相关方向,对模型能力分析具有浓厚兴趣。
4、具备良好的科研阅读能力,能够阅读并理解英文论文,关注OpenAI、Anthropic、Google DeepMind等前沿技术发展。
5、具备优秀的问题分析能力和学习能力,能够快速理解复杂系统,从模型能力、数据、评测等多个角度定位问题并提出解决方案。
6、熟悉Claude Code、Cursor、Hermes等AI编程工具,并能够将AI工具融入日常开发流程,提高研发效率。
加分项
有Agent、LLM RL/Evaluation、Benchmark建设相关项目经验;
有模型评测或轨迹数据分析、数据集构建经验;
有PPT自动生成、多模态内容生成相关项目或研究经验;
对模型能力评估、Benchmark设计或Evaluation Research方向有持续关注。
商汤招聘实习生:大模型评测实习生(AI PPT)岗位来自商汤招聘官网,具体内容以商汤招聘官网为准。
