
阿里巴巴|AI评测工程师实习
岗位职责
作为大模型评测研发工程师,将负责“大模型通用Benchmark评测体系”与“业务领域Benchmark构建”的全链路研发:从评测数据集设计、智能化自动化评估方法探索研究、指标实现,到平台化落地,精准衡量模型能力边界,持续驱动模型语料优化与模型迭代。 1、通用 Benchmark 研发: • 持续迭代覆盖语言理解、推理、知识、幻觉、对齐、代码、多模态、Agent 等各个维度的自动化评测框架; • 研究并实现更贴合业务发展的评测方法与指标,构建高效、可扩展、可复现、可解释的评测引擎; 2、业务领域 Benchmark 构建与评测: • 深入跨境多个垂直业务领域,构建领域Benchmark,真实反馈模型业务表现; • 设计场景化评估方案,如RAG、Agent、COT、 In-Context Learning等,并形成端到端评测能力; 3、评测方法研究: • 探索基于 LLM-as-a-Judge、人类偏好对齐、模型解释性等前沿评测技术; • 跟踪 ACL / EMNLP / NeurIPS / ICML / ICLR 等会议,高效复现SOTA方法,形成可比对可参考的评估系统。
任职要求
1、计算机、数学相关专业,博士及以上学历; 2、熟练掌握 Python,扎实的数据结构、机器学习功底; 3、熟悉 transformers、PyTorch/TensorFlow,有大规模数据处理经验; 加分项: 1、在 NeurIPS/ICLR/ACL 等顶会以一作发表评测相关论文; 2、主导过公开Benchmark的设计与维护; 3、有大模型微调、RLHF实践经验。
阿里巴巴招聘实习生:AI评测工程师岗位来自阿里巴巴招聘官网,具体内容以阿里巴巴招聘官网为准。
