米哈游|LLM Evaluation算法实习生

米哈游 · 程序&技术类 · 上海/北京 · 更新时间:2026-09-05

岗位职责

1. 对大语言模型评估结果做深入数据分析,理解不同评估指标与用户体验、需求之间的关联,对模型训练迭代提供指导意见 2. 研发可靠的大语言模型评估管线,制定针对角色扮演、创意写作等能力的自动或人工评测准则与方法,构建对应的评测数据集 3. 紧扣偏好对齐目标,分析和清洗奖励模型数据,研发不易被reward hack、偏好有深度的奖励模型

任职要求

1. 计算机科学、人工智能或相关领域的在读硕士或博士 2. 对大语言模型评测体系有较深入的理解,并能构建评估方法以改进模型性能,掌握LLM as Judge技术 3. 对大语言模型的工作原理有较深入的理解,熟悉BT reward model训练和SFT训练,熟悉RL训练更佳 4. 有良好的中英文阅读和鉴赏能力,有良好的沟通合作能力 加分项 1. 在ACM/ICPC,NOI/IOI,TopCoder等编程大赛上有获奖 2. 在模型评估方向有NeurIPS/ICML/ACL/EMNLP顶级论文发表,积极追踪大模型方向前沿进展和应用 3. 参与过有影响力的LLM应用项目,有交互界面设计、数据标注相关经历 4. 具备良好的文学素养,对游戏、影视、小说等人文和娱乐内容有浓厚兴趣

米哈游招聘实习生:LLM Evaluation算法实习生岗位来自米哈游招聘官网,具体内容以米哈游招聘官网为准。