shopee|【实习】AI-AI Agent 算法工程师-BJ/SH

shopee · 北京 · 更新时间:2026-07-28

岗位职责

职责 1.多轮对话能力建设:负责多轮对话上下文管理、澄清策略优化、多意图理解与 search plans 生成,提升复杂对话场景下的意图识别与任务规划质量; 2.电商skill 建设:负责商品推荐、对比、详情问答等售前能力,以及订单、物流、售后咨询等场景的 skill 设计与落地,构建可复用、可扩展的能力体系; 3.推荐理由与个性化优化:优化推荐理由生成的事实准确性,确保导购内容可信、可溯源,抑制幻觉; 4.电商memory:负责 memory 注入与个性化效果迭代,提供千人千面的导购体验; 5.后训练数据体系建设:面向 query 理解、多轮对话理解、推荐理由生成等子任务,负责后训练数据的构造与清洗(线上 trace 蒸馏、强模型标注、合成对话),搭建数据生成 pipeline 与质量校验机制; 6.模型后训练与 Agentic RL:负责开源基模型(Qwen、Kimi 等)的部署与后训练(SFT/DPO/OPD)及效果/耗时对比实验;参与 GRPO/DAPO 等强化学习算法在电商对话与工具调用场景的探索落地,包括 reward 设计、训练稳定性优化与线上效果验证; 任职要求 1.计算机、人工智能或相关专业本科及以上学历; 2.熟悉 PyTorch 与 LLM 训练全流程,理解 SFT/GRPO/OPD 的原理与实践细节; 3.熟悉 LLM prompt 工程与 Agent 框架,理解多轮对话或搜索系统的核心问题; 4.具备扎实的数据处理能力,能独立完成大规模训练数据的构造、清洗与质检; 5.良好的实验习惯:对照设计、消融分析、指标口径严谨;具备独立的线上迭代与数据分析能力;

任职要求

1.有训练框架(verl、LLaMA-Factory、Megatron、DeepSpeed 等)实际使用或二次开发经验; 2.有 Agentic RL / RLHF 实战经验:跑过 GRPO/DAPO 完整训练、设计过 reward、处理过训练不稳定(熵塌缩、reward hacking 等)问题; 3.有多轮对话状态管理、澄清/追问策略、意图体系设计,或 LLM 记忆系统(用户画像、偏好抽取、长期记忆管理)建设经验; 4.有多轮对话数据合成、LLM-as-Judge 评测体系或 badcase 自动归因工具建设经验; 5.在 NLP/ML 顶会(ACL/EMNLP/NeurIPS/ICLR/ICML 等)发表过论文,或有高质量开源项目。

shopee招聘实习生:【实习】AI-AI Agent 算法工程师-BJ/SH岗位来自shopee招聘官网,具体内容以shopee招聘官网为准。