
shopee|【实习】AI-AI Agent 算法工程师-BJ/SH
岗位职责
职责
1.多轮对话能力建设:负责多轮对话上下文管理、澄清策略优化、多意图理解与 search plans 生成,提升复杂对话场景下的意图识别与任务规划质量;
2.电商skill 建设:负责商品推荐、对比、详情问答等售前能力,以及订单、物流、售后咨询等场景的 skill 设计与落地,构建可复用、可扩展的能力体系;
3.推荐理由与个性化优化:优化推荐理由生成的事实准确性,确保导购内容可信、可溯源,抑制幻觉;
4.电商memory:负责 memory 注入与个性化效果迭代,提供千人千面的导购体验;
5.后训练数据体系建设:面向 query 理解、多轮对话理解、推荐理由生成等子任务,负责后训练数据的构造与清洗(线上 trace 蒸馏、强模型标注、合成对话),搭建数据生成 pipeline 与质量校验机制;
6.模型后训练与 Agentic RL:负责开源基模型(Qwen、Kimi 等)的部署与后训练(SFT/DPO/OPD)及效果/耗时对比实验;参与 GRPO/DAPO 等强化学习算法在电商对话与工具调用场景的探索落地,包括 reward 设计、训练稳定性优化与线上效果验证;
任职要求
1.计算机、人工智能或相关专业本科及以上学历;
2.熟悉 PyTorch 与 LLM 训练全流程,理解 SFT/GRPO/OPD 的原理与实践细节;
3.熟悉 LLM prompt 工程与 Agent 框架,理解多轮对话或搜索系统的核心问题;
4.具备扎实的数据处理能力,能独立完成大规模训练数据的构造、清洗与质检;
5.良好的实验习惯:对照设计、消融分析、指标口径严谨;具备独立的线上迭代与数据分析能力;
任职要求
1.有训练框架(verl、LLaMA-Factory、Megatron、DeepSpeed 等)实际使用或二次开发经验;
2.有 Agentic RL / RLHF 实战经验:跑过 GRPO/DAPO 完整训练、设计过 reward、处理过训练不稳定(熵塌缩、reward hacking 等)问题;
3.有多轮对话状态管理、澄清/追问策略、意图体系设计,或 LLM 记忆系统(用户画像、偏好抽取、长期记忆管理)建设经验;
4.有多轮对话数据合成、LLM-as-Judge 评测体系或 badcase 自动归因工具建设经验;
5.在 NLP/ML 顶会(ACL/EMNLP/NeurIPS/ICLR/ICML 等)发表过论文,或有高质量开源项目。
shopee招聘实习生:【实习】AI-AI Agent 算法工程师-BJ/SH岗位来自shopee招聘官网,具体内容以shopee招聘官网为准。
