shopee|【实习】AI-AI 算法工程师 (商品理解方向) -BJ/SH

shopee · 北京/上海 · 更新时间:2026-09-07

岗位职责

职责 1. 同款判别模型建设(核心):负责跨类目、多粒度(SKU/ITEM)商品同款判别模型的设计与迭代,提升细粒度语义与图文多模态的对比判别能力,降低误判、漏判; 2. 规则知识注入:构建结构化的类目对比维度与判别规则体系,注入 LLM 基座,让模型学会细分场景的专属判别逻辑; 3. 后训练与 Agentic RL:负责开源基模(Qwen、Kimi 等)的 SFT/DPO 后训练,探索 GRPO/DAPO 落地,含 reward 设计与训练稳定性优化,双向优化准召; 4. 后训练数据体系:负责 CoT 数据精标、线上难例与正负样本对挖掘、强模型标注与合成,搭建数据生成与质检 pipeline; 5. 轻量化上线:通过知识蒸馏与结构剪枝,在精度几乎无损下支撑百亿级商品、千万级 SKU 的高并发低延迟部署; 6. 评测与迭代:建设评测口径与 badcase 归因,通过线上 AB 验证收益并驱动迭代。

任职要求

1. 计算机、人工智能或相关专业本科及以上学历; 2. 熟悉 PyTorch 与 LLM 训练全流程,理解 SFT/GRPO/DPO 的原理与实践细节; 3. 熟悉 LLM prompt 工程,理解电商商品理解/相关性/匹配类任务的核心问题,有细粒度语义判别或商品对比相关经验优先; 4. 具备扎实的数据处理能力,能独立完成大规模训练数据(尤其 CoT / 偏好数据)的构造、清洗与质检; 5. 良好的实验习惯:对照设计、消融分析、指标口径(准召/F1)严谨;具备独立的线上迭代与数据分析能力。 加分项 1. 有训练框架(verl、LLaMA-Factory、Megatron、DeepSpeed 等)实际使用或二次开发经验; 2. 有 Agentic RL / RLHF 实战经验:跑过 GRPO/DAPO 完整训练、设计过多维复合 reward、处理过训练不稳定(reward hacking、熵塌缩、RL 冲毁冷启动推理逻辑等)问题; 3. 有大模型知识蒸馏(Logits/Feature 蒸馏)与结构剪枝(词表/深度/宽度剪枝)、大模型高并发低延迟推理部署经验; 4. 有多模态商品理解(图文统一表征、Semantic ID / 生成式召回)或电商搜广推大规模项目落地经验; 5. 有同款/相关性判别、规则知识结构化注入、LLM-as-Judge 评测体系或 badcase 自动归因工具建设经验; 6. 在 NLP/ML/CV 顶会(ACL/EMNLP/NeurIPS/ICLR/ICML/CVPR/AAAI 等)发表过论文,或有高质量开源项目。

shopee招聘实习生:【实习】AI-AI 算法工程师 (商品理解方向) -BJ/SH岗位来自shopee招聘官网,具体内容以shopee招聘官网为准。