
shopee|【实习】LLM-预训练算法实习生-数据-SH、BJ
岗位职责
关于团队
Compass 是由 Shopee 研发的面向全球竞争的超大规模多语言模型,具备强大的跨文化理解、复杂逻辑推理与自主执行能力。依托全球新兴市场(尤其是东南亚)海量的多语言、多文化数据优势,Compass 系列模型已成功实现了从 v1 到 v3 演进。当前,我们正聚焦前沿技术突破,全力打造架构更先进、能力更卓越的下一代基座大模型,打造全球领先的多语言与自主智能体(Agentic LLM)技术体系。我们将通过对算法和数据策略的深入研究,建立科学的 scaling law 指导规划,攻克训练与推理加速瓶颈,打通从数据治理到智能涌现的确定性路径。我们追求将现有的预训练技术做到极致。
岗位职责
参与核心算法与数据构建:协助设计基于多维指标(Loss/Embedding 等)的数据选择与采样算法;参与自动化合成数据链与蒸馏数据的实验验证,探索模型能力与数据配比的 Scaling Laws。
协助海量数据挖掘与清洗:参与全网数据选取策略的优化,挖掘 RAG 场景的时效性数据;编写高效脚本,清洗低质站点与链接,提升训练数据纯净度。
探索数据质量评测与去重:协助研发大规模数据的清洗、去噪与核心去重(如 MinHash、向量去重)算法;参与搭建自动化数据评分模型,追踪数据的分布变化。
支持数据平台与基建优化:在 Mentor 指导下使用分布式处理框架(Spark/Ray 等),参与自动化预训练数据流水线的建设与核心代码性能优化。
任职要求
必须项
学历专业: 计算机、AI、数据科学或数学等专业本科及以上学历。
编程功底: 精通 Python,熟练掌握 C++ 或 Rust,具备扎实的计算机系统基础。
数据与工程: 熟练使用 Spark/Ray/SQL 等分布式工具链,具备 TB~PB 级海量数据处理与计算引擎调优能力。
AI 与算法: 熟悉 LLM 预训练流程与 NLP 基础,熟练使用 PyTorch/TensorFlow;精通数据挖掘、清洗去噪与文本处理。
业务认知: 对“高质量预训练数据”的特征与分布有深刻理解,具备强问题诊断与跨团队协作能力。
shopee招聘实习生:【实习】LLM-预训练算法实习生-数据-SH、BJ岗位来自shopee招聘官网,具体内容以shopee招聘官网为准。
