腾讯|混元基座模型-预训练数据效率优化研究实习

腾讯 · TEG · 工作地点:北京 · 更新时间:2026-06-01

岗位职责

课题背景: 预训练数据是基座模型能力的基石。随着模型参数量剧增,高质量自然语料濒临枯竭,单纯扩大规模的收益递减。现有清洗与静态配比方案难以高效剔除隐蔽噪声,且缺乏动态调度机制,导致长尾知识吸收不足,制约模型能力上限。因此,攻克大模型数据清洗与调度机制是破局关键。 课题挑战: 1、规模与质量的博弈:在百TB级语料中进行深度清洗计算开销巨大,难以在过滤低质噪声的同时避免高价值长尾知识的误杀; 2、配比空间的组合爆炸:数据领域繁杂,传统启发式搜索无法有效寻优,精准建立数据分布与模型下游维度的映射规律极具挑战; 3、动态调度的指标盲区:训练过程中缺乏低成本、高置信度的即时评估指标,难以准确评估模型实时状态并实施精准的数据调度。 具体工作: 1、负责在PB级预训练语料中筛选有价值的部分,设计数据策略并验证其效果; 2、探究多领域数据科学配比规律; 3、设计并落地符合大模型认知规律的训练数据动态调度策略。

任职要求

1、相信scalinglaw; 2、有较强的工程能力,对于更高效更稳定的工具有持续追求; 3、认真仔细,不愿放过指标上或数据中的任何蛛丝马迹。 【加分项或注意事项】 此课题同时招聘应届实习生和低年级实习生。

腾讯招聘实习生:混元基座模型-预训练数据效率优化研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。