
腾讯|混元基座模型-预训练数据效率优化研究实习
岗位职责
课题背景:
预训练数据是基座模型能力的基石。随着模型参数量剧增,高质量自然语料濒临枯竭,单纯扩大规模的收益递减。现有清洗与静态配比方案难以高效剔除隐蔽噪声,且缺乏动态调度机制,导致长尾知识吸收不足,制约模型能力上限。因此,攻克大模型数据清洗与调度机制是破局关键。
课题挑战:
1、规模与质量的博弈:在百TB级语料中进行深度清洗计算开销巨大,难以在过滤低质噪声的同时避免高价值长尾知识的误杀;
2、配比空间的组合爆炸:数据领域繁杂,传统启发式搜索无法有效寻优,精准建立数据分布与模型下游维度的映射规律极具挑战;
3、动态调度的指标盲区:训练过程中缺乏低成本、高置信度的即时评估指标,难以准确评估模型实时状态并实施精准的数据调度。
具体工作:
1、负责在PB级预训练语料中筛选有价值的部分,设计数据策略并验证其效果;
2、探究多领域数据科学配比规律;
3、设计并落地符合大模型认知规律的训练数据动态调度策略。
任职要求
1、相信scalinglaw;
2、有较强的工程能力,对于更高效更稳定的工具有持续追求;
3、认真仔细,不愿放过指标上或数据中的任何蛛丝马迹。
【加分项或注意事项】
此课题同时招聘应届实习生和低年级实习生。
腾讯招聘实习生:混元基座模型-预训练数据效率优化研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
