
腾讯|混元基座模型-Mid-Train数据的高效筛选与合成研究实习
岗位职责
课题背景:
中期训练是衔接预训练与对齐阶段的核心,直接决定模型在代码、数理逻辑等复杂任务上的上限。由于高质量垂直领域人工数据极度稀缺,利用模型合成数据成为主流。但现有方案面临生成多样性坍塌及跨领域能力干扰等问题,亟待突破多领域数据精细筛选与高质量合成技术。
课题挑战:
1、模型退化危机:利用模型合成数据极易导致分布收敛与多样性丧失,在代码、数理等严谨领域合成出突破现有能力边界的“增量新知识”是核心难点;
2、能力跷跷板效应:多领域(如逻辑类与发散类)数据混合训练时易产生能力负迁移,通过提纯与组合策略实现各领域能力全面正向增益极具研究难度;
3、质量评估黑盒化:面对海量合成的垂直领域数据,缺乏高效且普适的自动化难度与质量评估标准,构建精准的打分体系面临巨大困难。
具体工作:
负责代码、数理、Agent、文创等核心领域数据的深度挖掘与筛选;设计高多样性的数据合成链路并在生产级别的模型上验证效果。
任职要求
1、自然语言处理/机器学习/模式识别/人工智能/计算机等相关专业硕士、博士学历;
2、在NLP、LLM领域有深入实践,对生成式AI、复杂推理或特定垂域(如代码生成、数学定理证明等)有丰富的数据构建与模型调优经验;
3、较强的工程实现能力,熟练掌握Python、C/C++等至少一种语言,熟悉指令演化(如Self-Instruct等)及合成数据Pipeline架构;
4、熟悉DeepSpeed、Megatron等分布式训练框架,熟练使用至少一种深度学习框架(如PyTorch等);
5、有高质量论文发表者优先(如ACL、EMNLP、NeurIPS、ICML、ICLR等),特别是在数据合成、模型微调或特定垂域能力突破方向;
6、具备强烈的进取心、自驱力及跨领域学习能力,团队合作精神极佳,对实现AGI核心能力跃迁充满热情。
【加分项或注意事项】
此课题同时招聘应届实习生和低年级实习生。
腾讯招聘实习生:混元基座模型-Mid-Train数据的高效筛选与合成研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
