腾讯|混元基座模型-大模型预训练动力学研究实习

腾讯 · TEG · 工作地点:北京 · 更新时间:2026-06-01

岗位职责

课题背景: 1、训练过程的高度不确定性:大模型训练中存在大量随机因素和非线性动力学行为,准确预警和干预极具挑战性; 2、因果关系的复杂性:需要区分相关性与因果关系,在数十亿参数空间中建立可靠的因果推断链条; 3、实验成本极其高昂:每次完整训练实验都需要巨大的计算资源和时间成本,对实验设计提出极高要求; 4、跨规模规律的外推性:从小规模实验推导出的规律是否能够有效迁移到更大规模模型尚待验证; 5、工程与理论的平衡:需要在系统实现复杂度和理论严谨性之间找到合适的平衡点。 课题挑战: 1、训练过程的高度不确定性:大模型训练中存在大量随机因素和非线性动力学行为,准确预警和干预极具挑战性; 2、因果关系的复杂性:需要区分相关性与因果关系,在数十亿参数空间中建立可靠的因果推断链条; 3、实验成本极其高昂:每次完整训练实验都需要巨大的计算资源和时间成本,对实验设计提出极高要求; 4、跨规模规律的外推性:从小规模实验推导出的规律是否能够有效迁移到更大规模模型尚待验证; 5、工程与理论的平衡:需要在系统实现复杂度和理论严谨性之间找到合适的平衡点。 具体工作: 你将参与到前沿的大模型预训练稳定性研究中,深入探索Transformer架构下的优化动力学特性;你将有机会设计并实现创新的监控指标、干预机制与优化算法,积累大规模分布式训练的系统级经验;你将通过严谨的实验设计和因果分析,为行业建立可靠的大模型训练最佳实践;你还可能将研究成果转化为学术论文或技术专利,为未来的模型训练范式提供理论支撑和实践指导。

任职要求

1、自然语言处理/机器学习/模式识别/人工智能/计算机等相关专业硕士、博士学历; 2、在NLP、LLM、深度学习、强化学习方面有一定研究基础,熟悉主流模型和算法,并有一定的实践经验; 3、较强的工程实现能力,熟练掌握C/C++,Python等至少一种语言,有实际编程项目经验,熟悉DeepSpeed、Megatron等分布式训练框架,熟练使用至少一种深度学习框架(如TensorFlow,PyTorch等); 4、有高质量论文发表者优先(如ACL、EMNLP、NeurIPS、ICML、ICLR等); 5、具备强烈的进取心、自驱力及团队合作精神,热衷于追求技术创新。 【加分项或注意事项】 此课题同时招聘应届实习生和低年级实习生。

腾讯招聘实习生:混元基座模型-大模型预训练动力学研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。