
腾讯|混元多模态-多模态交互大模型的Model Merge实习
岗位职责
背景:大规模语言模型的训练成本极高,工业界与学术界普遍存在针对不同任务/场景独立微调的范式:情感语音、多语言ASR、对话风格、指令跟随等能力往往分散在多个独立checkpoint中。如何将这些能力无损融合到单一模型,是多模态交互大模型落地的关键瓶颈。
核心挑战:
在无训练或者依赖轻量训练的模型参数合并要实现模型合并能力不drop甚至实现1+1>2的模型合并结果目前仍然具有很大挑战。
具体工作:
1、评测现有的Model Merging算法在Speech LM场景下的表现;
2、针对多模态交互,提出一种模型参数合并策略实现多个ckpt高效合并。产出一个可插拔的Model Merge工具箱,验证在无训练或者轻量训练的设定下实现模型参数merge。
任职要求
学历与专业:
来自计算机科学、人工智能、电子信息、信号处理等相关专业的博士/硕士同学,具备扎实的机器学习理论基础,有多模态方向研究经验者优先。
技能要求:
精通PyTorch框架与Python编程;深度掌握Transformer架构及主流MLLM(如LLaVA,Qwen-Audio,Qwen-Omni)原理;熟悉PPO、GRPO等强化学习算法及DeepSpeed/Megatron分布式训练工具;有CoT推理或RLHF实战经验者尤佳。
软性素质:
具备较强的问题分解与独立研究能力;能在模糊问题定义上给出清晰的拆解思路和方法。
【加分项或注意事项】
此课题同时招聘应届实习生和低年级实习生。
腾讯招聘实习生:混元多模态-多模态交互大模型的Model Merge岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
