腾讯|优图实验室—音频大模型研究实习

腾讯 · CSIG · 工作地点:北京 · 更新时间:2026-06-01

岗位职责

课题背景: 音频是信息传递的核心模态之一,贯穿生产生活全场景。相较于视觉、文本大模型的爆发式发展,音频领域研究存在明显短板:现有模型多局限于单一任务(如仅语音识别、仅音乐分类),缺乏跨音频类型(语音 / 音乐 / 环境音)的统一能力;音频理解深度不足,难以实现复杂语义推理与情感分析;全模态融合中,音频常处于辅助地位,未形成 “平等融合”的技术范式,无法充分发挥其信息价值。 课题挑战: 1、统一音频表征学习:突破语音、音乐、环境音的模态壁垒,构建通用音频表征模型,实现不同音频类型的统一理解与特征复用,解决现有模型 “任务割裂” 问题; 2、构建音频大模型范式:打造具备 “处理 - 分类 - 理解 - 推理 - 生成 - 评价” 全链路能力的大模型架构,覆盖从基础音频处理到高阶智能决策的全需求,适配多业务场景的灵活调用; 3、探索音频全模态融合方法:研究音频与文本、图像、视频的深度融合机制,突破 “音频辅助” 的传统模式,实现多模态信息的互补增强。 具体工作: 你将参与音频大模型相关的数据与建模工作,并结合安全审核和内容理解等业务需求寻找落地途径,探索与其他模态相融合方法。

任职要求

1、包含但不限于计算机、人工智能、模式识别等相关专业的博士和优秀硕士; 2、熟悉机器学习、深度学习、大模型等基础理论与算法,具有语音/音频/多模态相关研究经历的优先; 3、有较强的学术研究能力,在人工智能或语音相关顶会上有论文发表者优先; 4、熟练掌握Python编程,熟悉分布式训练框架,具备丰富的大模型训练经验; 5、具备较强的逻辑思考和解决问题能力,沟通协作和逻辑表达良好。

腾讯招聘实习生:优图实验室—音频大模型研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。