
腾讯|优图实验室—音频大模型研究实习
岗位职责
课题背景:
音频是信息传递的核心模态之一,贯穿生产生活全场景。相较于视觉、文本大模型的爆发式发展,音频领域研究存在明显短板:现有模型多局限于单一任务(如仅语音识别、仅音乐分类),缺乏跨音频类型(语音 / 音乐 / 环境音)的统一能力;音频理解深度不足,难以实现复杂语义推理与情感分析;全模态融合中,音频常处于辅助地位,未形成 “平等融合”的技术范式,无法充分发挥其信息价值。
课题挑战:
1、统一音频表征学习:突破语音、音乐、环境音的模态壁垒,构建通用音频表征模型,实现不同音频类型的统一理解与特征复用,解决现有模型 “任务割裂” 问题;
2、构建音频大模型范式:打造具备 “处理 - 分类 - 理解 - 推理 - 生成 - 评价” 全链路能力的大模型架构,覆盖从基础音频处理到高阶智能决策的全需求,适配多业务场景的灵活调用;
3、探索音频全模态融合方法:研究音频与文本、图像、视频的深度融合机制,突破 “音频辅助” 的传统模式,实现多模态信息的互补增强。
具体工作:
你将参与音频大模型相关的数据与建模工作,并结合安全审核和内容理解等业务需求寻找落地途径,探索与其他模态相融合方法。
任职要求
1、包含但不限于计算机、人工智能、模式识别等相关专业的博士和优秀硕士;
2、熟悉机器学习、深度学习、大模型等基础理论与算法,具有语音/音频/多模态相关研究经历的优先;
3、有较强的学术研究能力,在人工智能或语音相关顶会上有论文发表者优先;
4、熟练掌握Python编程,熟悉分布式训练框架,具备丰富的大模型训练经验;
5、具备较强的逻辑思考和解决问题能力,沟通协作和逻辑表达良好。
腾讯招聘实习生:优图实验室—音频大模型研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
