腾讯|微信助手-支持多方言的音频生成模型实习

腾讯 · WXG · 工作地点:北京 · 更新时间:2026-06-01

岗位职责

课题背景: 微信语音消息、语音播报、数字人交互等场景对自然、拟真且具有地域亲和力的语音生成能力需求不断提升。普通话语音生成已较成熟,但在类似客家话等小语种方言场景中,现有模型常存在发音不准、韵律不自然、风格不稳定等问题,因此需要研发支持多方言的音频生成模型,提升用户体验与表达丰富度。 课题挑战: 多方言语音生成面临发音体系差异大、方言文本表示不统一、训练数据稀缺等问题。部分方言存在多音、多读法和强地域差异,导致模型难以准确学习语音映射关系。同时,真实业务还要求模型兼顾自然度、可懂度、情感表现力和说话人一致性,在长文本、口语化表达及跨方言迁移场景下都保持稳定生成,这对数据、建模和评测都提出了较高要求。 具体工作: 参与多方言语音数据清洗与标注,探索音频生成模型训练与优化方案,提升发音准确性和自然度,并完成评测分析与效果迭代。

任职要求

学历和专业要求: 来自计算机、人工智能、自动化、电子信息、信号处理、数学等相关专业的博士/硕士同学。 技术技能要求: 掌握深度学习、生成模型、序列建模等算法及应用,熟悉Python,了解PyTorch/TensorFlow等训练框架。 软性素质要求: 具备良好的沟通协作与问题分析能力,对音乐、音频或AIGC方向有兴趣,学习能力和执行力强。 【加分项或注意事项】 此课题同时招聘应届实习生和低年级实习生。

腾讯招聘实习生:微信助手-支持多方言的音频生成模型岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。