
腾讯|微信助手-支持多方言的音频生成模型实习
岗位职责
课题背景:
微信语音消息、语音播报、数字人交互等场景对自然、拟真且具有地域亲和力的语音生成能力需求不断提升。普通话语音生成已较成熟,但在类似客家话等小语种方言场景中,现有模型常存在发音不准、韵律不自然、风格不稳定等问题,因此需要研发支持多方言的音频生成模型,提升用户体验与表达丰富度。
课题挑战:
多方言语音生成面临发音体系差异大、方言文本表示不统一、训练数据稀缺等问题。部分方言存在多音、多读法和强地域差异,导致模型难以准确学习语音映射关系。同时,真实业务还要求模型兼顾自然度、可懂度、情感表现力和说话人一致性,在长文本、口语化表达及跨方言迁移场景下都保持稳定生成,这对数据、建模和评测都提出了较高要求。
具体工作:
参与多方言语音数据清洗与标注,探索音频生成模型训练与优化方案,提升发音准确性和自然度,并完成评测分析与效果迭代。
任职要求
学历和专业要求:
来自计算机、人工智能、自动化、电子信息、信号处理、数学等相关专业的博士/硕士同学。
技术技能要求:
掌握深度学习、生成模型、序列建模等算法及应用,熟悉Python,了解PyTorch/TensorFlow等训练框架。
软性素质要求:
具备良好的沟通协作与问题分析能力,对音乐、音频或AIGC方向有兴趣,学习能力和执行力强。
【加分项或注意事项】
此课题同时招聘应届实习生和低年级实习生。
腾讯招聘实习生:微信助手-支持多方言的音频生成模型岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
