
腾讯|腾讯会议—语音理解大模型方向研究实习
岗位职责
课题背景:
会议内容理解是一项艰巨的课题,难点主要在于超长音频,超长上下文,多说话人,多距离,多语种,多方言,多轮,连续语流,还需要利用会议中出现的各类视觉,文本多模态信息,辅助音频理解达到理想的效果。
课题挑战:
会议是一个连续,长时音频输入,又涉及多人对话,远场场景,还有文档分享这些外部输入源。本研究旨在研发超长音频,超长上下文,多说话人,连续语流场景下,全面理解会议内容的大模型方案;更好的识别会议内容(semantic info)和富信息(paralinguistic info)。与此同时,如何更好的利用会议进行时的实时in context learning:充分利用会议的会前文档,会中屏幕文档共享,会议历史信息,提升模型的输出质量,最后,研发会议reward model,通过和参会用户不断的交互,建立价值体系,在交互中不断提升模型的能力。
具体工作:
本职位承接腾讯会议实时字幕,会后流式和离线纪要,上传文件,录音笔,实时和离线多语种语音内容理解等工作。在当前已有模型下,需要进一步提升内容识别和理解质量,这里就需要针对会议的特点,从长度和内容的丰富度上,研发超长音频,超长上下文,多说话人,多语种,多方言,多轮,连续语流场景下,全面理解会议内容的大模型方案;同时,从可利用的信息上,充分利用会中会外各类多媒体信息,通过和用户不断的交互,提升会议场景内容理解的质量。
任职要求
1、具有语音识别、说话人识别等方向的研究经验;
2、具备一定的LLM理论基础和调优实践经验;
3、熟悉端到端语音大模型的训练和调优技术;
4、在Interspeech、ICASSP等会议中投稿者优先。
腾讯招聘实习生:腾讯会议—语音理解大模型方向研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
