腾讯|腾讯云—音视频语音识别大模型研究实习

腾讯 · CSIG · 工作地点:上海 · 更新时间:2026-06-01

岗位职责

课题背景: 针对ASR在复杂场景(多轮对话、噪声、口音)的识别瓶颈及传统模型迭代慢、响应滞后问题,利用LLM的上下文推理与热词感知能力,构建可敏捷适应线上变化、快速修复识别缺陷的新一代架构。 课题挑战: 1、实时响应滞后:传统模型无法即时吸收新热词、适应主题切换,线上问题修复不及时。 2、语境歧义难解:缺乏长上下文参考,易混淆同音词或在噪声中丢失关键语义。 3、LLM流式效果不佳:低延迟流式场景下,音频特征与LLM动态文本特征的维度高效对齐困难,影响实时识别效果。 具体工作: 1、构建动态上下文修复机制:研发LLM推理模块捕捉对话主题演变,设计动态提示工程注入实时主题与热词,修正语境缺失错误。 2、开发热词自适应与在线纠偏方案:建立热词库与解码器毫秒级联动,生成候选修正列表,实现无需全量重训的热修复能力。 3、实现跨模态特征高效对齐:研究音文特征维度映射算法,验证最优融合架构,平衡开销与效果,保障复杂场景高准确率。

任职要求

1、计算机、人工智能、数学等相关专业的全日制研究生及以上学历; 2、熟悉ASR语音识别、LLM模型项目; 3、具备 Python/C++ 的算法实现能力,有深度学习框架 PyTorch/TensorFlow 经验。

腾讯招聘实习生:腾讯云—音视频语音识别大模型研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。