腾讯|语音/对话驱动数字人实习

腾讯 · IEG · 工作地点:上海 · 更新时间:2026-06-01

岗位职责

课题背景: 随着大模型、语音生成、多模态建模与实时渲染技术的发展,语音/对话驱动数字人正成为智能交互、虚拟主播、游戏 NPC、数字员工等方向的重要技术基础。相比传统"会说话"的数字人,真实可用的系统不仅要完成口型同步,还需要在对话过程中保持身份稳定、情绪一致、表达自然、响应实时。本课题聚焦语音与数字人交叉方向,重点研究如何结合语音、文本、上下文与环境信息,驱动游戏数字人生成自然连贯的面部表情、口型、头部运动与肢体动作,提升数字人的真实感、陪伴感与交互能力。 课题挑战: 1、角色身份一致性保持: 在长对话和多轮交互中,数字人容易出现表情习惯、动作风格、人格气质不稳定的问题,难以在情绪表达变化的同时持续保持"像这个角色在说话"; 2、语音—情绪—表情—动作的跨模态一致性: 现有方法往往只关注 lip-sync,容易出现"口型对了但情绪不对""语气强烈但表情平淡""声音和动作不同步"等跨模态冲突,缺乏覆盖语音韵律、面部表情、头部姿态、手势等多维度的统一情绪约束; 3、长时序连续性与情绪自然过渡: 持续对话中数字人容易出现表情重复、动作僵硬、情绪漂移与状态跳变等问题,且真实情绪变化是连续渐变而非离散跳转,建模自然过渡比建模静态情绪困难得多; 4、环境感知与上下文驱动不足: 数字人的表达应受场景、用户实时反馈与上下文语义的多层级影响,但目前系统在"感知—理解—表达"闭环上仍较弱,尚停留在被动回应而非主动感知; 5、实时性与端到端效率挑战: 数字人应用要求低延迟、稳定输出与在线交互,但多模态生成与高保真渲染链路推理成本高,难以兼顾效果与实时性。 具体工作: 1、多模态输入到数字人驱动的可控生成框架 融合语音、文本、上下文、环境信息与角色设定,建立统一的情绪条件表示;以 3D 数字人为主、兼顾 2D 视频数字人,研究从语音/对话到表情、口型、头部和肢体动作的联合生成,支持情绪强度、风格、视线等可控调节; 2、情绪一致性与长时序连续性建模 研究跨模态情绪约束与信号传递机制,解决语音、文本、表情、动作之间的情绪冲突;通过时序模型和状态记忆机制提升多轮对话中的情绪连贯性与自然过渡,缓解情绪漂移问题; 3、实时推理与端到端链路优化 面向在线交互场景,优化从语音输入到数字人输出的完整链路,涉及模型量化、推理加速、流式生成等,兼顾生成质量、响应延迟与系统稳定性。

任职要求

基本素质: 具备扎实的计算机科学、人工智能、计算机图形学或语音处理理论基础,拥有良好的跨学科技术视野与学术素养。在语音/对话驱动数字人领域,具备较强的独立科研能力与问题分析能力,能够围绕语音、文本、表情、动作与环境感知等多模态信息开展研究,探索数字人在真实交互场景下的情绪一致性、表达自然性与实时驱动问题。具备长期主义的科研精神,致力于将前沿模型与技术转化为具备实际应用价值的数字人原型与实验成果。 技能要求: 1、理论深度:在生成模型、多模态学习、计算机视觉、计算机图形学或语音技术方面具备扎实积累,熟悉 Transformer、Diffusion、时序建模、迁移学习等关键技术,并能够将其应用于语音/对话驱动数字人的核心任务中,如情绪一致性建模、音视频同步、表情与动作联合生成、长时序连续性优化等; 2、工程与实验能力:具备较强的模型实现与实验推进能力,熟悉语音、视频与 3D 数字人相关的数据处理、训练与调试流程。了解或掌握SMPL-X标准骨骼、FLAME、blendshape、MetaHuman 等 3D 数字人表示与资产体系,并具备一定的实时推理优化、部署加速或端到端系统实现能力; 3、学术成果:在 CVPR、SIGGRAPH、NeurIPS、ICML、ICLR、ACL、INTERSPEECH 等顶级会议发表过高质量论文者优先,研究方向聚焦于生成模型、多模态学习、语音交互、数字人等领域;在语音驱动生成、对话数字人、情绪建模、3D 人体/面部表示等相关方向有成果者优先。

腾讯招聘实习生:语音/对话驱动数字人岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。