
智元|语义动作生成算法工程师
岗位职责
结合TTS(文本转语音)的韵律特征(音素时长、基频、能量),生成与语音同步的口型、头部姿态、手势等副语言动作
设计多模态对齐机制,确保动作生成与语音合成的节奏、停顿、情感表达精准同步
构建语音合成与动作生成的流式协同框架,支持实时对话场景下的低延迟、高同步度输出
将算法能力封装为可复用的动作生成SDK/服务,支撑多元业务场景
与机器人控制、交互系统团队紧密协作,推动技术方案的产品化落地
任职要求
•计算机、机器人学、图形学、人工智能等相关专业硕士及以上学历,博士优先,相关领域研究或开发经验
•扎实的深度学习基础,精通PyTorch,有生成模型(Diffusion、VAE、GAN、Flow-based)的实际项目经验
•深入了解动作生成领域,熟悉MotionGPT、HumanML3D、MotionDiffusion、PhysDiff、ASE等代表性工作
•熟悉机器人运动学、计算机图形学中的角色动画基础,了解正向/逆向运动学、骨骼动画原理
•具备语音合成(TTS)相关基础知识,了解声学模型、声码器、韵律建模
熟悉动作表示与处理:SMPL/SMPL-X、BVH、AMC、运动学图(Kinematic Trees)、四元数/旋转矩阵表示
加分项
•顶级会议期刊论文发表
•有真实机器人平台或虚拟人引擎的实际落地经验
•熟悉实时动作生成管线,或有游戏/影视动画行业经验
•有语音合成(TTS)或语音识别(ASR)的深入研发经验,具备多模态联合训练经验
•熟悉物理驱动的动作生成、强化学习(RL)在动作控制中的应用
•有开源项目贡献或相关专利
智元校园招聘:语义动作生成算法工程师岗位来自智元招聘官网,具体内容以智元招聘官网为准。
