
智元|大模型音频算法工程师
岗位职责
参与大模型音频算法(ASR/AudioLLM/TTS等)的研究与落地,负责模型的SFT有监督微调训练、优化及部署;
针对语音合成、语音识别、语音理解等场景,设计高效的微调策略,提升模型在垂直领域的性能与鲁棒性;
负责音频数据预处理、质量分析及训练数据集构建,持续优化数据管线;
跟进AudioLLM、FlowMatching、Diffusion TTS等前沿技术,推动技术在业务场景的工程化落地;
撰写技术文档,沉淀模型训练方法论与最佳实践。
任职要求
硕士及以上学历,计算机科学、人工智能、信号处理等相关专业;
扎实的深度学习基础,熟悉Transformer、LLM架构及训练流程,有语音相关项目经验者优先;
熟练使用PyTorch、DeepSpeed、Transformers等深度学习框架及工具,具备大模型SFT/RLHF实操经验;
熟悉至少一个音频任务:ASR(语音识别)、TTS(语音合成)、Voice Conversion、Audio Codec等;
具备优秀的编程能力(Python/C++),良好的逻辑思维与沟通能力,能够快速复现前沿论文。
加分项
在Interspeech、ICASSP、NeurIPS、ACL等顶会发表过语音/音频相关论文;
熟悉主流开源AudioLLM项目(如Qwen-Audio、Gemini Audio、CosyVoice、FishSpeech等);
具备多机多卡大模型训练经验,熟悉Megatron-LM、FSDP等分布式训练框架;
有Kaldi、WeNet、ESPnet等传统语音工具链使用经验。
智元校园招聘:大模型音频算法工程师岗位来自智元招聘官网,具体内容以智元招聘官网为准。
