直招.cv

← 返回职位列表

阿里云智能 · 社会招聘

阿里云智能-终端智能创新业务 端侧语音推理引擎专家-杭州/北京/深圳

杭州 ·3年以上·本科

北京·深圳·杭州

职位描述

1. 负责语音识别(ASR)核心算法研究与推理引擎开发,对 Conformer、RNN-T、Whisper 等主流架构进行性能优化,覆盖实时转写、离线识别、多语种、强噪声等复杂场景; 2. 负责语音合成(TTS)声学模型与声码器算法研究,对 VITS、NaturalSpeech、CosyVoice 等架构进行优化,提升合成语音的自然度、表现力与推理速度,支撑多发音人、多语种、情感风格可控合成等场景落地; 3. 负责机器翻译算法研究与产品化落地,基于 Transformer 等主流架构进行优化,设计支持云端与离线端的翻译推理框架,覆盖多语种互译、低资源语言对及垂直领域翻译场景; 4. 负责 ASR / TTS / 翻译全链路推理框架设计,推动模型流式改造、INT8/INT4 量化、知识蒸馏、结构剪枝等轻量化技术落地,支撑移动端、嵌入式设备的大并发低延迟部署; 5. 跟进 ASR、TTS、机器翻译及多模态语音领域的学术前沿与行业动态,将研究成果快速转化为工程能力,持续提升产品效果与用户体验。 【任职要求】 1. 计算机、人工智能、电子信息、信号处理等相关专业本科及以上学历,具备扎实的数学基础(概率统计、线性代数、信号处理); 2. 熟悉主流语音识别模型算法,如 CTC、RNN-T、Conformer、Whisper,熟悉 Kaldi、WeNet、ESPnet、FunASR、K2 中至少两种开源框架; 3. 熟悉主流语音合成架构,了解 VITS、FastSpeech、HiFiGAN、CosyVoice、ChatTTS、IndexTTS 等模型基本原理,掌握语音信号离散化方法及声码器设计; 4. 熟悉 Seq2Seq / Transformer 翻译架构,了解 BPE、词表构建等基础知识,有 NMT 模型训练或推理部署实践经验; 5. 具备扎实的机器学习理论基础,熟练使用 PyTorch 等深度学习框架,掌握 SSL、LLM、Diffusion、对比学习等技术在语音与翻译领域的应用; 6. 熟练掌握 Python / C / C++ 编程,有 TensorRT、ONNX Runtime、TFLite 等推理框架使用经验,具备模型量化、剪枝、蒸馏工程落地能力者优先; 7. 学习能力强,能够独立阅读英文文献,对解决具有挑战性的问题充满热情。 加分项: 1. 在 ICASSP、Interspeech、ACL、EMNLP、NeurIPS、ICML、IEEE TASLP 等顶会或期刊发表过论文,或参加过相关国际竞赛者优先; 2. 相关领域竞赛取得优异成绩者优先; 3. 对 WeNet、FunASR、fairseq 等开源项目有突出贡献者优先。

最后确认在招:2026-09-01 19:10:00 · 来源平台:alibaba