直招.cv

← 返回职位列表

蚂蚁集团 · 社会招聘

蚂蚁集团-语音大模型算法-健康事业群

杭州 ·2年以上·本科

北京·杭州

职位描述

1. 面向蚂蚁集团医疗智能化场景,负责语音大模型相关算法研发与落地,探索基于大模型的新一代智能语音交互/多模态实时音视频交互范式,推动语音 AI 能力在真实医疗业务场景中的规模化应用; 2. 负责语音识别、语音理解、语音合成及语音对话大模型相关技术研发,包括但不限于: 语音识别大模型(ASR):探索复杂场景下的语音识别能力提升,包括医疗专业词、实体热词、方言、多语种、低资源语言、复杂环境鲁棒识别等方向; 语音合成大模型(TTS):探索高自然度、高表现力语音生成技术,包括自然对话、instruct情感表达、文本前端、多音字等方向; 语音对话大模型(Speech LLM):探索端到端语音交互、多模态理解、语音推理、Speech2Text 数据构建、模型后训练、能力评测等方向; 3. 负责语音大模型训练、优化及工程化落地,包括数据构建、模型训练、Post-training、强化学习、评测体系建设等关键环节,打造行业领先的语音智能能力; 4. 跟踪国内外语音、多模态、大模型领域前沿技术发展,结合业务场景探索 AI + 医疗的新型交互模式,推动医疗行业智能化升级。 【任职要求】 1. 计算机科学、人工智能、电子信息、语音技术等相关专业,本科及以上学历,2年以上语音算法、大模型算法或机器学习相关研发经验; 2. 对语音大模型领域有深入理解和实践经验,熟悉 ASR、TTS、Speech LLM、多模态模型等相关技术方向,在一个或多个方向具备较强技术积累; 3. 语音识别方向: • 熟悉端到端 ASR 技术,包括 Conformer、Transducer、CTC/Attention Encoder-Decoder、Audio LLM 等模型架构; • 具备语音识别系统优化经验,有热词增强、实体识别、方言、多语种、低资源语音等方向经验优先; 4. 语音合成方向: • 熟悉主流 TTS 模型架构,包括 VITS、Diffusion TTS、Codec-based TTS、LLM-based TTS 等; • 具备自然度提升、情感控制、音色克隆、实时 TTS、文本正则/文本前端优化经验优先; 5. 语音对话大模型方向: • 熟悉 Speech LLM、多模态大模型训练范式; • 有语音指令数据构建、SFT/RL/Post-training、模型评测体系建设经验优先; 6. 具备扎实的算法工程能力,熟悉 Python/C++,熟悉深度学习框架(PyTorch 等),有大规模模型训练、优化和部署经验; 7. 对 AI 前沿技术有强烈兴趣,具备良好的学习能力、问题分析能力和团队协作能力; 8. 有 NeurIPS、ICLR、ACL、ICASSP、INTERSPEECH 等顶会论文发表经历,或参与开源大模型项目者优先。

最后确认在招:2026-09-01 19:09:33 · 来源平台:alibaba