千问事业部 · 校园招聘
端到端语音智能体前沿技术研究-阿里星/C-Star
杭州 ·经验不限·学历不限
北京·杭州·上海
薪资面议
前往 千问事业部 官网投递
职位描述
1、负责统一语音多模态大模型的设计、训练、优化,涵盖语音识别、语音合成、语音理解、文本-语音融合、跨模态检索与生成等方向;
2、推动语音与其他模态(文本、图像等)在统一建模框架下的深度融合,提升模型的理解、生成与交互能力;
3、跟踪并研究前沿的多模态学习方法,包括但不限于Transformer、对比学习、扩散模型、自监督学习、强化学习等;
4、参与大规模数据预处理、模型训练与推理优化,推动模型在实际场景中的高效部署;
5、与产品、工程团队紧密协作,将研究成果应用于智能助手、虚拟人、智能硬件、会议记录等业务场景。
【任职要求】
1、计算机科学、电子工程、人工智能、信号处理等相关专业硕士及以上学历,博士优先;
2、精通语音识别(ASR)、语音合成(TTS)、语音理解(SLU)等相关技术;
3、熟悉主流大模型及深度学习框架(PyTorch/Megatron/DeepSpeed),具备大规模模型训练与调优能力;
4、熟悉多模态表示学习、跨模态对齐与融合、自监督预训练方法;
5、具备良好的算法实现能力和工程落地经验,熟悉模型压缩、蒸馏、量化、加速等技术;
6、具有较强的研究能力和创新意识,曾在顶级会议(如NeurIPS、ICML、ICLR、ACL、INTERSPEECH、ICASSP等)发表过论文者优先;
7、良好的沟通能力和团队协作精神,能够承担高强度的研发任务。
【加分项】
1、有大规模语音-文本数据构建与清洗经验;
2、有端到端多模态对话系统开发经验或者实时通话经验;
3、了解语音前端处理(VAD、说话人分离、语音增强等);
4、熟悉语音大模型及其扩展应用;
5、有开源社区贡献经历或主导过知名开源项目者优先。
最后确认在招:2026-09-01 19:06:52 · 来源平台:alibaba