直招.cv

← 返回职位列表

千问事业部 · 校园招聘

端到端语音智能体前沿技术研究-阿里星/C-Star

杭州 ·经验不限·学历不限

北京·杭州·上海

职位描述

1、负责统一语音多模态大模型的设计、训练、优化,涵盖语音识别、语音合成、语音理解、文本-语音融合、跨模态检索与生成等方向; 2、推动语音与其他模态(文本、图像等)在统一建模框架下的深度融合,提升模型的理解、生成与交互能力; 3、跟踪并研究前沿的多模态学习方法,包括但不限于Transformer、对比学习、扩散模型、自监督学习、强化学习等; 4、参与大规模数据预处理、模型训练与推理优化,推动模型在实际场景中的高效部署; 5、与产品、工程团队紧密协作,将研究成果应用于智能助手、虚拟人、智能硬件、会议记录等业务场景。 【任职要求】 1、计算机科学、电子工程、人工智能、信号处理等相关专业硕士及以上学历,博士优先; 2、精通语音识别(ASR)、语音合成(TTS)、语音理解(SLU)等相关技术; 3、熟悉主流大模型及深度学习框架(PyTorch/Megatron/DeepSpeed),具备大规模模型训练与调优能力; 4、熟悉多模态表示学习、跨模态对齐与融合、自监督预训练方法; 5、具备良好的算法实现能力和工程落地经验,熟悉模型压缩、蒸馏、量化、加速等技术; 6、具有较强的研究能力和创新意识,曾在顶级会议(如NeurIPS、ICML、ICLR、ACL、INTERSPEECH、ICASSP等)发表过论文者优先; 7、良好的沟通能力和团队协作精神,能够承担高强度的研发任务。 【加分项】 1、有大规模语音-文本数据构建与清洗经验; 2、有端到端多模态对话系统开发经验或者实时通话经验; 3、了解语音前端处理(VAD、说话人分离、语音增强等); 4、熟悉语音大模型及其扩展应用; 5、有开源社区贡献经历或主导过知名开源项目者优先。

最后确认在招:2026-09-01 19:06:52 · 来源平台:alibaba