阿里云智能 · 校园招聘
音视频数字人多模态大模型算法研究和应用-阿里星/A Star
杭州 ·经验不限·学历不限
北京·杭州
薪资面议
前往 阿里云智能 官网投递
职位描述
1.前沿技术研究:负责端到端多模态语音大模型的核心算法研究,攻克语音-语义联合建模、流式实时推理、情感感知对话等关键技术难题,推动从级联式架构向原生多模态架构的技术范式升级;
2.系统架构设计:主导设计面向智能外呼场景的下一代多模态对话系统架构,实现毫秒级端到端响应、自然话轮切换、实时情感理解等核心能力,重新定义人机语音交互体验;
3.大规模落地实践:将前沿研究成果落地到日均千万级调用量的工业级外呼系统,负责从数据构建、模型训练、效果调优到线上部署的全链路技术方案设计与实施;
4.数据与评测体系建设:主导构建大规模多模态对话数据集与标注体系,设计并建立覆盖语音理解、情感识别、对话质量等维度的系统化评测基准;
5.学术影响力建设:在语音、自然语言处理、多模态等领域顶级学术会议发表高质量论文,参与行业标准制定,提升团队在学术界和产业界的技术影响力;
6.技术创新孵化:探索多模态语音技术在更多创新场景(智能客服、语音助手、数字人、同声传译等)的应用可能,孵化下一代AI交互产品形态。
【任职要求】
1.计算机、电子工程、人工智能等相关专业硕士或者博士学历
2.在以下一个或多个领域有深入研究经验:
·语音识别(ASR)/ 语音合成(TTS)/ 语音情感识别(SER)
·多模态大语言模型(Multimodal LLM)
·端到端语音对话系统(Spoken Dialogue System)
·自然语言处理(NLP)/ 对话系统(Dialogue System)
3.在顶级学术会议或期刊发表过高质量论文,包括但不限于:ACL、EMNLP、NAACL、NeurIPS、ICML、ICLR、AAAI、Interspeech、ICASSP等
4.熟练掌握Python及主流深度学习框架(PyTorch/TensorFlow),具备扎实的工程实现能力
5.具备优秀的学习能力、独立研究能力和团队协作精神,对用AI技术改变人机交互方式充满热情
加分项:
1.有端到端语音大模型相关研究或工程经验(如SpeechGPT、SALMONN、Qwen-Audio、Mini-Omni、GLM-4-Voice等)
2.有大规模语言模型预训练、指令微调、RLHF等相关经验
3.有模型推理优化经验(量化、剪枝、蒸馏、投机解码、KV Cache优化等)
4.有分布式训练经验(DeepSpeed、Megatron-LM、FSDP等)
5.有知名开源项目贡献经历或顶级AI竞赛获奖经历(Kaggle、天池等)
6.在顶级会议担任过Reviewer、Area Chair或受邀进行过Tutorial/Keynote分享
7.有语音/对话方向的产业界实习或工作经验
最后确认在招:2026-09-01 19:06:52 · 来源平台:alibaba