直招.cv

← 返回职位列表

小米 校园招聘

顶尖应届-语音理解大模型算法工程师-大模型

北京 ·经验不限·学历不限

北京

职位描述

1、研发语音理解大模型核心技术,在模型结构、对齐策略、指令微调、偏好对齐、多阶段渐进式学习训练策略、推理能力增强(关系推理、因果推理、常识推理)等方面做出创新突破,达到业内一流。 2、优化语音拾音大模型的上下文感知能力,通过送入交互历史信息提升语音识别准确率;优化语音识别大模型的热词感知能力,通过送入相关热词提升语音识别准确率;优化语音多模态理解大模型的SpeechEncoder,提升语音理解大模型的语音理解能力和声音理解能力,包括语音内容、情感、性别、声音事件、音乐风格等;在用户跟智能体对话的过程中,检测用户的表达完整性,从而加快系统响应速度且不带来更多的误截断;在语音对话模型中,检测用户交互的对象,从而提升打断的有效性和系统交互的响应速度。 3、优化语音理解大模型的效果,提升语音、声音、环境信息的感知和理解能力,提升语音理解大模型的时间戳感知能力,提升语音理解大模型对特定异响声音的鉴别能力。 4、 优化空间音频理解的效果,提升多通道端到端语音理解能力,提升鸡尾酒会场景的语音识别和语音理解能力,提升说话人日志的效果。 5. 优化语音安全的能力,提升语音理解大模型对说话人感知的能力,提升语音理解大模型对合成音频的鉴别能力。 6. 提升端到端语音理解能力,建立比较广泛的业界影响力。 7. 推动语音理解算法落地,在小米核心业务场景提升核心产品竞争力和用户智能体验,包括手机(OS/小爱)、汽车、生态链等。 【任职要求】 1、博士学历,计算机、人工智能、机器学习、电子信息、自动化、数学等相关专业,多模态大模型、语音理解等相关方向; 2、具备丰富的多模态大模型、或语音理解经验,对多模态大模型、语音理解、全模态理解等有深入理解; 3、具备优秀的编程能力,熟练掌握PyTorch等至少一门深度学习框架,熟练掌握Python或C++等至少一门编程语言; 4、在Interspeech/ICASSP/AAAI/NeurIPS / ICLR / ICML等顶会发表过多模态大模型或深度强化学习方向高水平论文,或以主力身份参加相关领域主流算法竞赛且取得优秀成绩者,优先; 5、在ACM/ICPC、CodeForces、IOI/NOI/NOIP/CSP等编程算法竞赛中获得优秀成绩者,优先; 6、具备良好的团队合作精神;

官网发布:2026-07-28 · 最后确认在招:2026-09-03 23:17:24 · 来源平台:xiaomi