直招.cv

← 返回职位列表

小米 社会招聘

MiMo算法研究员-音频&语音

北京 ·经验不限·学历不限

北京

职位描述

我们在做什么?我们在通过探索 scaling 语音预训练和后训练,来让模型涌现出真正的语音超级智能。 1. Data - 海量语音数据处理:建设超大规模真实语音数据发掘、采集、预处理与清洗的流水线 - 高质量语音数据处理:搭建在海量真实语音中对高质量数据进行定义、召回、标注的流水线 2. Backbone & Infra - 语音原生架构:探索随着语音数据 scaling 收益上限最高的建模架构,不限于离散或者连续建模 - 高效训推框架:适配最契合语音模型架构的训练和推理框架,兼顾性能和效率 3. Pretrain & Post-train - 定义语音生成式预训练:围绕可泛化的语音预训练模型展开前沿探索性研究,坚定 scaling 路线 - 强化学习后训练:为语音预训练模型的强大能力提供语音对话的交互方式,激发预训练潜力 4. Evaluation & Product - 全面评估框架:定义和构建从预训练到后训练的评估方式 - 创新产品:搭建最适配模型能力的创新型产品 【任职要求】 我们在寻找怎样的你? - 共同信仰 — 相信语音端到端路线,相信语音 scaling 的巨大潜力,期待构建真正的语音超级智能。 - 期待打破边界和突破上限 — 对"还没有标准答案"的问题充满兴趣,愿意去做难而正确的事情,不怕打破常规,不怕不确定性,也不满足于在已有框架内做局部优化。 - 主动思考和深入思考的能力 — 能够自驱发现问题、提出假设、设计实验并复盘迭代;习惯把问题从"差不多能用"想清楚到"本质机制是什么",敢于质疑默认设定和隐含前提。 - 产品思维和用户思维 — 能够从具体使用场景出发思考能力边界、数据策略和评估方式。 - 团队协作精神和沟通能力 — 乐于和研究、工程、产品等多角色对齐,能够清晰表达想法、约束和 trade-off,愿意在 code review、实验设计、产品方案中彼此碰撞、共同打磨。 - 工程能力 — 具备扎实的编码能力(如 Python / C++ 等),有良好的代码结构和工程习惯;对大规模模型训练、推理部署或数据流水线工程化有经验者优先,有分布式训练、性能优化或在线服务经验更佳。

官网发布:2026-03-25 · 最后确认在招:2026-09-03 23:18:29 · 来源平台:xiaomi