月之暗面 社会招聘
Kimi 资深业务SRE
北京 ·经验不限·学历不限
北京
薪资面议
前往 月之暗面 官网投递
职位描述
你将负责什么
1. 定义 Kimi 业务的稳定性
「稳」是什么、稳到什么程度、怎么衡量——在 Kimi,这些问题的答案由你来写。Kimi 业务正在高速发展,模型高频发布、产品形态快速演进:你不只是在维护一套静态系统,而是深入快速变化的 AI 架构与产品演进路线,在真正的前沿场景里定义可靠性。
与研发团队共建 SLO / SLI 体系,在可用性、延迟与迭代速度之间取得平衡,让可靠性目标与业务影响直接挂钩。
建立信号清晰的告警体系:分级、降噪,实现故障的分钟级发现与精准定位。
主导故障响应与复盘:快速恢复、彻底复盘、系统性改进——让团队从每一次故障中学到东西,确保同类问题不重复发生。
2. 发布工程与变更安全
为高频模型发布与产品迭代设计安全变更框架:灰度、金丝雀、自动回滚、变更可观测性,把「变更导致故障」的概率降至最低。
护航关键发布:发布前 readiness 评估(容量、依赖、回滚路径),发布中值守,发布后复盘。
把发布 runbook 沉淀为工具与流水线,把手工核验变成持续校验——每一次发布,都让 checklist 更短。
3. 可观测性与可靠性工程
与研发共建统一的 Telemetry 标准(Metrics / Logs / Traces),构建从业务指标到基础设施指标的全链路可观测性。
用软件工程手段消除重复劳动(toil):自动化诊断、容量与性能管理、混沌工程与合成测试,把高频人工操作变成自助服务。
持续优化资源利用率与成本效率。
4. AI-native 与平台协作
用 AI Agent 重做可靠性工作:告警分析、事故总结、自动巡检——把已在内部跑通的雏形产品化,做「AI 时代 SRE 怎么工作」的探索者。
参与需求与架构评审,把可靠性前置到设计阶段,帮助业务团队早期规避技术债。
用好公司统一 infra 能力,把平台能力转化为业务指标。
我们期待的你
必须项
具备架构能力和意识:能清晰定义和描述业务架构,画得出系统全貌,看得清模块间的接缝;能对跨团队的技术方向形成判断并推动对齐。
系统功底扎实:精通 Linux 操作系统、网络、存储,具备深度诊断与优化能力。
精通 Cloud Native 架构:Kubernetes、Grafana、Loki、Helm、ArgoCD 等生态有生产环境实践。
AI-native 工作方式:对 AI Agent 有独到理解,自己就在用 AI 工具重做运维流程、提升工程效率。
有实打实的开发能力:精通 Go 语言,必须做过 DevOps 平台或系统,能用代码把重复工作自动化掉。
大规模在线业务的生产可靠性实战经验(SRE / Production Engineer / 后端出身均可),包括 on-call、故障响应与复盘驱动的改进。
对业务有热情,对细节问题一丝不苟;owner 意识强烈,有强烈的推动问题解决的意愿。
熟悉海内外主流云厂商的资源配置和使用。
加分项
有大模型 serving / 推理链路运维经验,理解 AI 产品的可靠性特性。
主导过从混乱到秩序的 SRE 建设:报警治理、发布流程重构、On-call 体系搭建。
可观测性或基础设施开源项目贡献者;熟悉 Chaos Engineering、eBPF、Service Mesh 等前沿技术。
我们能提供什么
直接的业务影响力:千万级用户的产品与高频模型发布,你的改进立即作用于核心业务,解决真实且紧迫的痛点。
前沿的真实战场:参与快速变化的 AI 架构与产品演进路线,你遇到的可靠性问题大多是新问题。
建设而非维护:我们处于快速成长期,你需要建立标准而非遵守过时的标准,有充足的发挥空间和资源支持。
AI-native 的实践场:把 AI Agent 用进可靠性工程,把你的 SRE Agent 产品化,这是一次全新的尝试。
与优秀的工程团队协作:我们是一群务实、对技术有追求的工程师,相信你能在这里找到技术共鸣。
官网发布:2026-08-26 · 最后确认在招:2026-09-03 21:40:44 · 来源平台:moka