直招.cv

← 返回职位列表

九号公司 社会招聘

SRE专家

北京 ·经验不限·学历不限

北京

职位描述

岗位职责: 1.稳定性体系构建与治理 负责公司核心业务与平台的全链路稳定性体系的规划、设计与持续优化,建立可量化、可运营的稳定性标准。 主导容量管理,包括容量规划、评估、压测与弹性伸缩策略制定,确保系统能从容应对业务峰值。 建立并推行基于 SLO/错误预算 的稳定性管理机制,平衡业务创新与系统稳定。 主导混沌工程实践,通过主动故障注入,验证系统韧性,驱动架构和预案的持续改进。 2.架构护航与专项治理 深度参与重大业务项目与核心架构演进(如微服务拆分、数据库重构、新机房/区域部署),从稳定性视角进行架构评审与风险把控。 主导变更风险防控体系建设,优化CI/CD流程,落地灰度发布、蓝绿部署等策略,降低发布风险。 牵头稳定性专项治理(如强弱依赖治理、慢调用治理、预案梳理与演练),系统性消除已知风险。 3.智能运维与工程效率提升 建设和完善可观测性平台,提升监控、日志、链路的覆盖度与智能化水平,实现故障的快速发现与定位。 探索并推动 AIOps 在智能告警、异常检测、根因分析、容量预测等场景的落地,提升运维自动化与智能化水平。 通过开发自动化工具和平台,工程化地解决重复性运维问题,提升团队整体运维效率。 4.故障管理与文化建设 作为核心骨干处理重大线上故障,组织应急响应、协调资源、推动快速恢复,并主导深度复盘。 建立并固化故障管理闭环流程,确保改进措施有效落地,将经验沉淀为知识库、工具或流程规范。 在技术团队内推广稳定性最佳实践,培养团队的稳定性意识与故障处理能力。任职要求: 计算机或相关专业本科及以上学历,5-8年以上SRE、运维架构或高可用系统建设经验。 拥有大规模、高并发分布式系统的稳定性保障和运维实战经验,对系统架构有深刻理解。 精通Linux操作系统、网络、存储等基础设施原理。 深入理解微服务架构、容器化技术(Docker/Kubernetes)及服务网格。 熟悉至少一种主流云平台(AWS/Azure/GCP/阿里云/腾讯云)的核心服务与架构。 熟练掌握高可用、容灾、限流、降级、熔断等稳定性设计模式。 精通全链路压测、容量规划、混沌工程等稳定性保障方法论。 具备丰富的监控、日志、APM等可观测性体系建设经验。 具备优秀的编程能力(Python/Go/Java等),善于通过自动化工具和平台解决运维问题。 熟悉DevOps理念与工具链,能主导CI/CD、IaC等实践落地。 优先考虑(加分项) 有主导过从0到1构建SRE体系或大型稳定性专项的成功经验。 有互联网头部公司(如Google、Netflix、字节跳动、阿里巴巴、腾讯等)核心SRE/基础架构团队工作经验。 有开源项目贡献或在技术社区有影响力。 具备跨国、多区域业务系统的稳定性保障经验。

官网发布:2026-04-08 · 最后确认在招:2026-09-03 21:08:29 · 来源平台:moka