直招.cv

← 返回职位列表

蚂蚁集团 · 社会招聘

蚂蚁集团-基础设施高可用架构师-杭州

杭州 ·5年以上·本科

杭州

职位描述

1. 稳定性架构设计:面向蚂蚁全站基础设施,设计端到端的稳定性保障架构,包括 SLA/SLO体系、容灾架构(同城/异地多活、单元化)、容量管理、故障自愈、变更安全等顶层模型,推动各基础设施域按统一标准落地。 2. 风险识别与架构评审:建立体系化的风险识别机制,主导重大架构变更、新平台接入、大促/容灾演练的稳定性评审,识别单点、依赖链路、爆炸半径、容量瓶颈等系统性风险,给出架构级改进方案并推动闭环。 3. 故障应急与根因治理:作为重大故障的架构级应急owner,主导定位与恢复;牵头根因分析,推动架构、流程、防护能力的长期治理,持续收敛基础设施稳定性风险。 4. 高可用能力建设:设计并落地监控告警、链路追踪、混沌工程、故障演练、自愈容灾等平台化能力,构建覆盖发现—定位—恢复—复盘的全生命周期稳定性工具链。 5. 大规模场景落地:围绕 ServiceMesh、Serverless、FaaS、混合云等在数百万容器场景下的接入、部署、升级与容灾方案,输出可复制的基础设施稳定性架构范式。 6. 智能化演进:结合大模型与 AI Agents,探索智能监控、智能应急、智能容量预测等方向的架构设计与落地,引领稳定性保障向智能化、数字化演进。 7. 跨团队协同与标准沉淀:与中间件、容器、网络、存储、安全等团队协同制定稳定性标准与架构基线,沉淀方法论,赋能业务应用在可用性、成本、效率上做出合理的架构选型。 【任职要求】 1.基本要求: - 计算机或相关专业本科及以上学历,5 年及以上大规模分布式系统研发或 SRE 架构经验,有过完整的高可用架构设计与落地案例。 - 扎实的编程基础,熟练掌握 Java / Golang / Python 中至少一种,能独立完成稳定性工具与平台的设计开发。 - 深入理解 Linux 操作系统、网络协议、存储、Docker 与 Kubernetes,熟悉大规模容器化与云原生架构。 - 熟悉主流开源中间件(Kafka、RabbitMQ、Redis、Dubbo 等)及其实现机制,理解其在超大规模下的稳定性边界与失效模式。 2.架构与稳定性能力: - 熟练掌握 SLO/SLI 体系、容量管理、容灾多活、混沌工程、故障演练等方法论,并具备体系化落地经验。 - 具备跨域复杂系统的故障定位与应急能力,主导过 P0/P1 级故障的定位、恢复与治理闭环。 - 能从架构层面抽象稳定性问题,输出可复用的架构模式与风险治理方案,而非依赖堆人力运维。 3. 加分项: - 有百万级容器/千万级 QPS 规模基础设施的稳定性架构或 SRE 经验。 - 有同城/异地多活、单元化部署、混合云容灾的大规模落地经验。 - 有 Service Mesh、Serverless、FaaS 等云原生架构在大规模场景下的接入与稳定性保障经验。 - 有 IaC 实践经验(Terraform / Ansible 等),熟悉运维自动化与基础设施即代码。 - 有开源社区贡献,或在中间件、云原生、可观测性等领域的开源项目中有深度参与。 - 有 AI Agents、大模型在运维/稳定性场景的落地经验。

最后确认在招:2026-09-01 19:09:33 · 来源平台:alibaba