蚂蚁集团 · 社会招聘
蚂蚁集团-基础设施高可用工程师-杭州
杭州 ·2年以上·本科
杭州
薪资面议
前往 蚂蚁集团 官网投递
职位描述
● 守护蚂蚁全球级基础设施的稳定性:负责蚂蚁全站数百万级容器规模、数百亿次调用的基础设施服务可靠性和稳定性,覆盖服务注册中心、配置中心、限流中心、消息中心、任务调度、分布式事务、MOSN/Layotto、七层网关、HCS、DNS、NTP等核心组件。
● 从架构层面设计高可用能力:这不是传统的"被动运维"角色。你将参与产品的稳定性架构设计,主导SLA体系建设、容灾多活方案规划、混沌工程、变更防御、自愈容灾等高可用能力的设计与落地,而不仅仅是执行日常运维。
● 用技术手段解决规模化难题:深入理解基础设施产品和架构,结合业务场景对生产问题进行根因诊断和持续优化;帮助业务应用在可用性、成本、效率上做好合适的架构选型。
● 推动前沿技术大规模落地:设计并落地Service Mesh、Serverless、FaaS等在蚂蚁数百万容器场景下的接入、部署和升级方案,构建平台化能力体系化识别和管控风险。
● 探索AI驱动的智能运维:结合大模型探索AI Agent在稳定性保障中的落地实践,引领中间件产品的稳定性保障模式向数字化、智能化方向演进。
【任职要求】
我们欢迎两类背景的候选人:
1、基础设施领域研发,想转向稳定性架构方向
如果你正在做中间件/容器/网络/存储等基础设施的研发,在研发过程中深度参与过故障应急、稳定性治理,并且对"从架构层面系统性解决稳定性问题"这个方向有强烈兴趣——我们非常欢迎你。你不需要有完整的SRE经验,技术深度和稳定性方向的热情是最重要的。
2、已有基础设施SRE经验,想在大规模场景下做更有挑战的事
如果你已经在存储、数据库、大数据、网络、中间件或容器等基础设施领域做过SRE,有独立处理线上故障的经验,想在千万级日请求的规模下验证和提升自己的架构能力——这里有足够大的舞台。
我们希望你具备:
● 至少一个基础设施领域的深度技术经验(中间件/容器/网络/存储/数据库/大数据中选一),能讲清底层实现原理,而非停留在方案层面。我们更看重你在某个领域的深度,而非面面俱到。
● 大规模系统经验:参与过百节点以上规模的系统建设或运维,对大规模分布式系统的复杂性有切身体会。
● 故障应急实操经验:参与过线上故障的应急处理(研发方向参与过即可),在研发或运维过程中需要考虑稳定性问题。
● 扎实的编程基础,2年及以上研发经验,熟悉至少一种开发语言(Java/Golang/Python)。
● 对基础设施稳定性架构方向有明确的兴趣和意向——这不是一个被动执行运维指令的角色,而是一个需要主动思考、系统性设计高可用方案的技术架构角色。
加分项(有则更好,没有可以入职后培养):
● 有SLO/SLA体系建设、混沌工程、容灾多活等高可用体系的实操经验。
● 熟悉主流开源中间件(如Kafka、RabbitMQ、Redis、Dubbo等)的实现机制,有开源社区贡献。
● 熟悉Linux操作系统、网络协议、存储、Docker与Kubernetes。
● 有AI Agent开发经验或智能运维方向实践。
● 有基础设施即代码(IaC)实践经验(如Ansible、Terraform)。
最后确认在招:2026-09-01 19:09:33 · 来源平台:alibaba