阿里云智能 · 社会招聘
阿里云智能-运维技术专家-AI&MaaS方向-杭州
杭州 ·5年以上·本科
杭州
薪资面议
前往 阿里云智能 官网投递
职位描述
部门介绍
云智能集团承载着阿里巴巴集团在人工智能与云计算领域的核心技术与业务创新,致力于构建面向全球的企业级 MaaS(Model as a Service)平台。随着大模型技术的快速发展,MaaS 已成为云计算服务的重要形态,涵盖模型推理服务、模型训练集群、AI 基础设施、向量数据库等核心产品矩阵。
GOC(Global Operations Center)团队承担着 MaaS 平台生产环境的稳定性保障与服务连续性使命。我们面临的挑战包括:
1. GPU 基础设施稳定性:万卡级 GPU 集群的高可用管理、故障隔离与容灾调度
2. 模型服务高可用:大模型推理服务 99.99% 可用性保障,毫秒级响应 SLA
3. AI-Native 运维体系:构建智能化运维能力,实现故障自愈、智能诊断与预测性维护
4. 大规模活动保障:支撑双 11、重要客户上线、模型发布会等关键时期的服务稳定性
5. 数据安全与合规:保障客户模型资产、训练数据、推理请求的数据可靠性与合规性
岗位职责
1. 稳定性体系建设与度量:建立并完善 MaaS 平台稳定性规范、标准与流程体系,覆盖健壮性架构、研发质量、发布变更、生产环境运行管理等方面,制定稳定性度量指标并持续度量改进,将稳定性要求贯彻到平台技术研发全链路。
2. 故障全生命周期管理:负责 MaaS 平台技术类故障的全流程管理,包括应急响应、协同调度、故障定位、恢复处置与复盘改进;执行值班响应职责,在 SLA 时间内完成对客响应,持续优化故障管理体系的质量与效率。
3. 推动稳定性架构治理战役:主导推进 MaaS 平台稳定性架构治理重大战役,包括全栈容灾、变更灰度、应急 1-5-10、资损防控、GPU 故障隔离等,通过技术与管理结合的体系化手段将稳定性风险快速持续收敛。
4. MaaS 运维保障解决方案落地:设计并落地 MaaS 业务的运维保障解决方案,涵盖线上问题管理、全链路监控管理、生产变更管理、故障容灾演练等方向;沉淀运维最佳实践,形成面向云用户的标准运维保障方案,持续优化落地效果。
5. 客户活动稳定性保障:主导客户大型活动的稳定性保障工作,包括重要模型发布、业务大促(如双 11)、行业峰会等关键时期的全方位保障,确保客户业务连续运行与体验。
【任职要求】
1. 专业背景:计算机、软件工程、人工智能等相关专业,具备扎实的计算机科学基础,对云计算或 AI 大模型方向有浓厚的兴趣和持续的技术积累。
2. 技术栈能力:3 年以上云计算或 AI 基础设施运维、SRE、稳定性保障相关经验。技术栈聚焦以下一个或多个领域:
● 运维技术栈:深入理解 Kubernetes 等云原生基础设施,熟悉监控、告警、变更、容灾等 SRE 工具链,具备存储、网络、数据库等云计算产品运维经验
● AI 技术栈:熟悉大语言模型(LLM)与 Agent 技术,有将其应用于自动化运维、故障诊断或系统分析的实践经验;了解 GPU 集群管理、模型推理服务架构者优先
3. 系统性解决问题能力:具备清晰的分析逻辑与全局思维,能针对复杂系统行为识别潜在风险与异常模式;善于从系统设计与工程机制角度提出创造性的解决思路,推动问题根除与持续改进。
4. 沟通协作与结构化表达:具备优秀的沟通能力和结构化表达能力,能主动洞察沟通对象的核心诉求,高效达成共识;能主导跨部门复杂业务协作,推动多方共同完成目标。
5. 快速学习与并行执行力:具备快速学习新技术的能力,能敏锐跟踪并吸收 AI、云原生、可观测性等前沿方向的发展;能高效并行处理多项工作,在压力下保持清晰的优先级判断。
加分项
1. AI 与 MaaS 实践:有大模型 ACA 认证、MaaS 平台运维或 GPU 集群管理经验,熟悉 LangChain / AutoGen 等 Agent 框架开发
2. AIOps 经验:有智能运维研究或落地实践,如异常检测、根因分析、智能告警等
3. ITIL 与多云:有 ITIL 认证及体系化实践,或具备 AWS / Azure / GCP 等云平台稳定性保障经验
4. 项目管理:能独立主导跨部门复杂项目落地,具备项目规划与推进能力
最后确认在招:2026-09-01 19:10:00 · 来源平台:alibaba