阿里云智能 · 校园招聘
AI SRE
杭州 ·经验不限·学历不限
北京·广州·杭州
薪资面议
前往 阿里云智能 官网投递
职位描述
根据 AI-Native 研发运维模式演进对运维决策、系统可靠性与基础设施可调用性的要求,完成 AI Ops 体系与关键能力建设,统筹可观测性、故障治理、可靠性优化和知识沉淀等工作,支撑运维智能化升级,实现系统稳定、高效与可规模化运行。
具体职责包括以下相关方向的一项或多项:
● 推动 AI-Native 研发运维模式演进:探索 AI 与工程师协同的软件研发与运维方式,让 AI 参与系统架构分析、运维决策与故障诊断。
● 构建 AI-Native Reliability System:设计具备推理能力的 SRE Agent,并结合系统可观测数据与知识体系,构建智能化系统分析与决策能力。
● 建设 AI-Ready 运维基础设施:升级运维基础设施,使系统数据、工具能力与执行接口能够被 AI 调用与理解。
● 设计可规模化的系统可靠性工程机制:通过系统架构与工程机制设计提升系统可靠性,例如故障隔离、风险控制与安全发布策略。
【任职要求】
1.基础条件
● 计算机、软件工程等相关专业优先。
● 具备扎实的软件工程基础与良好的编程能力(Python / Go / Java 等)。
2.专业能力
● 系统工程能力
○ 理解分布式系统和云原生架构,具备构建复杂工程系统的潜力。熟悉现代云原生基础设施,例如 Kubernetes。
● AI-Native 工程能力
○ 熟悉大语言模型(LLM)与 Agent 技术,并有将其应用于软件开发、系统分析或自动化运维的实践经验。
○ 理解 Agent 的基本机制(推理、规划、工具调用),能够将复杂系统问题抽象为可执行的任务链路。
○ 能够利用 AI 工具与智能体提升工程效率,并探索 AI 参与研发与运维流程的实践。
● 系统可靠性与工程思维
○ 理解系统可靠性工程理念,能够从系统设计与工程机制角度思考稳定性问题。
○ 能够分析复杂系统行为并识别潜在风险与异常模式。
加分项
● 有 Agent 开发经验(LangChain / AutoGen 等)。
● 有 AIOps / 智能运维研究或实践经验。
最后确认在招:2026-09-01 19:06:52 · 来源平台:alibaba