直招.cv

← 返回职位列表

众安保险 社会招聘

【技研】SRE高级工程师

地点未注明 ·经验不限·学历不限

职位描述

工作职责: - 负责业务全链路运维保障,涵盖系统、网络、容器、中间件、数据库领域,承担线上故障应急处置、预案建设与演练,完成故障复盘,迭代 SOP 与应急预案,形成问题经验闭环。 - 牵头处理跨域复杂线上故障,拆解排查路径、定位根因并推动问题闭环,运用大模型开展日志分析、故障诊断、脚本生成,提升问题处置效率。 - 搭建 SLI/SLO 稳定性量化体系,落地容量规划、容灾备份、流量调度,识别潜在运维风险并完成前置治理,利用 AI 能力实现流量预测、风险预判。 - 设计并落地指标、日志、链路、流量全链路可观测体系,建设分级告警与告警降噪机制,借助 AI 完成异常关联分析,缩短故障 MTTR。 - 推进运维标准化、自动化建设,沉淀 SOP 与交付规范,开发运维脚本与自动化工具,批量运维操作、简易故障自愈,探索大模型在运维场景落地,减少人工操作,降低人为变更风险。 - 负责云原生基础设施运维,开展资源效能分析与成本治理,通过 AI 完成资源画像、闲置资源识别、容量测算、弹性调优,提升资源利用率,实现成本压降。 职位要求: - 5 年以上大规模分布式 SRE / 生产运维实战经验,具备互联网业务全链路稳定性保障项目经历。 - 精通 Linux 系统原理与故障排查,熟悉 TCP/IP、HTTP 等网络协议,能够使用 tcpdump/Wireshark 定位网络问题,了解云网络产品原理及业务适用场景。 - 熟练使用 Shell 脚本,掌握 Python/Go 至少一门开发语言,具备 SOP 体系建设经验,能够把运维实践沉淀为流程规范,并转化为自动化工具。 - 熟悉 Kubernetes 生产落地与原理,掌握 Nginx、HAProxy、Redis、消息队列、数据库等高可用架构设计与运维。 - 了解可观测体系整体设计,熟悉 Prometheus、Grafana、日志、链路追踪相关技术,熟悉云原生 CI/CD 流程,掌握灰度、蓝绿等发布策略。 - 具备较强风险意识,能够主动识别隐患并前置干预,善于使用 AI 工具实现运维提效降本,有 AIOps、AI 辅助成本治理相关经验优先。

官网发布:2026-08-14 · 最后确认在招:2026-09-03 21:08:43 · 来源平台:moka