直招.cv

← 返回职位列表

金山云 社会招聘

高级运维工程师

武汉 ·经验不限·学历不限

武汉市

职位描述

一、岗位职责 1. 负责智算平台整体稳定性与SLA体系建设,覆盖算力集群、训练平台、推理与Token服务。 2. 主导分布式训练稳定性治理(如训练失败、Hang、慢卡、资源不均衡等问题)。 3. 负责推理服务与Token API的性能优化与SLO建设(P99延迟、吞吐、可用性)。 4. 设计并落地全链路可观测体系,实现链路可追踪能力。 5. 主导复杂故障排查与根因分析(RCA),推动系统性优化。 6. 推动自动化运维与自愈体系建设(自动隔离节点、自动恢复作业、弹性扩缩容)。 7. 参与成本治理,优化训练成本与单Token推理成本。 二、岗位要求 1. 本科及以上学历,5年以上SRE / 云平台 / 大规模系统运维经验。 2. 深入理解 Linux、网络、存储及分布式系统原理。 3. 熟悉 Kubernetes 及云原生体系,具备大规模集群(百节点以上)经验。 4. 熟悉监控与可观测体系设计,有落地经验。 5. 具备自动化运维能力(Python / Golang / 运维平台建设经验)。 高鹏程:高级运维工程师(T6) 一、岗位职责 1. 负责智算平台整体稳定性与SLA体系建设,覆盖算力集群、训练平台、推理与Token服务。 2. 主导分布式训练稳定性治理(如训练失败、Hang、慢卡、资源不均衡等问题)。 3. 负责推理服务与Token API的性能优化与SLO建设(P99延迟、吞吐、可用性)。 4. 设计并落地全链路可观测体系,实现链路可追踪能力。 5. 主导复杂故障排查与根因分析(RCA),推动系统性优化。 6. 推动自动化运维与自愈体系建设(自动隔离节点、自动恢复作业、弹性扩缩容)。 7. 参与成本治理,优化训练成本与单Token推理成本。 【任职要求】 二、岗位要求 1. 本科及以上学历,5年以上SRE / 云平台 / 大规模系统运维经验。 2. 深入理解 Linux、网络、存储及分布式系统原理。 3. 熟悉 Kubernetes 及云原生体系,具备大规模集群(百节点以上)经验。 4. 熟悉监控与可观测体系设计,有落地经验。 5. 具备自动化运维能力(Python / Golang / 运维平台建设经验)。

官网发布:2026-06-10 · 最后确认在招:2026-09-03 19:20:11 · 来源平台:beisen