金山云 社会招聘
高级运维工程师
武汉 ·经验不限·学历不限
武汉市
薪资面议
前往 金山云 官网投递
职位描述
一、岗位职责
1. 负责智算平台整体稳定性与SLA体系建设,覆盖算力集群、训练平台、推理与Token服务。
2. 主导分布式训练稳定性治理(如训练失败、Hang、慢卡、资源不均衡等问题)。
3. 负责推理服务与Token API的性能优化与SLO建设(P99延迟、吞吐、可用性)。
4. 设计并落地全链路可观测体系,实现链路可追踪能力。
5. 主导复杂故障排查与根因分析(RCA),推动系统性优化。
6. 推动自动化运维与自愈体系建设(自动隔离节点、自动恢复作业、弹性扩缩容)。
7. 参与成本治理,优化训练成本与单Token推理成本。
二、岗位要求
1. 本科及以上学历,5年以上SRE / 云平台 / 大规模系统运维经验。
2. 深入理解 Linux、网络、存储及分布式系统原理。
3. 熟悉 Kubernetes 及云原生体系,具备大规模集群(百节点以上)经验。
4. 熟悉监控与可观测体系设计,有落地经验。
5. 具备自动化运维能力(Python / Golang / 运维平台建设经验)。
高鹏程:高级运维工程师(T6)
一、岗位职责
1. 负责智算平台整体稳定性与SLA体系建设,覆盖算力集群、训练平台、推理与Token服务。
2. 主导分布式训练稳定性治理(如训练失败、Hang、慢卡、资源不均衡等问题)。
3. 负责推理服务与Token API的性能优化与SLO建设(P99延迟、吞吐、可用性)。
4. 设计并落地全链路可观测体系,实现链路可追踪能力。
5. 主导复杂故障排查与根因分析(RCA),推动系统性优化。
6. 推动自动化运维与自愈体系建设(自动隔离节点、自动恢复作业、弹性扩缩容)。
7. 参与成本治理,优化训练成本与单Token推理成本。
【任职要求】
二、岗位要求
1. 本科及以上学历,5年以上SRE / 云平台 / 大规模系统运维经验。
2. 深入理解 Linux、网络、存储及分布式系统原理。
3. 熟悉 Kubernetes 及云原生体系,具备大规模集群(百节点以上)经验。
4. 熟悉监控与可观测体系设计,有落地经验。
5. 具备自动化运维能力(Python / Golang / 运维平台建设经验)。
官网发布:2026-06-10 · 最后确认在招:2026-09-03 19:20:11 · 来源平台:beisen