服务器运营稳定性工程师 - DCS
杭州 ·经验不限·学历不限
杭州
需3年以上服务器运营经验,本科及以上学历,熟悉Linux系统和Shell脚本
薪资面议
职位描述
团队介绍:字节跳动基础设施DCS【Data Center/Cloud Service/System Service】团队,负责字节跳动全球数据中心全生命周期的运营管理,职责涵盖数据中心运维、服务器管理、资产管理、AI运维平台研发、系统服务、云服务等。致力于为抖音、豆包、今日头条、飞书、火山引擎等各类产品提供高可用、高稳定、高性能、低成本的算力资源。
1、负责线上服务器稳定性保障,规划建设稳定性流程规范、平台系统、保障机制和能力,负责现网运营稳定性监控、稳定性风险识别、问题响应处理和保障措施,保障业务稳定健康运行;
2、负责服务器稳定性相关能力建设及运营,包括服务器大规模故障快速恢复、服务器演练、服务器重保等;
3、负责服务器硬件相关稳定性故障处理,包括故障定位分析、故障跟踪止损、故障复盘等;
4、负责服务器稳定性风险发掘,包括服务器质量、运维流程、平台系统等方向风险识别及治理;
5、参与服务器监控告警优化,深入推进监控能力的长期治理,提高监控告警、事件分析质量。
【任职要求】
1、本科及以上学历,计算机、自动化等相关专业优先,3年以上服务器运营相关经验;
2、熟悉服务器硬件、Linux系统相关知识,熟练掌握Shell脚本,具备服务器运营经验者优先;
3、具备良好的计算机基础,至少掌握一门编程语言,包括但不限于Java、C、C++、Python、Go等;
4、具备良好的自驱力与学习能力,优秀的沟通能力、组织协调与项目推动能力;英语可作为工作语言者优先。
官网发布:2026-07-26 · 最后确认在招:2026-09-08 19:16:26 · 来源平台:feishu