大数据平台 SRE 工程师
北京 ·经验不限·学历不限
北京·上海
需3年以上平台运维/SRE经验,本科计算机专业,精通Python/Go/Java,熟悉分布式系统和Linux
薪资面议
职位描述
岗位职责
1. 数据管线稳定性保障:负责训练数据管线(采集、传输、调度、计算、服务全链路)的 SLA 体系建设与故障自愈能力建设,保障核心业务数据 7×24 小时稳定产出;
2. 可观测性体系建设主导设计并落地全链路可观测性体系,覆盖任务状态追踪、数据积压/延迟告警、血缘影响面分析与异常自动定位,让黑盒系统可观测、可诊断;
3. 故障应急与深度排查:主导线上故障应急响应与 Postmortem 复盘,深入代码级定位问题(Java/Go 服务),并与研发团队共同制定修复及预防措施;
4. 自动化运维建设:基于 Python/Go 开发部署、扩缩容、配置下发、巡检、故障自愈等自动化工具,推动重复性运维工作平台化,降低人力运维成本;
5. 容量与性能治理:负责数据管线的容量规划、限流降级、资源隔离与资源利用率优化,应对业务增长带来的数据洪峰,治理长尾任务;
6. AI Infra 支持:参与 Sandbox/推理集群的基础运维与训练任务保障,支撑模型训练数据链路的稳定性。
任职要求
1. 本科及以上学历,计算机相关专业,3 年以上平台运维 / SRE / 基础架构相关经验;
2. 计算机基本功扎实,深入理解 Linux、网络(TCP/IP)、存储及分布式系统原理;
3. 熟练掌握 Python/Go/Java 中至少一门语言,具备代码级问题定位能力(如阅读服务源码、分析线程栈与 GC 日志等);
4. 熟悉数据系统的基本范式:消息队列、批/流处理、任务调度、数据一致性,具备大规模数据链路的实际运维经验。
加分项
• 主导过监控/可观测性体系从 0 到 1 的建设,有数据血缘或影响面分析经验;
• 有 AI Infra 相关经验(GPU 集群、训练/推理任务保障);
• 有大规模容量规划或成本优化实践。
官网发布:2026-09-07 · 最后确认在招:2026-09-08 20:11:36 · 来源平台:moka