字节跳动 社会招聘
Infra平台开发工程师-Data AML
北京 ·经验不限·学历不限
北京
薪资面议
前往 字节跳动 官网投递
职位描述
1、AI基础设施平台研发:参与/负责面向大规模GPU集群、分布式存储与高性能网络的资源管理、调度、配额、隔离等平台能力建设,支持万卡级训练与大规模推理场景;
2、资源效率与成本优化:围绕GPU利用率、显存/算力/存储/带宽等关键指标,构建可观测体系并推动调度策略、混部、弹性伸缩、潮汐复用等优化方案落地;
3、稳定性体系建设:建立覆盖容量、变更、故障、应急的稳定性体系,主导/参与SLO定义、容量规划、故障演练、应急预案、Postmortem等工作,持续降低MTTR与故障影响面;
4、研发体系标准化:沉淀AI训练/推理/数据流水线的研发规范、模板与工具链(CI/CD、版本管理、环境管理、镜像管理、配置管理等),推动跨团队研发流程的统一与提效;
5、AIOps智能运维:基于平台大盘指标、日志、Trace、事件等数据,建设异常检测、告警降噪、根因定位、容量预测、自动化处置等智能运维能力;探索大模型/Agent在AI Infra运维场景的落地。
【任职要求】
1、本科及以上学历,计算机、软件工程、人工智能等相关专业;3年以上后端研发工作经验;
2、扎实的编程功底,熟悉Go/Python/Java中至少一门,具备良好的工程架构与代码质量意识;熟悉Python Flask、Celery、DjanGo、Tornado、NumPy等框架和库使用或熟悉Golang BeeGo、Gin、Gorm、Sarama,gRPC-Go等常见开源框架;
3、熟悉分布式系统、微服务架构,了解可观测性体系(OpenTSDB、Prometheus、Grafana、ELK、OpenTelemetry等),OLAP数据库ClickHouse使用;
4、具备以下任一方向经验者优先:
1)时序异常检测、告警降噪、根因分析等AIOps算法落地经验;
2)大模型/RAG/Agent应用开发经验;
3)监控、日志、Trace数据处理与平台建设经验;
5、良好的问题分析与解决能力,较强的沟通协作能力和主动性,能在复杂系统中快速定位与解决问题。
官网发布:2024-06-14 · 最后确认在招:2026-09-03 19:35:21 · 来源平台:feishu