直招.cv

← 返回职位列表

字节跳动 社会招聘

机器学习生产管理研发工程师 - Data AML

杭州 ·经验不限·学历不限

北京·上海·杭州

职位描述

团队介绍:Data AML是字节跳动的机器学习中台,为抖音/今日头条/西瓜视频等业务提供推荐/广告/CV/语音/NLP的训练和推理系统。为公司内业务部门提供强大的机器学习算力,并在这些业务的问题上研究一些具有通用性和创新性的算法。同时,也通过火山引擎将一些机器学习/推荐系统的核心能力提供给外部企业客户。 1、AML(Applied Machine Learning)训练平台稳定性保障与治理: 1)全面负责训练任务链路稳定性,包括任务调度(Scheduler)→分布式训练框架→运行环境(集群Kubernetes、CPU/GPU服务器)→样本与模型存储(HDFS/BMQ)→跨机房网络; 2)负责训练任务稳定性的Oncall值班与故障应急响应,主导事故复盘与Root Cause分析,推动改进项(预案、SOP、自动化治理)落地; 3)建立并优化训练平台在硬件层、服务层,以及业务层的稳定性指标体系(SLO/SLA); 2、AML(Applied Machine Learning)训练平台的工程化与变更管理: 1)负责分布式训练框架、训练任务编排与调度系统等关键组件的版本管理与变更治理; 2)推动变更风险控制体系,包含灰度发布、自动回滚、对比实验、变更检测机制; 3)建立训练任务的自动巡检系统与Pre-flight Check机制,通过工程化手段减少常见版本或配置类事故; 3、基础设施资源管理与效率优化: 1)负责训练任务的资源精细化管理与优化,包括GPU、CPU、网络带宽及调度队列等,提升资源利用率; 2)针对跨机房数据交互(样本、BMQ、模型同步)进行深度分析,制定并输出有效的限流与止损策略; 3)协同模型训练算法团队、架构团队及运维团队,共同推动训练效率提升与架构降本。 【任职要求】 1、本科及以上学历,计算机科学与技术、软件工程、人工智能、通信、自动化等相关专业;具备1年以上平台开发/DevOps/SRE工作经验,1年以上机器学习相关工作经验者优先; 2、熟练掌握Linux操作系统,精通Shell/Python/Go等至少2种编程语言;熟悉应用机器学习模型在线服务架构,了解TensorFlow/PyTorch等模型的推理原理,熟悉K8s生态架构,有K8s应用管理经验; 3、具备较强的问题诊断能力,能熟练通过指标、日志、结构化数据推断系统瓶颈; 4、具备强烈的责任心与学习能力,对新事物有好奇心,自驱力强;具备良好的跨团队协作能力,能有效对接算法团队、业务架构团队、基础设施团队等,推动问题高效解决;具备主动学习能力,关注应用机器学习领域的技术趋势,能将新技术、新工具引入实际工作,提升运维效率。 加分项: 1、有过平台/工程开发、架构经验者优先; 2、分布式训练平台运维或开发经验(如Torch/TF分布式、Horovod、Parameter Server); 3、熟悉HDFS、Kafka/BMQ、跨机房网络架构等底层基础设施; 4、有SLO建设、Chaos工程(混沌工程)、容量治理、变更治理相关实战经验; 5、具备数据分析(Data Analysis)或性能分析(Profiling)能力。

官网发布:2024-06-14 · 最后确认在招:2026-09-02 19:19:00 · 来源平台:feishu