字节跳动 社会招聘
机器学习生产管理研发工程师(编排调度/推理服务方向) - Data AML
杭州 ·经验不限·学历不限
北京·杭州·上海
薪资面议
前往 字节跳动 官网投递
职位描述
团队介绍:Data AML是字节跳动的机器学习中台,为抖音/今日头条/西瓜视频等业务提供推荐/广告/CV/语音/NLP的训练和推理系统。为公司内业务部门提供强大的机器学习算力,并在这些业务的问题上研究一些具有通用性和创新性的算法。同时,也通过火山引擎将一些机器学习/推荐系统的核心能力提供给外部企业客户。
1、AML(Applied Machine Learning)推理服务稳定性保障与成本优化:
1)负责应用机器学习模型在线推理服务的全生命周期运维,包括服务部署、监控告警、故障排查与根因分析,确保服务可用性满足业务需求;
2)建立并优化应用机器学习推理服务的稳定性指标体系(如可用性、时延、错误率、资源利用率等)与效率指标体系(模型迭代效率、资源调度效率等);
3)负责应用机器学习推理服务的多地域故障应急响应与容灾建设,并推动相关容灾、应急能力自动化等;
4)负责应用机器学习推理服务的GPU&CPU利用率提升建设,并推动上下游达成业务目标;
2、AML(Applied Machine Learning)模型服务的工程化落地:
1)协同算法团队与业务架构团队完成大规模推理服务的弹性伸缩方案落地,基于业务流量(如QPS波动)、资源使用率自动调整实例数量,结合Kubernetes等容器编排工具实现资源动态调度,降低运维成本;
2)推动应用机器学习推理服务的CI/CD流程建设,实现推理服务版本管理、服务发布自动化(如蓝绿部署、灰度发布、变更检测),保障版本切换无感知,减少发布风险;
3)基于大规模推理服务的运维应用场景,构建高效的运维管理系统平台(如巡检、自愈、场景运维等),以提升团队人效;
3、基础设施与性能优化:
1)负责AML推理服务底层基础设施(服务器、GPU/TPU资源、存储、网络)的生产管理与容量规划,根据模型推理需求优化资源配置,避免资源瓶颈;
2)针对AML推理服务的性能问题进行专项优化,包括服务器参数调优、模型量化压缩、异构卡管理等,提升服务吞吐量。
【任职要求】
1、本科及以上学历,计算机科学与技术、软件工程、人工智能、通信、自动化等相关专业,1年以上平台开发/DevOps/SRE工作经验,1年以上机器学习相关工作经验者优先;
2、熟练掌握Linux操作系统,精通Shell/Python/Go等至少2种编程语言,有过平台/工程开发、架构经验者优先;熟悉应用机器学习模型在线服务架构,了解TensorFlow/PyTorch等模型的推理原理,熟悉K8s生态架构,有K8s应用管理经验;具备性能优化经验,了解GPU/TPU等加速硬件的运维与调优,熟悉模型推理优化技术(如模型量化、剪枝、推理引擎优化)者优先;
3、具备强烈的责任心与学习能力,对新事物有好奇心,自驱力强;具备良好的跨团队协作能力,能有效对接算法团队、业务架构团队、基础设施团队等,推动问题高效解决;具备主动学习能力,关注应用机器学习领域的技术趋势(如大模型Serving、Serverless推理),能将新技术、新工具引入实际工作,提升运维效率;
4、参与过训练/推理服务的运维或性能优化项目,有成功案例者优先。
官网发布:2021-03-14 · 最后确认在招:2026-09-02 19:19:00 · 来源平台:feishu