字节跳动 校园招聘
公有云机器学习系统调度研发工程师 - 火山方舟
杭州 ·经验不限·学历不限
杭州·北京·上海
薪资面议
前往 字节跳动 官网投递
职位描述
团队介绍:火山方舟是火山引擎推出的一站式大模型服务平台,是中国大模型市场产品和份额领跑者。平台提供模型推理、评测、精调等全流程服务。方舟搭载了豆包及业界主流大模型,提供丰富的插件生态和AI应用开发服务,并通过稳定可靠的安全互信方案、专业的算法技术服务,全方位保障企业级AI应用落地。
1、负责机器学习系统资源调度的设计和开发,支持火山方舟和机器学习平台的产品业务;
2、负责多机房、多集群环境下各种异构计算(GPU、CPU、其他异构硬件)、存储(各种云存储)、网络(VPC、RDMA)等资源的最优化编排调度,在严格的多租隔离环境下,支持各种离线训练、在线推理等负载场景的调度需求,并实现整体资源的合理化、最大化利用。
【任职要求】
1、2027届获得本科及以上学历,计算机、软件工程等相关专业优先;
2、熟练掌握Linux环境下的Go/Java/Python等1至2种以上语言;
3、具备扎实的计算机科学功底和编程能力,熟悉常见算法和数据结构,具有良好的编程习惯;
4、熟悉至少一种主流的机器学习框架(TensorFlow/PyTorch或其他自研框架);
5、熟悉Kubernetes架构和生态,熟悉Docker/Containerd/Kata等容器技术,有丰富的云原生机器学习系统实践和开发经验;
6、掌握分布式系统原理,参与过分布式系统的设计、开发和维护。
加分项
1、有集群在离线资源调度相关工作的实践经验,对K8s/Volcano/Yarn/Mesos等一到多个开源项目的调度实现有源码级的深入理解,熟悉容器化、轻量级虚拟机等相关技术;
2、熟悉常见调度算法,对多租户Quota治理、抢占、弹性、碎片、潮汐、混部、QoS等一到多个调度问题有深入理解和实践经验,具备较强的解决复杂问题的分析和建模能力,有GPU相关调度经验;
3、有以下某一方向领域的经验:CUDA,RDMA,AI Infrastructure,HW/SW Co-Design,High Performance Computing,ML Hardware Architecture(GPU,Accelerators,Networking),ML for System,Distributed Storage。
官网发布:2026-08-03 · 最后确认在招:2026-09-02 19:10:19 · 来源平台:feishu