华为 社会招聘
AI算力调度专家
深圳 ·5·学历不限
深圳
薪资面议
前往 华为 官网投递
职位描述
1、调度系统架构设计:设计并实现大规模分布式调度系统,支持多代际、异构算力(NPU/CPU)的统一管理与拓扑感知调度。
2、多目标调度策略设计:设计并实现多目标协同优化调度算法,综合考虑任务排队时长、资源利用率、算力成本等指标,实现动态平衡与自适应调度。
3、智能调度策略实现:开发负载感知的自定义调度器插件,优化资源利用率与作业性能。
4、多场景调度优化:
4.1 训练场景:实现拓扑感知调度(HCCS/UB总线)、RDMA网络带宽保障、数据局部性调度,优化Checkpoint读写路径。
4.2 推理场景:开发镜像预热与分布式缓存策略,支持弹性扩缩容与资源超卖,保障SLO的同时提升资源复用率。
4.3 RL沙箱场景:设计任务协同调度机制,动态调整模拟环境与推理实例的资源配比,优化网络通信延迟,高效管理缓冲区存储。
5、多租户资源管理:实现配额管理、公平调度、抢占策略,保障多团队业务SLO。
6、调度性能优化:持续优化调度吞吐、调度延迟和资源碎片,支持万卡级集群规模。
【任职要求】
专业方向与研究背景
1、计算机科学、分布式系统或相关专业硕士及以上学历(博士优先)。
2、研究方向为分布式系统、高性能计算、操作系统、计算机体系结构,在资源调度、异构计算、多目标优化、运筹优化、存储/网络/镜像调度等领域有深入积累。
3、在OSDI、SOSP、EuroSys、ASPLOS、SC、HPDC、INFOCOM、ICAPS等顶会发表过论文者优先。
知识要求
1、深入理解Kubernetes调度框架(Scheduling Framework)或Slurm调度原理,有自定义调度器开发经验。
2、熟悉主流AI芯片架构(NVIDIA/AMD/昇腾)及其性能特征,理解GPU拓扑对通信的影响。
3、了解分布式一致性协议(Raft/Paxos)、资源分配算法(DRF/优先级抢占)。
4、熟悉多目标优化算法(如加权和、帕累托优化、强化学习调度),了解排队论、约束满足问题等理论基础。
5、熟悉成本模型,了解Spot实例、预留实例、按需实例的定价机制与成本优化策略。
6、熟悉容器镜像原理(Layer、Snapshotter)、镜像分发加速技术(P2P、预热、缓存)。
7、了解RDMA、RoCE、拥塞控制等网络基础知识,有高性能网络调优经验者优先。
能力与经验
1、5年以上分布式系统或后台系统开发经验,有大规模Kubernetes/Slurm集群管理经验。
2、调度系统经验:有自定义Kubernetes调度器或Slurm插件开发经验,熟悉调度算法(如Binpacking、碎片整理、优先级调度)。
3、多目标优化经验:参与过多目标调度算法设计或实现,有排队时间优化、利用率提升、成本优化的实际项目经验。
4、异构计算经验:有GPU/NPU集群调度经验,参与过异构资源池化或统一抽象项目。
5、多场景调度经验:至少对以下场景中的两个有深入实践:大规模训练调度(万卡级)、在线推理服务调度、RL沙箱环境调度。
6、存储调度经验:有数据局部性调度、Checkpoint优化、分布式缓存项目经验。
7、网络调度经验:有RDMA带宽保障、拥塞控制、网络拓扑感知调度经验。
8、镜像调度经验:有镜像预热系统、P2P分发系统(如Dragonfly)开发经验。
9、复杂工作流经验:有Airflow、Argo Workflows或Ray编排经验,理解DAG调度。
10、开源影响力:Kubernetes、YuniKorn、Volcano、KubeBatch等社区贡献者优先。
技能要求
1、精通Go/C++/Java中至少一种语言,具备高并发系统开发能力。
2、熟练使用Kubernetes Operator/Controller开发框架,熟悉client-go、controller-runtime等。
3、具备性能分析和调优能力,能使用pprof、火焰图等工具定位调度瓶颈。
4、熟悉Prometheus、Grafana等监控工具,能设计调度可观测性指标。
5、具备数据分析能力,能使用Python/R进行调度策略仿真与效果评估。
论文/专利
1、以第一作者发表过调度系统、异构计算、多目标优化调度、多场景资源调度相关论文者优先。
2、有相关技术专利者优先。
官网刷新:2026-08-06 · 最后确认在招:2026-09-03 19:46:19 · 来源平台:huawei