直招.cv

← 返回职位列表

阿里云智能 · 社会招聘

阿里云智能-数据库技术专家-资源调度方向-杭州/深圳/北京

杭州 ·5年以上·本科

北京·深圳·杭州

职位描述

1、技术规划与架构设计:结合智算、云原生数据库及AI Agent业务需求,参与制定高可用的异构资源调度架构规划;参与基于Kubernetes调度系统的技术迭代,CPU与GPU/NPU等多元算力池化,支撑万卡级集群的高效运转与Agent运行时环境的资源隔离。 2、方案设计与核心研发:分析业务资源需求,设计异构算力协同与资源分配策略;参与调度器(Scheduler)的深度定制与二次开发,比如CPU在离线混部、GPU虚拟化(MIG/vGPU)、跨集群调度等,同时参与面向海量AI Agent的底层容器调度与隔离平台建设。 3、稳定性保障与性能优化:建立全链路可观测体系,快速定位并解决CPU负载异常、GPU硬件故障及调度延迟等线上难题;通过CPU/GPU潮汐混部、推理冷启动加速等手段,极致提升整体资源利用率并降低算力成本;利用AI Agent开发AIOps工具,实现故障自动排查与运维流程的自动化提效。 4、前沿技术预研:紧密跟踪AI Infra、AI Agent、Data+AI趋势,探索利用大模型(LLM)优化数据库与算力资源调度,推动异构调度系统向智能化、自动化方向持续演进。 【任职要求】 1、学历与经验背景:本科及以上学历,计算机、软件工程或相关专业;具备3年以上后端研发或云计算平台开发经验,其中至少有1年以上Kubernetes调度器(Scheduler)扩展、云原生资源管理或大规模智算集群调度系统的实战经验, 有数据库,数据库引擎开发等相关领域经验为加分项。 2、核心技术栈能力:具备扎实的计算机基础,深入理解Linux内核原理、操作系统资源管理(CPU/GPU/内存/网络)及分布式系统理论;熟悉Kubernetes架构及核心组件,对K8s调度框架(Scheduling Framework)、设备插件(Device Plugin)、CRD控制器等有较好的理解与二次开发能力优先。 3、异构算力调度经验:熟悉大规模异构资源(CPU/GPU/NPU)的池化与调度技术,了解GPU虚拟化(如MIG、vGPU)、在离线混部(潮汐调度)、拓扑感知调度及RDMA网络通信优化;有万卡级智算集群或云原生资源调度系统设计与落地经验者优先。 4、AI Infra与Agent工程能力:熟悉AI Infra技术栈,了解主流大模型(LLM)的训练与推理流程;具备AI Agent开发经验,熟悉Agent运行时环境的资源隔离与调度需求;有利用AI/LLM技术落地AIOps(如智能故障排查、自动化运维提效)或优化算力资源调度的实战经验优先。 5、性能优化与稳定性保障:具备极强的性能优化与故障排查能力,熟悉全链路可观测性体系(如Prometheus、Grafana等)的搭建与应用;能够独立解决高并发、大规模节点下的调度延迟、资源争抢及硬件故障等复杂线上问题。 6、综合素质与驱动力:对云原生、AI等领域的前沿技术保持高度敏感,具备优秀的技术前瞻性、逻辑分析能力和跨团队沟通协作能力,能够推动复杂技术方案在业务中的落地与持续演进。

最后确认在招:2026-09-01 19:10:00 · 来源平台:alibaba