直招.cv

← 返回职位列表

通义实验室 · 社会招聘

Token Foundry-大模型平台研发工程师-训练平台

杭州 ·3年以上·硕士

北京·杭州

职位描述

主要负责 TokenFoundry 大模型训练平台建设,为大模型训练提供稳定、高效、弹性的 AI Infra 基础设施。你将参与新一代大模型训练平台的架构演进,支撑大规模分布式训练任务编排、异构集群资源调度、训练容错与弹性恢复等核心系统,持续提升研发效能与算力利用率。 主要工作职责和挑战 1. 训练任务平台设计与研发:负责分布式训练任务的提交、编排、调度、可观测性与全生命周期管理系统的架构设计及核心代码实现。 2. 大规模资源调度引擎:设计并实现面向异构集群的资源调度策略,涵盖拓扑感知调度、抢占式调度、优先级队列及多租户配额管理等能力。 3. 平台化与产品化:快速迭代平台产品能力,支撑大模型研发迭代对训练基础设施的能力需求。 4. 技术攻坚与前沿探索:跟踪 AI Infra 及训练调度领域的最新进展,推动技术方案落地并持续优化系统性能。 【任职要求】 1. 具备优秀的技术自驱力与分析解决复杂问题的能力,对 AI Infra 技术有强烈热情。 2. 工程实现能力扎实,精通 Go 或 Java,熟悉 Python;代码规范严谨,重视可测试性与可维护性。 3. 有平台类产品研发经验,深入理解 Kubernetes 架构与调度机制,具备生产环境 K8s 集群管控及 Operator/Scheduler 开发经验。 4. 符合以下条件之一者优先: a. 熟悉 Megatron-LM / VeRL / DeepSpeed 等主流分布式训练框架。 b. 有大规模 GPU/NPU 异构训练平台的研发经验。 c. 追求优雅代码设计,在云原生或 AI Infra 相关开源社区有活跃贡献。

最后确认在招:2026-09-01 19:09:38 · 来源平台:alibaba