通义实验室 · 社会招聘
Token Foundry-大模型平台研发工程师-训练平台
杭州 ·3年以上·硕士
北京·杭州
薪资面议
前往 通义实验室 官网投递
职位描述
主要负责 TokenFoundry 大模型训练平台建设,为大模型训练提供稳定、高效、弹性的 AI Infra 基础设施。你将参与新一代大模型训练平台的架构演进,支撑大规模分布式训练任务编排、异构集群资源调度、训练容错与弹性恢复等核心系统,持续提升研发效能与算力利用率。
主要工作职责和挑战
1. 训练任务平台设计与研发:负责分布式训练任务的提交、编排、调度、可观测性与全生命周期管理系统的架构设计及核心代码实现。
2. 大规模资源调度引擎:设计并实现面向异构集群的资源调度策略,涵盖拓扑感知调度、抢占式调度、优先级队列及多租户配额管理等能力。
3. 平台化与产品化:快速迭代平台产品能力,支撑大模型研发迭代对训练基础设施的能力需求。
4. 技术攻坚与前沿探索:跟踪 AI Infra 及训练调度领域的最新进展,推动技术方案落地并持续优化系统性能。
【任职要求】
1. 具备优秀的技术自驱力与分析解决复杂问题的能力,对 AI Infra 技术有强烈热情。
2. 工程实现能力扎实,精通 Go 或 Java,熟悉 Python;代码规范严谨,重视可测试性与可维护性。
3. 有平台类产品研发经验,深入理解 Kubernetes 架构与调度机制,具备生产环境 K8s 集群管控及 Operator/Scheduler 开发经验。
4. 符合以下条件之一者优先:
a. 熟悉 Megatron-LM / VeRL / DeepSpeed 等主流分布式训练框架。
b. 有大规模 GPU/NPU 异构训练平台的研发经验。
c. 追求优雅代码设计,在云原生或 AI Infra 相关开源社区有活跃贡献。
最后确认在招:2026-09-01 19:09:38 · 来源平台:alibaba