蚂蚁集团 · 社会招聘
蚂蚁集团-Agent 镜像工程师-杭州/成都
杭州 ·2年以上·本科
杭州·成都
薪资面议
前往 蚂蚁集团 官网投递
职位描述
岗位描述:
大模型的背后是 AI 基础设施,而镜像链路是 AI 基础设施的咽喉。
Agent 时代给镜像链路带来了前所未有的挑战:一次 Agent 任务可能瞬间拉起成百上千个沙箱容器,每个容器需要毫秒级就绪;SWE RL 场景下,数千个代码沙箱并发启动,每个沙箱都要挂载不同的代码环境与依赖镜像——这对镜像分发速度、按需加载延迟、并发拉取能力提出了极致要求。而传统镜像链路在设计之初从未考虑过这种量级的并发与延迟需求。
这是挑战,更是机会。我们正在做的事情,就是把容器镜像链路的每一步推到极致——让 TB 级模型权重秒级就位,让 Agent 沙箱毫秒级启动,让十万卡集群上分发不再是瓶颈。你将深度参与 Dragonfly、Nydus、Harbor 等开源项目,打通容器镜像与 AI 模型权重分发的全链路,重新定义 AI 时代的镜像基础设施。
我们希望你是镜像与存储领域的专家——可以是镜像构建与分发、文件系统、按需加载,也可以是高性能网络、分布式存储、P2P 传输,能以独特经验和独到观点从不同维度优化系统;同时具有开阔的架构视野,能把镜像链路的上下游真正联动起来,而不是各自为战。
岗位职责:
1. 容器镜像与 AI 模型权重分发:参与 Dragonfly、Nydus、Harbor 等开源项目的开发落地与上游维护,构建从镜像构建、分发到按需加载的全链路优化,推动云原生场景下 AI 模型权重分发的社区标准化;
2. Agent 沙箱镜像加速:面向 Agent 服务与 SWE RL 场景,设计高并发、低延迟的沙箱镜像加载方案——从镜像按需加载、incremental snapshot、layer 共享到本地热缓存,让千级并发沙箱毫秒级就绪成为可能;
3. 高性能存储:针对 AI 模型权重与容器镜像的 I/O 模式,优化存储链路——从镜像层存储、块设备、分布式缓存到本地持久化,让 TB 级模型分发的延迟降到极致;
4. 高性能网络:优化 P2P 分发与模型拉取的网络链路,探索 RDMA/RoCE 在大规模镜像分发场景下的最佳实践,让带宽利用率逼近物理极限。
【任职要求】
1. 对技术充满热情,具备强烈的责任心和自驱力,能快速掌握和应用解决问题所需要的技术,优先考虑具有开源社区工作背景的候选人;
2. 具备扎实的编程能力、优秀的设计能力和代码品味,至少可以熟练掌握 Go/Rust 中的一种,并可以在需要时使用其他语言;
3. 具备扎实的计算机专业基础,包括计算机体系结构、操作系统、存储技术、文件系统和网络等;
4. 有细致的系统层软件性能调优经验——能找到瓶颈,能解释为什么慢,能用数据证明优化效果。
加分项(满足任一即可):
● 熟悉容器镜像与存储管控链路:containerd, runc, kata-containers, overlayfs 等;
● 有 Dragonfly, Nydus, Harbor, Ceph, JuiceFS 等镜像/存储相关项目经验;
● 有 RDMA/RoCE/NCCL 等高性能网络经验,或大规模 P2P 分发系统经验;
● 有 Linux VFS/块设备/文件系统内核开发经验;
● 有沙箱/微虚拟机(如 Firecracker, Cloud Hypervisor)快速启动或增量快照经验;
● 对主流开源软件有深入了解并对此有代码贡献;
● 具有自我驱动和自我管理能力,能针对系统的不足提出改进方案并推动实现。
最后确认在招:2026-09-01 19:09:33 · 来源平台:alibaba