MiniMax 社会招聘
存储系统DevOps 工程师(大模型 / AI 基础设施方向)
上海 ·经验不限·学历不限
上海
薪资面议
前往 MiniMax 官网投递
职位描述
##职位描述
###一句话定位
面向大模型训练、推理和数据清洗场景,负责存储系统与软硬件方案的选型、测试、交付、运维和性能优化,保障大规模
GPU / AI 集群稳定、高效运行。
### 主要职责
1. 存储方案选型与交付
- 负责对象存储 S3、文件系统 NFS、高性能文件系统 PFS、KVCache 等存储系统的选型、测试、交付与运维。
- 制定存储产品技术路线,评估不同存储方案在 AI 场景下的适配性、稳定性和性价比。
- 推动 NVMe SSD、RDMA、分布式存储、新型文件系统等技术在大模型平台落地。
2. AI 场景存储性能测试
设计并实施面向真实 AI 负载的存储性能测试体系,覆盖:
- 大模型训练: Checkpoint、Dataset 读取、训练过程中的伴生 I/O 负载;
- 推理服务: 低延迟、高并发、小 I/O 访问;
- 数据清洗与特征工程: 高吞吐、顺序 I/O、混合 I/O 访问。
输出性能评估与优化报告,为存储架构和产品选型提供依据。
3. 存储性能分析与优化
- 深入分析训练、推理链路中的 CPU、GPU、网络和存储协同瓶颈。
- 针对具体问题制定性能优化方案,包括:
- 存储协议与参数优化;
- 数据布局与访问模式优化;
- Cache / Buffer / 并发模型优化;
- 数据加载与 I/O 调度优化。
4. 稳定性与问题闭环
- 持续监控存储系统在真实大模型业务负载下的稳定性、性能和质量。
- 快速定位 I/O 超时、吞吐下降、长尾延迟、Checkpoint 慢、任务阻塞等问题。
- 与训练框架、平台、硬件和运维团队协作,推动复杂问题从发现、定位到修复闭环。
5. 工具与自动化体系建设
- 建设存储性能测试方法、工具和自动化平台。
- 沉淀标准化测试流程、性能基线、问题诊断工具和优化方法。
- 提升存储基础设施的整体效率、可观测性和可扩展性。
【任职要求】
## 职位要求
### 基本要求
1. 本科及以上学历,计算机、电子工程或相关专业。
2. 5 年以上存储领域经验,具备开发、测试、性能优化或存储运维经验。
3. 3 年以上存储系统架构设计、技术规划或方案选型经验。
4. 熟悉 Linux / Unix 系统,精通操作系统、存储系统和 I/O 相关原理,能够独立分析和解决复杂性能问题。
5. 熟悉至少一种存储形态:
- 对象存储;
- 文件系统;
- 高性能并行文件系统;
- KVCache 或缓存系统。
理解其在大模型训练与推理场景中的适用性和限制。
6. 熟悉服务器硬件体系结构,包括 CPU、内存、NVMe SSD、NIC、PCIe 拓扑等,理解 GPU 训练对存储和网络的依赖关系。
7. 熟练使用性能测试和分析工具,例如 Fio、Iperf、IOzone 等。
8. 具备良好的跨团队沟通和项目推动能力,能够与模型训练、平台、硬件、存储和运维团队协作推进问题解决。
### 加分项
- 有大模型训练平台、推理平台或 AI Infra 实战经验;
- 熟悉 PyTorch、TensorFlow 等训练框架的 I/O 行为;
- 熟悉 RDMA、GPUDirect Storage、NVMe-oF 等高性能数据链路;
- 了解分布式数据加载、Dataset / Checkpoint 存储和缓存加速机制;
- 有 AI 场景定制化性能测试、测试工具或平台开发经验;
- 有超大规模数据集管理或数据清洗流水线经验。
官网发布:2026-01-20 · 最后确认在招:2026-09-03 19:28:38 · 来源平台:feishu