直招.cv

← 返回职位列表

MiniMax 社会招聘

存储系统DevOps 工程师(大模型 / AI 基础设施方向)

上海 ·经验不限·学历不限

上海

职位描述

##职位描述 ###一句话定位 面向大模型训练、推理和数据清洗场景,负责存储系统与软硬件方案的选型、测试、交付、运维和性能优化,保障大规模 GPU / AI 集群稳定、高效运行。 ### 主要职责 1. 存储方案选型与交付 - 负责对象存储 S3、文件系统 NFS、高性能文件系统 PFS、KVCache 等存储系统的选型、测试、交付与运维。 - 制定存储产品技术路线,评估不同存储方案在 AI 场景下的适配性、稳定性和性价比。 - 推动 NVMe SSD、RDMA、分布式存储、新型文件系统等技术在大模型平台落地。 2. AI 场景存储性能测试 设计并实施面向真实 AI 负载的存储性能测试体系,覆盖: - 大模型训练: Checkpoint、Dataset 读取、训练过程中的伴生 I/O 负载; - 推理服务: 低延迟、高并发、小 I/O 访问; - 数据清洗与特征工程: 高吞吐、顺序 I/O、混合 I/O 访问。 输出性能评估与优化报告,为存储架构和产品选型提供依据。 3. 存储性能分析与优化 - 深入分析训练、推理链路中的 CPU、GPU、网络和存储协同瓶颈。 - 针对具体问题制定性能优化方案,包括: - 存储协议与参数优化; - 数据布局与访问模式优化; - Cache / Buffer / 并发模型优化; - 数据加载与 I/O 调度优化。 4. 稳定性与问题闭环 - 持续监控存储系统在真实大模型业务负载下的稳定性、性能和质量。 - 快速定位 I/O 超时、吞吐下降、长尾延迟、Checkpoint 慢、任务阻塞等问题。 - 与训练框架、平台、硬件和运维团队协作,推动复杂问题从发现、定位到修复闭环。 5. 工具与自动化体系建设 - 建设存储性能测试方法、工具和自动化平台。 - 沉淀标准化测试流程、性能基线、问题诊断工具和优化方法。 - 提升存储基础设施的整体效率、可观测性和可扩展性。 【任职要求】 ## 职位要求 ### 基本要求 1. 本科及以上学历,计算机、电子工程或相关专业。 2. 5 年以上存储领域经验,具备开发、测试、性能优化或存储运维经验。 3. 3 年以上存储系统架构设计、技术规划或方案选型经验。 4. 熟悉 Linux / Unix 系统,精通操作系统、存储系统和 I/O 相关原理,能够独立分析和解决复杂性能问题。 5. 熟悉至少一种存储形态: - 对象存储; - 文件系统; - 高性能并行文件系统; - KVCache 或缓存系统。 理解其在大模型训练与推理场景中的适用性和限制。 6. 熟悉服务器硬件体系结构,包括 CPU、内存、NVMe SSD、NIC、PCIe 拓扑等,理解 GPU 训练对存储和网络的依赖关系。 7. 熟练使用性能测试和分析工具,例如 Fio、Iperf、IOzone 等。 8. 具备良好的跨团队沟通和项目推动能力,能够与模型训练、平台、硬件、存储和运维团队协作推进问题解决。 ### 加分项 - 有大模型训练平台、推理平台或 AI Infra 实战经验; - 熟悉 PyTorch、TensorFlow 等训练框架的 I/O 行为; - 熟悉 RDMA、GPUDirect Storage、NVMe-oF 等高性能数据链路; - 了解分布式数据加载、Dataset / Checkpoint 存储和缓存加速机制; - 有 AI 场景定制化性能测试、测试工具或平台开发经验; - 有超大规模数据集管理或数据清洗流水线经验。

官网发布:2026-01-20 · 最后确认在招:2026-09-03 19:28:38 · 来源平台:feishu