直招.cv

← 返回职位列表

MiniMax 社会招聘

AI Data 研发工程师(大模型数据方向)

上海 ·经验不限·学历不限

上海·北京

职位描述

MiniMax 致力于构建下一代通用人工智能模型,覆盖文本、图像、视频、语音等多模态大模型方向。数据是大模型能力演进的核心基础,我们正在建设面向大模型时代的新一代 AI Data Infra 平台,支撑预训练、后训练、评测及模型迭代全过程的数据生产、管理与优化。我们希望寻找优秀的数据基础设施工程师,共同打造服务于全模态大模型的数据平台和 Pipeline 基础设施。 你将参与: 1. 建设面向大模型的数据基础设施,负责构建支撑海量 AI 数据的数据基础设施,包括: - 面向文本、图像、视频、语音等多模态数据的统一管理体系; - 支撑 PB 级数据的存储、计算、索引与分发能力; - 建设面向 AI 数据的数据湖/湖仓体系,支持数据版本管理、元数据管理和生命周期管理; - 优化数据访问链路,保障大规模模型训练任务的数据吞吐和稳定性。 2. 构建大模型训练与后训练数据 Pipeline,参与建设覆盖模型全生命周期的数据生产体系,包括: - 预训练数据 Pipeline:数据解析、清洗、过滤、去重、质量评估、分类采样; - 后训练数据 Pipeline:SFT、Preference Data、RLHF/RLAIF 数据构造及自动化评估; - 多模态数据处理:图像/视频/语音数据处理、Caption 生成、Embedding 提取和特征构建; - 数据合成、增强和数据闭环优化。 3. 打造 AI Native 数据处理平台,建设面向大模型时代的数据计算平台: - 基于 Ray、Spark、Datatrove 等分布式计算框架构建大规模数据处理能力; - 建设数据 Pipeline 编排和执行体系,支持复杂任务自动化运行; - 支持 CPU/GPU 混合计算场景; - 探索智能调度、自动优化、异常检测和自动修复等 AI Native 能力。 4. 建设高效的数据工程平台体系,提升算法团队的数据研发效率: - 建设标准化数据处理 SDK、API 和开发框架; - 建设任务调度、监控、日志、指标和可观测体系; - 建设数据资产管理、质量管理和数据治理能力; - 降低模型研发过程中的数据使用成本,加速模型迭代。 【任职要求】 1.基础能力 - 扎实的计算机基础,理解分布式系统原理; - 熟练掌握 Python、Java、Go 等至少一种编程语言; - 熟悉 Linux、Kubernetes 等云原生基础设施; - 具备大规模数据系统设计和工程实践经验。 2.数据基础设施能力,具备以下一个或多个方向经验: 2.1.分布式计算 - 熟悉 Spark、Ray、Flink 等分布式计算框架; - 有大规模数据 Pipeline 构建和性能优化经验; - 理解任务调度、资源管理、计算优化机制。 2.2.数据湖与存储 - 熟悉 Iceberg、Paimon、Lance 等湖仓技术; - 理解 Metadata、Partition、Manifest、Index、Compaction 等核心机制; - 有 PB 级数据管理经验。 2.3.数据平台 - 熟悉 Airflow、DolphinScheduler 等工作流系统; - 有数据开发平台、元数据管理、数据质量、数据治理平台建设经验; - 熟悉 Kubernetes 资源调度体系。 3.大模型数据经验(优先) - 参与过大模型预训练数据建设; - 熟悉网页、代码、多模态数据处理流程; - 理解数据清洗、过滤、Deduplication、Quality Filtering; - 熟悉 Embedding、向量检索、数据聚类等技术; - 了解 SFT、RLHF、Preference Data 等后训练数据流程; - 有 Vision-Language Model、Video Model、Speech Model 数据处理经验。 加分项 - 参与过 GPT 类模型、MoE 模型、多模态模型的数据平台建设; - 有 TB/PB 级训练数据处理经验; - 建设过大规模数据清洗、去重、质量评估 Pipeline; - 熟悉 WebDataset、Parquet、MDS、Arrow、Lance 等训练数据格式; - 有数据平台 SDK/API 产品化经验。

官网发布:2025-04-23 · 最后确认在招:2026-09-03 19:28:38 · 来源平台:feishu