直招.cv

← 返回职位列表

MiniMax 社会招聘

预训练数据 Pipeline 工程师

北京 ·经验不限·学历不限

北京·上海

职位描述

为什么加入我们 1. 你会直接参与大模型训练前最核心的数据生产链路,数据质量、吞吐和覆盖度会影响模型能力上限。 2. 这里不是传统离线数仓,而是面向预训练数据构建的大规模分布式数据基础设施。 3. 你会在真实海量数据场景中使用 Spark 等分布式计算技术,解决解析、清洗、过滤、去重、质量评估和采样的工程问题。 【任职要求】 我们在做什么 MiniMax 正在建设面向大模型预训练的数据生产体系,支撑文本、音频、视频、多模态等数据从采集、解析、清洗、过滤、去重、质量评估到数据资产管理的完整链路 这不是普通的数据处理岗位,而是要把海量非结构化数据转化为可训练、可追踪、可评估、可持续供给的高质量预训练数据资产。你会深度参与预训练数据 Pipeline、分布式 计算平台和数据质量体系建设。 你将做什么 1. 设计并实现预训练数据 Pipeline,覆盖数据解析、清洗、过滤、去重、质量评估、分类采样等核心环节。 2. 基于 Spark 构建大规模分布式数据处理任务,优化任务调度、资源使用、吞吐和稳定性。 3. 参与文本、音频、视频及多模态预训练数据处理,开发数据处理、合成、筛选和优化算子。 4. 建设数据质量评估与数据资产管理能力,让数据来源、处理过程、质量指标和样本分布可追踪。 5. 跟踪预训练数据领域前沿方法,探索数据增强、高质量数据筛选、数据去重和分布优化等方案,并落地到生产链路。 我们期待你 基础要求: 1. 本科及以上学历,计算机、数学、人工智能等相关专业,具备扎实的计算机基础和分布式系统理解。 2. 熟练掌握 Python、Java、Go、C++ 中至少一门语言,具备良好的工程实现能力。 3. 熟悉 Spark 技术栈,有大规模数据 Pipeline 构建、性能优化或稳定性治理经验。 4. 对大模型预训练数据、文本/音视频/多模态数据处理有兴趣,愿意深入业务问题。 加分项: 1. 有 Ray、Flink、Kafka、Iceberg、Hudi、Parquet、Arrow 等数据系统实践经验。 2. 有预训练数据清洗、去重、质量评估、数据采样或数据增强经验。 3. 有大模型预训练数据工程或有行业影响力项目经验。 4. 熟悉 AI Coding、CLI、Skills、Agent 工作流,并能用自动化提升研发效率。

官网发布:2026-08-10 · 最后确认在招:2026-09-03 19:28:38 · 来源平台:feishu