直招.cv

← 返回职位列表

阶跃星辰 社会招聘

Pre-train data 算法研究员/工程师

上海 ·经验不限·学历不限

上海·北京

职位描述

Data doesn't just train models. It defines their potential. 随着模型规模逐渐接近,同样的模型结构,不同的数据策略却可能带来完全不同的能力表现。 什么样的数据真正促进推理能力?数据规模与数据质量之间如何平衡?如何建立能够持续驱动模型演进的数据 Flywheel? 你将负责探索: 如何构建覆盖文本、代码、多语言等场景的高质量 Pre-training 数据体系 如何建立数据质量评估方法,而不仅仅依赖经验规则 如何利用课程学习、数据混合、合成数据、自蒸馏等策略持续释放数据价值 如何建立自动化的数据生产与迭代流程,使数据持续驱动模型能力增长 如何理解数据分布变化对于模型泛化能力和 Emergent Ability 的影响 如果模型能力来自训练,那么训练能力首先来自数据。 岗位职责 负责 Foundation Model Pre-training 数据算法研究,构建覆盖数据采集、清洗、过滤、质量评估、配比及迭代优化的完整数据体系。 研究 Curriculum Learning、Data Mixing、Synthetic Data、Self-training、自蒸馏等关键技术,不断优化模型训练效果。 建立数据质量评估体系,分析不同数据策略对模型知识、推理及泛化能力的影响。 与模型训练、Evaluation 团队共同构建 Data Flywheel,让数据成为模型持续成长的重要驱动力。 任职要求 2026 届或 2027 届计算机、人工智能、数学、电子、自动化等相关专业硕士及以上或优秀本科生; 熟悉 NLP、数据挖掘、大规模数据处理或 Data-centric AI 相关方向。 具备优秀的数据分析能力及工程能力,能够独立完成数据实验设计、效果分析与 Pipeline 开发。 对数据驱动模型能力增长具有深入理解或实践经验,有 Synthetic Data、Data Scaling 等相关研究经历者优先。 在各类竞赛中取得突出成绩,或在开源社区有重要贡献者优先。

官网发布:2026-09-02 · 最后确认在招:2026-09-03 22:42:05 · 来源平台:moka