阶跃星辰 社会招聘
Mid-train 算法工程师(数据方向)
上海 ·经验不限·学历不限
上海·北京
薪资面议
前往 阶跃星辰 官网投递
职位描述
The right data does not just improve models. It creates new capabilities.
随着基础模型规模不断扩大,单纯增加训练数据已经无法保证能力持续提升。
未来模型竞争的核心,将从“拥有多少数据”转向“是否能够构建持续产生高价值数据的能力增长系统”。
你将探索的问题包括:
什么样的数据能够真正激发模型的Reasoning、Coding和Agent能力
如何设计高质量Mid-training Data Recipe,实现能力定向增强
如何利用Synthetic Data、Self-play、Self-distillation生成模型需要的数据
如何通过数据回流和模型反馈,建立自动进化的数据闭环
如何衡量数据价值,并找到数据与能力提升之间的因果关系
你的工作将直接决定模型能力增长的方向
岗位职责
负责大模型Mid-training阶段数据算法研究,构建能力增强型数据体系。
设计和优化数据Recipe,包括数据筛选、数据混合、课程学习、合成数据生成等策略。
面向代码、数学、Reasoning、Agent、多模态等能力方向,构建高价值训练数据。
分析数据分布、数据质量与模型能力之间的关系,建立数据评估体系。
与算法训练、Evaluation团队协同,通过数据驱动模型能力持续提升。
任职要求
2026届或2027届计算机、人工智能、数学、统计等相关专业硕士及以上或优秀本科生;
熟悉NLP、大模型数据处理、数据挖掘或Data-centric AI相关技术。
具备较强的数据分析能力和工程能力,能够独立完成数据Pipeline建设和实验验证。
对Synthetic Data、Data Flywheel、Self-training、数据Scaling等方向有研究兴趣或实践经验。
在各类竞赛中取得突出成绩,或在开源社区有重要贡献者优先。
官网发布:2026-09-02 · 最后确认在招:2026-09-03 22:42:05 · 来源平台:moka