直招.cv

← 返回职位列表

阶跃星辰 社会招聘

Mid-train 算法工程师(数据方向)

上海 ·经验不限·学历不限

上海·北京

职位描述

The right data does not just improve models. It creates new capabilities. 随着基础模型规模不断扩大,单纯增加训练数据已经无法保证能力持续提升。 未来模型竞争的核心,将从“拥有多少数据”转向“是否能够构建持续产生高价值数据的能力增长系统”。 你将探索的问题包括: 什么样的数据能够真正激发模型的Reasoning、Coding和Agent能力 如何设计高质量Mid-training Data Recipe,实现能力定向增强 如何利用Synthetic Data、Self-play、Self-distillation生成模型需要的数据 如何通过数据回流和模型反馈,建立自动进化的数据闭环 如何衡量数据价值,并找到数据与能力提升之间的因果关系 你的工作将直接决定模型能力增长的方向 岗位职责 负责大模型Mid-training阶段数据算法研究,构建能力增强型数据体系。 设计和优化数据Recipe,包括数据筛选、数据混合、课程学习、合成数据生成等策略。 面向代码、数学、Reasoning、Agent、多模态等能力方向,构建高价值训练数据。 分析数据分布、数据质量与模型能力之间的关系,建立数据评估体系。 与算法训练、Evaluation团队协同,通过数据驱动模型能力持续提升。 任职要求 2026届或2027届计算机、人工智能、数学、统计等相关专业硕士及以上或优秀本科生; 熟悉NLP、大模型数据处理、数据挖掘或Data-centric AI相关技术。 具备较强的数据分析能力和工程能力,能够独立完成数据Pipeline建设和实验验证。 对Synthetic Data、Data Flywheel、Self-training、数据Scaling等方向有研究兴趣或实践经验。 在各类竞赛中取得突出成绩,或在开源社区有重要贡献者优先。

官网发布:2026-09-02 · 最后确认在招:2026-09-03 22:42:05 · 来源平台:moka