蚂蚁集团 · 社会招聘
蚂蚁集团-蚂蚁技术研究院-大模型数据算法研究员
杭州 ·1年以上·硕士
北京·上海·杭州
薪资面议
前往 蚂蚁集团 官网投递
职位描述
1. 构建百亿-千亿级参数大模型的工业化数据管道原型系统,主导预训练数据(多语言/多模态)的数据质量治理体系设计,开发数据去噪、清洗、打标、去偏和毒性检测算法
2. 构建大模型多维度评估体系:开发面向领域任务的细粒度评估框架,设计红蓝军对抗性测试集,在细粒度层面建立能力-数据关联分析模型
3. 构建大模型Agent应用场景的交互数据闭环系统,开发自动化数据标注、推理轨迹数据监督和治理、幻觉检测和消除等技术模块
4. 研究预训练和后训练的数据智能新架构、新流程和新算法,包括但不限于小样本数据蒸馏、课程学习策略优化、数据价值量化评估等,并实现先进方法的工程化落地
5. 研究基于LLM的合成数据生成框架,探索多模态数据合成(代码/数学推理/跨模态对齐)方法,探索多模态思维链合成增强、对抗性和合作性数据增强等技术路线
【任职要求】
1. 海内外高校计算机科学、人工智能、数据科学、数学等相关专业毕业。
2. 技术栈:
• 精通Python编程,具备扎实的算法、数据结构和机器学习基础。
• 精通深度学习和大模型框架(如PyTorch、Huggingface transformer、LangChain、vLLM、DeepSpeed、Megatron-LM等)。
• 精通大模型的基本原理、训练和评估流程。
3. 项目经验(满足2项+优先):
• 主导过亿级token量级的大模型预训练数据清洗项目
• 在NeurIPS/ICLR/ICML/ACL等顶会发表过大模型数据侧算法的相关论文
• 开发过企业级LLM数据治理工具
• 具有复杂Agent系统的决策数据优化经验
4. 论文阅读与实现能力:能够快速阅读和理解顶级会议(如NeurIPS、ICLR、ICML、ACL等)的论文,并复现算法。
5. 团队合作:良好的沟通能力和团队协作精神,能够与团队成员高效合作。
最后确认在招:2026-09-01 19:09:33 · 来源平台:alibaba