蔚来 社会招聘
算法工程师-大模型数据方向
上海 ·经验不限·学历不限
上海
薪资面议
前往 蔚来 官网投递
职位描述
1. 全链路数据体系搭建:设计并实现大模型数据资产的知识体系,包括语料分类标准、知识图谱映射以及多维度的标签体系,构建可扩展的数据治理框架。
2. 语料精细化清洗:深度参与原始海量语料的清洗工作。利用 Python/Spark 等工具编写清洗脚本,处理噪音、去重、脱敏,并制定针对不同来源语料的清洗逻辑与质量标准。
3. 高质量数据池构建:负责通用语料与垂直行业语料的挖掘与整合,通过启发式规则、模型打分、聚类分析等手段,沉淀出亿级规模的“黄金语料库”。
4. 评测集与反馈闭环:构建科学的数据质量评测指标体系,通过模型反馈指导语料的进一步优化,形成“数据生产-评测-迭代”的良性循环。
5. 标注链路研发与提效:设计并优化 AI 辅助标注流程,开发辅助打标工具,在保证质量的前提下,极大提升人工标注的吞吐量。
【任职要求】
- 学历背景:计算机、数学或人工智能相关专业本科及以上学历。
- 技术功底:精通 Python,熟悉正则、多进程处理、Pandas/Spark 等大规模数据处理工具,具备极强的数据清洗和工程实操能力。
- 模型理解:熟练掌握 PyTorch 或 TensorFlow,对 Transformer 架构及大模型训练对数据的偏好(如多样性、质量分布)有深刻理解。
- 素质模型:不仅是算法思考者,更是实干家(Problem-solver);对数据敏感,能够耐心地从枯燥的数据中发现规律并抽象成体系。
加分项
- 有实际参与大模型全量预训练(Pre-training)或微调(SFT)阶段数据准备经验者优先。
- 在自然语言处理(NLP)领域有数据增强、语料合成、自动化评估等相关项目经验。
- 有大型知识图谱构建或企业级数据中台建设背景。
官网发布:2026-02-27 · 最后确认在招:2026-09-03 19:39:42 · 来源平台:feishu