阶跃星辰 社会招聘
大模型训练优化工程师
北京 ·经验不限·学历不限
北京
薪资面议
前往 阶跃星辰 官网投递
职位描述
工作职责
1 负责大语言模型(LLM)训练基础设施的设计与开发,包括大规模数据加载优化、训练数据构建和数据处理 Pipeline。
2 负责大规模训练数据格式与存储方案设计(如 WebDataset / Sharded Dataset 等),优化数据 IO 和分布式训练场景下的数据吞吐能力。
3 负责模型工具链建设,包括模型格式转换、权重切分与合并、跨框架模型迁移(如 HuggingFace / Megatron 等)。
4 参与大模型训练系统开发与优化,支持预训练、SFT、RLHF 等不同训练流程,提高训练效率和 GPU 利用率。
5 参与大模型推理基础设施开发,建设高性能推理平台,支持在线推理服务。
6 跟踪大模型训练与推理领域的前沿技术(如高效数据管道、训练加速等),持续推动系统能力升级。
任职资格
1 计算机科学、人工智能、软件工程或相关专业,硕士及以上学历。2年以上AI Infra相关的工作经验。
2 精通Python / Go / C++ 中至少两门语言,有一定的代码品味,能编写高质量的代码。
3 有良好的算法和数理基础,熟悉常用算法。
4 熟练掌握深度学习框架(PyTorch)、分布式训练技术(5D并行)及相关框架(Megatron-LM),有实际的模型训练经验。对LLM训练的各个环节尤其是dataloader、checkpoint等模块有深入研究。
5 熟练使用分布式计算系统如Ray、Spark,有实际使用和应用调优的经验。
6 擅长性能优化,对性能和稳定性有极致的追求,能在压力下快速的定位到性能瓶颈,并落地优化方案。
7 具备良好的问题分析与解决能力,良好的团队合作精神和沟通能力,能编写高质量文档。
加分项:
在国内外知名会议发表过相关领域的高质量论文;
在ACM、PAC等编程竞赛中取得过较好成绩。
知名开源项目的core contributor或maintainer。
官网发布:2026-05-27 · 最后确认在招:2026-09-03 22:42:05 · 来源平台:moka