蚂蚁集团 · 社会招聘
蚂蚁集团-资深训练系统研发工程师-北京/上海/杭州
杭州 ·2年以上·本科
北京·上海·杭州
薪资面议
前往 蚂蚁集团 官网投递
职位描述
● 负责搜广推训练系统的设计、开发和稳定性建设,覆盖离线训练及在线学习场景。
● 深入理解算法用户的训练流程和实际痛点,将业务需求抽象为可复用、可演进的系统能力。
● 负责训练系统与公司内部调度、数据流、存储、模型管理及通用训练平台的集成。
● 负责 TensorFlow、PyTorch,以及 TorchRec、PyTorch Lightning 等相关组件的内部适配和演进。
● 建设训练任务的可观测、智能诊断和故障恢复能力,提升用户自助排障效率。
● 负责训练平台后端及相关工具建设,推动任务提交、运行、诊断和模型产出流程标准化。
● 治理版本碎片化和历史技术债务,推进公共能力复用及系统架构收敛。
● 与算法、数据、调度、存储等团队协作,持续提升训练效率、稳定性和用户体验。
【任职要求】
● 计算机相关专业本科及以上学历,具备扎实的计算机基础和良好的工程能力,二年以上工作经验。
● 具备后端或系统研发经验,熟悉分布式系统、任务调度、数据处理、存储或可观测性中的一个或多个方向。
● 熟练掌握 Python,并熟悉 Java、C++、Go 中至少一种语言,具备跨语言定位问题的能力。
● 理解机器学习训练的基本流程,使用或维护过 TensorFlow、PyTorch 等训练框架。
● 熟悉 Kubernetes、容器化和分布式任务运行机制,具备线上系统稳定性建设及故障排查经验。
● 能够独立负责复杂系统或核心模块,在保障业务连续性的同时推进技术演进和历史问题治理。
● 具备用户视角、技术产品判断和跨团队推动能力,能够抽象需求并合理判断功能边界、用户价值及长期维护成本。
加分项
● 有搜索、推荐、广告训练或在线学习系统经验。
● 有分布式训练、Embedding、Parameter Server、TorchRec 或大规模稀疏模型经验。
● 有面向算法用户建设训练平台、机器学习平台、数据平台或任务调度平台的经验。
● 有 Elastic Training、Checkpoint、训练节点恢复、故障注入或可观测体系建设经验。
● 有存量系统治理、平台能力收敛、版本治理或用户迁移经验。
● 有使用 AI Coding 完成平台前后端迭代的实践经验。
最后确认在招:2026-09-01 19:09:33 · 来源平台:alibaba