直招.cv

← 返回职位列表

阿里巴巴控股集团 社会招聘

智能引擎-多模态大模型数据工程师-北京

北京 ·3年以上·本科

北京

职位描述

团队负责阿里巴巴多模态基础模型的数据体系建设,支撑行业领先的视频生成模型训练,处理百亿级图像、视频及图文数据。 本岗位聚焦复杂多模态数据管线建设,持续提升大规模数据处理的吞吐、正确性与数据质量,为 Pretrain、SFT、RL 提供高效、可靠的数据供给。 职位描述 1. 设计和建设百亿级多模态数据处理管线,覆盖数据清洗、解码、转换、过滤、标注及训练加载等环节。 2. 深入分析 CPU、内存、网络、存储、编解码及任务调度瓶颈,提升端到端吞吐、资源利用率和系统稳定性。 3. 建设数据校验与质量评估体系,保障数据完整、一致、可追溯,持续提升数据的准确性、多样性和有效性。 4. 基于 Ray、FFmpeg、PyTorch、vLLM 等技术建设高性能数据处理与模型推理组件,优化任务切分、批量推理、资源调度、数据传输及容错恢复。 5. 面向 Pretrain、SFT、RL 等训练阶段,协同设计数据格式、分片策略、存储布局和读取链路,提升训练数据供给效率。 6. 建立数据管线可观测体系,持续监控吞吐、延迟、资源利用率、失败率及数据质量,并分析数据特征与模型效果的关联。 7. 与算法、训练框架及基础设施团队协作,完成复杂数据链路的架构设计、性能优化和规模化落地。 【任职要求】 1. 计算机基础扎实,熟练使用 Python,具备良好的 Linux 系统开发能力。 2. 熟悉 PyTorch、FFmpeg、vLLM 等技术,具备多媒体数据处理或模型推理经验。 3. 熟悉 Ray 或其他分布式计算框架,理解任务调度、数据传输、容错和资源管理机制。 4. 具备系统性能分析与调优能力,能够定位 CPU、网络、存储、I/O 及编解码瓶颈。 5. 了解多模态大模型及不同训练阶段的数据需求,重视数据质量,具备良好的跨团队协作能力。

官网刷新:2026-08-26 · 最后确认在招:2026-09-03 22:50:57 · 来源平台:alibaba