阿里巴巴控股集团 社会招聘
智能引擎-多模态大模型数据工程师-北京
北京 ·3年以上·本科
北京
薪资面议
前往 阿里巴巴控股集团 官网投递
职位描述
团队负责阿里巴巴多模态基础模型的数据体系建设,支撑行业领先的视频生成模型训练,处理百亿级图像、视频及图文数据。
本岗位聚焦复杂多模态数据管线建设,持续提升大规模数据处理的吞吐、正确性与数据质量,为 Pretrain、SFT、RL 提供高效、可靠的数据供给。
职位描述
1. 设计和建设百亿级多模态数据处理管线,覆盖数据清洗、解码、转换、过滤、标注及训练加载等环节。
2. 深入分析 CPU、内存、网络、存储、编解码及任务调度瓶颈,提升端到端吞吐、资源利用率和系统稳定性。
3. 建设数据校验与质量评估体系,保障数据完整、一致、可追溯,持续提升数据的准确性、多样性和有效性。
4. 基于 Ray、FFmpeg、PyTorch、vLLM 等技术建设高性能数据处理与模型推理组件,优化任务切分、批量推理、资源调度、数据传输及容错恢复。
5. 面向 Pretrain、SFT、RL 等训练阶段,协同设计数据格式、分片策略、存储布局和读取链路,提升训练数据供给效率。
6. 建立数据管线可观测体系,持续监控吞吐、延迟、资源利用率、失败率及数据质量,并分析数据特征与模型效果的关联。
7. 与算法、训练框架及基础设施团队协作,完成复杂数据链路的架构设计、性能优化和规模化落地。
【任职要求】
1. 计算机基础扎实,熟练使用 Python,具备良好的 Linux 系统开发能力。
2. 熟悉 PyTorch、FFmpeg、vLLM 等技术,具备多媒体数据处理或模型推理经验。
3. 熟悉 Ray 或其他分布式计算框架,理解任务调度、数据传输、容错和资源管理机制。
4. 具备系统性能分析与调优能力,能够定位 CPU、网络、存储、I/O 及编解码瓶颈。
5. 了解多模态大模型及不同训练阶段的数据需求,重视数据质量,具备良好的跨团队协作能力。
官网刷新:2026-08-26 · 最后确认在招:2026-09-03 22:50:57 · 来源平台:alibaba