蚂蚁集团 · 社会招聘
蚂蚁集团-数据采集工程师(LLM数据方向)-健康事业群
杭州 ·3年以上·本科
北京·上海·杭州
薪资面议
前往 蚂蚁集团 官网投递
职位描述
我们正在寻找一位技术深厚的数据采集工程师,主导面向LLM(大语言模型)训练的大规模分布式数据采集系统建设。你将负责设计支撑日均数千万级高难度抓取量的高可用爬虫架构,攻克业界最前沿的反爬与风控挑战,构建大模型的数据底座。
核心职责
1. 构建千亿级数据采集基础设施
- 基于开源框架设计高并发、高可用的分布式爬虫架构设计,支撑日均数千万级页面的抓取吞吐量
- 深度对抗各类先进反爬机制:验证码体系(ReCaptcha/HCaptcha/行为验证)、JS混淆与动态指纹、TLS/JA3指纹检测、浏览器行为链分析等
- 构建反溯源与反识别体系:设计IP代理池智能调度、设备指纹动态生成、请求行为拟真等核心能力
- 建立实时监控预警与自动策略切换机制,实现对抗能力的持续迭代
2. 主导AI驱动的智能爬虫系统
- 基于LLM构建类似FireCrawl/Crawlee的智能爬虫:无需规则即可自动理解页面结构、提取结构化数据
- 开发LLM Agent驱动的自适应爬虫:自动识别站点结构、动态生成抓取策略、智能处理异常场景
- 攻克复杂SPA/动态渲染页面的智能解析难题,实现多模态数据(图文混排、PDF、表格、视频字幕)的统一提取
【任职要求】
必备条件
- 1年以上爬虫实战经验,有千万级/亿级规模数据采集项目落地经验
- 攻防体系实战能力:丰富的反爬对抗背景,熟悉反溯源与反识别技术
- 反爬经验:解决过复杂验证码(图形/滑块/点选/行为验证)、WAF防护、Bot Management(Cloudflare/DataDome/PerimeterX等)等典型场景
- AI爬虫经验:具备Crawlee/Scrapling/FireCrawl类AI爬虫项目经验,或独立实现过基于LLM的自动化数据提取系统
- 技术栈深度:精通Python或Go,对Scrapy、Playwright、Selenium、Puppeteer等框架有深入源码级理解
- 技术热情:对技术有强烈热忱,具备优秀的系统性思维和问题解决能力
加分项
- 移动端采集:具备APP逆向与自动化操作经验
- 多模态技术栈:有视觉模型微调经验,能处理复杂版面的图文解析
- 安全与逆向功底:熟练掌握JS反混淆、APK逆向、动态调试等技术
- LLM工程经验:深入理解Agent架构,有ReAct/CoT/多智能体系统的实际开发经验
---
为什么加入我们
- 前沿技术战场:在反爬对抗和AI自动化采集的最前线,持续面对世界级技术挑战
- 超大影响力:你的代码将直接支撑下一代大模型的数据底座,赋能千万级用户
- 技术成长:与顶尖工程师并肩,在攻防对抗中持续突破技术边界
---
如果你热爱技术对抗、追求极致、渴望用AI重新定义数据采集——我们期待与你聊聊。
最后确认在招:2026-09-01 19:09:33 · 来源平台:alibaba