直招.cv

← 返回职位列表

蚂蚁集团 · 社会招聘

蚂蚁集团-数据采集工程师(LLM数据方向)-健康事业群

杭州 ·3年以上·本科

北京·上海·杭州

职位描述

我们正在寻找一位技术深厚的数据采集工程师,主导面向LLM(大语言模型)训练的大规模分布式数据采集系统建设。你将负责设计支撑日均数千万级高难度抓取量的高可用爬虫架构,攻克业界最前沿的反爬与风控挑战,构建大模型的数据底座。 核心职责 1. 构建千亿级数据采集基础设施 - 基于开源框架设计高并发、高可用的分布式爬虫架构设计,支撑日均数千万级页面的抓取吞吐量 - 深度对抗各类先进反爬机制:验证码体系(ReCaptcha/HCaptcha/行为验证)、JS混淆与动态指纹、TLS/JA3指纹检测、浏览器行为链分析等 - 构建反溯源与反识别体系:设计IP代理池智能调度、设备指纹动态生成、请求行为拟真等核心能力 - 建立实时监控预警与自动策略切换机制,实现对抗能力的持续迭代 2. 主导AI驱动的智能爬虫系统 - 基于LLM构建类似FireCrawl/Crawlee的智能爬虫:无需规则即可自动理解页面结构、提取结构化数据 - 开发LLM Agent驱动的自适应爬虫:自动识别站点结构、动态生成抓取策略、智能处理异常场景 - 攻克复杂SPA/动态渲染页面的智能解析难题,实现多模态数据(图文混排、PDF、表格、视频字幕)的统一提取 【任职要求】 必备条件 - 1年以上爬虫实战经验,有千万级/亿级规模数据采集项目落地经验 - 攻防体系实战能力:丰富的反爬对抗背景,熟悉反溯源与反识别技术 - 反爬经验:解决过复杂验证码(图形/滑块/点选/行为验证)、WAF防护、Bot Management(Cloudflare/DataDome/PerimeterX等)等典型场景 - AI爬虫经验:具备Crawlee/Scrapling/FireCrawl类AI爬虫项目经验,或独立实现过基于LLM的自动化数据提取系统 - 技术栈深度:精通Python或Go,对Scrapy、Playwright、Selenium、Puppeteer等框架有深入源码级理解 - 技术热情:对技术有强烈热忱,具备优秀的系统性思维和问题解决能力 加分项 - 移动端采集:具备APP逆向与自动化操作经验 - 多模态技术栈:有视觉模型微调经验,能处理复杂版面的图文解析 - 安全与逆向功底:熟练掌握JS反混淆、APK逆向、动态调试等技术 - LLM工程经验:深入理解Agent架构,有ReAct/CoT/多智能体系统的实际开发经验 --- 为什么加入我们 - 前沿技术战场:在反爬对抗和AI自动化采集的最前线,持续面对世界级技术挑战 - 超大影响力:你的代码将直接支撑下一代大模型的数据底座,赋能千万级用户 - 技术成长:与顶尖工程师并肩,在攻防对抗中持续突破技术边界 --- 如果你热爱技术对抗、追求极致、渴望用AI重新定义数据采集——我们期待与你聊聊。

最后确认在招:2026-09-01 19:09:33 · 来源平台:alibaba