直招.cv

← 返回职位列表

阿里巴巴控股集团 · 社会招聘

数据技术及产品部-数据采集合规与治理工程师-爬虫方向

杭州 ·2年以上·本科

杭州

职位描述

1. 负责公开网络数据采集链路的合规治理体系建设,覆盖数据源准入、采集策略、采集留痕、数据处理、入库、训练集构建和后续排除机制。 2. 建设爬虫数据证据链与数据血缘系统,记录 URL、域名、获取时间、来源类型、访问决策依据、内容哈希、处理流程、风险标签、数据集版本、模型训练版本和审计日志。 3. 建立网络采集合规控制机制,包括机器可读访问限制、站点访问策略、频率控制、来源留痕、异常监控、争议处理和数据下架流程。 4. 与法务团队协作,将版权、TDM opt-out、站点条款、授权边界、权利人投诉、数据删除请求等要求转化为系统规则、审批流程和可追溯记录。 5. 与安全、隐私和合规团队协作,建立爬虫数据风险管理机制,包括敏感数据识别、PII 过滤、来源风险分级、黑白名单、人工复核、访问控制和异常告警。 6. 牵引公开网络数据的准入和分级管理,对不同类型站点、内容类别、数据用途、地域风险和权利状态建立统一评估标准。 7. 建设面向欧盟监管检查和客户尽调的技术支撑能力,包括训练数据来源摘要、版权政策执行记录、采集留痕、风险处置记录和审计报表。 8. 推动爬虫平台、数据平台、模型训练平台、法务、安全团队之间的系统打通,确保数据从采集到训练使用全链路可解释、可追溯、可处置。 9. 支持风险事件复盘和外部问询,能够快速回答“数据从哪里来、为什么可以采、是否进入训练集、如何排除或删除”等问题。 【任职要求】 1. 5 年以上后端、爬虫平台、搜索引擎、数据平台、数据治理、安全合规或 AI 数据工程经验,有复杂系统设计和跨团队项目推进经验。 2. 熟悉大规模网页采集系统,理解 URL 调度、网页解析、内容抽取、去重、分布式任务调度、访问控制、日志留存和数据入湖链路。 3. 熟悉数据血缘、元数据管理、审计日志、数据版本、权限控制、数据生命周期管理等工程体系。 4. 具备合规工程能力,能够把法律、政策、安全或监管要求拆解成系统规则、数据字段、控制点、审批流程和监控指标。 5. 理解基础模型训练数据流程,包括采集、清洗、过滤、去重、采样、版本管理、训练集构建和模型版本关联。 6. 熟悉数据安全、隐私保护、版权治理、公开网络数据治理或监管审计中的至少一个方向。 7. 具备强跨职能协作能力,能够与法务、安全、隐私、政策、研究、数据工程和业务团队共同推进复杂项目。 8. 有较强的风险判断能力,既能理解合规边界,也能设计工程上可落地、可规模化、可维护的解决方案。 加分项 1. 有搜索引擎、大规模爬虫、内容平台、广告平台、数据中台、基础模型数据平台经验。 2. 熟悉 EU AI Act、GDPR、版权法、TDM opt-out、AI 训练数据透明度或模型合规文档要求。 3. 有爬虫合规、数据存证、审计追踪、监管检查、客户安全尽调或诉讼保全相关系统经验。 4. 熟悉 PII 检测、敏感数据识别、内容安全、版权内容识别、多模态数据治理。 5. 有推动法务、安全、工程和研究团队协同制定数据使用标准并落地系统的经验。

最后确认在招:2026-09-01 19:10:48 · 来源平台:alibaba