直招.cv

← 返回职位列表

腾讯 社会招聘

智能湖仓研发工程师(上海/深圳)

上海 ·三年以上工作经验·学历不限

上海

职位描述

1.负责公司统一 AI 数据湖基础能力建设,围绕存储、元数据、索引、版本、权限、生命周期和查询规划等方向,构建高性能、可治理、可复用的数据基础设施; 2.深度适配 Spark、Flink、StarRocks、Ray,Pytorch等大数据和AI 计算框架 ,优化数据写入、扫描、过滤、采样、批量读取、训练数据加载和结果回写等端到端性能; 3.支持广告、推荐、搜索等业务场景,建设样本、特征、行为日志、模型输入输出和效果数据等核心数据资产的统一管理与高效访问能力,支撑样本构建、特征回溯、训练数据管理和实验复现; 4.支持大模型研发链路中的数据采集、清洗解析、特征抽取、Embedding 生成、数据去重、训练集构建、评估与推理回写等环节,建设高效的数据存储与数据访问能力; 5.围绕多模态数据管理、向量检索、近重复检测、语义检索、RAG、混合查询和批量数据治理等场景,构建高吞吐、低成本、可版本化的数据处理与检索能力。 【任职要求】 1.5 年以上大数据、分布式系统、存储系统、湖仓、检索系统、广告推荐数据平台或 AI 数据平台研发经验; 2.熟悉 Java / Scala / C++ / Rust / Python 中至少一种语言,具备扎实的系统设计、编码和性能优化能力; 3.熟悉数据湖、湖仓、分布式存储、元数据管理、事务提交、文件组织、查询规划、分区裁剪和文件裁剪等机制; 4.熟悉 Spark、Flink、Trino / Presto、Hive、StarRocks、Ray 等计算或查询引擎中的一种或多种; 5.熟悉 Parquet,Lance, Vortex,Nimble 等列存文件格式,理解列式存储、随机访问、批量读取、压缩编码和 IO 优化; 6.熟悉广告、推荐、搜索中的样本生产、特征工程、训练数据管理、特征回溯或模型效果分析链路者优先; 7.熟悉向量检索、多模态检索、近重复检测、语义检索、RAG 或大规模 embedding 数据治理者优先; 8.具备良好的技术判断力、问题抽象能力、跨团队沟通能力和复杂项目推进能力; 9.加分项:; 10.有数据湖表格式、存储内核、查询引擎、特征平台、样本平台、向量检索系统或多模态数据平台研发经验; 11.有 Iceberg,Hudi, Paimon, Lance, Vortex, Nimble, Arrow、Spark、Flink、Trino、Ray 等开源项目源码经验或社区贡献者优先; 12.有 PB 级数据、百亿级样本、大规模 特征或 embedding 数据处理经验者优先。

最后确认在招:2026-09-03 23:15:16 · 来源平台:tencent