直招.cv

← 返回职位列表

追觅科技 社会招聘

数仓工程师(J59451)

地点未注明 ·经验不限·学历不限

江苏省

职位描述

1. 数据湖架构设计与建设 负责企业级数据湖的规划与建设,构建覆盖车端、研发端、生产端、营销端的一站式数据汇聚平台,实现结构化、半结构化(如车辆日志)和非结构化数据的统一存储与管理。 设计数据湖分层架构(如Bronze银/原始层、Silver银/清洗层、Gold金/应用层),制定数据入湖规范,确保数据的可追溯性和不可变性。 基于 湖仓一体(Lakehouse) 理念,构建高性能数据底座,平衡数据湖的灵活性与数据仓库的ACID(原子性、一致性、隔离性、持久性)事务需求。 2. 车联网数据处理 重点负责车联网(IoV)数据的接入与处理:设计和开发实时/准实时数据管道,处理来自车载传感器(T-Box,即车载远程通信终端)的海量时序数据(如车速、电机转速、电池电压温度、GPS轨迹)。 针对新能源三电系统(电池、电机、电控)数据特点,建立高效的数据压缩、清洗和聚合策略,降低存储成本并提升查询分析性能。 处理智能座舱相关的用户行为日志数据(如APP使用、语音交互),为座舱体验优化提供数据支持。 3. 数据仓库建模与ETL开发 承担数据仓库模型设计工作,在数据湖的Gold层建设主题式数据模型(如车辆主题、用户主题、零部件主题、充电行为主题),支撑BI(商业智能)报表和业务分析。 开发并维护高效、稳定的数据ETL(抽取、转换、加载) pipeline,负责数据从采集、清洗、转换到分发的全流程编码与调度。 负责数据质量和数据治理在工程侧的落地,设计数据质量监控规则,确保数据湖中数据的准确性、完整性和一致性。 4. 数据服务与性能优化 为内部数据消费者(算法工程师、数据分析师、业务运营)提供高效的数据服务接口或视图,简化数据获取流程。 持续优化数据计算和存储性能,解决数据倾斜、任务长尾等问题,控制数据湖运维成本(特别是云上存储与计算成本)。 【任职要求】 1. 基本条件 全日制本科及以上学历,计算机科学、软件工程、数学、大数据或相关专业。 5 年以上数据仓库或大数据开发经验,其中至少 2 年新能源主机厂或大型车联网平台工作经验。 2. 专业技能 数据湖架构: 深入理解数据湖理念,有基于 Delta Lake / Apache Hudi / Apache Iceberg 等湖格式构建数据湖的实际项目经验,熟悉其ACID、时间旅行、upsert(更新插入)等特性。 大数据技术栈: 精通 Spark(Structured Streaming 和 Spark SQL)进行大规模数据处理;熟练掌握 Flink 进行实时数据处理;熟悉 Hadoop 生态(HDFS、Hive)或云原生对象存储(S3/OSS)。 计算与调度: 熟练掌握 Spark 的内核调优;熟悉至少一种调度平台,如 Airflow、DolphinScheduler。 编程语言: 精通 SQL,具备扎实的 Scala 或 Python 开发能力,能够编写复杂、高效的数据处理逻辑。 数据建模: 掌握数据仓库建模理论(如维度建模),能够根据业务场景设计星型/雪花模型。 3. 行业理解 车联网数据经验: 熟悉车联网数据的采集协议(如MQTT)和常见数据类型,有处理高频时序数据的实战经验,了解新能源三电系统的基本数据含义。 业务理解: 对新能源主机厂的业务场景有认知,理解诸如车辆故障诊断、电池健康度评估(SOH,即健康状态)、用户画像、智慧生产等场景对数据的具体要求。 4. 综合素质 架构思维: 具备良好的技术视野,能根据业务发展预判数据规模的增长,并进行合理的分层和技术选型。 数据敏感度: 对数据质量有执念,能从数据波动中发现问题,并追查至底层链路。 沟通协作: 能够与算法、后端、嵌入式及业务部门有效沟通,理解数据产生的业务背景,并将其转化为工程实现。 【加分项】 云平台经验: 熟悉主流云厂商的大数据服务(如 AWS EMR/Redshift, 阿里云 E-MapReduce/MaxCompute, 腾讯云 EMR),有云成本优化经验。 实时计算: 有基于 Flink SQL + Kafka 构建实时数据湖的实战经验。 DevOps 能力: 了解 Docker/Kubernetes,能够将数据处理任务容器化部署。 数据治理: 参与过数据治理项目,有元数据管理(如Atlas)和数据血缘分析经验。

官网发布:2026-04-09 · 最后确认在招:2026-09-03 19:19:55 · 来源平台:beisen