追觅科技 社会招聘
数仓工程师(J59451)
地点未注明 ·经验不限·学历不限
江苏省
薪资面议
前往 追觅科技 官网投递
职位描述
1. 数据湖架构设计与建设
负责企业级数据湖的规划与建设,构建覆盖车端、研发端、生产端、营销端的一站式数据汇聚平台,实现结构化、半结构化(如车辆日志)和非结构化数据的统一存储与管理。
设计数据湖分层架构(如Bronze银/原始层、Silver银/清洗层、Gold金/应用层),制定数据入湖规范,确保数据的可追溯性和不可变性。
基于 湖仓一体(Lakehouse) 理念,构建高性能数据底座,平衡数据湖的灵活性与数据仓库的ACID(原子性、一致性、隔离性、持久性)事务需求。
2. 车联网数据处理
重点负责车联网(IoV)数据的接入与处理:设计和开发实时/准实时数据管道,处理来自车载传感器(T-Box,即车载远程通信终端)的海量时序数据(如车速、电机转速、电池电压温度、GPS轨迹)。
针对新能源三电系统(电池、电机、电控)数据特点,建立高效的数据压缩、清洗和聚合策略,降低存储成本并提升查询分析性能。
处理智能座舱相关的用户行为日志数据(如APP使用、语音交互),为座舱体验优化提供数据支持。
3. 数据仓库建模与ETL开发
承担数据仓库模型设计工作,在数据湖的Gold层建设主题式数据模型(如车辆主题、用户主题、零部件主题、充电行为主题),支撑BI(商业智能)报表和业务分析。
开发并维护高效、稳定的数据ETL(抽取、转换、加载) pipeline,负责数据从采集、清洗、转换到分发的全流程编码与调度。
负责数据质量和数据治理在工程侧的落地,设计数据质量监控规则,确保数据湖中数据的准确性、完整性和一致性。
4. 数据服务与性能优化
为内部数据消费者(算法工程师、数据分析师、业务运营)提供高效的数据服务接口或视图,简化数据获取流程。
持续优化数据计算和存储性能,解决数据倾斜、任务长尾等问题,控制数据湖运维成本(特别是云上存储与计算成本)。
【任职要求】
1. 基本条件
全日制本科及以上学历,计算机科学、软件工程、数学、大数据或相关专业。
5 年以上数据仓库或大数据开发经验,其中至少 2 年新能源主机厂或大型车联网平台工作经验。
2. 专业技能
数据湖架构: 深入理解数据湖理念,有基于 Delta Lake / Apache Hudi / Apache Iceberg 等湖格式构建数据湖的实际项目经验,熟悉其ACID、时间旅行、upsert(更新插入)等特性。
大数据技术栈: 精通 Spark(Structured Streaming 和 Spark SQL)进行大规模数据处理;熟练掌握 Flink 进行实时数据处理;熟悉 Hadoop 生态(HDFS、Hive)或云原生对象存储(S3/OSS)。
计算与调度: 熟练掌握 Spark 的内核调优;熟悉至少一种调度平台,如 Airflow、DolphinScheduler。
编程语言: 精通 SQL,具备扎实的 Scala 或 Python 开发能力,能够编写复杂、高效的数据处理逻辑。
数据建模: 掌握数据仓库建模理论(如维度建模),能够根据业务场景设计星型/雪花模型。
3. 行业理解
车联网数据经验: 熟悉车联网数据的采集协议(如MQTT)和常见数据类型,有处理高频时序数据的实战经验,了解新能源三电系统的基本数据含义。
业务理解: 对新能源主机厂的业务场景有认知,理解诸如车辆故障诊断、电池健康度评估(SOH,即健康状态)、用户画像、智慧生产等场景对数据的具体要求。
4. 综合素质
架构思维: 具备良好的技术视野,能根据业务发展预判数据规模的增长,并进行合理的分层和技术选型。
数据敏感度: 对数据质量有执念,能从数据波动中发现问题,并追查至底层链路。
沟通协作: 能够与算法、后端、嵌入式及业务部门有效沟通,理解数据产生的业务背景,并将其转化为工程实现。
【加分项】
云平台经验: 熟悉主流云厂商的大数据服务(如 AWS EMR/Redshift, 阿里云 E-MapReduce/MaxCompute, 腾讯云 EMR),有云成本优化经验。
实时计算: 有基于 Flink SQL + Kafka 构建实时数据湖的实战经验。
DevOps 能力: 了解 Docker/Kubernetes,能够将数据处理任务容器化部署。
数据治理: 参与过数据治理项目,有元数据管理(如Atlas)和数据血缘分析经验。
官网发布:2026-04-09 · 最后确认在招:2026-09-03 19:19:55 · 来源平台:beisen