淘天集团 社会招聘
阿里妈妈-AI Infra高级研发工程师-高性能计算/大模型-北京
北京 ·2年以上·本科
北京
薪资面议
前往 淘天集团 官网投递
职位描述
【团队与愿景】
我们是阿里淘天集团阿里妈妈广告技术部的核心基础设施团队(AI Infra)。在电商场景下,我们支撑着全球最复杂的广告召回、排序与机制策略业务。
这里不仅是算法的落地场,更是系统工程的深水区。我们管理着数百万 CPU 核与数万 GPU 卡的异构集群,致力于解决生成式大模型、超大规模稀疏特征(万亿级 Embedding)在工业界落地的极致性能难题。
如果你渴望在高并发低延迟、海量数据存储、高速网络通信等领域挑战技术天花板,这里就是你的最佳舞台。
【你将面临的硬核挑战】
加入我们将有机会主导以下三大核心方向的技术突破:
1. 下一代广告推理引擎 (AI Serving & LLM)
设计支持高并发、毫秒级延迟的广告实时预测系统,让大模型在电商场景中真正“跑起来”。
开展算法 - 软件 - 硬件协同优化(异构计算、算子融合、稀疏量化),释放万卡集群的每一分算力。
2. 超大规模高性能存储系统 (High-Performance Storage)
内核级优化:负责万亿级参数 Embedding 表的高性能 KV 存储引擎研发,深入操作系统内核与用户态进行极致调优。
分级存储架构:设计并实现多级缓存策略(DRAM/NVM/SSD),解决海量稀疏特征的低延迟访问难题,平衡容量与速度。
一致性保障:在超高吞吐写入场景下,保障分布式存储的数据强一致性与高可用性。
3. 极致网络通信加速 (Network & Interconnect)
RDMA/GDR 深度应用:利用 RDMA (RoCE/iWARP) 和 GPU Direct RDMA (GDR) 技术,打通 GPU 显存与网卡间的零拷贝通道,消除数据传输瓶颈。
【任职要求】
【我们期待这样的你】
基础扎实:计算机相关专业背景,拥有深厚的 C++ 功底,精通数据结构、算法及操作系统原理(内存管理、多线程、锁机制)。
专项特长(满足以下任一方向即可,不必全能):
推理优化方向:熟悉 CUDA 编程,有 GPU Kernel 优化经验;或熟悉 TensorFlow/PyTorch 底层,有 TRT/XLA/TVM/MLIR 等编译器优化经验。
存储引擎方向:有高性能 KV 存储(如 RocksDB, LevelDB, Redis 等)内核开发经验,熟悉 NVM/SSD 特性及分级存储设计。
网络通信方向:深刻理解 TCP/IP 协议栈,有 RDMA、DPDK、SmartNIC 或 GPU Direct 相关开发与调优经验。
系统视野:对分布式系统架构有独到见解,具备从全局视角分析性能瓶颈(Profiling)并解决问题的能力。
极客精神:对技术指标有洁癖,喜欢阅读源码,乐于攻克“别人搞不定”的底层难题。
【为什么选择我们?】
稀缺场景:业内少有的同时涵盖“大模型推理 + 万亿级存储 + 高速网络”的全栈系统实践机会。
顶级资源:直接接触并操作万卡级 GPU 集群与海量真实业务数据。
成长空间:扁平化的技术氛围,与大牛并肩作战,你的每一行代码都将影响数亿用户的体验。
回报丰厚:极具竞争力的薪酬包与期权激励。
工作地点:北京
温馨提示:即使您只专注于存储、网络或推理中的某一个细分领域,只要够深够专,我们都热烈欢迎!期待与您交流。
官网刷新:2026-09-01 · 最后确认在招:2026-09-03 22:45:31 · 来源平台:alibaba