直招.cv

← 返回职位列表

哈啰出行 校园招聘

【量天尺计划】智驾Efficient AI 前沿预研-造父Robotaxi(J21702)

上海 ·经验不限·学历不限

上海市

职位描述

关键词:MLSys, MLInfer, Heterogeneous Computing, Compiler Optimization, NVIDIA Thor, Real-time Inference 在 L4/L5 级自动驾驶的演进中,算力不再是唯一的瓶颈,能效比(Performance per Watt)与确定性低延迟(Deterministic Low Latency)才是决胜关键。我们致力于打破传统深度学习框架的黑盒限制,从芯片指令集到上层应用逻辑,重新定义端侧 AI 的运行效率。如果你渴望在物理极限边缘跳舞,欢迎加入我们。 核心预研课题方向 我们将围绕 “极致加速” 与 “异构协同” 两大主线,设立以下挑战性课题: 1. Efficient AI 算法 研究内容: 结合当前Physical AI领域端到端大模型算法结构设计,提供端侧更高效的backbone或head,或注意力机制算法,优化ViT、DiT或迭代新网络; 设计端侧带宽瓶颈、内存瓶颈下的高效算法模型结构,如sparse attention/flashattention/linear attention等; 2. 跨异构平台的AI 编译器设计、端侧高效推理加速器 背景:车载计算单元日益复杂,包含 CPU (ARM/x86)、GPU (CUDA) 及专用 NPU/ASIC。如何在一个统一的编译流中调度这些异构资源是行业难题。 研究内容: 中间表示(IR)创新:基于MLIR做端侧推理的vllm,设计支持多后端统一抽象的高级 IR,打通从 PyTorch/TensorFlow 到 C++/CUDA/OpenCL 的全自动代码生成路径,加速端侧推理和调度优化。 自动调优(Auto-tuning):mlir/tvm-tensorrt 开发基于强化学习或贝叶斯优化的算子搜索器,针对特定硬件缓存层级(L1/L2/Shared Memory)自动寻找最优分块(Tiling)与并行策略。 端到端编译:实现从模型图到二进制指令的零拷贝优化,消除框架 overhead,达成 C++ 到 CUDA 内核生成的全链路性能逼近理论峰值。 【任职要求】 我们寻找这样的你 学历背景:计算机科学、电子工程、应用数学等相关专业博士或杰出硕士,有顶级会议(OSDI, MLSys, ASPLOS, ISCA, CVPR, ICCV)论文发表者优先。 核心技术栈: 精通 C++/CUDA 编程,具备深厚的计算机体系结构知识(流水线、缓存一致性、SIMD/SIMT)。 熟练掌握至少一种主流深度学习编译器框架(TVM, MLIR, XLA, Triton, TensorRT),一种主流推理框架(sglang、vllm等)并有源码修改或插件开发经验。 对 NVIDIA GPU 架构(Ampere/Hopper/Blackwell)或主流 NPU 指令集有深刻理解。 特质: 极客精神:不满足于调用 API,热衷于挖掘底层性能极限,享受将推理速度提升 10% 带来的成就感。 系统思维:能够从全局视角看待算法、软件与硬件的协同设计。

官网发布:2026-08-31 · 最后确认在招:2026-09-03 19:14:12 · 来源平台:beisen