哈啰出行 校园招聘
【量天尺计划】智驾Efficient AI 前沿预研-造父Robotaxi(J21702)
上海 ·经验不限·学历不限
上海市
薪资面议
前往 哈啰出行 官网投递
职位描述
关键词:MLSys, MLInfer, Heterogeneous Computing, Compiler Optimization, NVIDIA Thor, Real-time Inference
在 L4/L5 级自动驾驶的演进中,算力不再是唯一的瓶颈,能效比(Performance per Watt)与确定性低延迟(Deterministic Low Latency)才是决胜关键。我们致力于打破传统深度学习框架的黑盒限制,从芯片指令集到上层应用逻辑,重新定义端侧 AI 的运行效率。如果你渴望在物理极限边缘跳舞,欢迎加入我们。
核心预研课题方向
我们将围绕 “极致加速” 与 “异构协同” 两大主线,设立以下挑战性课题:
1. Efficient AI 算法
研究内容:
结合当前Physical AI领域端到端大模型算法结构设计,提供端侧更高效的backbone或head,或注意力机制算法,优化ViT、DiT或迭代新网络;
设计端侧带宽瓶颈、内存瓶颈下的高效算法模型结构,如sparse attention/flashattention/linear attention等;
2. 跨异构平台的AI 编译器设计、端侧高效推理加速器
背景:车载计算单元日益复杂,包含 CPU (ARM/x86)、GPU (CUDA) 及专用 NPU/ASIC。如何在一个统一的编译流中调度这些异构资源是行业难题。
研究内容:
中间表示(IR)创新:基于MLIR做端侧推理的vllm,设计支持多后端统一抽象的高级 IR,打通从 PyTorch/TensorFlow 到 C++/CUDA/OpenCL 的全自动代码生成路径,加速端侧推理和调度优化。
自动调优(Auto-tuning):mlir/tvm-tensorrt 开发基于强化学习或贝叶斯优化的算子搜索器,针对特定硬件缓存层级(L1/L2/Shared Memory)自动寻找最优分块(Tiling)与并行策略。
端到端编译:实现从模型图到二进制指令的零拷贝优化,消除框架 overhead,达成 C++ 到 CUDA 内核生成的全链路性能逼近理论峰值。
【任职要求】
我们寻找这样的你
学历背景:计算机科学、电子工程、应用数学等相关专业博士或杰出硕士,有顶级会议(OSDI, MLSys, ASPLOS, ISCA, CVPR, ICCV)论文发表者优先。
核心技术栈:
精通 C++/CUDA 编程,具备深厚的计算机体系结构知识(流水线、缓存一致性、SIMD/SIMT)。
熟练掌握至少一种主流深度学习编译器框架(TVM, MLIR, XLA, Triton, TensorRT),一种主流推理框架(sglang、vllm等)并有源码修改或插件开发经验。
对 NVIDIA GPU 架构(Ampere/Hopper/Blackwell)或主流 NPU 指令集有深刻理解。
特质:
极客精神:不满足于调用 API,热衷于挖掘底层性能极限,享受将推理速度提升 10% 带来的成就感。
系统思维:能够从全局视角看待算法、软件与硬件的协同设计。
官网发布:2026-08-31 · 最后确认在招:2026-09-03 19:14:12 · 来源平台:beisen