直招.cv

← 返回职位列表

字节跳动 社会招聘

端侧多模态推理引擎高性能优化工程师-AML(上海/杭州/广州/深圳)

上海 ·经验不限·学历不限

上海

职位描述

1、负责开发和优化字节跳动公司级的端侧AI推理框架,通过CPU/GPU/DSP/NPU的并行计算优化、架构设计、稀疏优化、异构调度等多种高性能优化技术打造业界领先的高性能异构AI推理引擎; 2、负责将LLM、多模态、AIGC等大模型算法在端侧做AI推理技术优化,落地到抖音、剪映、火山引擎等产品,支撑字节跳动AI业务的发展; 3、负责AI模型和推理框架工具链开发及技术生态的建设。 【任职要求】 1、本科及以上学历,计算机/电子/信息/通信/自动化/软件等相关专业,有AI工程优化经验优先; 2、精通C/C++,精通算法与数据结构,熟悉Python; 3、熟悉主流LLM/VLM/AIGC算法模型原理,了解混合专家(MoE)架构、低比特量化(如INT8/INT4/INT2)、SparseAttention等模型优化手段,有相关优化经验者优先; 4、具备CUDA/OpenCL/Metal中的至少1种GPU优化经验,熟悉TensorRT/Triton/CUTLASS,熟悉高通/MTK等NPU架构及部署方案,有丰富的ARM NEON汇编优化,有以上技术的AI工程优化部署经验者优先; 5、熟练掌握GPU(NVIDIA/Adreno/Mali/Apple)、CPU(ARM/x86)中的1个或多个平台的高性能计算优化技术,深入理解计算机体系结构,熟悉移动端/PC端/车端中一个或多个平台的并行计算优化、访存优化等; 6、熟悉常用深度学习推理计算库,例如Llama.cpp、MNN、TNN、CoreML等,熟悉计算密集型算子如FlashAttention、Conv2d、GEMM、GEMV实现和加速优先。

官网发布:2024-09-24 · 最后确认在招:2026-09-03 19:35:21 · 来源平台:feishu