字节跳动 社会招聘
端侧多模态推理引擎高性能优化工程师-AML(上海/杭州/广州/深圳)
上海 ·经验不限·学历不限
上海
薪资面议
前往 字节跳动 官网投递
职位描述
1、负责开发和优化字节跳动公司级的端侧AI推理框架,通过CPU/GPU/DSP/NPU的并行计算优化、架构设计、稀疏优化、异构调度等多种高性能优化技术打造业界领先的高性能异构AI推理引擎;
2、负责将LLM、多模态、AIGC等大模型算法在端侧做AI推理技术优化,落地到抖音、剪映、火山引擎等产品,支撑字节跳动AI业务的发展;
3、负责AI模型和推理框架工具链开发及技术生态的建设。
【任职要求】
1、本科及以上学历,计算机/电子/信息/通信/自动化/软件等相关专业,有AI工程优化经验优先;
2、精通C/C++,精通算法与数据结构,熟悉Python;
3、熟悉主流LLM/VLM/AIGC算法模型原理,了解混合专家(MoE)架构、低比特量化(如INT8/INT4/INT2)、SparseAttention等模型优化手段,有相关优化经验者优先;
4、具备CUDA/OpenCL/Metal中的至少1种GPU优化经验,熟悉TensorRT/Triton/CUTLASS,熟悉高通/MTK等NPU架构及部署方案,有丰富的ARM NEON汇编优化,有以上技术的AI工程优化部署经验者优先;
5、熟练掌握GPU(NVIDIA/Adreno/Mali/Apple)、CPU(ARM/x86)中的1个或多个平台的高性能计算优化技术,深入理解计算机体系结构,熟悉移动端/PC端/车端中一个或多个平台的并行计算优化、访存优化等;
6、熟悉常用深度学习推理计算库,例如Llama.cpp、MNN、TNN、CoreML等,熟悉计算密集型算子如FlashAttention、Conv2d、GEMM、GEMV实现和加速优先。
官网发布:2024-09-24 · 最后确认在招:2026-09-03 19:35:21 · 来源平台:feishu