直招.cv

← 返回职位列表

平头哥 社会招聘

平头哥-边缘AI芯片算法部署工程师-上海

上海 ·5年以上·硕士

上海

职位描述

1. 负责大模型在端侧/边缘设备的高效部署,优化多模型部署、多任务调度、多线程/多进程加速,提升推理性能与资源利用率。 2. 基于主流Agent框架,设计端侧Agent运行时架构与产品方案;优化Agent上下文管理(包括上下文窗口、缓存策略、压缩算法),提升长对话和复杂任务的执行效率等。 3. 深入分析端侧AI软件栈和芯片微架构性能瓶颈(如核心利用率、内存带宽、指令流水线等),持续输出优化建议,推动芯片架构和SDK持续优化。 【任职要求】 1. 计算机科学、电子工程、微电子、自动化等相关专业硕士及以上学历。 2. 具备Agent框架工程实践经验:了解OpenClaw(ReAct+Skills模式、MCP集成)或Hermes-Agent(自我改进机制、子Agent委派、上下文压缩)等主流Agent框架的架构原理和部署模式;有将Agent框架适配到端侧硬件平台(边缘服务器、嵌入式AI模组、机器人计算平台)的实践经验者优先。 3. 具备3年以上AI推理优化相关工作经验,深刻理解并行计算和CUDA编程,熟悉TensorRT和TensorRT-LLM的模型部署和优化;熟练掌握C/C++,熟悉Python,具备优化计算编程能力。 4. 熟悉边缘AI芯片上模型部署使用者优先;理解GPU/GPU/NPU的计算架构原理,包括计算流水线、内存层次结构、带宽与延迟的权衡。 5. 熟悉Linux系统,精通系统性能分析工具的使用和分析,如nsight-sys/nsight-compute/xperf/eBPF等;能从算子级、图级、系统级多层次定位性能瓶颈。 6. 良好的口头和书面表达能力,包括英文读写能力,良好的沟通能力和团队合作意识;具备良好的文档输出能力,能撰写结构清晰、数据翔实的性能分析报告和优化建议书。 符合以下条件为加分项: 1. 有端侧大模型推理优化经验(量化、KV Cache优化、Speculative Decoding、FlashAttention适配等)。 2. 有CUDA/OpenCL/类CUDA编程模型的算子开发或优化经验。 3. 有Transformer架构的深度理解和推理优化经验(Attention机制优化、KV Cache管理、Prefill/Decode分离等)。 4. 有开源社区贡献经验(如vLLM、llama.cpp、TVM等项目)。

官网刷新:2026-08-28 · 最后确认在招:2026-09-03 22:45:02 · 来源平台:alibaba