字节跳动 社会招聘
AI加速软件资深研发工程师-芯片研发
深圳 ·经验不限·学历不限
深圳
薪资面议
前往 字节跳动 官网投递
职位描述
1、负责大模型在自研AI芯片上的性能评估与软硬件协同优化,主导方案设计、计算、通信全链路适配和调优;
2、对接算法,负责字节跳动大模型例如豆包、Seedance等在自研硬件不同分布式方案设计性能评估、roofline建模和集群成本分析等,协助业务落地的软硬件协同设计;
3、负责高性能计算算子与集合通信算子的设计、实现与优化,主导大模型分布式训练/推理场景下计算与通信的融合及重叠优化,追求极致的端到端吞吐与性价比;
4、负责模型量化、稀疏、蒸馏等部署方案的探索与落地,构建分布式推理系统并对推理框架做极致调优;
5、牵引关键技术难题攻关,制定技术路线,指导并培养团队成员,推动跨团队(算法、框架、驱动、硬件、芯片验证)协同与自研软件栈的架构演进;主动探索针对硬件,创新的部署方案和软件栈方案设计。
【任职要求】
1、计算机、电子工程相关专业,硕士学位及以上优先,4年以上AI编译器、算子或高性能通信相关研发经验;
2、深入理解AI加速硬件体系结构与并行计算,精通多层级存储、片上NOC与片间互联原理,能从体系结构视角驱动软硬件协同设计;
3、精通C、C++与Python,具备扎实的算法功底与大型软件系统的架构设计、性能优化能力;
4、深入掌握主流深度学习框架的底层计算与运行时机制,对常见算子的底层实现有深刻理解;
5、具备技术领导力与较强自驱力,能独立牵引复杂技术攻关,沟通协作与问题分析解决能力优秀。
以下为加分项
1、深入理解LLM与多模态模型(如Qwen、DeepSeek等),有大模型分布式训练、推理框架的研发与调优经验,有大模型训练千卡以上集群训练落地经验;
2、熟悉NCCL、DeepEP等集合通信库与RDMA原理,有自研集合通信库或芯片互联的研发与优化经验;
3、熟悉GPU或主流AI DSA体系结构与CUDA等异构编程模型,有算子优化、图编译优化或硬件评测的实战经验;
4、有AI加速硬件量化工具的开发经验,熟悉模型量化、稀疏、剪枝、蒸馏等压缩技术的落地;
5、熟悉AI服务器与集群架构,对多层级卡间互联Topo有实践经验,有大规模分布式部署落地经历。
官网发布:2026-06-05 · 最后确认在招:2026-09-03 19:35:21 · 来源平台:feishu