科大讯飞 社会招聘
词元星火-算子开发-北京(J13593)
北京 ·经验不限·学历不限
北京市
薪资面议
前往 科大讯飞 官网投递
职位描述
1、 算子开发与优化
- 围绕GPU、NPU等主流硬件架构,依托CUDA、Ascend C、TileLang等技术,完成大模型核心计算和通信算子研发和优化。
- 立足芯片存储层级、计算单元、指令集特性,开展针对性性能调优,确保算子性能精准匹配硬件能力,为业务提供高效算力支持。
通信算子研发与调优
- 针对跨卡、跨机等多样化通信场景,设计、开发并优化通信算子,保障分布式训练、推理的高效通信链路。
- 持续对NCCL、HCCL等主流集合通信库进行性能打磨与故障排查,保障通信环节稳定可靠,适配大规模算力协同需求。
2、协同与优化
- 紧跟模型结构与算法迭代趋势,协同框架、算法团队,设计适配硬件特性的模型方案,挖掘硬件与算法的协同潜力。
- 围绕真实训练、推理负载开展性能分析,为模型落地提供性能优化支撑,保障业务高效运行。
【任职要求】
1、基础门槛
- 研究生及以上学历。
- 编程功底扎实,精通C++/C语言,具备良好的代码规范意识与数据结构、算法基础,熟悉操作系统核心原理。
- 熟练使用Git等代码管理工具,养成规范的开发习惯;熟练掌握linux下开发能力。
- 热爱性能优化,兼具技术视野与代码品质追求,具备良好的中文沟通能力、团队协作意识、责任心与自驱力,学习能力突出。
2、技术必备
- 熟练掌握CUDA、Ascend C等编程原理,能够基于编程语言开展算子开发工作。
- 掌握编译优化技术,清晰理解GPU/NPU架构的并行执行、内存层级与计算单元特性。
- 熟练掌握TileLang、Triton等编译原理及使用,编写和优化核心算子。
- 对硬件底层架构有清晰认知,能够结合硬件特性开展针对性优化。
加分项
1、算子专长:有CUDA或Ascend C算子开发经验,熟悉LLM相关算子等算子库,深入理解AI加速卡硬架构和特性。
2、竞赛背景:在高性能计算相关赛事取得较好成绩。
3、行业经验:拥有3年以上算子库优化经验,执着于挖掘硬件性能、提升软件效率。
官网发布:2026-08-18 · 最后确认在招:2026-09-03 19:18:18 · 来源平台:beisen