小米 实习
大模型后训练与GPU/加速器内核优化实习生
北京 ·经验不限·学历不限
北京
薪资面议
前往 小米 官网投递
职位描述
面向CUDA及多架构加速器(类CUDA)内核开发的垂直场景,基于现有基础模型开展后训练与评测落地,提升模型在内核生成/改写/性能优化上的实用能力,并在真实业务中落地
1. 构建/清洗面向内核的训练数据与指令模板(生成、优化、注释、性能提示等);
2. 基于SFT、DPO/奖励建模、PPO/RLHF/RLAIF等开展后训练与对齐;
3. 搭建自动化评测闭环:编译-单测-正确性-性能基准与指标(可编译率、通过率、吞吐/延迟、寄存器/共享内存、occupancy等);
4. 集成编译/分析/运行工具,将静态/动态性能信号引入训练反馈。
【任职要求】
1. 硕士/博士在读,大模型方向;
2. 至少一种LLM后训练实践(SFT或RLHF/RLAIF/奖励建模/DPO等),重视训练-评测落地能力,有coding方向经验加分;
3. 熟悉PyTorch与数据处理,能搭建训练/评测流水线;了解分布式/混合精度者优先;
4. 具备CUDA/GPU并行基础,能阅读/编写内核并定位性能瓶颈;熟悉nvcc/clang与profilers等工具;
5. 工程能力扎实(Python优先,C/C++加分),自驱与协作良好。
加分项
1. 有CUDA/HIP/SYCL或其他加速器内核优化经验;搭建过编译-运行-打分闭环;
2. 在算子优化/并行计算/系统性能工程方面有积累;有开源、论文或竞赛经历。
官网发布:2026-03-03 · 最后确认在招:2026-09-03 23:17:41 · 来源平台:xiaomi