直招.cv

← 返回职位列表

小红书 · 校园招聘

【REDstar】大模型 Infra 工程师

北京市,上海市,杭州 ·经验不限·学历不限

北京市,上海市,杭州市

职位描述

团队介绍 我们是小红书大模型基建部(RAI Studio),负责公司级 AI 大模型全链路基础设施建设。我们围绕「算力 - 框架 - 平台」三层体系,提供从大模型训练、压缩、部署、在离线服务到Agent构建发布的标准化能力,以解决大模型生产及应用过程中的效率、成本、稳定性和规模化交付问题。我们构建了 Relax RL 开源训练框架、RedSlim 模型压缩工具、rLLM 推理部署框架、以及大模型训练、部署、MaaS、Agent等平台设施,持续支撑社区、大商业、国际化、审核、企业智能等小红书核心业务的大模型落地。在这里,你会面对千卡级后训练、高并发推理、EPD 分离与 KV Cache 复用、低比特模型量化、国产异构芯片性能优化、万卡级 GPU 调度等真实业务的大规模 AI Infra 挑战。在这里你可以选择在训练、推理或模型压缩方向深耕,也可以参与跨方向系统设计,成长为真正理解大模型全链路的 AI Infra 工程师。团队持续参与开源与行业技术交流,期待有志于构建生产级 Infra 能力并持续提升个人行业影响力的优秀同学加入。 工作职责: 1、训练与推理框架研发: 参与 Relax RL 后训练框架和 rLLM 推理框架的核心研发,支撑 LLM、MLLM、Agent、DiT 等模型的高效训练与高性能在线推理;可根据个人专长重点负责训练、推理或模型压缩方向。 2、RL Pipeline 与分布式训练优化: 支持 SFT、DPO、PPO、GRPO、RLVR 等主流后训练范式,优化 Rollout、Reward Model、Actor、Reference Model 等模块间的资源调度与动态协同,并结合 TP / PP / DP / ZeRO / Sequence Parallel 等并行策略提升端到端训练吞吐。 3、分布式推理与服务架构建设: 建设 KV Router、PD 分离 / EPD 分离、KV Cache 管理、Prefix Cache 复用、Continuous Batching、动态请求调度等核心能力,持续提升 TTFT、TPOT、吞吐、并发能力和 GPU 利用率。 4、模型压缩与加速算法探索: 探索并落地低比特量化、蒸馏、剪枝、投机解码、KV Cache 压缩、CoT 压缩等技术,建设从效果评估到部署的完整闭环,在精度、延迟、吞吐、显存、成本和业务效果之间取得合理平衡。 5、大规模系统稳定性建设: 攻克千卡训练和高并发推理中的显存管理、跨节点通信、弹性容错、任务调度、请求迁移、故障检测、自愈恢复、灰度发布等挑战,提升训练成功率、推理 SLO 和集群资源利用率。 6、异构芯片与多模型适配: 负责训练及推理框架在 Nvidia GPU、国产 NPU / PPU 等硬件上的适配与深度优化,完成模型迁移、算子支持、Profiling、Kernel 调优、并行策略及服务架构优化,推动国产算力规模化使用。 7、大模型生产工具链建设: 打通训练、压缩、推理框架与训练部署及MaaS服务平台,建设可视化、自动调优、评估、故障诊断和部署等生产级能力,降低算法与业务团队的使用门槛。 8、业务协同与技术探索: 与算法和业务团队深度协作,支撑重点业务的算法探索与工程落地,通过算法与系统联合优化持续提升性能、稳定性和成本效率。 【任职要求】 任职资格: 1、具备扎实的代码能力、数据结构和基础算法功底,熟悉 Python / C++ / Rust 中至少一门语言,具备良好的工程实现能力和代码质量意识。 2、在大模型训练、推理或模型压缩至少一个方向具备深入实践,能够阅读和修改框架源码,并有性能优化或生产级工程落地经验。 3、熟悉至少一种主流训练、后训练或推理框架,如 PyTorch、Megatron、DeepSpeed、veRL、OpenRLHF、TRL、vLLM、SGLang、TensorRT-LLM、Nvidia Dynamo、AIBrix 等,并具备使用或二次开发经验。 4、理解分布式训练或推理的核心技术,包括并行策略、显存管理、跨机通信、KV Cache、请求调度、服务稳定性等;无需同时精通全部方向,但能够基于系统原理分析和解决复杂问题。 5、具备性能分析和问题定位能力,能够借助 Nsight Systems / Compute、PyTorch Profiler、日志、监控和实验分析等手段定位计算、通信、显存或系统瓶颈,并推动问题闭环。 6、能围绕吞吐、延迟、并发、稳定性、资源利用率、精度、成本和业务效果等指标进行系统分析,在技术效果与业务收益之间做出合理权衡。 7、具备良好的学习能力、沟通协作能力、自驱力和问题闭环意识,能够与算法、平台及业务团队协同推进技术落地。 加分项: 1、在大模型训练、推理、模型压缩、分布式系统或 MLSys 方向有高水平论文发表或优秀开源项目经历。 2、有千卡级大模型训练、后训练或大规模线上推理实战经验,解决过跨节点通信、显存优化、容错训练、高并发、故障迁移、弹性扩缩容或 SLO 保障等生产问题。 3、参与过 Megatron、DeepSpeed、veRL、OpenRLHF、vLLM、SGLang、TensorRT-LLM、Nvidia Dynamo、AIBrix 等开源项目的核心模块开发或贡献。 4、有 CUDA Kernel、Fused Operator、Attention / GEMM、FlashAttention、PagedAttention 或通信计算重叠等底层优化经验。 5、有量化、蒸馏、剪枝、SmoothQuant、AWQ、GPTQ、KV Cache 压缩或投机解码等技术的工程落地经验。 6、有国产异构芯片(昇腾 Ascend、平头哥 PPU 等)训练或推理适配、Kernel 开发及规模化落地经验,熟悉 CANN / ROCm 等基础软件栈。 7、深入理解 GPU / NPU 硬件架构及性能瓶颈,能够结合 Tensor Core、内存层级、计算单元和通信拓扑进行差异化优化方案设计。

最后确认在招:2026-09-01 19:11:16 · 来源平台:xiaohongshu