阿里国际 · 校园招聘
Agentic Post-training Infra-阿里星/Bravo Star
杭州 ·经验不限·学历不限
杭州
薪资面议
前往 阿里国际 官网投递
职位描述
1. 负责大模型训练及 Post-Training 基础设施建设,支持 RLHF、Agentic RL、工具调用和推理能力训练等任务。
2. 持续迭代完善 Agent Rollout、Sandbox、推理代理、轨迹记录、奖励处理和训练框架集成。
3. 建立训练与推理的正确性及一致性保障体系,实现 Token、Logprob、采样、Checkpoint 和 Adapter 加载等关键行为的验证与追踪。
4. 建设性能分析、监控和调试工具,沉淀标准脚本、配置模板、诊断手册及可复用方案,提升资源效率、系统稳定性和实验迭代速度。
【任职要求】
1. 具备扎实的工程能力,熟练使用 Python,最好掌握 C++、CUDA、Rust、Go 等系统或高性能计算语言中的至少一种。
2. 熟悉 PyTorch 生态及大模型训练流程,理解前向与反向传播、优化器、混合精度、激活重计算和 Checkpoint 等机制。
3. 具备分布式系统或大规模训练实践经验,理解 GPU 集群、NCCL、并行策略、通信开销、显存优化及故障恢复。
4. 实际使用或开发过 Megatron、DeepSpeed、FSDP、SGLang、vLLM、TensorRT-LLM、Ray 等训练或推理系统中的至少一类。
5. 理解 SFT、DPO、PPO、GRPO、RLHF、RLAIF 或 Agentic RL 等 Post-Training 范式,具备复杂系统问题定位能力、较强的责任意识和跨团队协作能力。
最后确认在招:2026-09-01 19:06:52 · 来源平台:alibaba