直招.cv

← 返回职位列表

腾讯 社会招聘

微信WeLM-大模型研发基础设施工程师-研发效能方向(深圳、上海、广州)

北京 ·两年以上工作经验·学历不限

北京

职位描述

1.面向研发迭代过程中的典型负载优化调度、路由、部署策略,优化系统吞吐和稳定性; 2.建设并运营面向模型研发的沙箱 CPU 集群与工具执行环境,负责环境隔离、任务编排、资源调度与运行治理,保障评估和实验任务稳定执行; 3.建设并运营 GPU 集群、Kubernetes 和数据系统,提升资源利用率、任务吞吐和端到端研发效率; 4.负责研发生产系统的 SLA、可观测性与故障恢复,定位性能瓶颈和异常波动,保障关键任务与评估结果稳定、可复现、可诊断; 5.与算法、评估和推理基础设施团队共同定义真实研发负载,持续演进面向前沿模型迭代的系统能力。 【任职要求】 1.具备扎实的分布式系统或 ML Systems 经验,能够设计和维护持续运行的大规模生产系统; 2.熟悉任务调度、工作流系统、容器或沙箱、Kubernetes、存储、消息系统以及可观测性中的一个或多个领域; 3.对大模型训练、推理、评测、合成数据或强化学习 Rollout 有实际经验或强烈兴趣; 4.能够同时关注系统可靠性与研究正确性,理解“系统成功运行”和“产生可信模型结论”之间的差异; 5.乐于深入模型研发现场,理解研究工作流,并将快速变化的实验需求抽象为可靠、可复用的系统能力; 6.希望自己的系统工作直接影响前沿模型的数据、评估和训练迭代,而不仅仅是优化一般软件开发流程。

最后确认在招:2026-09-03 23:15:16 · 来源平台:tencent