MiniMax 社会招聘
AI 可观测系统研发工程师
北京 ·经验不限·学历不限
北京·上海
薪资面议
前往 MiniMax 官网投递
职位描述
一、一句话定位
面向大模型训练、大模型推理与 Agent 运行时建设新一代可观测平台,连接硬件、网络、存储、模型框架、推理引擎和 Agent 执行轨迹,让复杂 AI 系统的异常看得见、定得准、恢复快、价值可衡量。
二、为什么这个岗位重要
大模型系统的问题往往横跨 GPU、网络、存储、容器、框架、推理引擎、模型行为和外部工具。我们希望建设统一的数据与诊断能力,回答三类核心问题:
训练为什么中断、变慢或损失有效算力;
推理为什么首 Token 变慢、吞吐下降、成本升高或质量退化;
Agent 为什么任务失败、循环调用、链路异常或 Token 消耗失控。
三、你将负责什么
1. 建设统一的 AI 可观测平台
建设指标、日志、Trace、事件的采集、处理、存储、查询与可视化能力;
建立作业、请求、Agent 任务与节点、GPU、Pod、进程、Rank、模型、版本之间的关联;
治理高基数、高频事件和大规模时序数据,探索异常检测、告警降噪与根因分析能力。
2. 支撑大模型训练可观测
建设覆盖基础设施、通信与运行时、训练框架、模型与数据的分层观测体系;
关联 job → pod/process → rank → node → GPU UUID,诊断训练 Hang、慢 Rank、硬件、网络、存储和 Checkpoint 异常;
量化训练进度、有效算力及重试、等待损耗,推动问题处置和效果验证闭环。
3. 支撑大模型推理可观测
建设覆盖网关、路由、批处理、推理引擎、模型实例和 GPU 的请求级观测;
观测 TTFT、TPOT、排队、吞吐、KV Cache、Token 等指标,定位 Prefill、Decode、调度与资源争用问题;
关联模型版本、参数、上下文、输出质量和成本,支持性能与质量回归分析。
4. 支撑 Agent 运行时可观测
建设 Agent 任务到模型、工具、子 Agent、记忆和知识库访问的完整执行轨迹;
支持顺序、并行、循环和分支结构,量化任务成功率、工具成功率、重试及 Token 成本;
结合规则、模型评估、人工反馈和业务结果,诊断依赖故障、工作流异常及质量回归。
【任职要求】
四、我们期望你具备
基本要求
1. 计算机或相关专业本科及以上学历,或具备同等工程能力;
2. 具备 3 年以上可观测、基础架构、分布式系统、云原生平台或后端平台研发经验;资深候选人需有大型生产系统的设计与落地经历;
3. 熟练掌握 Go、Java、C++、Rust、Python 中至少一门语言,具备扎实的并发编程和系统设计能力;
4. 熟悉 Metrics、Logs、Traces、Events 中至少两类数据的完整工程链路;
5. 熟悉 Linux、网络、容器、Kubernetes 和分布式系统,能够开展跨层问题分析;
6. 具备良好的抽象、落地和协作能力,愿意深入理解 AI 工作负载。
加分项
1. 有 Prometheus/Mimir、VictoriaMetrics、Thanos、OpenTelemetry、Jaeger/Tempo、Loki/ELK、ClickHouse、Grafana 等系统经验;
2. 有 GPU、RDMA、NCCL、分布式训练、Checkpoint 或训练稳定性经验;
3. 有 vLLM、TensorRT-LLM、SGLang、TGI、模型网关或容量管理经验;
4. 有 Agent Runtime、工作流引擎、LLM Trace 或评测平台经验;
5. 有 eBPF、AIOps、开源贡献或从 0 到 1 建设平台的经验。
官网发布:2024-07-17 · 最后确认在招:2026-09-03 19:28:38 · 来源平台:feishu