字节跳动 社会招聘
大模型推理存储系统专家-Seed
杭州 ·经验不限·学历不限
杭州
薪资面议
前往 字节跳动 官网投递
职位描述
团队介绍:字节跳动Seed团队成立于2023年,致力于寻找通用智能的新方法,追求智能上限,为科技和社会发展作出贡献。
Seed团队在AI领域拥有长期愿景与决心,团队研究方向涵盖MLLM、GenMedia、AI for Science、机器人等,在中国、新加坡、美国等地设有实验室和岗位。目前,团队已推出业界领先的通用大模型以及前沿的多模态能力,支持豆包、即梦、TRAE等超过50个应用场景,并通过火山引擎开放给企业客户。第三方数据显示,豆包App用户量在中国市场排名第一,豆包大模型日均Token调用量行业领先。
1、负责机器学习系统存储相关组件的设计和开发,服务于大模型推理的各业务场景(LLM/S2S/VLM/多模态等),包括模型分发加载、KV Cache存储和优化,数据IO性能优化,提高推理TTFT、TBT等核心性能指标;
2、负责设计和实现面向大模型推理的多层级存储系统,综合利用显存、本地内存、分布式内存/磁盘、远端大容量存储系统(HDFS/对象存储)等多种介质进行数据的存储和迁移管理,实现「近计算缓存+远端大容量存储」的一体化分级系统;
3、负责优化大模型KV Cache命中率,从推理框架,流量调度,多级缓存等多个系统纬度入手定制化优化策略;优化数据的读取性能,充分利用近计算侧的NVLink、RDMA高速网络、GPU Direct技术实现数据的高效传输;优化数据副本的存放策略,实现负载流量和存储数据的合理化分布;
4、负责设计和实现高效、易用的数据访问接口,实现和推理框架、引擎的无缝对接,管理KV Cache的生命周期;
5、负责Kubernetes场景下多级存储系统的接入、管理、运维、监控及多机房、多地域、多云场景的系统搭建和容灾,确保稳定性并优化跨集群的数据摆放。
【任职要求】
1、熟练掌握Linux环境下的C++/Go/Python/Shell等1至2种以上语言;
2、熟悉Kubernetes架构和生态,熟悉PV/CSI等云原生容器存储技术,有丰富的机器学习系统实践和开发经验;
3、掌握分布式系统原理,参与过分布式系统的设计、开发和维护;
4、有优秀的逻辑分析能力,能够对业务逻辑进行合理的抽象和拆分;
5、有强烈的工作责任心,较好的学习能力、沟通能力和自驱力,能够快速的响应和行动;
6、有良好的工作文档习惯,及时按要求撰写更新工作流程及技术文档。
加分项:
1、熟悉至少一种主流的机器学习框架/推理引擎(例如vLLM/SGLang/PyTorch);
2、有大模型推理相关的技术落地经验,比如:KV Cache相关优化的实现;
3、熟悉分布式缓存系统(例如Alluxio/JuiceFS/GooseFS/JindoFS)等;
4、熟悉NVLink、RDMA、NCCL、GPU Direct等技术;
5、在计算机系统存储顶会(包括但不限于OSDI/SOSP/FAST)上有文章发表经验。
官网发布:2024-12-20 · 最后确认在招:2026-09-02 19:19:00 · 来源平台:feishu