字节跳动 社会招聘
算法工程专家(模型推理平台-国际支付)-Global Payment
深圳 ·经验不限·学历不限
深圳
薪资面议
前往 字节跳动 官网投递
职位描述
1、负责国际支付场景专属统一模型推理平台的架构设计、核心模块开发与性能优化,支撑大模型/小模型、多框架(PyTorch/TensorFlow/ONNX/TensorRT)的统一部署与服务化,保障支付场景的高可用与低延迟;
2、设计并实现适配支付流量特性的推理调度机制,包括负载均衡、弹性扩缩容、多副本管理、灰度发布、流量管控,满足稳定性要求;
3、聚焦支付场景模型推理优化,开展模型转换、量化、剪枝、算子融合、显存/内存优化、多卡/分布式推理优化,平衡推理性能与成本效率;
4、构建支付级模型服务标准化体系:统一API网关、鉴权(符合跨境合规要求)、限流、全链路监控告警、日志追溯、压测与SLA保障体系,支撑风控、合规等业务的高并发调用;
5、支撑国际支付业务各类模型快速上线与技术创新:
1)解决高并发、低延迟、高吞吐场景下的推理性能瓶颈与稳定性问题,保障支付交易链路的实时响应;
2)与算法、支付业务、运维团队协同,制定模型部署规范、镜像构建流程、CI/CD与运维自动化体系,提升模型上线效率与运维可靠性;
3)跟踪业界推理技术(vLLM/TGI/TensorRT-LLM/DeepSpeed/ONNX Runtime等),结合国际支付业务特性落地技术创新,持续迭代平台性能与成本优势。
【任职要求】
1、本科及以上学历,计算机、软件工程、电子信息、自动化等相关专业,1年及以上算法工程、模型部署或推理平台相关工作经验;
2、熟练掌握至少一种后端开发语言(Golang/Python/C++),具备良好的工程架构思维与代码质量意识,能独立完成核心模块开发;
3、熟悉主流深度学习框架(PyTorch/TensorFlow/JAX),深刻理解模型训练与推理全流程,能适配多框架模型的统一部署需求;
4、熟悉至少一种推理加速引擎/工具链(TensorRT、ONNX Runtime、vLLM等),有实际项目应用经验;
5、具备推理平台或模型服务化落地经验,涉及API服务、流式推理、批处理、动态批处理、多模型编排等核心场景;
6、具备较强的性能调优与问题排查能力,能解决GPU利用率提升、显存优化、延迟/吞吐调优、服务稳定性治理等问题,具备良好的系统设计能力、跨团队沟通协作能力,能独立负责复杂模块或平台级项目,推动技术方案落地。
加分项
1、有大模型推理平台(LLM Inference Platform)实际建设经验,或支付、金融等高并发场景模型部署经验者优先;
2、熟悉分布式推理技术(张量并行、流水线并行、P2P通信、NCCL等),有大规模模型分布式部署优化经验;
3、有开源项目贡献(推理、部署、性能优化方向)或技术博客输出,具备技术沉淀与分享能力;
4、熟悉微服务架构、gRPC/HTTP API设计、高可用架构设计,能适配支付场景的高可靠要求;
5、了解机器学习、多目标学习、深度学习、在线学习算法。
官网发布:2026-04-15 · 最后确认在招:2026-09-03 19:35:21 · 来源平台:feishu