阿里国际 · AI 工程/Infra 社会招聘
天猫淘宝海外-高级LLM推理优化工程师-杭州
杭州 ·1年以上·本科
需1年以上推理优化经验,本科,精通C++/Python,熟悉GPU编程和深度学习推理框架,有分布式系统设计能力。
职位描述
团队介绍
天猫淘宝海外搜推导购技术团队承担了平台多端的搜索及推荐两大导购体系的技术平台和相关业务研发。团队目前承担了数十亿用户搜索和推荐请求,解决国际跨境及本地市场搜索、推荐以及模型计算方面的挑战。我们正在将大模型能力深度融入搜索推荐链路,探索生成式检索、LLM意图理解、AI导购等新一代搜推产品形态。随着LLM在线推理成为搜推系统的核心基础设施,如何在保证效果的前提下实现低延迟、高吞吐、低成本的在线推理服务,是团队当前最关键的技术课题之一。国际化是集团的重点方向之一,业务的飞速发展需要有经验有想法有能力的工程师加入我们,一起打造面向全球的智能搜推推理引擎。
职位描述
1.负责搜推场景下LLM/生成式模型的在线推理引擎研发与持续优化,包括推理加速、显存优化、批处理调度等,保障线上服务的延迟和吞吐指标;
2.参与生成式搜推架构的设计与落地,涵盖生成式检索、LLM Query理解、AI导购等方向,推动大模型能力在搜推链路的工程化部署;
3.负责GPU推理集群的资源规划与成本优化,通过模型量化、KV Cache管理、投机采样、异步化等手段持续降低推理成本;
4.跟踪业界推理引擎前沿技术(vLLM、TensorRT-LLM、SGLang等),完成技术选型和难点攻坚,推动团队技术演进。
任职要求
1.具备扎实的计算机理论基础,对数据结构及算法有较强的功底;
2.精通C++/Python至少一种语言,具备优秀的系统Debug/Profiling能力和性能调优经验;
3.一年以上实战经验,具备以下领域经验之一或多个:搜索引擎、推荐系统、广告系统、模型推理服务;
4.熟悉GPU编程(CUDA)及深度学习推理框架(PyTorch、TensorRT、vLLM、ONNX Runtime等),有实际的推理优化项目经验;
5.熟悉分布式系统设计,了解高并发、高可用在线服务的架构模式;
6.学习能力强,追求编写优雅的代码,对新技术有热情,能从技术趋势和思路上影响团队;
7.(加分项)有LLM推理引擎开发经验(vLLM/SGLang/TensorRT-LLM);有模型量化、投机采样等推理加速实践经验;在开源社区有活跃贡献。
官网刷新:2026-09-09 · 最后确认在招:2026-09-10 20:24:07 · 来源平台:alibaba