淘天集团 · 校园招聘
Agent在线强化学习-阿里星/T-Star
杭州 ·经验不限·学历不限
杭州
薪资面议
前往 淘天集团 官网投递
职位描述
课题背景:淘天业务平台承载亿级用户的交易、营销、导购等核心链路,面临全球最复杂的在线决策挑战:双11峰值数十万QPS、分钟级故障处置窗口、大促规则年年迭代带来的分布漂移、研发变更与运维保障的目标冲突。现有基于规则引擎和离线模型的智能化手段已触及天花板——规则无法覆盖组合爆炸的决策空间,离线模型部署即过时,孤立的运维/研发/业务知识无法形成合力。
本课题旨在构建全球首个本体知识增强 × 在线安全强化学习 × 模型能力自进化三位一体的智能体系统,在淘天真实大促场景中实现从""人工经验驱动""到""数据-知识-决策闭环自主进化""的范式跃迁。
——从人工经验到自主进化:面向淘天业务平台全链路智能决策与运维系统的在线强化学习范式
核心问题:
● 构建一个能在非平稳、高风险、知识密集的在线环境中持续安全学习并自主进化决策能力的智能体
研究内容包括:
1. 基于本体知识驱动的在线安全强化学习框架:让领域知识成为RL的""骨架""而非""旁注"",在生产环境中安全地在线学习,解决生产环境RL的样本效率低、安全无保障、奖励设计难的问题
2. LLM-RL协同的全链路智能决策与运维系统:基于LLM、在线策略强化学习、本体常识约束,打造生产级决策与运维系统
3. 面向业务演进的模型能力自进化机制:构建多层进化循环机制,包括跨大促元学习、单次大促内的持续适应,以及实时决策与反馈的闭环,交付跨大促的元学习快速适应算法,实现策略-本体双向进化的闭环构建。
岗位职责:
1. 理论研究:负责本体约束的在线强化学习框架建模,并进行理论证明、自进化的收敛性分析
2. 算法开发:设计并实现本体增强的安全在线RL算法族、LLM-RL协同决策算法、跨大促Meta-RL与经验固化算法
3. 场景落地:在双11/618等真实大促中验证系统效果;与SRE/研发团队协作确保决策可信赖;量化评估业务价值
【任职要求】
硬性要求:
● 计算机科学、人工智能、运筹学、自动化等相关方向博士
● 扎实的强化学习理论功底,精通主流RL算法(Policy Gradient/PPO/GRPO及其变体),有实际实现与调优经验
● 熟练Python + PyTorch,具备生产级代码交付能力
● 在ICML/NeurIPS/ICLR/AAAI/ACL/WWW等顶会有一作或共同一作论文发表,或有等价的突出研究成果
优先条件:
● 包括安全强化学习、在线学习、元学习、多智能体,了解本体工程、神经符号推理,有LLM与决策系统结合的研究经验,了解大规模分布式系统、AIOps、SRE相关背景知识,有扎实的数学功底,包括优化理论、概率论、随机过程功底扎实,能独立完成定理证明
素质要求:
● 第一性原理思维: 能从问题本质出发设计方案,而非套用现有方法
● 理论与实践并重: 既能推公式证定理,也能写出高质量生产代码
● 大促体感: 对""安全红线""有敬畏心,理解生产环境不允许trial-and-error
● 跨域学习能力: 愿意深入理解业务/运维/研发领域知识,而非将其视为黑箱
● 长期主义: 认同""自进化""的愿景,愿意用3年时间构建有壁垒的系统
我们提供:
1. 丰富的数据:淘天历次大促全链路运维/研发/业务数据,全球独一无二
2. 顶级的场景:双11/618,全球最大规模在线决策试验场
3. 充足的算力:GPU/CPU集群支持大规模RL训练与模拟
4. 成熟的基础设施:成熟的监控/追踪/日志/变更管控平台作为感知与执行底座
5. 密切的协作:与平台SRE、研发、业务团队的直接协作通道
6. 导师:配备顶级业务+技术双导师,定期进行学术交流
加入我们一起构建面向下一个十年的智能决策范式!
最后确认在招:2026-09-01 19:06:52 · 来源平台:alibaba