直招.cv

← 返回职位列表

淘天集团 · 校园招聘

算法工程师-Agent在线强化学习(T-Star Lab)

杭州 ·经验不限·学历不限

杭州

职位描述

T-Star计划是阿里巴巴淘天集团顶尖人才招聘和培养项目,继承“阿里星〞的使命与愿景,面向全球招募顶尖技术人才。首次开设实习生专项招聘,面向2026年11月及以后毕业的校优秀技术同学。期待你们在淘天,通过极具挑战的前沿课题与亿级规模的海量数据、应用场景,探索和实践最前沿的Al技术,在有价值的业务场景落地技术成果。 1. 理论研究:负责本体约束的在线强化学习框架建模,并进行理论证明、自进化的收敛性分析 2. 算法开发:设计并实现本体增强的安全在线RL算法族、LLM-RL协同决策算法、跨大促Meta-RL与经验固化算法 3. 场景落地:在双11/618等真实大促中验证系统效果;与SRE/研发团队协作确保决策可信赖;量化评估业务价值 【任职要求】 ● 计算机科学、人工智能、运筹学、自动化等相关方向博士 ● 扎实的强化学习理论功底,精通主流RL算法(Policy Gradient/PPO/GRPO及其变体),有实际实现与调优经验 ● 熟练Python + PyTorch,具备生产级代码交付能力 ● 在ICML/NeurIPS/ICLR/AAAI/ACL/WWW等顶会有一作或共同一作论文发表,或有等价的突出研究成果 ● 第一性原理思维: 能从问题本质出发设计方案,而非套用现有方法 ● 理论与实践并重: 既能推公式证定理,也能写出高质量生产代码 ● 大促体感: 对""安全红线""有敬畏心,理解生产环境不允许trial-and-error ● 跨域学习能力: 愿意深入理解业务/运维/研发领域知识,而非将其视为黑箱 ● 长期主义: 认同""自进化""的愿景,愿意用3年时间构建有壁垒的系统 加分项: ● 包括安全强化学习、在线学习、元学习、多智能体,了解本体工程、神经符号推理,有LLM与决策系统结合的研究经验,了解大规模分布式系统、AIOps、SRE相关背景知识,有扎实的数学功底,包括优化理论、概率论、随机过程功底扎实,能独立完成定理证明

最后确认在招:2026-09-01 19:06:52 · 来源平台:alibaba