直招.cv

← 返回职位列表

淘天集团 · 校园招聘

基于行为奖励与快慢脑协同的实时AI导购研究-阿里星/T-Star

杭州 ·经验不限·学历不限

北京·杭州

职位描述

淘天集团AI助手算法团队承担了淘天集团新一代AI原生购物助手的开发工作,通过统一的All in One大模型解决淘宝在不同场景的用户需求。团队在大模型强化学习、Agentic训练、原生多模态训练以及Agent框架设计有着行业领先的认知和实际落地效果。 在这里,你将 ● 全链路模型训练 ○ 深度参与购物场景统一大模型的完整训练周期:预训练退火 → SFT → RLVR → RLHF ○ 你碰到的不是一个冻结的API,而是一个你可以从底层塑造的模型 ● Agent框架设计——让大模型真正""能办事"" ○ 设计大模型原生的Agent架构,通过Skill编排、Sub-agent协作等机制,将淘系搜索、推荐、交易、客服等全域能力注入AI助手 ○ 让模型不只是""能聊"",而是""能买、能比、能帮你做决定"" ● 奖励信号发现——在真实场景中定义""什么是好"" ○ 基于淘天数亿用户的真实交互行为,挖掘和设计最能提升用户体验的奖励信号 ○ 用RL的方式让模型在电商场景下持续逼近SOTA体验 ● 无人区探索——做业界还没有答案的事 ○ 异步实时Agent:用户不等你,你怎么让Agent在真实时间约束下又快又好? ○ 原生Any-to-Any多模态:文字、图片、视频、商品卡片……如何让模型原生理解和生成一切? ○ 这些方向没有教科书,我们需要你带着自己的判断力走进去 为什么值得来 你会加入这样一个团队: ● “师兄机制”:为你配置经验丰富的师兄,亲自带你熟悉环境,在进行实习期间进行全方位的指导。 ● 灵活开放的技术氛围:根据你的实际研究内容,结合你感兴趣的方向,量身定制匹配的研究方向。 ● 浓厚的技术氛围:定期记性技术分享,保持对前沿技术的敏感度。 ● 充足的算力资源:学校的卡不够用?在这里不存在的,会有足够的资源支持实验迭代。 收获在学校无法获得的宝贵经验: ● 场景稀缺性:数亿级日活用户 × 极其丰富的电商意图 × 可闭环的商业验证 ● 技术纵深:从模型训练到Agent系统到产品体验,你可以一竿子插到底,而不是只做流水线上的一环 ● 前沿密度:团队在RLVR、Agentic Training、多模态等前沿研究方向持续投入 ● 影响力:你训练的模型、设计的Agent,会直接服务于淘宝用户 我们期待你 ● 在大模型预训练/SFT/RLHF/强化学习中有扎实的实战经验。对Agent/Tool-use/Multi-agent系统有深入理解。 ● 有科研成果或在顶会发表过自己的论文,或在Github有自己的维护的小项目。 ● 有自己的想法想要落地、通过实际场景来证明自己的科研价值。 职位描述: 课题1:Action-to-Rewards(行为即奖励):利用淘宝海量用户真实行为构建可无限扩展的奖励信号,解决传统奖励模型无法规模化难题。通过将行为数据融入强化学习链路,驱动模型从“做对”进化至“做好”,开辟全新的Scaling维度。 课题2:Duet快-慢脑协同架构:构建统一音频前端与快慢双脑协同机制,实现感知、即时应答与深度推理的并行处理。通过“边说边想”消除对话延迟与阻塞,打造低延迟、主动介入的实时多模态智能交互体验。" 【任职要求】 1. 计算机科学/人工智能/机器学习等相关领域的硕士或博士,具备扎实的编程基础(Python/C++),熟悉常用算法与数据结构。 2. 深入理解强化学习(RLHF/RLAIF)理论或大模型推理加速机制,在NLP、多模态交互、搜推广系统中至少一个领域有深厚积累。 3. 熟练掌握PyTorch/TensorFlow等深度学习框架,有大规模分布式训练、模型微调或高性能推理引擎开发经验者优先。 4. 对AI Agent前沿技术充满好奇心,重点关注大模型Scaling Law、实时多模态交互、端云协同及强化学习在推荐/导购场景的应用。 5. 在顶级会议(如NeurIPS, ICML, ACL, CVPR等)发表过相关论文,或有复现SOTA模型及开源项目贡献者优先。 6. 具备极强的工程落地与问题拆解能力,能从海量用户行为数据中挖掘价值,并通过数据分析优化模型奖励机制或降低交互延迟。 7. 良好的跨团队协作能力,能与后端工程师、产品经理高效配合,将“行为即奖励”或“快慢脑”技术方案转化为真实的业务增长指标。 8. 对电商导购场景有敏锐洞察,愿意深入探索用户意图识别、多轮对话管理及商业转化逻辑。 【加分项】 1. 针对课题1:有基于真实用户反馈构建Reward Model的经验,或在大规模RLHF/在线强化学习链路中有实际落地成果。 2. 针对课题2:有流式音频处理、低延迟LLM推理优化(如Speculative Decoding)、或多模态端到端模型(Audio-Text)研发经验。 3. 拥有海量时序行为数据处理经验,或在Kaggle/天池等竞赛中针对推荐系统、对话智能体赛道获得优异成绩。"

最后确认在招:2026-09-01 19:06:52 · 来源平台:alibaba