夸克 · 社会招聘
千问事业部-千问大模型Agentic算法专家-北京/杭州
杭州 ·2年以上·本科
北京·杭州
薪资面议
前往 夸克 官网投递
职位描述
全面负责定义、设计并实现下一代 Agentic AI 系统的核心算法与技术范式,将千问从回答问题升级成执行任务,解决智能体在任务规划、工具使用、多步推理、长程自主执行、环境交互等方面的核心挑战,探索并引领模型在自主决策、复杂任务编排、人机协作等前沿方向的技术突破。直接决定数亿千问用户在 AI 助手场景下的任务完成体验, 打造千问在 Agentic AI 时代的领先地位。
1. Agentic 能力定义与技术规划
深入分析用户的真实任务需求与使用场景,结合业务,制定并执行 Agentic 能力的中长期技术演进路线图。密切追踪并研究 agentic AI 领域的最新进展,包括 agent 架构范式(ReAct、多智能体协作等)、agentic RL、工具学习、计算机使用(computer use)、长程自主执行等方向,主导定义“顶级智能体能力”的标准,并将其分解为可落地、可量化的算法迭代目标。
2. 任务规划与多步推理
攻坚并解决复杂任务下的核心技术难题,包括但不限于任务分解与规划、多步推理与反思、错误自我识别与纠正、长程任务的记忆与状态管理、异常处理与恢复等。设计创新的脚手架与训练策略,使模型具备真正可靠、连贯的长程自主执行能力,而不仅是单轮的指令响应。
3. 工具使用与环境交互
主导研发模型与外部工具、API、代码执行环境、搜索引擎、数据库等深度动态融合的先进技术。解决工具调用准确性、参数生成、多工具编排、observation 理解与处理、执行结果验证等核心问题。设计并优化可扩展的工具调用框架与执行环境,显著提升智能体在真实场景下完成复杂任务的成功率与可靠性。
4. Agentic 训练与对齐
主导大模型在 agentic 场景下的 post-training 与对齐工作,包括 agentic SFT、面向工具使用与多步任务的强化学习(RLHF/RLAIF/DPO/GRPO 等)、奖励设计与可验证奖励、长程任务的信用分配、reward hacking 的识别与对抗等,设计高效的样本构建流水线,推动 agentic 能力的持续提升。
5. 评测体系与数据飞轮
建立并完善一套科学、全面的 agentic 能力评测体系,能够精准衡量智能体的任务完成质量(成功率、效率、可靠性、安全性等),覆盖过程评估与结果评估。探索 Agent-as-Judge 等前沿评测方法,以及针对性agentic benchmark建设,设计并驱动高效的数据闭环系统,利用真实用户的任务轨迹与反馈,持续、自动化地优化模型。
【任职要求】
1. 拥有计算机科学、人工智能或相关领域的博士学位者优先,硕士学位亦可。
2. 至少 3 年在自然语言处理(NLP)或大语言模型(LLM)领域的研发经验,对 LLM-based Agent、工具使用、强化学习等有深刻的理解和丰富的实战经验。在学术界或工业界有公认的 agentic 或相关技术成果。
3. 在以下一个或多个领域拥有一流的技术水准和成功经验:agent 架构与规划、工具学习与 function calling、大模型对齐技术(SFT/RLHF/RLAIF/DPO/GRPO 等)在 agentic 场景的深度应用、agentic RL、长 horizon 任务的训练与优化、熟悉主流 RL 训练框架者优先。
4. 具备以下条件者将获得优先考虑:
- 主导或核心参与过业界知名的 AI Agent、code agent、autonomous agent 或相关智能体项目。
- 在顶级学术会议(如 NeurIPS、ICML、ICLR、ACL、EMNLP 等)上发表过多篇高质量的 agent、强化学习或相关方向论文。
- 对工具使用、多智能体系统、computer use、具身智能等前沿方向有深入研究或浓厚兴趣,有将前沿 agentic 技术成功应用于大规模商业产品的经验。
- 对前沿技术充满热情,具备出色的问题分析和解决能力,能够将研究成果有效应用于实际业务场景。
最后确认在招:2026-09-01 19:07:02 · 来源平台:alibaba