直招.cv

← 返回职位列表

腾讯 社会招聘

企业微信-大模型算法工程师-Agent后训练(北京/广州)

成都 ·两年以上工作经验·学历不限

成都

职位描述

1.参与 Agent 大模型的后训练工作,在 SFT、奖励模型、强化学习等方向进行方案设计、数据构建与训练落地,持续提升真实场景下的规划、推理、工具调用与指令遵循能力; 2.针对 Agent 任务执行中的能力短板(如多步规划、抗干扰与幻觉抑制等),设计定向的训练优化方案,并构建数据合成、清洗与质量评估管线;面向意图识别等特定场景模型进行训练与优化,结合业务需求完成定制化的能力构建; 3.持续跟踪并引入后训练领域的最新技术,推动技术在实际业务的创新落地。 【任职要求】 1.计算机、人工智能、机器学习、数学等相关专业,硕士及以上学历,具备扎实的计算机基础与算法基础,2 年以上相关领域工作经验; 2.深入理解大语言模型与 Agent 技术体系,熟练掌握主流后训练技术(SFT、RLHF、DPO、PPO/GRPO 等),具备完整的模型训练与优化项目经验,能独立定位并解决效果问题; 3.熟练掌握 Python,熟练使用主流深度学习与训练框架(如 PyTorch、DeepSpeed/Megatron、veRL/OpenRLHF 等),具备扎实的算法实现与大规模分布式训练调优能力; 4.熟悉数据构建与评估体系,有强化学习环境搭建、奖励模型训练或高质量指令/偏好数据合成经验者优先; 5.在 ICLR、NeurIPS、ICML、ACL、EMNLP 等顶尖会议发表过论文,或为优秀机器学习开源项目贡献者优先。

最后确认在招:2026-09-03 23:15:16 · 来源平台:tencent