宁德时代 社会招聘
强化学习与贝叶斯优化算法工程师(LLM 方向)
蕉城区 ·经验不限·学历不限
蕉城区
薪资面议
前往 宁德时代 官网投递
职位描述
岗位职责:
1. 负责强化学习算法的研发与落地,包括但不限于策略优化、离线强化学习、多智能体协作等方向,支撑决策与控制类业务场景。
2. 基于贝叶斯优化框架,开展超参数调优、黑盒函数优化、实验设计与自动调参系统的设计与实现。
3. 结合大语言模型能力,探索 RLHF、RLAIF、在线对齐等方向的算法创新,参与语言模型后训练中的强化学习环节研发。
4. 跟踪前沿学术进展,复现并改进经典与 SOTA 算法,完成算法原型验证、性能评测与工程化落地。
5. 与产品、工程团队协作,将算法能力封装为标准化组件,支撑业务迭代。
岗位要求:
学历专业:硕士及以上学历,计算机、数学、统计、自动化等相关专业
知识技能:
1. 扎实的强化学习理论基础,熟悉值函数方法(DQN 系列)、策略梯度方法(PPO、A2C、SAC 等)、离线 RL 等主流算法,具备至少一个方向的完整实现经验。
2. 精通贝叶斯优化原理,深入理解高斯过程、采集函数(EI、PI、UCB 等)、多保真优化等核心技术,有实际调优系统开发经验优先。
3. 具备大语言模型相关实践经验,了解 Transformer 架构、预训练与对齐基本流程,有 RLHF/DPO 相关项目经验者优先。
4. 熟练使用 Python 及 PyTorch/TensorFlow 等深度学习框架,具备良好的代码规范与工程实现能力。
5. 具备优秀的数学功底与逻辑分析能力,能独立阅读顶会论文并完成算法复现。
工作经验:1-2 年算法研发相关工作经验
语言:中文、英文4级
其他:
• 在 ICML、NeurIPS、ICLR 等顶会发表过强化学习、贝叶斯优化或大模型相关论文。
• 有开源强化学习框架(如 Stable Baselines、RLlib)或贝叶斯优化库(如 BoTorch、Optuna)的二次开发或贡献经验。
• 具备推荐系统、自动驾驶、机器人、AIGC 等任一领域的强化学习落地经验。
官网发布:2026-07-07 · 最后确认在招:2026-09-03 21:20:17 · 来源平台:moka