跳到正文
千机 API
原文
OpenAI News·· 2022-10-19

研究奖励模型过度优化与参数规模的关系

Scaling laws for reward model overoptimization

AI 导读

OpenAI 于 2022 年 10 月 19 日介绍一项关于人类反馈强化学习中奖励模型过度优化的研究,使用固定的「黄金标准」奖励模型模拟人类偏好标签,测量以代理奖励模型进行强化学习或 best-of-n 采样时的表现变化。研究发现,两种优化方法呈现不同的函数形式,且关系中的系数随奖励模型参数量平滑变化;该结论来自合成设置。

来源:OpenAI News · openai.com