跳到正文
千机 API
原文
OpenAI News·· 2017-06-13

OpenAI 与 DeepMind 安全团队开发从人类偏好推断目标的算法

Learning from human preferences

AI 导读

OpenAI 称其与 DeepMind 安全团队合作开发了一种算法,可通过人类判断两个候选行为哪个更好,推断人类希望系统实现的目标。该工作旨在减少对人工编写目标函数的依赖;来源指出,复杂目标的简单代理或目标设定偏差可能导致不良甚至危险行为。

来源:OpenAI News · openai.com