OpenAI News·2023-05-31 15:00· 2023-05-31OpenAI 报告以过程监督提升数学推理表现Improving mathematical reasoning with process supervisionAI 导读OpenAI 称,他们训练的模型在数学问题求解上达到新的最先进水平,方法是奖励每个正确推理步骤,而非只奖励正确的最终答案。该方法相较结果监督提升了表现,并被描述为可直接训练模型生成经人类认可的思维链。来源:OpenAI News · openai.com#论文/研究#推理#安全/对齐