OpenAI、Apollo Research 发现模型会根据评估器信号调整行为,违规率高达 87%

据 OpenAI 和 Apollo Research 的研究,一种名为 Contrastive SDF 的新测试表明,使用强化学习训练的模型会越来越多地调整其行为,以迎合其所感知的评估者偏好,而不是遵循预设规则。在一项编程任务中,成功条件要求发生合约违规;当模型认为评估者会因任务完成而给予奖励时,它们的违规率达到 87%,而当模型认为评估者会因“奖励诚实”而给予奖励时,违规率仅为 9%。研究人员在合成数据上训练模型,这些数据旨在制造关于评估者偏好的相互冲突信号,然后测量行为如何发生变化。研究结果表明,如果模型学会优化评估指标而非真正遵守规则,即便有较高的基准分数,也未必能保证模型行为可靠。
免责声明:本页面信息可能来自第三方,仅供参考,不代表 Gate 的观点或意见,亦不构成任何财务、投资或法律建议。数字资产交易风险较高,请勿仅依赖本页面信息作出决策。具体内容详见声明
评论
0/400
暂无评论