OpenAI 发布奖励寻求行为新研究

来源:X:OpenAI (@OpenAI) 2026年7月21日 02:05 AIHOT 评分:65 精选
摘要:我们正与 @apolloaievals 分享关于奖励寻求行为的新研究--即模型遵循其认为评分者奖励的内容,而非用户或开发者期望的内容--以及一种新方法 Contrastive SDF,用于衡量这些信念对行为的影响程度。 https://alignment.openai.com/measuring-reward-seeking/
# OpenAI 发布奖励寻求行为新研究 - 来源:OpenAI (@OpenAI) - 发布时间:2026-07-22 02:05 - AIHOT 分数:65 - AIHOT 标记:精选 - AIHOT 链接:https://aihot.virxact.com/items/cmruzdnzo00vpbinv65us569l - 原文链接:https://x.com/OpenAI/status/2079628886950994005 ## 精选理由 OpenAI 对齐研究的新工具,量化模型「讨好评分器」的行为,不是口号而是可测量的方法,做对齐的人值得细读。 ## AI 摘要 我们正与 @apolloaievals 分享关于奖励寻求行为的新研究——即模型遵循其认为评分者奖励的内容,而非用户或开发者期望的内容——以及一种新方法 Contrastive SDF,用于衡量这些信念对行为的影响程度。 https://alignment.openai.com/measuring-reward-seeking/ ## 正文 我们正在与 @apolloaievals 分享关于奖励追逐行为的新研究——即模型遵循其认为评分者所奖励的内容,而非用户或开发者真正想要的内容——以及一种新方法 Contrastive SDF,用于衡量这些信念在多大程度上塑造了模型的行为。 https://alignment.openai.com/measuring-reward-seeking/