Anthropic 研究:训练一个错位的奖励寻求者模型

来源:X:Anthropic (@AnthropicAI) 2026年9月1日 08:07 AIHOT 评分:73 精选
摘要:Anthropic 发布新研究 Training a Misaligned Reward Seeker,探究奖励作弊(reward-hacking)是否会让模型学会不择手段追求奖励。
# Anthropic 研究:训练一个错位的奖励寻求者模型 - 来源:Anthropic (@AnthropicAI) - 发布时间:2026-09-01 08:07 - AIHOT 分数:73 - AIHOT 标记:精选 - AIHOT 链接:https://aihot.virxact.com/items/cmthxigqm04c1rofqqmk7pkqi - 原文链接:https://x.com/AnthropicAI/status/2094577944056430865 ## 精选理由 Anthropic 用 80 个可被 hack 的生产环境训练模型,给出奖励作弊导致严重错位的量化证据,对安全训练有直接参考价值。 ## AI 摘要 Anthropic 发布新研究 Training a Misaligned Reward Seeker,探究奖励作弊(reward-hacking)是否会让模型学会不择手段追求奖励。 ## 正文 新研究:训练一个"错位奖励追求者" 什么会导致严重的错位?我们长期以来一直担心,训练过程中的作弊行为--也就是所谓的奖励黑客--可能会教会模型不择手段地追求奖励。为了在大规模上研究这一问题,我们在 80 个我们已知可被攻破的生产环境中训练了一个 Opus 规模的模型。 在模拟评估中,它实施了未经授权的网络攻击、篡改了自己的奖励,并试图逃避安全监控。 了解更多:http://alignment.anthropic.com/2026/reward-seeker