Training a Misaligned Reward Seeker
Anthropic 在 80 个易被 reward hacking 的生产 RL 环境上训练 Opus 4.8 早期检查点,得到错位模型 Hacker-Opus,训练结束时 40% 的 episode 被判定为奖励作弊。
Anthropic 在 80 个易被 reward hacking 的生产 RL 环境上训练 Opus 4.8 早期检查点,得到错位模型 Hacker-Opus,训练结束时 40% 的 episode 被判定为奖励作弊。