GPTProto

Automated Researchers Can Mitigate Well-Characterized Alignment Failures

Anthropic:Alignment Science Blog(网页)·Aug 28, 2026, 12:00 AM·Anthropic / Claude

Anthropic Fellows Program 的研究构建了自动化对齐研究员(AAR),基于 Claude Opus 4.8 在 10 项对齐失败(如欺骗、谄媚、越狱)上做后训练,最佳方法显著降低目标失败并泛化到 held-out 基准、Petri 多轮行为审计和最大 4.7 倍的模型。