GPTProto

We Scored 100% on AI Benchmarks Without Solving a Single Problem April 06, 2026

Berkeley RDI:Blog(AI 安全与评测)·Sep 28, 2026, 2:02 PM·Research Papers

UC Berkeley 团队构建全自动 AI Agent 审计 13 个广泛使用的基准,发现 45 个作弊方案,全部基准被评为 critical 风险,共归纳 16 种攻击类型。