Claude Opus 5 在 ARC-AGI-3 上得分 30.2%,是 GPT-5.6 Sol 的近四倍——但基准与实际体验出现割裂
Anthropic 的 Claude Opus 5 在 ARC-AGI-3 基准上取得 30.2%,是 GPT-5.6 Sol (Max) 此前 7.8% 纪录的近四倍。在 Artificial Analysis 智能指数上以 61 分登顶,领先 Fable 5(60 分)和 GPT-5.6 Sol(59 分),平均智能任务成本 $2.03。Epoch AI 数据显示 Opus 5 的 SWE-ECI 与 Fable 5 持平,均为 161。
但 X 用户 @oran_ge 指出,Opus 5 在多项通用基准上全面超越 Fable 5,实际使用体验却远不及后者。Anthropic 在 5 系列中先训练 Mythos 再蒸馏出 Sonnet 和 Opus,Sonnet 5 表现不佳,Opus 5 评价两极。