ARC-AGI-3とは?Claude Opus 5が30.2%で新記録、その中身を検証
AnthropicのClaude Opus 5が、未知タスクの推論を測るARC-AGI-3で30.2%を記録し、従来トップだったOpenAIのGPT-5.6 Sol(Max)の7.8%を大きく更新しました。ただし独立系ベンチマークWitnessでは伸びが小さく、ベンチマーク特化学習の可能性も指摘されています。
AnthropicのClaude Opus 5が、未知タスクの推論を測るARC-AGI-3で30.2%を記録し、従来トップだったOpenAIのGPT-5.6 Sol(Max)の7.8%を大きく更新しました。ただし独立系ベンチマークWitnessでは伸びが小さく、ベンチマーク特化学習の可能性も指摘されています。