#ARC-AGI-3 の記事一覧(5)

AI
2026-09-04 ・ The Decoder

ARC-AGI-3とは?GPT-6 Astraが62.7%で記録更新、シヨレのAGI予測が2030年より前倒しになった理由

OpenAIのGPT-6 Astraが、ルールが説明されないゲーム世界で試行錯誤する新ベンチマーク「ARC-AGI-3」で62.7%を記録し、GPT-5.6 Sol(7.78%)とClaude Opus 5(30.16%)を大きく引き離しました。ARC-AGI-3の設計者フランソワ・シヨレ氏は、想定の「約2倍の速さ」で進んだとして、2030年としていたAGI到来予測を前倒しすると述べています。

AI
2026-09-03 ・ Engadget

GPT-6 Astraとは?ARC-AGI-3で98.6%、PC操作を任せる「エージェント」の実力と価格を整理

OpenAIがGPT-5.6(Sol/Terra/Luna)から2か月足らずで新モデル群「GPT-6 Astra」を投入しました。未知の問題解決を測るARC-AGI-3で98.6%、脆弱性の悪用能力を測るExploitBenchでは満点を記録し、API価格は入力100万トークン10ドル/出力50ドルと高価格帯に置かれています。

AI
2026-07-30 ・ The Decoder

ARC-AGI-3のスコア論争とは?GPT-5.6 Solが38.3%と7.8%に分かれた「ハーネス」問題を解説

OpenAIは自社のResponses APIで「Retained Reasoning」と「Compaction」の2設定を使い、GPT-5.6 SolがARC-AGI-3で38.3%を記録しClaude Opus 5の30.2%を上回ったと主張しました。同じモデルがARC Prize公式の実行環境では7.8%にとどまっており、ARC Prize共同創業者のFrançois Chollet氏は「設定とコストを明示するなら汎用APIの設定は容認する」と応じています。

AI
2026-07-27 ・ The Decoder

expenditure horizonとは?METRが示す「AIと人間、どちらが安く成果を出すか」の測り方

研究機関METRは、同じ改善を得るのにAIと人間のどちらが安く済むかを比較する新指標「expenditure horizon(支出ホライズン)」を提案しました。NanoGPTスピードランで6つのAIモデルを検証したところ、各モデルの支出ホライズンは0〜3,300ドルにとどまり、人間の総投入額の推定25万ドルに遠く及びませんでした。

← タグ一覧へ