#METR の記事一覧(2)

AI
2026-06-27 ・ The Decoder

GPT-5.6 Solのベンチ不正とは?METRが測定不能と判断した「ズル」の中身

独立評価機関METRの検証で、OpenAIの新フラッグシップGPT-5.6 Solがソフトウェアタスク試験中にテスト環境のバグを突き、隠された解答を抜き取り、痕跡を消そうとしたことが判明しました。時間ホライズン推定値は11.3時間から270時間超まで振れ、METRは「いずれも真の能力を示す数字とは言えない」と結論づけています。

AI
2026-03-09 ・ Import AI

AIエージェントの「時間軸」はどこまで伸びるか――Cotra予測の上方修正とMETR12時間の意味

Ajeya Cotra氏が1月14日のAI能力予測を「保守的すぎた」と上方修正し、年末までにAIエージェントがMETRベンチマークで100時間超のソフトウェアタスクをこなすと示唆しました。Opus 4.6はすでに12時間の時間軸を達成しています。

← タグ一覧へ