JudgeGPTとは?パキスタン司法1,559人の判事が使ったAI補助ツールが示す「訓練付きAI」の生産性
ETHチューリッヒらがパキスタンの判事1,559人・118法廷で行った大規模実験で、GPT-4ベースのAI「JudgeGPT」と6回の集中研修を組み合わせた判事は、1地区あたり年約1,848件(6.3%増)多く事件を処理した。AIアクセスだけでは効果は乏しく、投資1ドルあたり少なくとも10ドル、推計で38.50ドルのリターンが得られたとされる。
ETHチューリッヒらがパキスタンの判事1,559人・118法廷で行った大規模実験で、GPT-4ベースのAI「JudgeGPT」と6回の集中研修を組み合わせた判事は、1地区あたり年約1,848件(6.3%増)多く事件を処理した。AIアクセスだけでは効果は乏しく、投資1ドルあたり少なくとも10ドル、推計で38.50ドルのリターンが得られたとされる。
Epoch AIの能力指数(ECI)によると、2024年2月にClaude 3 OpenusがGPT-4を陥落させて以降、首位は17回入れ替わり、モデルあたりの在位期間中央値はわずか約7週間となりました。GPT-4が約1年間トップを維持した「独走時代」は終わり、AIモデルの優位はきわめて短命になっています。
OpenAI、Anthropic、Google Geminiの次世代モデルが開発上の壁に直面しているとThe Information、Reuters、Bloombergが報道。業界の主流は「モデルスケーリング」から、o1やDeepSeek R1に代表される「推論スケーリング(test-time compute scaling)」へと急速にシフトしています。