GPT-4oで成績は上がるが学習は進むのか?ボッコーニ大1,053人のランダム化実験が示した「評価の欠陥」
イタリア・ボッコーニ大学の1年生1,053人を対象とした2025年11月のランダム化実験で、GPT-4oを使った学生の課題成績は5点満点で1点近く上昇しました。一方、因果推論のレッスンを受けた群は成績が上がらず、むしろわずかに低下しながら、アイデアの多様性だけが増えるという逆説的な結果が出ています。
イタリア・ボッコーニ大学の1年生1,053人を対象とした2025年11月のランダム化実験で、GPT-4oを使った学生の課題成績は5点満点で1点近く上昇しました。一方、因果推論のレッスンを受けた群は成績が上がらず、むしろわずかに低下しながら、アイデアの多様性だけが増えるという逆説的な結果が出ています。
ChatGPTの有料プランを解約しても止まるのは課金だけで、アカウントもチャット履歴もモデル学習設定も残ります。OpenAIは次回請求日の24時間前までの手続きを推奨し、解約の効力は次回請求日の翌日から。Web・Apple・Googleの請求は別管理で、二重契約も起こり得ます。
Penn State大学とDuke大学らの研究チームは、LLMマルチエージェントシステムの失敗原因を自動で特定する新タスクと、127システム分の失敗ログを集めたベンチマーク「Who&When」を公開しました。最良の手法でも責任エージェント特定の精度は53.5%、決定的な誤り箇所の特定は14.2%にとどまります。
プリンストン大学の研究チームがAIエージェントの「論文再現能力」を測るベンチマーク「CORE-Bench」を公開しました。最高性能の構成でも最難関レベルの正答率は22%にとどまり、現状のAIエージェントの実力と限界を可視化しています。
AI Snake Oilは、モデルを大きくし続けるだけではAGIに到達しない可能性が高いと指摘しました。高品質な学習データは枯渇に近づき、OpenAI・Anthropic・Googleの最強モデルは「最大モデル」ではなくなっています。