LLMは長文の技術解説がなぜ苦手なのか?AI研究者が教科書執筆で測った「省力化は10〜20%」の現在地
post-training教科書『Reinforcement Learning from Human Feedback』を書き上げたInterconnectsの著者が、LLMは長文ノンフィクション執筆でここ数年ほぼ停滞しており、本の執筆で節約できた労力は10〜20%にすぎないと報告しました。同じ期間にコーディングと数学は「まあまあ」から超人級へ進んだにもかかわらず、です。
post-training教科書『Reinforcement Learning from Human Feedback』を書き上げたInterconnectsの著者が、LLMは長文ノンフィクション執筆でここ数年ほぼ停滞しており、本の執筆で節約できた労力は10〜20%にすぎないと報告しました。同じ期間にコーディングと数学は「まあまあ」から超人級へ進んだにもかかわらず、です。
OpenAIは全ChatGPTユーザーを対象にテキストチャットの回数制限を撤廃し、新モデルGPT-5.6 Luna/Solを投入します。無料版とGoの既定モデルはGPT-5.5からGPT-5.6 Lunaに置き換わり、社内評価では事実誤りがGPT-5.5-Instant比でLunaは62%、Solは68%少なかったと説明されています。
OpenAIがChatGPTのGPT-5.6 Solを更新し、冗長な説明や過剰な書式を削ったうえで、有料ユーザー向けに思考量を5段階で選べるスライダーを追加しました。同時にFree/Goの標準モデルは小型のGPT-5.6 Lunaへ切り替わり、社内評価では「事実誤りを含む回答」がGPT-5.5 Instant比でLunaが約62%、Solが68%減ったとしています。
OpenAIが研究者向けプログラム「ChatGPT for Academic Researchers」を開始します。選定した学術機関の科学者・数学者・エンジニア10万人に自社AIモデルを無償提供し、最新モデルGPT-5.6 Sol Proへのアクセスと直接サポートを付ける──2027年までの2億5000万ドル超のコミットメントの一部です。
OpenAIは80万件超の仕事関連ChatGPTメッセージを分析し、職種別クエリの43.5%が「別の専門職の業務」に踏み込んでいたと報告しました。同社はこれを職域が交差する「タスク・クロスオーバー」と呼び、職務の境界が肩書きより先に変わり始めた兆候だと位置づけています。
AnthropicはAIチャットボット「Claude」の設定内に、利用状況を振り返り使いすぎを抑える新ダッシュボード「Reflect」を公開しました。休憩リマインダーと曜日別の「クワイエットアワー」で使用時間を管理でき、過去1・3・6・12カ月の利用サマリーを生成します。
AnthropicはClaudeの新機能「Reflect」をベータ提供開始しました。会話内容の要約や最も活発な曜日・時間帯、休憩リマインダーを表示し、無料・Pro・Maxの全プランで使える、あえて「利用時間を最大化しない」設計のダッシュボードです。
中国の2.6万人を追跡した研究で、生徒のAI利用率は約80%まで急増し、宿題の点数は18%上がった一方、閉本試験は20%、高考・中考は最大24%下落しました。ダメージが完全に顕在化するまで約2年かかる点が、企業のAI活用にも重い示唆を投げかけます。