「Bitter Lesson」が突きつけた現実
The Gradientの論考は、過去10年の機械学習が「数学的に美しい設計」ではなく「計算資源とデータ量のスケール」によって進歩してきた事実を出発点としています。数理的に練り上げられたアーキテクチャは限定的な改善しかもたらさず、一方で愚直なスケーリングは既存理論では予測不能な能力を引き出してきました。これがいわゆる「Bitter Lesson(苦い教訓)」です。
それでも数学が消えない理由
著者らは数学不要論には立ちません。役割が「事前に性能を保証する道具」から「経験的に観測された現象を後から説明する道具」へ移っただけだ、というのが主旨です。これは物理学における数学の位置づけに近い。設計の細部を縛るのではなく、タスク構造やデータの対称性とアーキテクチャを噛み合わせる「高次の設計判断」に効くという整理です。翻訳等変性を持つCNNが40年以上前から存在することは、この発想自体は新しくないことを示します。
高次元という「象」をどう触るか
70億パラメータ・50層のモデルを評価ベンチマークの精度だけで語るのは不十分で、分布外汎化、キャリブレーション、敵対的頑健性といった二次的指標が重要になります。隠れ層の活性化は高次元かつ無構造で、重みは数百万〜数十億の直交方向に広がる。これを解析することは、ピン1本の感触から象全体を描こうとするようなものだと著者らは喩えます。
ここで前面に出てくるのが、確率論や線形代数のような「応用寄り」だけでなく、トポロジー、代数、幾何といった純粋数学です。たとえばn次元の回転はSO(n)という多様体を成し、n=512なら512²次元空間の中の多様体を扱うことになります。
内在次元という鍵
注目株が「内在次元(intrinsic dimension)」です。多くのデータは高次元空間に埋め込まれた低次元多様体上に近似的に分布する、という多様体仮説に基づく概念で、ベンチマークデータの内在次元は汎化のしやすさと相関することが報告されています。医療画像のような領域間の性能差、生成モデルのスケーリング則、敵対的サンプルやAI生成物の検出、ハルシネーション検出にまで応用が広がっています。ReLU網が入力空間を多数の多角形領域に分割する様子をSplineCamで可視化する研究も、同じ問題意識の延長線にあります。
💼 事業会社視点:これは自社にどう効くか
事業会社の役員にとって本論考の含意は明快です。「数理的に正しいから勝つ」モデルはもう来ないということ。SaaSや受託開発で「独自アルゴリズム」を売りにしてきたベンダーの差別化は、スケールに飲み込まれつつあります。日本企業がいま投資すべきは、独自アーキテクチャの研究ではなく、(1)自社データの内在次元が低い領域——医療画像、製造現場の異常検知、専門文書処理など、汎用モデルが落ちる領域の特定、(2)分布外汎化・キャリブレーション・敵対的頑健性といった「二次指標」を契約・SLAに組み込む発注スキルの内製化、(3)ハルシネーション検知や生成物の真贋判定に内在次元ベースの手法を持つ研究者・ベンダーへの早期アクセス確保、です。とくにEC・金融・保険など「平均精度では語れないリスク」を抱える事業では、精度数値ひとつで意思決定するPoCを今すぐ卒業し、評価設計そのものを経営アジェンダに上げるべきです。数学は消えませんが、出番は「設計前」から「検収時と運用監視」に移っています。