何が起きたか

OpenAIのVaibhav Srivastav氏が、新モデルGPT-5.6 Solの推論レベルをタスクの複雑さに応じてどう選ぶか、実践的な指針を示しました。

下位から順に、素早く答えの決まったタスクには「Light」「Low」、計画や分析には「Medium」、複数ステップにわたる複雑な作業や慎重な検証(careful verification)には「High」「xhigh」が適するとされます。さらに上位の「Max」は1つの問題により多くの時間をかけさせるモード、「Ultra」は複数のサブエージェントを並列に走らせ、それぞれがタスクの別々の部分を担当する仕組みです。

当然ながら、上位レベルほど処理時間は長くなり、消費トークンも増えます。Srivastav氏の推奨は明快で、まず低いレベルから始め、必要なときだけ引き上げること。前世代GPT-5.5のティアとは対応関係がないため、乗り換える人は「これまで使い慣れたレベルより1段階低いところ」から始めるよう促しています。

なぜ重要か

この設計は、OpenAIが掲げる「ChatGPTをほとんどインターフェースが不要(almost no interface)なほどシンプルにする」という目標と、実務のあいだにあるギャップを浮き彫りにします。理想は「ユーザーが何も選ばなくてよい」状態ですが、現実にはLightからUltraまでを手動で選び分ける負担が残っています。

しかも各レベルの最適解は、自分でベンチマークを走らせなければ判断しづらい。裏を返せば、この「選ばせる」設計自体が、OpenAI側にどのタスクにどのレベルが選ばれるかという利用データを集めさせる仕掛けにもなり得ます。

背景の論点

Solにはさらに上位の「Pro」ティアが存在するとみられますが、正式には未公開で、ゲノミクス分野のベンチマーク論文から先行して漏れていました。トークンとコストが段階的に増える構造は、性能を課金設計に直結させるものでもあります。

💼 事業会社視点:これは自社にどう効くか

「精度を上げるほど時間とトークン、つまりコストが増える」構造が明示された点は、AI活用を進める事業会社にとって単なる技術話ではなく原価設計の問題です。SaaSや受託開発でLLMをAPI組み込みしている企業は、全リクエストを高レベル固定にすると原価が膨らみます。Srivastav氏の「低レベルから始め、必要な時だけ上げる」という助言は、そのままコスト最適化の設計指針になります。定型的な分類・要約はLightやLow、要件定義や設計レビューのような複雑作業だけHigh以上、と処理を仕分ける発想が有効です。とりわけECの商品説明生成やカスタマーサポート自動応答のような大量・低難度タスクを抱える現場では、レベルの取り違えが月次コストを数倍動かしかねません。経営者・事業責任者が今動くべきは、社内のAI利用を「一律の最高性能」から「タスク別のレベル設計」へ棚卸しすること。前世代からの乗り換え時は1段階下げてコストと精度の実測から始めるのが安全です。ベンチマークを自前で回す体制の有無が、そのままAI原価管理の巧拙を分けます。