何が起きたか
OpenAIは新モデルファミリー「GPT-5.6」を発表し、難問特化のSol、業務量重視のTerra、低コスト日常用途のLunaという3階層に再編しました。従来の「nano/mini」呼称から宇宙モチーフへ変更し、世代番号(5.6)と能力階層(Sol/Terra/Luna)を分離する命名体系に移行しています。
初期提供は約20組織のみ。これは2026年6月2日にトランプ大統領が発した、連邦機関による新規AIモデルのベンチマーク・能力評価を求める大統領令(30日間、7月2日まで)に対応した措置で、一般公開は「数週間以内」とされています。
なぜ重要か——「政府調整」が常態化する
最大の論点はモデル性能そのものより、米政府が事前評価に関与する展開プロセスが既定路線になりつつある点です。背景にはAnthropicの「Claude Fable 5」「Claude Mythos 5」でジェイルブレイクが発見され、米政府の輸出管理命令を受けてAnthropic側が公開停止に追い込まれた経緯があります。OpenAIは同じ轍を踏まないよう、リリース計画を事前共有する形で先回りしました。
GPT-5.6システムカードは3モデルすべてをサイバーおよび生物・化学能力で「High」リスクに分類。Sol/Terraには活性化ベースの監視層を追加し、約70万A100e GPU時間を自動レッドチーミングに投入したと公表しています。
ベンチマークと運用面の実利
- TerminalBench 2.1:Sol(ultra思考モード)が91.91%、Claude Mythos 5の88%を上回る
- ExploitBench:Mythos Preview同等の精度を約3分の1の出力トークンで達成
- API側の改良:プロンプトキャッシュが最低30分保証、キャッシュ読み出しは90%割引(書き込みは1.25倍)
- 推論基盤:7月からCerebras上でSolを最大750トークン/秒で提供
「ultraモード」では複数サブエージェントが並列分担し複雑案件を加速。Lunaは前世代旗艦をわずかに上回る程度でGPT-5.5並みの性能に留まりますが、入力1ドル/出力6ドル(100万トークンあたり)と価格差は明確です。
💼 事業会社視点:これは自社にどう効くか
日本の事業会社が即時に検討すべきこと
SaaS・受託開発:Sol/Terra/Lunaの3階層分離は、これまで「GPT-5.5一択」でコスト最適化を諦めていた現場に明確な選択肢を与えます。顧客サポートやドキュメント解析などTerra相当の業務は出力15ドル/100万トークンで足り、ルーティン処理はLunaで十分。プロダクト内のLLM呼び出しを用途別に振り分ける「モデルルーティング」設計が早急に必要です。GLM-5.2やDeepSeek系が総額数ドル台にある現状を見れば、Lunaも「最安」ではなく中価格帯であることを直視すべきです。
EC・大手事業会社:注目すべきはプロンプトキャッシュの30分保証と90%割引。商品説明生成やFAQ応答など同一プロンプトを反復するワークロードでは、実効コストが半減以下に落ちる可能性があります。バッチ設計と契約見直しの好機です。
経営層への含意:米政府が「フロンティアモデルは事前審査を経て公開」する流れを定着させたことは、日本企業のAI調達計画にとってサプライリスクそのものです。Claude Mythos 5のように突然アクセス停止される事例が再発し得る前提で、主要LLMを2系統以上確保し、社内ナレッジは特定モデルAPI形式に過度依存しない抽象化層を持たせる体制が必要です。