何が変わったか

GPT 5.4はCodex向けに投入されたエージェント特化のアップデートです。前世代のGPT 5.2 Codexではgit操作などで途中停止が頻発し、レビュアーがrage quits(作業放棄)するほどのdeath by a thousand cuts(細かな不具合の積み重ね)があったとされます。GPT 5.4ではこの硬い角が消え、Fastモード+高〜超高エフォートで「ランダムに投げた多様なタスクを最後までこなせる初のOpenAIエージェント」と評価されています。

単一スコアでは測れないエージェント評価

従来のベンチマークは正答率一つに集約されがちですが、エージェントの実力は使い勝手・速度・コストの総合で決まります。OpenAIのリリースブログでは、世代ごとにピーク性能到達までのトークン消費が圧縮されており、推論効率の改善は明確です。Cursorの公開プロットも傾向を支持しますが、全エフォートや料金体系を網羅していない点には注意が必要です。

ClaudeとGPT 5.4の「性格」の違い

Claudeはキャラクターを持ち、ユーザーの意図をモデル化する「賢いモデル」と評されます。対するGPT 5.4は几帳面・冷たく機械的で、指示に正確に従うタイプ。レビュアーは意見が分かれる作業はClaude、明確なToDoを淡々と処理する作業はGPT 5.4に振り分けています。前者は新規ユーザーに、後者は分散タスクを束ねる「マスター・エージェント・コーディネーター」に向くという整理です。

残る課題と将来像

両モデルとも、1メッセージに複数ToDoを詰め込むと一部を落とす「軽い忘却」が残り、モデル作業中の追加投入は単純用途以外でリスクが高いとされます。CodexアプリはSlackのような複数エージェント間通信基盤へ進化する余地があり、GPT 5.4 ProのCodex直接統合(\ultrathink相当)が実現すればOpenAIの大きな差別化要因になり得ます。それでもレビュアーが朝、端末に打ち込むコマンドは今もcodexではなくclaudeであると認めている点が示唆的です。

💼 事業会社視点:これは自社にどう効くか

経営者目線で見ると、GPT 5.4 Codexは「AIエージェントを社内開発に組み込めるかどうか」の境界線を一段押し下げました。月額200ドルのChatGPTプランで大容量のFastモードと高いレート上限を提供する設計は、レート制限に当たるたびに作業が止まる月額100ドル帯のClaudeとは運用思想が異なります。

受託開発・SaaS事業では、要件が固まったタスクをGPT 5.4に並列で消化させ、仕様判断や設計議論はClaudeに任せる「役割分担運用」が現実解になります。とりわけ社内に複数の小タスクを束ねる中堅エンジニアがいるなら、その職務を「マスター・エージェント・コーディネーター」として明示的に再定義することで、人員を増やさず開発スループットを引き上げられます。経営判断としては、両プランを併用しつつ「どちらの月額がどの案件で早く回収されるか」を実測する試算運用を、今四半期内に着手すべきです。

関連リンク