何が変わるのか
Anthropicはブログ投稿で、AIコーディングツールClaude CodeのAuto Modeを8月14日からデフォルト有効にすると発表しました。対象はPro・Max・Teamプランで、Enterprise顧客のみ引き続きオプトイン方式です。
Auto Modeでは、AIが一手ごとに人間の承認を待たずに作業を進めます。代わりに分類器(クラシファイア)が各アクションを判定し、危険または不可逆と見なされた場合にだけ確認を求めます。この分類器が消費するトークンは課金対象外です。
「人間の承認」は安全装置として機能していなかった
最も重い数字は、承認プロセスそのものへの評価です。1,053人の有料テスターを対象とした管理下の調査で、危険なコマンドを捕捉できた割合は人間のレビュアーが13.6%、Auto Modeが89%でした。内部のレッドチーム演習を含めても、Auto Modeは手動承認と同等以上に安全に振る舞ったとされています。
これは「AIに任せると危ない」という直感と逆の結果です。一手ごとの承認ダイアログは、繰り返されるうちに読まれなくなる。承認ボタンは押されているが、内容は検査されていない——現場の実感としても心当たりのある構図でしょう。安全性の担保を「人間がその場で見る」ことに置いていた設計は、疲労という一点で崩れていたことになります。
プロンプトインジェクション耐性という別の論点
AnthropicはAuto Modeを、プロンプトインジェクション(外部から混入したコードやテキストがエージェントを本来の指示から逸脱させる攻撃)への防御層としても位置づけています。
独立監査を行ったTrajectory Labsは、72の攻撃シナリオを各10回、計720回試行しました。Auto Mode下のClaude現行モデル(Fable 5、Opus 5、Sonnet 5)に対して成功した攻撃は0件。一方、OpenAIのGPT-5.6 SolをCodexのAuto-Reviewモードで動かした場合は5.83%が通過したと報告されています。
実運用での事例も挙げられています。Anthropic社内では、Auto ModeがClaudeによる機密データの公開ページへのアップロードを阻止しました。また、ある長時間セッションでは、進行中のGPU学習ジョブを妨害しかねないプロセスを約2,000個停止させたといいます。
Anthropic自身が引いている線
それでもAnthropicは慎重な姿勢を崩していません。分類器はリスクを減らすが排除はしないとし、「本番インフラへの重大な変更については、Claudeのアクションをご自身で確認することを引き続き推奨します」と明記しています。
見落とせないのは、この判断がAnthropicにとって商業的にも都合が良いことです。作業が長く続けばトークン消費量は増え、売上も増えます。それが主目的だったとは限らないにせよ、安全性の改善と収益構造が同じ方向を向いている点は、読み手として頭の片隅に置いておくべきでしょう。
残る逆説
Claude Codeは現在、AIコーディングツールとして圧倒的なシェアを持ちます。そのデフォルトが変わるということは、開発者の役割が「書く人」から「AIの出力をレビューする人」へさらに一段移動するということです。
ここに逆説が生まれます。開発者が介入する頻度が下がるほど、その数少ない介入の重みは増す。しかし同時に、Auto Modeが大部分を組み上げたプロジェクトについて、深い理解を積み上げることは難しくなっていきます。介入の質が上がるべき局面で、介入の土台になる理解は痩せていく——この矛盾に、各社が自前の運用ルールで答えを出す必要があります。
💼 事業会社視点:これは自社にどう効くか
受託開発・SIerへの影響が最も大きい——PRが約25%増えるということは、レビュー工数が同じだけ増えるということです。人月単価で見積もる契約形態では、生産性向上分がそのまま売上減になりかねません。Auto Mode前提の成果物ベース契約へ、価格体系の見直しを今期中に検討すべきです。
日本企業の情シス・セキュリティ部門は、8月14日を「勝手に設定が変わる日」として認識しておく必要があります。Enterpriseプラン以外を使っている開発チームは、当日から挙動が変わります。逆に言えば、危険コマンド検知89%という数字は、これまで「AIコーディングツールは承認制でないと許可できない」としてきた社内規程の前提を崩します。承認制を維持するコストと、13.6%しか捕捉できていない実効性を並べて、規程を書き直す好機です。
SaaS・自社プロダクト企業は、本番インフラ変更だけを人間レビュー必須に切り出す設計へ移行するのが現実的です。Anthropic自身が線を引いているのはそこだけであり、全工程を一律に人間が見る運用はもはや投資対効果が悪い。CTOは「どこを人間が見るか」を工程単位で明文化してください。
共通のリスクは、レビュアーの理解の空洞化です。エンジニアがコードベースを理解する機会をどう意図的に設計するか——ここは経営判断の領域です。