#Opus 4.8 の記事一覧(7)

AI
2026-07-18 ・ Wired

コンテキスト・ボミングとは?プロンプトインジェクションでAIハッキングエージェントを止める防御術を解説

セキュリティ企業Tracebitが、AWS上の「おとりの機密情報」にプロンプトインジェクションを仕込み、攻撃側のAIエージェントを拒否させて止める「コンテキスト・ボミング(context bombing)」を公表しました。5モデル・152回の検証で、管理者権限奪取の成功率は57%から5%へ、最強モデルOpus 4.8は93%成功から全敗へと激減しました。

AI
2026-07-16 ・ TechCrunch

Kimi K3とは?中国Moonshot AIの最大級オープンモデルがOpus 4.8に並ぶ意味

中国AIラボMoonshot AIの新モデル「Kimi K3」が、Anthropicの最上位モデルOpus 4.8に匹敵か凌駕する性能になる見込みだとFinancial Timesが報じました。パラメータ数2兆〜3兆で中国最大級のオープンウェイトモデルとなり、「数日以内」に公開されるとされています。

AI
2026-07-13 ・ Simon Willison

コーディングエージェントの効果は数字で見えるのか?Simon Willison氏がDatasetteのコミット頻度グラフで示したもの

Simon Willison氏が2026年7月13日、自身のブログで、オープンソースプロジェクト「Datasette」のGitHubコード変更頻度グラフを公開しました。期間末に大きなスパイクがあり、氏はこれがOpus 4.8、GPT-5.5、Fable 5、GPT-5.6 Solの登場時期と一致すると述べています。生産性への影響を語る言葉ではなく、リポジトリの履歴という「消せない記録」で示した点が新しいところです。

AI
2026-07-09 ・ The Decoder

Muse Spark 1.1とは?Metaの新API価格が示す「フロンティアAIの値崩れ」を読み解く

Meta Superintelligence Labsがマルチモーダル推論モデル「Muse Spark 1.1」を公開し、同時に初の開発者向けAPI「Meta Model API」のパブリックプレビューを開始しました。出力100万トークンあたり4.25ドルという価格は、25〜50ドル帯のOpus 4.8・GPT-5.5・Fable 5を一桁下回り、前日にローンチしたGrok 4.5の「最安」も1日で塗り替えています。

AI
2026-07-04 ・ Simon Willison

Claude Opus 4.8・Sonnet 5でサードパーティのedit toolが動かない問題とは?Claude Code最適化の副作用を解説

Anthropicの最新モデルOpus 4.8とSonnet 5が、コーディング環境Piの編集ツールに存在しないキーを混ぜて呼び出し、旧世代モデルより成功率が下がる現象をArmin氏が報告しました。SOTAモデルが特定のツールスキーマで「後退」する珍しい事例です。

AI
2026-07-03 ・ The Decoder

AIエージェントの実力は「予算」で化ける──英AISIが暴いた、ベンチマーク神話の崩壊

英国AIセキュリティ研究所(AISI)は、GPT-5やOpus 4.8などフロンティアモデルを7つのベンチマークで検証し、固定のトークン予算では真の能力が体系的に過小評価されると結論づけました。サイバータスクの約8%は1000万トークン超でしか解けず、5000万トークンでは時間軸のダブリング速度が従来推定の約60%加速することも判明しています。

← タグ一覧へ