AIエージェントの「信頼」はどう測るか?Vijilが説く実行時トラストと受託者責任
Vijil CEOのVin Sharma氏は、AIエージェントの信頼性は静的ベンチマークで測る「能力」ではなく、稼働後に変化し続ける「実行時(ランタイム)」の問題だと主張します。信頼を能力ではなくリスク(信頼性・セキュリティ・安全性)で定義し、消費者信用スコアのように継続測定する枠組みを提示しました。
Vijil CEOのVin Sharma氏は、AIエージェントの信頼性は静的ベンチマークで測る「能力」ではなく、稼働後に変化し続ける「実行時(ランタイム)」の問題だと主張します。信頼を能力ではなくリスク(信頼性・セキュリティ・安全性)で定義し、消費者信用スコアのように継続測定する枠組みを提示しました。
東京発のSakana AIが、自社のオーケストレーターFuguにNvidiaのオープンモデルNemotronを統合します。複数のオープンモデルを協調させて単一のフロンティアモデルに匹敵させるという発想で、特定プロバイダーへの依存を避ける「集合知」アプローチが軸です。
AnthropicがフラッグシップのClaude Fable 5を「プランナー」に限定し、実行は小型のSonnet 5に任せる二つの構成を公式に推奨。SWE-bench Proでは単体比92%の性能を63%のコストで実現しました。
2026年6月26日、競合ベンダー2社のAIレビューエージェントが同一プルリクエスト上で「悪意あるパッケージか否か」を巡り議論を続け、340コメントと41,255ドルの推論コストを積み上げました。財務部門がAPIキーを停止して鎮火しましたが、片方のベンダーはこの異常を「敵対的マルチエージェント・セキュリティ推論が前年比430%増」と謳うプレスリリースに転換し、株価は6%高で寄り付いています。
東京拠点のSakana AIが、複数のLLMを動的に呼び分けるオーケストレーター「Fugu」と上位版「Fugu Ultra」を公開しました。OpenAI互換APIで提供され、SWE Bench ProでFugu Ultraが73.7とOpus 4.8の69.2を上回るなど、AnthropicのFable 5・Mythosに匹敵する性能を主張しています。
Sakana AIが、複数の専門エージェントを動的に呼び分けるマルチエージェント基盤「Fugu」を発表しました。OpenAI互換の単一APIで、LiveCodeBench 93.2、GPQA-D 95.5を記録し、米輸出規制で公開停止となったClaude Fable 5やMythosに迫るスコアを叩き出しています。
Stanfordの研究チームが、中央オーケストレータを置かずにAIエージェント同士を直接連携させる新フレームワーク「DeLM(decentralized language model)」を発表。SWE-bench Verifiedで最強ベースラインを10.5%上回り、タスクあたりコストを約50%削減したと報告しています。