Shieldstralとは?Mistralの3Bセーフティ分類器が「YES/NOの質問」で審査基準を切り替える仕組み
Mistralが30億パラメータのオープンウェイト安全性分類器「Shieldstral」をApache 2.0で公開しました。固定カテゴリではなく運用者が自然文で書いたYES/NO形式の質問で判定するのが特徴で、テキスト系ベンチマークのF1は84.9%と、約7倍規模のGPT-OSS-Safeguard-20Bと並びます。
Mistralが30億パラメータのオープンウェイト安全性分類器「Shieldstral」をApache 2.0で公開しました。固定カテゴリではなく運用者が自然文で書いたYES/NO形式の質問で判定するのが特徴で、テキスト系ベンチマークのF1は84.9%と、約7倍規模のGPT-OSS-Safeguard-20Bと並びます。
上海人工知能研究所が発表した「Self-Harness」は、LLMエージェントが自らの実行ログを分析し、システムプロンプトやツール運用ルールを自動で書き換える枠組みです。Terminal-Bench-2.0での評価では、MiniMax M2.5やGLM-5など3モデルで33〜60%の性能改善を確認しました。
AI研究者Simon Willison氏が2026年6月1日、スポンサー限定の月次ニュースレター5月号を配信。「AIは高価になり、Anthropicが絶好調の月だった」「モデルリリースはやや期待外れ」という総括と、自身が立ち上げた『Datasette Agent』の進捗を報告しました。