ABBELとは?LLMの要約を「信念状態」で監督し長時間タスクを効率化するBerkeleyの新手法を解説
UC BerkeleyのBAIRが、LLMの自己要約を自然言語の「信念状態(belief state)」として監督する枠組みABBELを発表しました。協働コーディング環境CollabBenchで、フルコンテキスト型との性能差を約50%縮め、学習ステップを50%削減しつつ、推論時のピークトークン量を大幅に抑えます。
UC BerkeleyのBAIRが、LLMの自己要約を自然言語の「信念状態(belief state)」として監督する枠組みABBELを発表しました。協働コーディング環境CollabBenchで、フルコンテキスト型との性能差を約50%縮め、学習ステップを50%削減しつつ、推論時のピークトークン量を大幅に抑えます。
AnthropicがコーディングAI「Opus 5」を公開しました。Opus 4.5のような性能の大飛躍ではなく、上位モデルFableに迫る品質を約半分のコストで出す「費用対効果」路線が今回の主眼です。
Anthropicが金曜、コーディングとエージェント業務向けの新モデル「Claude Opus 5」を投入しました。価格は前世代Opus 4.8と同じ入力100万トークンあたり5ドル・出力25ドルに据え置き、最上位Fable 5の約半額でほぼ同等の知能を狙う「日常使いの主力」という位置づけです。
Poolsideが小型オープンウェイトのコーディングモデル「Laguna S 2.1」を公開しました。Terminal-Bench 2.1で思考モード有効時70.2%を記録し、1兆パラメータ超のオープンモデルさえ下回るDeepSWEで40.4%を出すなど、規模ではなく「粘り強さ」で性能を稼ぐ設計が特徴です。
米AIラボPoolsideが7月21日、オープンウェイトのコーディングモデル「Laguna S 2.1」を公開しました。1180億パラメータのMixture-of-Experts(MoE)ながら実行時は80億パラメータのみを使い、Terminal-Bench 2.1で70.2%を記録。中国勢が席巻するオープンウェイト市場に「西側が信頼して自社環境で動かせるモデルを」と対抗する戦略製品です。
OpenAIは7月9日、米商務省の承認を経てGPT-5.6シリーズを一般公開しました。上位モデル「Sol Ultra」はコーディング指標TerminalBench 2.1で91.9%を記録し、Anthropic「Claude Mythos 5」の88.0%、Google「Gemini 3.1 Pro Preview」の70.7%を上回りました。
Epoch AIの新ベンチマーク「MirrorCode」で、Claude Opus 4.7が解答率56%を記録し首位に。1タスクに最大19日間・2600ドルを投じる長時間推論の実力が初めて可視化されました。
Moonshot AIがコーディング特化のオープン重みモデル「Kimi K2.7 Code」を公開しました。入力100万トークンあたり0.95ドル・出力4.00ドルと、GPT-5.5(入力5.00ドル/出力30.00ドル)やClaude Opus 4.8(入力5.00ドル/出力25.00ドル)を大きく下回る価格設定が特徴です。
Anthropicが新モデル「Claude Fable 5」「Mythos 5」を公開しました。Fable 5はFrontierCodeで29.3%とOpus 4.8の13.4%・GPT 5.5の5.7%を大きく上回り、StripeやIMCなどの実務評価でも従来比で桁違いの生産性を示しています。価格は入力10ドル/出力50ドル(100万トークンあたり)とOpus 4.8の倍となり、安全装置として危険プロンプトはOpus 4.8へ自動フォールバックする仕組みも入りました。