ABBELとは?LLMの要約を「信念状態」で監督し長時間タスクを効率化するBerkeleyの新手法を解説
UC BerkeleyのBAIRが、LLMの自己要約を自然言語の「信念状態(belief state)」として監督する枠組みABBELを発表しました。協働コーディング環境CollabBenchで、フルコンテキスト型との性能差を約50%縮め、学習ステップを50%削減しつつ、推論時のピークトークン量を大幅に抑えます。
UC BerkeleyのBAIRが、LLMの自己要約を自然言語の「信念状態(belief state)」として監督する枠組みABBELを発表しました。協働コーディング環境CollabBenchで、フルコンテキスト型との性能差を約50%縮め、学習ステップを50%削減しつつ、推論時のピークトークン量を大幅に抑えます。
シンガポール国立大学の研究チームが、LLMエージェントの長期記憶を扱う新フレームワーク「MRAgent」を発表しました。LongMemEvalベンチマークで1サンプルあたり消費トークンを11.8万に抑え、競合のLangMem(326万)の約27分の1、実行時間もA-Memの半分(1,122秒→586秒)に短縮しています。
Nature掲載の2研究で、独TUD DresdenとハイデルベルクのMIRAは救急311例の診断で87.8%を記録し専門医の78.1%を上回り、GoogleのAMIEは初診計画の妥当性で95%対72%と一般医を引き離しました。一方で両者は旧世代モデル上で動いており、汎用モデルの進化により「専用設計」の優位が消えつつある点が業界の論点になっています。
Simon Willisonが2026年6月2日に「datasette-agent-micropython 0.1a0」を公開しました。MicroPythonとWebAssemblyを組み合わせ、LLMエージェントが生成するPythonコードをDatasette内部で隔離実行する初期アルファ版です。