#Terminal-Bench の記事一覧(3)

AI
2026-07-23 ・ The Decoder

Laguna S 2.1とは?小型オープンモデルがコーディングで巨大モデルを上回る理由を解説

Poolsideが小型オープンウェイトのコーディングモデル「Laguna S 2.1」を公開しました。Terminal-Bench 2.1で思考モード有効時70.2%を記録し、1兆パラメータ超のオープンモデルさえ下回るDeepSWEで40.4%を出すなど、規模ではなく「粘り強さ」で性能を稼ぐ設計が特徴です。

AI
2026-07-20 ・ Ars Technica

AIコーディングの「ハーネス」とは?Claude CodeとAugment Codeの設計思想の違いを解説

Augment CodeのVP of Engineering、Vinay Perneti氏がArs Technicaで、AIコーディングツールの性能を左右するのはモデルより「ハーネス(周辺ソフト)」だと主張。同社はリポジトリを埋め込みで事前索引化する意味検索型を採用し、Terminal-BenchでClaude Codeと同精度・トークン33%効率と示した。

AI
2026-06-22 ・ VentureBeat

Self-Harnessとは?AIエージェントが自分のルールを書き換える新手法、最大60%性能向上の仕組み

上海人工知能研究所が発表した「Self-Harness」は、LLMエージェントが自らの実行ログを分析し、システムプロンプトやツール運用ルールを自動で書き換える枠組みです。Terminal-Bench-2.0での評価では、MiniMax M2.5やGLM-5など3モデルで33〜60%の性能改善を確認しました。

← タグ一覧へ