#Gemini 3.1 Pro の記事一覧(3)

AI
2026-07-30 ・ Wired

ピッグ・ブッチャリング詐欺とは?AIチャットボットが人間より信頼を勝ち取った四大学実験を解説

インド・アムリタ大学、ヴェネツィア・カ・フォスカリ大学、メルボルン大学、ベングリオン大学の研究チームが、ロマンス投資詐欺「ピッグ・ブッチャリング」の信頼構築段階を再現した実験で、Claudeベースのボットが人間の詐欺専門家を上回る結果を出しました。ボットの依頼にアプリをダウンロードした被験者は46%、人間側は18%。信頼スコアも3.78対3.31でAIが上回っています。

AI
2026-07-12 ・ The Decoder

AgenticSTSとは?「文脈を溜めない」5層メモリのAIエージェントが示した、トークン90分の1の設計思想

Cheng et al.のAgenticSTSは、チャットログを積み上げる代わりに5層に分けた記憶領域から毎回プロンプトを組み直す設計で、デッキ構築ローグライク『Slay the Spire 2』を攻略しました。同じGemini 3.1 Proを使う既存エージェント(STS2MCP、CharTyr)が5戦0勝だったのに対し、獲得スコア当たりのトークン量は66〜90分の1です。

Gemini-SQL2とは?BIRDベンチで80.04%、自然言語からSQL生成でGoogleが首位に立った意味
2026-06-13 ・ The Decoder

Gemini-SQL2とは?BIRDベンチで80.04%、自然言語からSQL生成でGoogleが首位に立った意味

Google ResearchがGemini 3.1 Proベースの新システム「Gemini-SQL2」を公開し、text-to-SQLの代表的ベンチマークBIRDで実行精度80.04%を記録、OpenAIのGPT-5.5-xhigh(約72.8%)やAnthropicのClaude Opus 4.6(約70.9%)を引き離して首位に立ちました。論文未公開・一般提供も未定ですが、社内データ活用のあり方を揺らす指標です。

← タグ一覧へ