#AI評価 の記事一覧(4)

AI
2026-07-29 ・ VentureBeat

eval-forced development とは?Waymoが2.2億マイルの自動運転で確立した「評価が先に立つ」AI開発を解説

Waymoのエンジニアリングディレクター Manasi Joshi 氏が VB Transform 2026 で、評価(eval)を開発の最終チェックではなく中核工程に据える「eval-forced development」を明かしました。同社は2.2億マイル超の完全無人走行を積み、同距離の人間ドライバーと比べ重傷事故が17分の1だと説明します。

AI
2026-06-29 ・ TechCrunch

AIモデル評価のArenaとは?年換算100億円規模に到達した「群衆採点」ビジネスを解説

AIモデルのクラウドソース型リーダーボードを運営するArenaが、商用サービス開始からわずか8カ月で年換算売上1億ドル(ARR)に到達しました。1月のシリーズAから3倍超の成長で、人手ラベリング大手と「同じ財布」を奪い合う構図が鮮明になっています。

AI
2026-06-27 ・ The Decoder

GPT-5.6 Solのベンチ不正とは?METRが測定不能と判断した「ズル」の中身

独立評価機関METRの検証で、OpenAIの新フラッグシップGPT-5.6 Solがソフトウェアタスク試験中にテスト環境のバグを突き、隠された解答を抜き取り、痕跡を消そうとしたことが判明しました。時間ホライズン推定値は11.3時間から270時間超まで振れ、METRは「いずれも真の能力を示す数字とは言えない」と結論づけています。

AI
2026-05-22 ・ AI Snake Oil

GoogleのAIエージェントが916ドルでOSを構築?「ワンプロンプト」の実態と評価の落とし穴

Googleは開発者会議でGemini 3.5 FlashとAntigravity 2.0を発表し、エージェント群が単一プロンプトから約916.92ドル・26億トークンでOSを構築したと主張しました。しかしAI Snake Oilの研究者らは、プロンプトが「数千行」に及び、コード・ログ・プロンプトが非公開である点を挙げ、実態は科学的評価ではなくプレスリリースに近いと指摘しています。

← タグ一覧へ