何が発表されたか
OpenAIが投入した「GPT-Live」は、従来の交互発話を前提とした音声UIを捨て、聞き取りと発話を並行して行う全二重アーキテクチャを採用した新世代モデルです。有料のGo/Plus/Pro向けに「GPT-Live-1」、無料枠には「GPT-Live-1 mini」が提供され、iOS・Android・ChatGPT.comで利用でき、API公開も予告されています。同種の全二重路線ではNvidiaがオープンソースの「PersonaPlex」を先行公開しており、業界の潮目が変わりつつあります。
なぜ「二層構造」が本命なのか
GPT-Liveは毎秒複数回、「話す/聞く/止まる/割り込む/ツールを呼ぶ」を判断し、「mhmm」「got it」といった相づちで会話の流れを保ちます。ユーザー側も途中で口を挟んだり考える間を取ったりでき、UXは電話の対話に近づきました。真の新規性は、Web検索・推論・エージェント動作が必要な質問を裏側のGPT-5.5にオフロードし、その間もフロントの音声モデルが会話を止めない設計にあります。「Instant/Medium/High」の推論レベルを選べる点も、応答速度と回答精度のトレードオフを制御可能にしました。
数字が示す非連続な性能差
エージェント型Web検索のBrowseCompでは、GPT-Live-1が75.2%に対しAdvanced Voice Modeは0.7%と、実質的に別のプロダクトです。社内評価のtau3 Voice Telecom(サポート業務)では、GPT-Live-1(High)が約65%を約385秒で解き、Advanced Voice Modeの約30%を上回りました。会話中に天気・株価・スポーツ結果などのビジュアルカードを提示できるほか、音声は9種にリニューアルされ、自己危害関連ではクライシスホットライン提示など、発話中でも介入する安全設計が組み込まれています。
💼 事業会社視点:これは自社にどう効くか
事業への含意:「電話×AI」の経済圏が動く
最も直撃を受けるのは、コールセンター・BPO・SaaSの音声チャネル領域です。tau3 Voice Telecomで約65%のサポート業務を6分強で解いた事実は、日本のコンタクトセンター委託(1席あたり月40万〜60万円規模)の一次受電を、AIが実務レベルで担い始めた合図と読むべきです。
業界別の打ち手:
- EC・D2C: 受注後の変更・キャンセル対応など「電話でしか終わらない」問い合わせをGPT-Live経由に寄せ、有人はクレームと解約防止に集中させる設計に切り替える価値があります。
- SaaS事業者: 自社プロダクトに音声UIを載せるなら、独自実装よりAPI公開待ちで様子見が合理的です。全二重の自前開発は数億円規模で溶ける可能性が高い領域です。
- 受託開発・SIer: 「AVMベースの音声Bot」提案は即座に陳腐化します。BrowseCompで0.7%→75.2%の断絶は、既存案件の技術選定を今週中に見直すべき水準です。
役員層への提言は明確で、「音声AIのPoCを来期に」というスケジュールは半年前倒しが妥当です。