Gemini 3.5 Transcribeとは?85言語対応・単語誤り率2.6%の音声認識が業務に効く理由
Googleが2026年8月27日、リアルタイム音声認識モデル「Gemini 3.5 Transcribe」を公開しました。85言語超を自動判別し、単語誤り率はストリーミング4.0%・録音音声2.6%、遅延は前世代Chirp 3比で70%削減。「えーと」などのフィラー除去や言い間違いの訂正、整形までモデル側で完結します。
Googleが2026年8月27日、リアルタイム音声認識モデル「Gemini 3.5 Transcribe」を公開しました。85言語超を自動判別し、単語誤り率はストリーミング4.0%・録音音声2.6%、遅延は前世代Chirp 3比で70%削減。「えーと」などのフィラー除去や言い間違いの訂正、整形までモデル側で完結します。
Googleが音声認識モデル「Gemini 3.5 Transcribe」を投入しました。発話中の「えーと」や言い直しをその場で削除し、整形済みテキストを出力するもので、音声から最終テキストまで従来比約70%高速、ライブ音声のエラー率は5.5%(従来エンジンChirp 3はGoogle計測で7.32%)。85言語に対応し、Pixel 11のGboard「Rambler」機能で既に稼働しています。