Gemini 3.5 Transcribeとは?85言語対応の音声認識モデルが業務の「入力」を変える理由
Googleが新しい音声モデル「Gemini 3.5 Transcribe」を公開しました。85以上の言語を自動判別し、フィラー(えー、あのー)を除去した整形済みテキストを生成、最大3人までの話者を単語単位のタイムスタンプ付きで識別します。Pixel 11シリーズの「Rambler」やmacOS版Geminiアプリを動かし、APIでも提供されます。
Googleが新しい音声モデル「Gemini 3.5 Transcribe」を公開しました。85以上の言語を自動判別し、フィラー(えー、あのー)を除去した整形済みテキストを生成、最大3人までの話者を単語単位のタイムスタンプ付きで識別します。Pixel 11シリーズの「Rambler」やmacOS版Geminiアプリを動かし、APIでも提供されます。