Muse Voice Transcribeとは?Metaの初リアルタイム音声AIが「20人・多言語混在」を1モデルで捌く意味
Metaは9月1日、Meta Superintelligence Lab初のリアルタイム音声認識モデル「Muse Voice Transcribe」を公開しました。20人超の話者を自動で識別し、文の途中で日本語と英語が混ざる「コードスイッチング」もそのまま書き起こせるとされ、70以上の言語で学習・25言語が公開時点で検証済み、料金は音声1,000分あたり3ドルです。
Metaは9月1日、Meta Superintelligence Lab初のリアルタイム音声認識モデル「Muse Voice Transcribe」を公開しました。20人超の話者を自動で識別し、文の途中で日本語と英語が混ざる「コードスイッチング」もそのまま書き起こせるとされ、70以上の言語で学習・25言語が公開時点で検証済み、料金は音声1,000分あたり3ドルです。
Googleが新しい文字起こしモデル「Gemini 3.5 Transcribe」を公開しました。85以上の言語と専門用語を自動検出し、「えーと」「あのー」といったフィラーを自動除去、最大3話者の話者分離と単語単位のタイムスタンプに対応します。
Googleが音声認識モデル「Gemini 3.5 Transcribe」を投入しました。発話中の「えーと」や言い直しをその場で削除し、整形済みテキストを出力するもので、音声から最終テキストまで従来比約70%高速、ライブ音声のエラー率は5.5%(従来エンジンChirp 3はGoogle計測で7.32%)。85言語に対応し、Pixel 11のGboard「Rambler」機能で既に稼働しています。
Googleが新しい音声モデル「Gemini 3.5 Transcribe」を公開しました。85以上の言語を自動判別し、フィラー(えー、あのー)を除去した整形済みテキストを生成、最大3人までの話者を単語単位のタイムスタンプ付きで識別します。Pixel 11シリーズの「Rambler」やmacOS版Geminiアプリを動かし、APIでも提供されます。