#音声認識 の記事一覧(9)

AI
2026-09-06 ・ The Decoder

Muse Voice Transcribeとは?Metaの新音声認識が「1時間3円台」で市場を壊す理由

Meta Superintelligence Labsが、リアルタイム音声認識モデル「Muse Voice Transcribe」を公開しました。英語の単語誤り率3.1%・発話終了から0.16秒という精度と速度を、1時間あたり0.18ドル(音声1,000分で3ドル)という業界最安値で提供します。話者分離と文境界検出も同一モデルに内包しています。

AI
2026-09-01 ・ Engadget

Muse Voice Transcribeとは?Metaの初リアルタイム音声AIが「20人・多言語混在」を1モデルで捌く意味

Metaは9月1日、Meta Superintelligence Lab初のリアルタイム音声認識モデル「Muse Voice Transcribe」を公開しました。20人超の話者を自動で識別し、文の途中で日本語と英語が混ざる「コードスイッチング」もそのまま書き起こせるとされ、70以上の言語で学習・25言語が公開時点で検証済み、料金は音声1,000分あたり3ドルです。

AI
2026-08-27 ・ The Decoder

Gemini 3.5 Transcribeとは?85言語対応・単語誤り率2.6%の音声認識が業務に効く理由

Googleが2026年8月27日、リアルタイム音声認識モデル「Gemini 3.5 Transcribe」を公開しました。85言語超を自動判別し、単語誤り率はストリーミング4.0%・録音音声2.6%、遅延は前世代Chirp 3比で70%削減。「えーと」などのフィラー除去や言い間違いの訂正、整形までモデル側で完結します。

AI
2026-08-26 ・ Ars Technica

Gemini 3.5 Transcribeとは?「えーと」を消す音声入力AIが企業の議事録・カスタマーサポートに効く理由

Googleが音声認識モデル「Gemini 3.5 Transcribe」を投入しました。発話中の「えーと」や言い直しをその場で削除し、整形済みテキストを出力するもので、音声から最終テキストまで従来比約70%高速、ライブ音声のエラー率は5.5%(従来エンジンChirp 3はGoogle計測で7.32%)。85言語に対応し、Pixel 11のGboard「Rambler」機能で既に稼働しています。

AI
2026-08-26 ・ Engadget

Gemini 3.5 Transcribeとは?85言語対応の音声認識モデルが業務の「入力」を変える理由

Googleが新しい音声モデル「Gemini 3.5 Transcribe」を公開しました。85以上の言語を自動判別し、フィラー(えー、あのー)を除去した整形済みテキストを生成、最大3人までの話者を単語単位のタイムスタンプ付きで識別します。Pixel 11シリーズの「Rambler」やmacOS版Geminiアプリを動かし、APIでも提供されます。

AI
2026-07-29 ・ The Decoder

GPT Transcribeとは?OpenAIの新音声認識APIをElevenLabs・Gemini 3 Pro・Voxtralと精度と単価で比較する

OpenAIが音声認識API「GPT Transcribe」と「GPT Live Transcribe」を公開しました。Artificial AnalysisのAA-WERベンチマークで単語誤り率3.31%、価格は25%下げて1分0.0045ドル。ただし精度首位はElevenLabs Scribe v2の2.3%で、最安はMistralの1分0.003ドルという構図です。

← タグ一覧へ