モデル・開発・消費者向け
Gemini 3.5 Transcribeによるインテリジェントな文字起こし
原題: Intelligent transcription with Gemini 3.5 Transcribe
リアルタイム音声を整形済みテキストへ
Googleは8月26日、音声文字起こしモデル「Gemini 3.5 Transcribe」を発表しました。
背景雑音、専門用語、言い直しを含む音声を、整形されたテキストへ直接変換するモデルです。
リアルタイムのストリーミングと、録音済み音声を扱う非ストリーミングの両方に対応します。
Gemini API、Google AI Studio、Gemini Enterprise Agent Platformから利用できます。
GeminiアプリやAndroidの音声機能にも、この文字起こしモデルが使われています。
話者、言語、句読点、書式を文脈に応じて処理し、単純な音声認識を越えた整形を行います。
GoogleはArtificial Analysisの測定として、平均単語誤り率がストリーミングで4.0%、非ストリーミングで2.6%だったと紹介しています。
この値はGoogle自身の製品発表に掲載された外部評価の引用であり、利用環境ごとの精度を保証するものではありません。
開発者は新しいモデルを音声エージェント、会議記録、字幕、顧客対応などへ組み込めます。
提供開始済みのモデルであり、予告や限定プレビューではありません。