モデル・開発・消費者向け

Gemini 3.5 Transcribeによるインテリジェントな文字起こし

原題: Intelligent transcription with Gemini 3.5 Transcribe

重要API提供済み

リアルタイム音声を整形済みテキストへ

Googleは8月26日、音声文字起こしモデル「Gemini 3.5 Transcribe」を発表しました。

背景雑音、専門用語、言い直しを含む音声を、整形されたテキストへ直接変換するモデルです。

リアルタイムのストリーミングと、録音済み音声を扱う非ストリーミングの両方に対応します。

Gemini API、Google AI Studio、Gemini Enterprise Agent Platformから利用できます。

GeminiアプリやAndroidの音声機能にも、この文字起こしモデルが使われています。

話者、言語、句読点、書式を文脈に応じて処理し、単純な音声認識を越えた整形を行います。

GoogleはArtificial Analysisの測定として、平均単語誤り率がストリーミングで4.0%、非ストリーミングで2.6%だったと紹介しています。

この値はGoogle自身の製品発表に掲載された外部評価の引用であり、利用環境ごとの精度を保証するものではありません。

開発者は新しいモデルを音声エージェント、会議記録、字幕、顧客対応などへ組み込めます。

提供開始済みのモデルであり、予告や限定プレビューではありません。

原文

← 日次まとめへ戻る