モデル・開発

MAI-Transcribe-2は世界で最も高速、高精度、低価格な音声認識モデル

原題: MAI-Transcribe-2 is the fastest, most accurate and cheapest speech recognition model in the world

重要提供開始音声認識

60言語対応の文字起こしモデルを提供

Microsoft AIは9月3日、音声認識モデルMAI-Transcribe-2を発表しました。

60言語の音声文字起こしに対応します。

話者分離を使い、複数の話者へ発言を割り当てられます。

語単位のタイムスタンプを返し、音声と文字の位置を対応付けられます。

フィラーや言い直しを残す逐語形式と、読みやすく整えるクリーン形式を選べます。

言語の自動判定、キーワードの優先、発話中の言語切り替えにも対応します。

Microsoft Foundry、MAI Playground、OpenRouterから試用できます。

Azure Speech APIではFast Transcription APIのenhanced modeでモデル名を指定して利用します。

Voice Live APIの入力音声文字起こしにも指定できます。

発売時の料金は音声1時間当たり0.10ドルで、年末までの期間限定価格です。

MicrosoftはFLEURSの60言語平均で単語誤り率5.2%と説明しています。

速度、精度、競合比較の数値はMicrosoftによる評価です。

原文

← 日次まとめへ戻る