モデル・開発
MAI-Transcribe-2は世界で最も高速、高精度、低価格な音声認識モデル
原題: MAI-Transcribe-2 is the fastest, most accurate and cheapest speech recognition model in the world
60言語対応の文字起こしモデルを提供
Microsoft AIは9月3日、音声認識モデルMAI-Transcribe-2を発表しました。
60言語の音声文字起こしに対応します。
話者分離を使い、複数の話者へ発言を割り当てられます。
語単位のタイムスタンプを返し、音声と文字の位置を対応付けられます。
フィラーや言い直しを残す逐語形式と、読みやすく整えるクリーン形式を選べます。
言語の自動判定、キーワードの優先、発話中の言語切り替えにも対応します。
Microsoft Foundry、MAI Playground、OpenRouterから試用できます。
Azure Speech APIではFast Transcription APIのenhanced modeでモデル名を指定して利用します。
Voice Live APIの入力音声文字起こしにも指定できます。
発売時の料金は音声1時間当たり0.10ドルで、年末までの期間限定価格です。
MicrosoftはFLEURSの60言語平均で単語誤り率5.2%と説明しています。
速度、精度、競合比較の数値はMicrosoftによる評価です。