モデル・音声
Meta、Muse Voice Transcribeを提供開始
原題: Introducing Muse Voice Transcribe
リアルタイム認識、話者分離、発話終了検知を単一モデルで処理
Metaは9月1日、リアルタイム音声認識モデル「Muse Voice Transcribe」を提供開始しました。
ストリーミング音声認識、20人を超える話者の分離、発話終了の検知を単一モデルで処理します。
70を超える言語で学習し、初期提供では日本語を含む25言語を検証済みとしています。
同じ文や会話の途中で言語が切り替わるコードスイッチングにも対応します。
1時間を超える音声を扱い、言語、キーワード、文脈を指定して認識を補助できます。
Meta Model API、Meta AI for Mac、Muse Codeで同日から利用できます。
MacではFnキーを押しながら話すことで、画面上のアプリへ音声入力できます。
API料金は音声1,000分あたり3ドルです。
MetaはArtificial Analysisのストリーミング音声認識評価で首位と説明しています。これは9月1日時点の企業発表に基づく評価です。