新登場X(公式投稿)公式発表(24分前)
Meta AI、リアルタイム音声認識モデルを提供開始 20人以上の話者識別に対応
結論(先に3行)
- Meta AIが「Muse Voice Transcribe」を発表しました。
- リアルタイムASRと20人以上の話者識別に対応します。
- Meta Model APIやMeta AI for Macなどで利用できます。

Meta AIは、Meta Superintelligence Labs初のリアルタイム音声認識モデル「Muse Voice Transcribe」を発表しました。同モデルは、リアルタイムストリーミングASR、20人以上の話者識別、発話終了検出を備えます。
Muse Voice Transcribeは多言語に対応し、シームレスなコードスイッチングも扱います。言語、キーワード、文脈によるバイアス指定で精度を高めます。
同モデルはMuse Sparkファミリーの自己回帰型マルチモーダルLLMです。音声を80ms単位、12.5 Hzで処理し、各チャンクごとに聞き続けるか文字を出力するかを判断します。
Meta AIによると、Muse Voice TranscribeはArtificial Analysisのストリーミング音声テキスト変換と公開話者識別ベンチマークで1位です。Meta Model API、Meta AI for Mac、Muse Codeで利用できます。
誰に関係するか
リアルタイム文字起こしや多人数の会話識別を必要とする開発者や利用者に関係します。

