Metaは、リアルタイムで複数人の話者識別が可能な音声認識モデル「Muse Voice Transcribe」を発表しました。ITmedia AI+によると、このモデルは20人以上の話者を識別できるだけでなく、日本語を含む多言語に対応しています。
この技術は、多人数が参加する会議やインタビューなどでの音声認識精度を向上させることが期待されており、特に多言語環境での利用に強みがあります。リアルタイム処理が可能な点も特徴です。
日本市場においては、多言語対応の音声認識技術はグローバルビジネスの拡大やリモートワークの普及に伴い、需要が高まる分野であり、今回のMetaの発表は注目されるでしょう。