Metaがリアルタイム音声認識モデルを発表、20人以上の話者識別や多言語に対応
Metaが新モデル「Muse Voice Transcribe」を公開。20人以上の話者識別と多言語対応を単一モデルで実現し、リアルタイム文字起こしを効率化します。
💻 IT・テクノロジー
2媒体の報道をまとめ
「音声認識」に関連する記事を新しい順に並べています。
Metaが新モデル「Muse Voice Transcribe」を公開。20人以上の話者識別と多言語対応を単一モデルで実現し、リアルタイム文字起こしを効率化します。
GoogleのGemini 3.5 TranscribeとMicrosoftのMAI-Transcribe-2が登場。言いよどみ除去による清書機能と、圧倒的な処理速度。音声認識AIの最新トレンドを解説します。
最新の音声認識AIモデルを幅広くサポートする「transcribe.cpp」が公開。GGMLベースでwhisper.cppからの移行も可能と報じられています。
OpenAIがAPI向けの音声文字起こしモデル「GPT Transcribe」と「GPT Live Transcribe」を公開。ノイズや専門用語への対応力を高めた新機能の概要をまとめます。