OpenAIが音声文字起こしの新モデルを公開 リアルタイム対応など2種類をAPI提供
OpenAIが、音声からテキストを生成する新モデル「GPT Transcribe」および「GPT Live Transcribe」の提供を開始しました。APIを通じて利用可能で、録音データとリアルタイム音声の双方に対応し、精度の向上を図っていると報じられています。
何が起きたのか
OpenAIは、音声を文字に変換する2つのモデルをAPI経由で公開しました。一つは録音済みのファイルを扱う「GPT Transcribe」、もう一つは会話を即座にテキスト化する「GPT Live Transcribe」です。後者の費用は、音声1分につき0.017ドルとされています。どちらのモデルも、専門的な言葉が含まれる場合や、雑音が混じった環境であっても、文脈を捉えて正確に処理できる点に強みがあるとしています。
なぜ注目されているのか
もともと音声認識の技術は、単に音を文字に置き換える段階から、文脈を読み取って誤りを正す方向へと発展してきました。これまで多くのツールが存在してきましたが、業界特有の用語や周囲の騒音への対応は困難な課題でした。今回、OpenAIが文脈理解を重視したモデルを投入したのは、AIによる高度な意味解釈を音声処理に統合させたいという開発の流れにあると考えられます。
報道を読み比べると
GIGAZINEやはてなブックマークでは、専門用語への対応力やノイズへの強さといった性能面を主に伝えています。対してImpress Watchは、API提供である点や、リアルタイム処理に要する具体的なコストに言及しており、実装側の視点から報じています。各社の情報を合わせると、用途に応じて2つのモデルを使い分ける形式であることが分かります。
この記事に出てくる言葉
- API
- 外部のソフトが特定の機能を利用するための窓口。開発者が自社サービスにAIを組み込む際に使われます。
- 文字起こし
- 録音された音声やリアルタイムの会話を、テキスト形式の文字に変換することです。
今後の注目点
- API経由でどのような外部サービスに組み込まれ、活用されるか
- 騒音環境下での精度が実際の利用シーンでどう評価されるか
よくある質問
どのような機能があるのか?
録音済み音声のテキスト化と、会話のリアルタイム文字起こしの2種類が提供されており、専門用語やノイズへの強さが特徴とされています。
利用料金はいくらか?
リアルタイム文字起こしを行う「GPT-Live-Transcribe」については、音声1分あたり0.017ドルであると報じられています。
💻 ルーツ の取材メモ
この話題を選んだ理由:3つの媒体が同じ出来事を報じていた(注目度スコア 4.606)
「GPT Transcribe」側の具体的な料金体系については材料に含まれていなかったため、記載を避けました。また、API提供である点について、一般ユーザー向けアプリではなく開発者向けの機能であるという切り分けを明確にするよう留意して執筆しました。
参照した報道(3媒体・3本)
この記事は下記の各社が公開している見出し・配信情報をもとに、独自にまとめたものです。記事本文は転載していません。詳細は各社の元記事をご確認ください。
この記事は、各社が公開している見出しと配信情報をAIが読み取り、要点・背景・論点を整理して自動生成したものです。速報性を優先しているため、内容に誤りや古い情報が含まれる場合があります。正確な情報は必ず上記の出典元をご確認ください。医療・投資・法律に関わる判断は専門家にご相談ください。