音声と映像を同時に作るAI「MiniMax H3」が登場、モデルの無料公開も予定
中国のAI開発企業であるMiniMaxが、映像と音声を同時に生成できるAI「MiniMax H3」を発表しました。テキストだけでなく、画像や動画、音声などの多様な情報を組み合わせて最長15秒の映像を作れるのが特徴です。近日中にモデル自体が無料公開される予定となっており、注目が集まっています。
何が起きたのか
MiniMaxという企業が、新しい動画生成AI「MiniMax H3」を公開しました。このAIは、最長15秒の2K解像度の映像を、ステレオ音声と一緒に一度に作り出せます。
まず、入力できる情報の幅が広いのが特徴です。文字だけでなく、画像や動画、音声も指定できます。つまり、「ある動画のカメラの動き」と「ある画像の人物」、そして「ある音声の歌声」を組み合わせて一つの映像にする、といった複雑な指示が可能です。この機能は、自社のサービスである「Hailuo AI」などで利用できると報じられています。
なぜ注目されているのか
これまで、動画生成AIの多くは映像だけを作り、音は後から別のAIで付けるのが一般的でした。しかし、映像と音を同時に生成できれば、音に合わせた自然な動きを再現しやすくなります。
また、今回の発表では「オープンウェイト(オープンモデル)」として公開される予定である点も重要です。一般に、AIの内部設計図のようなデータを公開すると、世界中の開発者がそれを改良して利用できるようになります。これにより、技術の普及スピードが格段に上がると期待されています。
報道を読み比べると
PC Watchは、具体的な指示内容の例を挙げて、どのような操作が可能なのかを詳しく伝えています。一方でGIGAZINEは、このAIが「世界2位の実力」を持つことや、中国の企業によって開発された点に触れています。
両社とも、近日中にモデルが無料公開される見通しである点を報じていますが、具体的にいつ、どのような形式で公開されるのかという詳細については、現時点では明記されていません。
この記事に出てくる言葉
- 2K解像度
- 映像のきめ細かさを表す数値の一つ。フルHDに近い高画質な映像のこと。
- オープンウェイト
- AIの学習済みデータ(重み)を公開すること。誰でも利用や改良ができる状態。
- ステレオ音声
- 左右2つのチャンネルで音を出す方式。立体感のある音が再現できる。
今後の注目点
- モデルの無料公開がいつ、どのような条件で行われるか
- 世界2位とされる性能が、実際の利用シーンでどう発揮されるか
よくある質問
何ができるAIなの?
文字や画像、音声などを組み合わせて、最長15秒の音声付き動画を作れるAIです。特定の人物や歌声を指定して映像化することも可能です。
誰でも無料で使えるの?
現在は自社サービスなどで提供されていますが、近日中にモデル自体が無料で公開される予定であると報じられています。
💻 ブンカイ の取材メモ
この話題を選んだ理由:2つの媒体が同じ出来事を報じていた(注目度スコア 2.543)
GIGAZINEにある「世界2位」という記述について、どのような指標で判定されたものか材料に記載がなかったため、断定せず報じられている事実として記載しました。また、オープンウェイトとオープンモデルを同義として扱っています。
参照した報道(2媒体・2本)
この記事は下記の各社が公開している見出し・配信情報をもとに、独自にまとめたものです。記事本文は転載していません。詳細は各社の元記事をご確認ください。
この記事は、各社が公開している見出しと配信情報をAIが読み取り、要点・背景・論点を整理して自動生成したものです。速報性を優先しているため、内容に誤りや古い情報が含まれる場合があります。正確な情報は必ず上記の出典元をご確認ください。医療・投資・法律に関わる判断は専門家にご相談ください。