オープンソースのビジュアル大規模モデルがマルチモーダル生成を強化、2K HDオーディオ・ビデオが業界に革命をもたらす見込み

8月3日、AI企業のMiniMaxは、次世代汎用動画モデル「MiniMax H3 」のオープンソース化を発表した。このフルモーダル生成システムは、従来の単一タスクの枠を超え、テキスト、画像、動画、音声といったマルチモーダルな文脈を深く統合・理解することで、強力なタスク汎化能力を発揮する。
生成に関しては、H3は24 FPS、32 kHzステレオオーディオで、4秒から15秒までの出力時間をサポートしている。 ユーザーは、21:9、16:9、4:3、1:1などの一般的なアスペクト比から選択でき、基本的な作成ではデフォルトで短辺が768ピクセルに設定されています。専用の「H3-Regenerate-2K」ソリューションにより、最大2K解像度の鮮明な画像を生成可能です。 多言語対応に関しては、アラビア語、中国語、英語、フランス語、ドイツ語、イタリア語、日本語、韓国語、スペイン語、ポルトガル語、ロシア語の11の主要言語を確実にサポートしています。
多様なクリエイティブシナリオに対応するため、H3は柔軟なモデルバージョンと豊富な入力オプションを提供します。「H3-Base-FL2VA」ファースト・ラストフレームモードは、0~2枚の画像を受け付け、「テキストから動画」、「最初のフレームから動画」、「最後のフレームから動画」、および「ファースト・ラストフレームのコラボレーション」といったタスクを処理します。 一方、H3-Base-Ref2VAのフルモーダル参照モードは、最大9枚の画像、3つの動画クリップ(合計再生時間15秒未満)、3つの音声セグメント――合計最大12ファイル――の混合入力をサポートしており、プロのクリエイターにこれまでにないきめ細かな制御を提供します。
内部構造において、MiniMax H3システムは3つのコアモジュールで構成されています。まず、H3-Context-IR(コンテキスト中間表現)は、複雑なマルチインストラクションを詳細に分析し、モデルに適した構造に変換することで、高品質な出力を実現するための重要な架け橋としての役割を果たします。 次に、H3-Baseモジュールが768p解像度のベースとなる音声および動画を生成します。最後に、H3-Regenerate-2Kモジュールが、初期結果と元のコンテキストをフィードバックすることで、2Kの超解像再構成を実現します。この組み合わせにより、鮮明なディテールを維持しつつ、視覚的な忠実度を大幅に向上させます。
本モデルは、MiniMax H3コミュニティライセンスの下で正式にリリースされました。開発者や技術愛好家は、Hugging Face を通じて完全なオープンソースコードとリソースにアクセスできます。業界の専門家は、このオープンソース化により、マルチモーダル動画生成の参入障壁がさらに低くなり、映画制作、ビジュアルデザイン、AIインタラクションが新たな高みへと押し上げられると見込んでいます。
関連記事
ByteDanceのSeedがグローバルキャンパス採用を開始、大規模モデルのトップ人材獲得に向けて仮想株式を提供
大規模言語モデルの競争環境において、トップクラスのタレントを確保することは、最も重要な戦略的資産であり続けています。4月1日、ByteDanceは、大規模モデル人材育成プログラムの一部であるSeedグローバルキャンパス採用イニシアチブの開始を発表しました。このキャンペーンは2027年卒の卒業予定者と現在のインターン生を対象としており、世界中のAI分野におけるエリート研究開発者およびエンジニアの発掘と確保を目指しています。拡大:世界中から100名の「AIシード」を発掘急速な技術進歩の中で、B
法的争訟の中でSunoが曲に透かしを入れる
Sunoは、ユーザーがAI生成音楽を作成できるプラットフォームであり、プラットフォームが生成したトラックにラベルを付け、ダウンロードを制限し、不正な複製を抑制するためにコミュニティ基準を更新する新機能を公開した。これらの更新は、Sunoがレコードレーベルやアーティスト団体からの複数の訴訟に直面している時期に実施される。共同創設者兼CEOのMikey Shulmanはブログ記事で、プラットフォームの目標が、より広い層にAI音楽ツールのアクセスを拡大しながら、オリジナルの創作を促進することに重点を
ムスク氏はGrokの構築でユーザーのコードが漏洩したことを認め、すべての履歴データを消去すると約束した。
エロン・マスクは、Grok Buildをめぐるプライバシー問題に直接言及し、まず「True」という単純な回答で事件の存在を確認した。彼は、SpaceXAIに以前アップロードされたすべてのユーザーデータを永久に削除すると約束し、「1バイトも残さない」と述べた。これは、主要なテックリーダーが公に過ちを認め、ユーザーデータを自発的に削除したというAI業界初の事例である。安全研究者による「フィッシング」テストでデータ漏洩の具体的な証拠が明らかになったこの問題は、独立したAIセキュリティ研究者である@
関連特集おすすめ
コメント (0)
0/500

8月3日、AI企業のMiniMaxは、次世代汎用動画モデル「
生成に関しては、H3は24 FPS、32 kHzステレオオーディオで、4秒から15秒までの出力時間をサポートしている。 ユーザーは、21:9、16:9、4:3、1:1などの一般的なアスペクト比から選択でき、基本的な作成ではデフォルトで短辺が768ピクセルに設定されています。専用の「H3-Regenerate-2K」ソリューションにより、最大2K解像度の鮮明な画像を生成可能です。 多言語対応に関しては、アラビア語、中国語、英語、フランス語、ドイツ語、イタリア語、日本語、韓国語、スペイン語、ポルトガル語、ロシア語の11の主要言語を確実にサポートしています。
多様なクリエイティブシナリオに対応するため、H3は柔軟なモデルバージョンと豊富な入力オプションを提供します。「H3-Base-FL2VA」ファースト・ラストフレームモードは、0~2枚の画像を受け付け、「テキストから動画」、「最初のフレームから動画」、「最後のフレームから動画」、および「ファースト・ラストフレームのコラボレーション」といったタスクを処理します。 一方、H3-Base-Ref2VAのフルモーダル参照モードは、最大9枚の画像、3つの動画クリップ(合計再生時間15秒未満)、3つの音声セグメント――合計最大12ファイル――の混合入力をサポートしており、プロのクリエイターにこれまでにないきめ細かな制御を提供します。
内部構造において、MiniMax H3システムは3つのコアモジュールで構成されています。まず、H3-Context-IR(コンテキスト中間表現)は、複雑なマルチインストラクションを詳細に分析し、モデルに適した構造に変換することで、高品質な出力を実現するための重要な架け橋としての役割を果たします。 次に、H3-Baseモジュールが768p解像度のベースとなる音声および動画を生成します。最後に、H3-Regenerate-2Kモジュールが、初期結果と元のコンテキストをフィードバックすることで、2Kの超解像再構成を実現します。この組み合わせにより、鮮明なディテールを維持しつつ、視覚的な忠実度を大幅に向上させます。
本モデルは、MiniMax H3コミュニティライセンスの下で正式にリリースされました。開発者や技術愛好家は、
ByteDanceのSeedがグローバルキャンパス採用を開始、大規模モデルのトップ人材獲得に向けて仮想株式を提供
大規模言語モデルの競争環境において、トップクラスのタレントを確保することは、最も重要な戦略的資産であり続けています。4月1日、ByteDanceは、大規模モデル人材育成プログラムの一部であるSeedグローバルキャンパス採用イニシアチブの開始を発表しました。このキャンペーンは2027年卒の卒業予定者と現在のインターン生を対象としており、世界中のAI分野におけるエリート研究開発者およびエンジニアの発掘と確保を目指しています。拡大:世界中から100名の「AIシード」を発掘急速な技術進歩の中で、B
法的争訟の中でSunoが曲に透かしを入れる
Sunoは、ユーザーがAI生成音楽を作成できるプラットフォームであり、プラットフォームが生成したトラックにラベルを付け、ダウンロードを制限し、不正な複製を抑制するためにコミュニティ基準を更新する新機能を公開した。これらの更新は、Sunoがレコードレーベルやアーティスト団体からの複数の訴訟に直面している時期に実施される。共同創設者兼CEOのMikey Shulmanはブログ記事で、プラットフォームの目標が、より広い層にAI音楽ツールのアクセスを拡大しながら、オリジナルの創作を促進することに重点を
ムスク氏はGrokの構築でユーザーのコードが漏洩したことを認め、すべての履歴データを消去すると約束した。
エロン・マスクは、Grok Buildをめぐるプライバシー問題に直接言及し、まず「True」という単純な回答で事件の存在を確認した。彼は、SpaceXAIに以前アップロードされたすべてのユーザーデータを永久に削除すると約束し、「1バイトも残さない」と述べた。これは、主要なテックリーダーが公に過ちを認め、ユーザーデータを自発的に削除したというAI業界初の事例である。安全研究者による「フィッシング」テストでデータ漏洩の具体的な証拠が明らかになったこの問題は、独立したAIセキュリティ研究者である@





家






