Heim
Open-Source-Modelle für visuelle Großdatenmengen verbessern die multimodale Generierung – 2K-HD-Audio und -Video werden die Branche revolutionieren

Am 3. August gab das KI-Unternehmen MiniMax die Open-Source-Veröffentlichung seines allgemeinen Videomodells der nächsten Generation, MiniMax H3 , bekannt. Dieses vollmodale Generierungssystem überwindet die Grenzen herkömmlicher Einzelaufgaben, integriert und versteht multimodale Kontexte aus Text, Bildern, Video und Audio auf tiefgreifende Weise und zeichnet sich durch starke Fähigkeiten zur Aufgabenverallgemeinerung aus.
Bei der Generierung unterstützt H3 Ausgabedauern von 4 bis 15 Sekunden bei 24 FPS und 32 kHz Stereo-Audio. Nutzer können zwischen gängigen Seitenverhältnissen wie 21:9, 16:9, 4:3 oder 1:1 wählen, wobei die kürzere Seite standardmäßig 768 Pixel beträgt, um eine einfache Erstellung zu ermöglichen. Die spezielle Lösung „H3-Regenerate-2K“ ermöglicht atemberaubende Bilder mit einer Auflösung von bis zu 2K. Für die mehrsprachige Interaktion unterstützt es zuverlässig 11 wichtige Sprachen: Arabisch, Chinesisch, Englisch, Französisch, Deutsch, Italienisch, Japanisch, Koreanisch, Spanisch, Portugiesisch und Russisch.
Um vielfältigen kreativen Szenarien gerecht zu werden, bietet H3 flexible Modellversionen und umfangreiche Eingabemöglichkeiten. Der „First-Last-Frame“-Modus „H3-Base-FL2VA“ akzeptiert 0 bis 2 Bilder und bewältigt Aufgaben wie „Text-zu-Video“, „Erstes-Bild-zu-Video“, „Letztes-Bild-zu-Video“ sowie die Zusammenarbeit zwischen erstem und letztem Bild. Der „H3-Base-Ref2VA“-Modus (Full-Modal-Referenzmodus) unterstützt hingegen gemischte Eingaben von bis zu 9 Bildern, 3 Videoclips (Gesamtdauer unter 15 Sekunden) und 3 Audiosegmenten – insgesamt bis zu 12 Dateien –, was professionellen Kreativen eine beispiellose Feinsteuerung ermöglicht.
Technisch gesehen besteht das MiniMax H3-System aus drei Kernmodulen. Zunächst analysiert das H3-Context-IR-Modul (Context Intermediate Representation) komplexe Mehrfachanweisungen eingehend und wandelt sie in modellfreundliche Strukturen um, wodurch es als Schlüsselelement für eine hochwertige Ausgabe dient. Als Nächstes generiert das H3-Base-Modul Basis-Audio- und -Videodaten mit einer Auflösung von 768p. Schließlich erreicht das H3-Regenerate-2K-Modul eine 2K-Superauflösungs-Rekonstruktion, indem es erste Ergebnisse und den ursprünglichen Kontext rückkoppelt. Diese Kombination bewahrt lebendige Details und verbessert gleichzeitig die visuelle Wiedergabetreue erheblich.
Das Modell wurde nun offiziell unter der MiniMax H3 Community License veröffentlicht. Entwickler und Technikbegeisterte können über Hugging Face auf den vollständigen Open-Source-Code und die Ressourcen zugreifen. Branchenexperten gehen davon aus, dass diese Open-Source-Veröffentlichung die Hürden für die multimodale Videogenerierung weiter senken und die Filmproduktion, das visuelle Design sowie die KI-Interaktion auf ein neues Niveau heben wird.
Verwandter Artikel
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13
Google testet den Remy AI Agent für Gemini, da der Fokus auf die Benutzerkontrolle verlagert wird
Laut Business Insider testet Google Remy, einen neuen KI-Personalagenten für Gemini. Dieses Tool soll Aufgaben im Auftrag von Nutzern ausführen und sowohl professionelle Arbeitsabläufe als auch tägliche Routinen optimieren.Derzeit wird Remy in einer
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)

Am 3. August gab das KI-Unternehmen MiniMax die Open-Source-Veröffentlichung seines allgemeinen Videomodells der nächsten Generation,
Bei der Generierung unterstützt H3 Ausgabedauern von 4 bis 15 Sekunden bei 24 FPS und 32 kHz Stereo-Audio. Nutzer können zwischen gängigen Seitenverhältnissen wie 21:9, 16:9, 4:3 oder 1:1 wählen, wobei die kürzere Seite standardmäßig 768 Pixel beträgt, um eine einfache Erstellung zu ermöglichen. Die spezielle Lösung „H3-Regenerate-2K“ ermöglicht atemberaubende Bilder mit einer Auflösung von bis zu 2K. Für die mehrsprachige Interaktion unterstützt es zuverlässig 11 wichtige Sprachen: Arabisch, Chinesisch, Englisch, Französisch, Deutsch, Italienisch, Japanisch, Koreanisch, Spanisch, Portugiesisch und Russisch.
Um vielfältigen kreativen Szenarien gerecht zu werden, bietet H3 flexible Modellversionen und umfangreiche Eingabemöglichkeiten. Der „First-Last-Frame“-Modus „H3-Base-FL2VA“ akzeptiert 0 bis 2 Bilder und bewältigt Aufgaben wie „Text-zu-Video“, „Erstes-Bild-zu-Video“, „Letztes-Bild-zu-Video“ sowie die Zusammenarbeit zwischen erstem und letztem Bild. Der „H3-Base-Ref2VA“-Modus (Full-Modal-Referenzmodus) unterstützt hingegen gemischte Eingaben von bis zu 9 Bildern, 3 Videoclips (Gesamtdauer unter 15 Sekunden) und 3 Audiosegmenten – insgesamt bis zu 12 Dateien –, was professionellen Kreativen eine beispiellose Feinsteuerung ermöglicht.
Technisch gesehen besteht das MiniMax H3-System aus drei Kernmodulen. Zunächst analysiert das H3-Context-IR-Modul (Context Intermediate Representation) komplexe Mehrfachanweisungen eingehend und wandelt sie in modellfreundliche Strukturen um, wodurch es als Schlüsselelement für eine hochwertige Ausgabe dient. Als Nächstes generiert das H3-Base-Modul Basis-Audio- und -Videodaten mit einer Auflösung von 768p. Schließlich erreicht das H3-Regenerate-2K-Modul eine 2K-Superauflösungs-Rekonstruktion, indem es erste Ergebnisse und den ursprünglichen Kontext rückkoppelt. Diese Kombination bewahrt lebendige Details und verbessert gleichzeitig die visuelle Wiedergabetreue erheblich.
Das Modell wurde nun offiziell unter der MiniMax H3 Community License veröffentlicht. Entwickler und Technikbegeisterte können über
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13











