Maison
Les grands modèles visuels open source améliorent la génération multimodale ; l'audio et la vidéo HD 2K s'apprêtent à révolutionner le secteur

Le 3 août, la société spécialisée dans l’IA MiniMax a annoncé la mise à disposition en open source de son modèle vidéo généraliste de nouvelle génération, MiniMax H3 . Ce système de génération multimodale transcende les limites traditionnelles des tâches uniques, en intégrant et en comprenant en profondeur les contextes multimodaux (texte, images, vidéo et audio), ce qui lui confère de solides capacités de généralisation des tâches.
En matière de génération, H3 prend en charge des durées de sortie comprises entre 4 et 15 secondes à 24 images par seconde (FPS) et un son stéréo à 32 kHz. Les utilisateurs peuvent choisir parmi des formats d'image courants tels que 21:9, 16:9, 4:3 ou 1:1, avec un côté le plus court par défaut de 768 pixels pour la création de base. La solution dédiée H3-Regenerate-2K permet d'obtenir des images époustouflantes avec une résolution allant jusqu'à 2K. En matière d’interaction multilingue, il prend en charge de manière fiable 11 langues principales : l’arabe, le chinois, l’anglais, le français, l’allemand, l’italien, le japonais, le coréen, l’espagnol, le portugais et le russe.
Pour s’adapter à divers scénarios créatifs, H3 propose des versions de modèles flexibles et de nombreuses options d’entrée. Le mode « première-dernière image » (H3-Base-FL2VA) accepte de 0 à 2 images, prenant en charge des tâches telles que la conversion de texte en vidéo, la conversion de la première image en vidéo, la conversion de la dernière image en vidéo et la collaboration entre la première et la dernière image. Le mode de référence multimodal « H3-Base-Ref2VA », quant à lui, prend en charge une entrée mixte comprenant jusqu’à 9 images, 3 clips vidéo (d’une durée totale inférieure à 15 secondes) et 3 segments audio — soit jusqu’à 12 fichiers au total —, offrant ainsi aux créateurs professionnels un contrôle précis sans précédent.
En coulisses, le système MiniMax H3 comprend trois modules principaux. Tout d’abord, le module H3-Context-IR (représentation intermédiaire du contexte) analyse en profondeur des instructions multiples complexes et les convertit en structures adaptées au modèle, servant ainsi de maillon clé pour un résultat de haute qualité. Ensuite, le module H3-Base génère des contenus audio et vidéo de base en résolution 768p. Enfin, le module H3-Regenerate-2K réalise une reconstruction en super-résolution 2K en réinjectant les résultats initiaux et le contexte d’origine. Cette combinaison préserve les détails saisissants tout en améliorant considérablement la fidélité visuelle.
Le modèle est désormais officiellement disponible sous la licence communautaire MiniMax H3. Les développeurs et les passionnés de technologie peuvent accéder à l’intégralité du code open source et aux ressources via Hugging Face . Les experts du secteur estiment que cette mise à disposition en open source réduira encore davantage les obstacles à la génération de vidéos multimodales, propulsant ainsi la production cinématographique, la conception visuelle et l’interaction avec l’IA vers de nouveaux sommets.
Article connexe
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur
Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Recommandations de sujets spéciaux liés
commentaires (0)

Le 3 août, la société spécialisée dans l’IA MiniMax a annoncé la mise à disposition en open source de son modèle vidéo généraliste de nouvelle génération,
En matière de génération, H3 prend en charge des durées de sortie comprises entre 4 et 15 secondes à 24 images par seconde (FPS) et un son stéréo à 32 kHz. Les utilisateurs peuvent choisir parmi des formats d'image courants tels que 21:9, 16:9, 4:3 ou 1:1, avec un côté le plus court par défaut de 768 pixels pour la création de base. La solution dédiée H3-Regenerate-2K permet d'obtenir des images époustouflantes avec une résolution allant jusqu'à 2K. En matière d’interaction multilingue, il prend en charge de manière fiable 11 langues principales : l’arabe, le chinois, l’anglais, le français, l’allemand, l’italien, le japonais, le coréen, l’espagnol, le portugais et le russe.
Pour s’adapter à divers scénarios créatifs, H3 propose des versions de modèles flexibles et de nombreuses options d’entrée. Le mode « première-dernière image » (H3-Base-FL2VA) accepte de 0 à 2 images, prenant en charge des tâches telles que la conversion de texte en vidéo, la conversion de la première image en vidéo, la conversion de la dernière image en vidéo et la collaboration entre la première et la dernière image. Le mode de référence multimodal « H3-Base-Ref2VA », quant à lui, prend en charge une entrée mixte comprenant jusqu’à 9 images, 3 clips vidéo (d’une durée totale inférieure à 15 secondes) et 3 segments audio — soit jusqu’à 12 fichiers au total —, offrant ainsi aux créateurs professionnels un contrôle précis sans précédent.
En coulisses, le système MiniMax H3 comprend trois modules principaux. Tout d’abord, le module H3-Context-IR (représentation intermédiaire du contexte) analyse en profondeur des instructions multiples complexes et les convertit en structures adaptées au modèle, servant ainsi de maillon clé pour un résultat de haute qualité. Ensuite, le module H3-Base génère des contenus audio et vidéo de base en résolution 768p. Enfin, le module H3-Regenerate-2K réalise une reconstruction en super-résolution 2K en réinjectant les résultats initiaux et le contexte d’origine. Cette combinaison préserve les détails saisissants tout en améliorant considérablement la fidélité visuelle.
Le modèle est désormais officiellement disponible sous la licence communautaire MiniMax H3. Les développeurs et les passionnés de technologie peuvent accéder à l’intégralité du code open source et aux ressources via
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter











