Hogar
Los grandes modelos visuales de código abierto mejoran la generación multimodal; el audio y el vídeo en alta definición 2K están llamados a revolucionar el sector

El 3 de agosto, la empresa de inteligencia artificial MiniMax anunció el lanzamiento en código abierto de su modelo de vídeo general de última generación, MiniMax H3 . Este sistema de generación multimodal trasciende los límites tradicionales de las tareas únicas, integrando y comprendiendo en profundidad contextos multimodales de texto, imágenes, vídeo y audio, lo que demuestra una gran capacidad de generalización de tareas.
En cuanto a la generación, H3 admite duraciones de salida de entre 4 y 15 segundos a 24 FPS y audio estéreo a 32 kHz. Los usuarios pueden elegir entre relaciones de aspecto habituales como 21:9, 16:9, 4:3 o 1:1, con un lado más corto predeterminado de 768 píxeles para la creación básica. La solución específica H3-Regenerate-2K permite obtener imágenes impresionantes con una resolución de hasta 2K. En cuanto a la interacción multilingüe, es compatible de forma fiable con 11 idiomas principales: árabe, chino, inglés, francés, alemán, italiano, japonés, coreano, español, portugués y ruso.
Para adaptarse a diversos escenarios creativos, H3 ofrece versiones flexibles del modelo y amplias opciones de entrada. El modo «primer y último fotograma» (H3-Base-FL2VA) admite de 0 a 2 imágenes, y gestiona tareas como la conversión de texto a vídeo, de primer fotograma a vídeo, de último fotograma a vídeo y la colaboración entre primer y último fotograma. Por su parte, el modo de referencia multimodal completo H3-Base-Ref2VA admite entradas mixtas de hasta 9 imágenes, 3 clips de vídeo (con una duración total inferior a 15 segundos) y 3 segmentos de audio —hasta un total de 12 archivos—, lo que proporciona a los creadores profesionales un control preciso sin precedentes.
En su interior, el sistema MiniMax H3 se compone de tres módulos principales. En primer lugar, el H3-Context-IR (representación intermedia del contexto) analiza en profundidad instrucciones múltiples complejas y las convierte en estructuras compatibles con el modelo, lo que constituye un eslabón clave para obtener resultados de alta calidad. A continuación, el módulo H3-Base genera audio y vídeo base con una resolución de 768p. Por último, el módulo H3-Regenerate-2K logra una reconstrucción con superresolución 2K mediante la retroalimentación de los resultados iniciales y el contexto original. Esta combinación conserva detalles vívidos al tiempo que mejora considerablemente la fidelidad visual.
El modelo ya se ha lanzado oficialmente bajo la licencia MiniMax H3 Community License. Los desarrolladores y los entusiastas de la tecnología pueden acceder al código fuente completo y a los recursos a través de Hugging Face . Los expertos del sector creen que este lanzamiento de código abierto reducirá aún más las barreras para la generación de vídeo multimodal, impulsando la producción cinematográfica, el diseño visual y la interacción con la IA a nuevas cotas.
Artículo relacionado
Suno añade marcas de agua a las canciones en medio de batallas legales
Suno, la plataforma que permite a los usuarios generar música creada por inteligencia artificial, ha presentado nuevas funciones para etiquetar las pistas producidas en la plataforma, restringir las descargas y actualizar las normas de la comunidad c
Musk admite que Grok filtró código de usuarios, promete borrar todos los datos históricos
Elon Musk abordó directamente la controversia por privacidad relacionada con Grok Build, comenzando con un simple "Verdadero" para confirmar la validez del incidente. Se comprometió a que todos los datos de usuario cargados previamente en SpaceXAI se
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
Recomendaciones de temas especiales relacionados
comentario (0)
0/500

El 3 de agosto, la empresa de inteligencia artificial MiniMax anunció el lanzamiento en código abierto de su modelo de vídeo general de última generación,
En cuanto a la generación, H3 admite duraciones de salida de entre 4 y 15 segundos a 24 FPS y audio estéreo a 32 kHz. Los usuarios pueden elegir entre relaciones de aspecto habituales como 21:9, 16:9, 4:3 o 1:1, con un lado más corto predeterminado de 768 píxeles para la creación básica. La solución específica H3-Regenerate-2K permite obtener imágenes impresionantes con una resolución de hasta 2K. En cuanto a la interacción multilingüe, es compatible de forma fiable con 11 idiomas principales: árabe, chino, inglés, francés, alemán, italiano, japonés, coreano, español, portugués y ruso.
Para adaptarse a diversos escenarios creativos, H3 ofrece versiones flexibles del modelo y amplias opciones de entrada. El modo «primer y último fotograma» (H3-Base-FL2VA) admite de 0 a 2 imágenes, y gestiona tareas como la conversión de texto a vídeo, de primer fotograma a vídeo, de último fotograma a vídeo y la colaboración entre primer y último fotograma. Por su parte, el modo de referencia multimodal completo H3-Base-Ref2VA admite entradas mixtas de hasta 9 imágenes, 3 clips de vídeo (con una duración total inferior a 15 segundos) y 3 segmentos de audio —hasta un total de 12 archivos—, lo que proporciona a los creadores profesionales un control preciso sin precedentes.
En su interior, el sistema MiniMax H3 se compone de tres módulos principales. En primer lugar, el H3-Context-IR (representación intermedia del contexto) analiza en profundidad instrucciones múltiples complejas y las convierte en estructuras compatibles con el modelo, lo que constituye un eslabón clave para obtener resultados de alta calidad. A continuación, el módulo H3-Base genera audio y vídeo base con una resolución de 768p. Por último, el módulo H3-Regenerate-2K logra una reconstrucción con superresolución 2K mediante la retroalimentación de los resultados iniciales y el contexto original. Esta combinación conserva detalles vívidos al tiempo que mejora considerablemente la fidelidad visual.
El modelo ya se ha lanzado oficialmente bajo la licencia MiniMax H3 Community License. Los desarrolladores y los entusiastas de la tecnología pueden acceder al código fuente completo y a los recursos a través de
Suno añade marcas de agua a las canciones en medio de batallas legales
Suno, la plataforma que permite a los usuarios generar música creada por inteligencia artificial, ha presentado nuevas funciones para etiquetar las pistas producidas en la plataforma, restringir las descargas y actualizar las normas de la comunidad c
Musk admite que Grok filtró código de usuarios, promete borrar todos los datos históricos
Elon Musk abordó directamente la controversia por privacidad relacionada con Grok Build, comenzando con un simple "Verdadero" para confirmar la validez del incidente. Se comprometió a que todos los datos de usuario cargados previamente en SpaceXAI se
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de











