Hogar
ByteDance publica el código fuente del marco Bernini para la generación y edición unificadas de vídeo
El equipo de tecnología de comercialización de ByteDance ha lanzado oficialmente un marco de código abierto para la generación y edición de vídeos denominado Bernini. En esencia, el marco adopta un mecanismo colaborativo basado en el principio de «primero comprender, luego generar», diseñado para abordar retos habituales del sector, como la inestabilidad de la imagen y el parpadeo de los fotogramas, que surgen cuando los modelos tradicionales no logran interpretar con precisión instrucciones complejas.
En las evaluaciones internas de ByteDance, Bernini ha obtenido resultados de primer nivel. Su código de inferencia y el modelo de segunda fase, Bernini-R, ya están disponibles públicamente, y está previsto que la versión con todas las funciones se publique íntegramente en código abierto en un futuro próximo.

Separación de la semántica del renderizado
El flujo de trabajo de Bernini introduce una novedosa separación entre la «planificación semántica» y el «renderizado visual». El proceso comienza con un planificador multimodal de gran modelo que analiza a fondo los materiales de entrada para producir un «bosquejo semántico», que luego es traducido en fotogramas de vídeo estables y coherentes por el renderizador.
Esta clara división de responsabilidades hace que el marco sea especialmente útil para la edición controlable. Los usuarios pueden ajustar atributos de la escena como el tiempo, la estación del año o el estilo visual mediante comandos sencillos, y también obtienen un control preciso sobre los ángulos de cámara, el enfoque y los movimientos de los sujetos.
Amplias capacidades de referencia visual
Más allá del control tradicional basado en texto, Bernini admite el uso de imágenes y vídeos como referencias visuales, lo que mejora significativamente la coherencia creativa. En la edición de vídeo, puede colocar con precisión materiales específicos o carteles en regiones objetivo sin artefactos de bordes ni distorsión de la perspectiva.
Para generar nuevos vídeos, el modelo gestiona entradas de referencia de una sola imagen y de múltiples ángulos, y puede convertir fotogramas clave en secuencias continuas. Para evitar confusiones al conectar múltiples segmentos visuales, el equipo introdujo un mecanismo de codificación posicional específico que distingue claramente los materiales de referencia de los objetivos de salida.
Página del proyecto: https://bernini-ai.github.io/
Artículo relacionado
Google prueba el agente Remy AI para Gemini a medida que el enfoque se desplaza hacia el control del usuario
Según Business Insider, Google está probando Remy, un nuevo agente personal de IA para Gemini. Esta herramienta tiene como objetivo ejecutar tareas en nombre de los usuarios, optimizando tanto los flujos de trabajo profesionales como las rutinas diar
Cómo corregir las Core Web Vitals para mejorar el posicionamiento SEO
Simplificar los comentarios de las tarjetas de calificación con herramientas de IAIntroducciónHerramientas de IA para generar comentarios de tarjetas de calificaciónMagic SchoolAlmanac AIChat GPTUso de Magic School para generar comentarios de t
Slackbot se convierte en un agente de IA
Slackbot, el asistente automatizado integrado en la plataforma de mensajería corporativa Slack de Salesforce, está evolucionando hacia un agente de inteligencia artificial. El CTO de Salesforce, Parker Harris, prevé que alcance un estatus viral compa
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
El equipo de tecnología de comercialización de ByteDance ha lanzado oficialmente un marco de código abierto para la generación y edición de vídeos denominado Bernini. En esencia, el marco adopta un mecanismo colaborativo basado en el principio de «primero comprender, luego generar», diseñado para abordar retos habituales del sector, como la inestabilidad de la imagen y el parpadeo de los fotogramas, que surgen cuando los modelos tradicionales no logran interpretar con precisión instrucciones complejas.
En las evaluaciones internas de ByteDance, Bernini ha obtenido resultados de primer nivel. Su código de inferencia y el modelo de segunda fase, Bernini-R, ya están disponibles públicamente, y está previsto que la versión con todas las funciones se publique íntegramente en código abierto en un futuro próximo.

Separación de la semántica del renderizado
El flujo de trabajo de Bernini introduce una novedosa separación entre la «planificación semántica» y el «renderizado visual». El proceso comienza con un planificador multimodal de gran modelo que analiza a fondo los materiales de entrada para producir un «bosquejo semántico», que luego es traducido en fotogramas de vídeo estables y coherentes por el renderizador.
Esta clara división de responsabilidades hace que el marco sea especialmente útil para la edición controlable. Los usuarios pueden ajustar atributos de la escena como el tiempo, la estación del año o el estilo visual mediante comandos sencillos, y también obtienen un control preciso sobre los ángulos de cámara, el enfoque y los movimientos de los sujetos.
Amplias capacidades de referencia visual
Más allá del control tradicional basado en texto, Bernini admite el uso de imágenes y vídeos como referencias visuales, lo que mejora significativamente la coherencia creativa. En la edición de vídeo, puede colocar con precisión materiales específicos o carteles en regiones objetivo sin artefactos de bordes ni distorsión de la perspectiva.
Para generar nuevos vídeos, el modelo gestiona entradas de referencia de una sola imagen y de múltiples ángulos, y puede convertir fotogramas clave en secuencias continuas. Para evitar confusiones al conectar múltiples segmentos visuales, el equipo introdujo un mecanismo de codificación posicional específico que distingue claramente los materiales de referencia de los objetivos de salida.
Página del proyecto: https://bernini-ai.github.io/
Cómo corregir las Core Web Vitals para mejorar el posicionamiento SEO
Simplificar los comentarios de las tarjetas de calificación con herramientas de IAIntroducciónHerramientas de IA para generar comentarios de tarjetas de calificaciónMagic SchoolAlmanac AIChat GPTUso de Magic School para generar comentarios de t
Slackbot se convierte en un agente de IA
Slackbot, el asistente automatizado integrado en la plataforma de mensajería corporativa Slack de Salesforce, está evolucionando hacia un agente de inteligencia artificial. El CTO de Salesforce, Parker Harris, prevé que alcance un estatus viral compa











