Maison
ByteDance met en open source le framework Bernini pour la génération et le montage vidéo unifiés
L'équipe chargée de la commercialisation des technologies chez ByteDance a officiellement lancé un framework open source de génération et d'édition vidéo baptisé Bernini. Ce framework repose sur un mécanisme collaboratif de type « comprendre d'abord, générer ensuite », conçu pour relever les défis courants du secteur, tels que l'instabilité des images et le scintillement des images, qui résultent de l'incapacité des modèles traditionnels à interpréter avec précision des instructions complexes.
Lors des évaluations internes menées chez ByteDance, Bernini a obtenu des résultats de premier ordre. Son code d'inférence et le modèle de deuxième génération, Bernini-R, sont désormais accessibles au public, et la version complète devrait être publiée en open source dans un avenir proche.

Dissocier la sémantique du rendu
Le workflow de Bernini introduit une séparation novatrice entre la « planification sémantique » et le « rendu visuel ». Le processus commence par un planificateur multimodal à grande échelle qui analyse en profondeur les données d'entrée pour produire une « esquisse sémantique », laquelle est ensuite traduite en images vidéo stables et cohérentes par le moteur de rendu.
Cette division claire des responsabilités rend le framework particulièrement utile pour un montage contrôlable. Les utilisateurs peuvent ajuster les attributs de la scène tels que la météo, la saison ou le style visuel à l'aide de commandes simples, et bénéficier d'un contrôle précis sur les angles de caméra, la mise au point et les mouvements des sujets.
Capacités de référence visuelle avancées
Au-delà du contrôle traditionnel basé sur le texte, Bernini prend en charge l’utilisation d’images et de vidéos comme références visuelles, améliorant ainsi considérablement la cohérence créative. En montage vidéo, il peut placer avec précision des éléments spécifiques ou des affiches dans des zones cibles sans artefacts de bordure ni distorsion de perspective.
Pour générer de nouvelles vidéos, le modèle gère les entrées de référence à image unique et multi-angles, et peut transformer des images clés en séquences continues. Afin d'éviter toute confusion lors de la connexion de plusieurs segments visuels, l'équipe a introduit un mécanisme d'encodage positionnel dédié qui distingue clairement les éléments de référence des cibles de sortie.
Page du projet : https://bernini-ai.github.io/
Article connexe
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur
Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Recommandations de sujets spéciaux liés
commentaires (0)
L'équipe chargée de la commercialisation des technologies chez ByteDance a officiellement lancé un framework open source de génération et d'édition vidéo baptisé Bernini. Ce framework repose sur un mécanisme collaboratif de type « comprendre d'abord, générer ensuite », conçu pour relever les défis courants du secteur, tels que l'instabilité des images et le scintillement des images, qui résultent de l'incapacité des modèles traditionnels à interpréter avec précision des instructions complexes.
Lors des évaluations internes menées chez ByteDance, Bernini a obtenu des résultats de premier ordre. Son code d'inférence et le modèle de deuxième génération, Bernini-R, sont désormais accessibles au public, et la version complète devrait être publiée en open source dans un avenir proche.

Dissocier la sémantique du rendu
Le workflow de Bernini introduit une séparation novatrice entre la « planification sémantique » et le « rendu visuel ». Le processus commence par un planificateur multimodal à grande échelle qui analyse en profondeur les données d'entrée pour produire une « esquisse sémantique », laquelle est ensuite traduite en images vidéo stables et cohérentes par le moteur de rendu.
Cette division claire des responsabilités rend le framework particulièrement utile pour un montage contrôlable. Les utilisateurs peuvent ajuster les attributs de la scène tels que la météo, la saison ou le style visuel à l'aide de commandes simples, et bénéficier d'un contrôle précis sur les angles de caméra, la mise au point et les mouvements des sujets.
Capacités de référence visuelle avancées
Au-delà du contrôle traditionnel basé sur le texte, Bernini prend en charge l’utilisation d’images et de vidéos comme références visuelles, améliorant ainsi considérablement la cohérence créative. En montage vidéo, il peut placer avec précision des éléments spécifiques ou des affiches dans des zones cibles sans artefacts de bordure ni distorsion de perspective.
Pour générer de nouvelles vidéos, le modèle gère les entrées de référence à image unique et multi-angles, et peut transformer des images clés en séquences continues. Afin d'éviter toute confusion lors de la connexion de plusieurs segments visuels, l'équipe a introduit un mécanisme d'encodage positionnel dédié qui distingue clairement les éléments de référence des cibles de sortie.
Page du projet : https://bernini-ai.github.io/
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter











