Lar
A ByteDance torna o Bernini Framework de código aberto para geração e edição unificadas de vídeo
A equipe de tecnologia de comercialização da ByteDance lançou oficialmente uma estrutura de código aberto para geração e edição de vídeo chamada Bernini. Em sua essência, a estrutura adota um mecanismo colaborativo do tipo “primeiro compreender, depois gerar”, projetado para resolver desafios comuns do setor, como instabilidade de imagem e tremulação de quadros, decorrentes da incapacidade dos modelos tradicionais de interpretar instruções complexas com precisão.
Em avaliações internas na ByteDance, o Bernini alcançou resultados de alto nível. Seu código de inferência e o modelo de segundo estágio, o Bernini-R, já estão disponíveis publicamente, com a versão completa programada para um lançamento totalmente de código aberto em um futuro próximo.

Separando a semântica da renderização
O fluxo de trabalho do Bernini introduz uma separação inovadora entre “planejamento semântico” e “renderização visual”. O processo começa com um planejador de modelo multimodal de grande porte que analisa minuciosamente os materiais de entrada para produzir um “esboço semântico”, que é então traduzido em quadros de vídeo estáveis e coerentes pelo renderizador.
Essa divisão clara de responsabilidades torna a estrutura particularmente útil para a edição controlável. Os usuários podem ajustar atributos da cena, como clima, estação do ano ou estilo visual, por meio de comandos simples, além de obter controle preciso sobre ângulos de câmera, foco e movimentos do objeto.
Ricas capacidades de referência visual
Além do controle tradicional baseado em texto, o Bernini suporta o uso de imagens e vídeos como referências visuais, melhorando significativamente a consistência criativa. Na edição de vídeo, ele pode posicionar com precisão materiais específicos ou pôsteres em regiões-alvo sem artefatos de borda ou distorção de perspectiva.
Para gerar novos vídeos, o modelo lida com entradas de referência de imagem única e multiângulo, e pode transformar quadros-chave em sequências contínuas. Para evitar confusão ao conectar múltiplos segmentos visuais, a equipe introduziu um mecanismo de codificação posicional dedicado que distingue claramente os materiais de referência dos alvos de saída.
Página do projeto: https://bernini-ai.github.io/
Artigo relacionado
O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário
De acordo com o Business Insider, o Google está testando o Remy, um novo agente pessoal de IA para o Gemini. Esta ferramenta tem como objetivo executar tarefas em nome dos usuários, simplificando tanto os fluxos de trabalho profissionais quanto as ro
Como corrigir as Core Web Vitals para melhorar o ranqueamento de SEO
Simplifique os Comentários do Boletim Escolar com Ferramentas de IAIntroduçãoFerramentas de IA para Gerar Comentários do Boletim EscolarMagic SchoolAlmanac AIChat GPTUsando o Magic School para Gerar Comentários do Boletim EscolarFazendo login n
O Slackbot torna-se um Agente de IA
O Slackbot, o assistente automatizado integrado à plataforma de mensagens corporativas Slack da Salesforce, está se transformando em um agente de IA. O CTO da Salesforce, Parker Harris, prevê que ele alcance um status viral comparável ao do ChatGPT d
Recomendações de tópicos especiais relacionados
Comentários (0)
A equipe de tecnologia de comercialização da ByteDance lançou oficialmente uma estrutura de código aberto para geração e edição de vídeo chamada Bernini. Em sua essência, a estrutura adota um mecanismo colaborativo do tipo “primeiro compreender, depois gerar”, projetado para resolver desafios comuns do setor, como instabilidade de imagem e tremulação de quadros, decorrentes da incapacidade dos modelos tradicionais de interpretar instruções complexas com precisão.
Em avaliações internas na ByteDance, o Bernini alcançou resultados de alto nível. Seu código de inferência e o modelo de segundo estágio, o Bernini-R, já estão disponíveis publicamente, com a versão completa programada para um lançamento totalmente de código aberto em um futuro próximo.

Separando a semântica da renderização
O fluxo de trabalho do Bernini introduz uma separação inovadora entre “planejamento semântico” e “renderização visual”. O processo começa com um planejador de modelo multimodal de grande porte que analisa minuciosamente os materiais de entrada para produzir um “esboço semântico”, que é então traduzido em quadros de vídeo estáveis e coerentes pelo renderizador.
Essa divisão clara de responsabilidades torna a estrutura particularmente útil para a edição controlável. Os usuários podem ajustar atributos da cena, como clima, estação do ano ou estilo visual, por meio de comandos simples, além de obter controle preciso sobre ângulos de câmera, foco e movimentos do objeto.
Ricas capacidades de referência visual
Além do controle tradicional baseado em texto, o Bernini suporta o uso de imagens e vídeos como referências visuais, melhorando significativamente a consistência criativa. Na edição de vídeo, ele pode posicionar com precisão materiais específicos ou pôsteres em regiões-alvo sem artefatos de borda ou distorção de perspectiva.
Para gerar novos vídeos, o modelo lida com entradas de referência de imagem única e multiângulo, e pode transformar quadros-chave em sequências contínuas. Para evitar confusão ao conectar múltiplos segmentos visuais, a equipe introduziu um mecanismo de codificação posicional dedicado que distingue claramente os materiais de referência dos alvos de saída.
Página do projeto: https://bernini-ai.github.io/
Como corrigir as Core Web Vitals para melhorar o ranqueamento de SEO
Simplifique os Comentários do Boletim Escolar com Ferramentas de IAIntroduçãoFerramentas de IA para Gerar Comentários do Boletim EscolarMagic SchoolAlmanac AIChat GPTUsando o Magic School para Gerar Comentários do Boletim EscolarFazendo login n
O Slackbot torna-se um Agente de IA
O Slackbot, o assistente automatizado integrado à plataforma de mensagens corporativas Slack da Salesforce, está se transformando em um agente de IA. O CTO da Salesforce, Parker Harris, prevê que ele alcance um status viral comparável ao do ChatGPT d











