opção
Lar
Notícias
A IA orientada para a otimização surge como um novo caminho para modelos de uso geral

A IA orientada para a otimização surge como um novo caminho para modelos de uso geral

22 de Fevereiro de 2026
131

Pesquisadores da Universidade de Illinois Urbana-Champaign e da Universidade da Virgínia criaram uma nova arquitetura de modelo que pode abrir caminho para sistemas de IA mais resilientes com maior capacidade de raciocínio.

Chamada de transformador baseado em energia (EBT), essa arquitetura aproveita naturalmente o dimensionamento do tempo de inferência para lidar com desafios complexos. Para as empresas, isso significa aplicações de IA econômicas que podem se adaptar a novos cenários sem a necessidade de modelos especializados e ajustados.

O desafio do pensamento do Sistema 2

Na psicologia, a cognição humana é normalmente dividida em dois modos: o Sistema 1, que é rápido e instintivo, e o Sistema 2, que é mais lento, mais deliberado e analítico. Os grandes modelos de linguagem (LLMs) atuais são excelentes em tarefas do Sistema 1, mas o campo da IA está agora se concentrando no desenvolvimento do pensamento do Sistema 2 para lidar com problemas de raciocínio mais complexos.

Os modelos de raciocínio empregam vários métodos de dimensionamento do tempo de inferência para aumentar seu desempenho em questões difíceis. Uma técnica comum é o aprendizado por reforço (RL), usado em modelos como DeepSeek-R1 e “o-series” da OpenAI, onde a IA ganha recompensas por gerar tokens de raciocínio até chegar à solução correta. Outra estratégia, frequentemente chamada de best-of-n, envolve a criação de várias respostas possíveis e o uso de um sistema de verificação para escolher a melhor.

No entanto, essas abordagens apresentam limitações notáveis. Elas geralmente se limitam a um conjunto restrito de problemas facilmente verificáveis, como matemática e codificação, e podem reduzir o desempenho em outras tarefas, como redação criativa. Além disso, estudos recentes indicam que os métodos baseados em RL podem não estar ensinando novas habilidades de raciocínio aos modelos, mas simplesmente incentivando-os a reutilizar padrões de raciocínio bem-sucedidos que eles já conhecem. Isso restringe sua capacidade de resolver problemas que exigem uma exploração genuína além do escopo de seu treinamento.

Modelos baseados em energia (EBM)

Essa nova arquitetura segue um caminho diferente, baseando-se em uma classe de modelos conhecidos como modelos baseados em energia (EBMs). O conceito central é simples: em vez de gerar uma resposta diretamente, o modelo aprende uma “função de energia” que serve como verificador. Essa função recebe uma entrada (como um prompt) e uma previsão candidata e, em seguida, atribui a ela um valor, ou “energia”. Uma pontuação de energia baixa sugere alta compatibilidade, o que significa que a previsão se encaixa bem na entrada, enquanto uma pontuação de energia alta indica uma correspondência ruim.

Aplicando isso ao raciocínio da IA, os pesquisadores propõem em um artigo que os desenvolvedores devem considerar “o pensamento como um procedimento de otimização em relação a um verificador aprendido, que avalia a compatibilidade (probabilidade não normalizada) entre uma entrada e a previsão candidata”. O processo começa com uma previsão aleatória, que é então gradualmente refinada, minimizando sua pontuação de energia e explorando possíveis soluções até convergir para uma resposta altamente compatível. Esse método se baseia na ideia de que verificar uma solução costuma ser muito mais simples do que gerar uma do zero.

Esse design “centrado no verificador” aborda três grandes desafios no raciocínio da IA. Primeiro, ele permite a alocação dinâmica de computação, permitindo que os modelos “pensem” mais em problemas difíceis e menos em problemas mais fáceis. Segundo, os EBMs acomodam naturalmente a incerteza das questões do mundo real, onde não existe uma resposta única e clara. Terceiro, eles funcionam como seus próprios verificadores, eliminando a necessidade de modelos externos.

Ao contrário de outros sistemas que empregam geradores e verificadores separados, os EBMs integram ambos em um único modelo unificado. Uma grande vantagem dessa configuração é a generalização aprimorada. Como verificar uma solução em dados novos e fora da distribuição (OOD) é normalmente mais fácil do que gerar uma resposta correta, os EBMs podem gerenciar melhor situações desconhecidas.

Apesar de seu potencial, os EBMs historicamente enfrentam problemas de escalabilidade. Para resolver isso, os pesquisadores introduziram os EBTs, que são modelos transformadores especializados projetados para essa estrutura. Os EBTs são treinados para primeiro verificar a compatibilidade entre um contexto e uma previsão e, em seguida, refinar as previsões até identificarem a saída de menor energia (mais compatível). Esse procedimento imita efetivamente um processo de raciocínio para cada previsão. A equipe criou duas variantes de EBT: um modelo apenas decodificador inspirado na arquitetura GPT e um modelo bidirecional semelhante ao BERT.

Transformador baseado em energia (fonte: GitHub)

A arquitetura dos EBTs os torna adaptáveis e compatíveis com vários métodos de dimensionamento em tempo de inferência. “Os EBTs podem gerar CoTs mais longos, autoverificar, fazer o melhor de N [ou] você pode fazer amostragens de muitos EBTs”, disse Alexi Gladstone, estudante de doutorado em ciência da computação na Universidade de Illinois Urbana-Champaign e principal autor do artigo, à VentureBeat. “A melhor parte é que todas essas capacidades são aprendidas durante o pré-treinamento.”

EBTs em ação

Os pesquisadores testaram os EBTs em relação a arquiteturas estabelecidas: a popular receita transformer++ para geração de texto (modalidades discretas) e o transformador de difusão (DiT) para tarefas como previsão de vídeo e redução de ruído de imagem (modalidades contínuas). Eles avaliaram os modelos com base em dois critérios principais: “escalabilidade de aprendizagem”, ou quão eficientemente eles treinam, e “escalabilidade de pensamento”, que mede como o desempenho melhora com mais computação durante a inferência.

Durante o pré-treinamento, os EBTs mostraram eficiência superior, alcançando uma taxa de escalabilidade até 35% maior do que o Transformer++ em dados, tamanho de lote, parâmetros e computação. Isso significa que os EBTs podem ser treinados de forma mais rápida e econômica.

Na inferência, os EBTs também superaram os modelos existentes em tarefas de raciocínio. Ao “pensar por mais tempo” (usando mais etapas de otimização) e realizar “autoverificação” (gerando vários candidatos e selecionando aquele com a menor energia), os EBTs melhoraram o desempenho da modelagem de linguagem em 29% a mais do que o Transformer++. “Isso se alinha com nossas afirmações de que, como os transformadores feed-forward tradicionais não podem alocar dinamicamente computação adicional para cada previsão feita, eles são incapazes de melhorar o desempenho de cada token pensando por mais tempo”, explicam os pesquisadores.

Para a redução de ruído de imagem, os EBTs apresentaram melhores resultados do que os DiTs, usando 99% menos passagens diretas.

É importante ressaltar que o estudo revelou que os EBTs generalizam de forma mais eficaz do que outras arquiteturas. Mesmo com desempenho de pré-treinamento igual ou inferior, os EBTs superaram os modelos existentes em tarefas downstream. Os ganhos de desempenho do pensamento do Sistema 2 foram mais pronunciados em dados que estavam mais fora da distribuição (ao contrário dos dados de treinamento), indicando que os EBTs são especialmente robustos quando confrontados com desafios novos e difíceis.

Os pesquisadores observam que “os benefícios do pensamento dos EBTs não são uniformes em todos os dados, mas aumentam positivamente com a magnitude das mudanças distributivas, destacando o pensamento como um mecanismo crítico para a generalização robusta além das distribuições de treinamento”.

As vantagens dos EBTs são significativas por duas razões principais. Primeiro, eles sugerem que, na escala massiva dos modelos básicos atuais, os EBTs poderiam superar substancialmente a arquitetura clássica do transformador usada nos LLMs. Os autores observam que “na escala dos modelos básicos modernos treinados com 1.000 vezes mais dados e modelos 1.000 vezes maiores, esperamos que o desempenho do pré-treinamento dos EBTs seja significativamente melhor do que o da receita do Transformer++”.

Segundo, os EBTs demonstram uma eficiência de dados muito maior. Essa é uma vantagem crucial em uma era em que dados de treinamento de alta qualidade são cada vez mais um grande gargalo para o dimensionamento da IA. “Como os dados se tornaram um dos principais fatores limitantes para um maior dimensionamento, isso torna os EBTs especialmente atraentes”, afirma o artigo.

Apesar de seu mecanismo de inferência diferente, a arquitetura EBT é altamente compatível com o transformador, permitindo que ele sirva como um substituto direto para os LLMs atuais.

“Os EBTs são muito compatíveis com as estruturas atuais de hardware/inferência”, disse Gladstone, incluindo a decodificação especulativa usando modelos feed-forward em GPUs ou TPUs. Ele acrescentou que está confiante de que eles podem ser executados em aceleradores especializados, como LPUs e algoritmos de otimização como o FlashAttention-3, ou podem ser implantados por meio de estruturas de inferência comuns, como o vLLM.

Para desenvolvedores e empresas, as fortes habilidades de raciocínio e generalização dos EBTs podem torná-los uma base poderosa e confiável para a construção da próxima geração de aplicativos de IA. “Pensar mais a longo prazo pode ajudar amplamente em quase todos os aplicativos empresariais, mas acho que os mais empolgantes serão aqueles que exigem decisões mais importantes, segurança ou aplicativos com dados limitados”, disse Gladstone.

Artigo relacionado
Base44 revela modelo de IA proprietário para fortalecer a defensabilidade na plataforma de programação por vibração Base44 revela modelo de IA proprietário para fortalecer a defensabilidade na plataforma de programação por vibração Base44, a plataforma de vibe coding adquirida pela Wix por US$ 80 milhões há apenas um ano — quando tinha apenas seis meses de existência e uma equipe de oito pessoas — começou a implantar seu modelo de IA proprietário para ajudar os usuários a criar
A Bayer utiliza a Iambic AI para acelerar a descoberta de medicamentos A Bayer utiliza a Iambic AI para acelerar a descoberta de medicamentos O Dr. Juergen Eckhardt atua como chefe de Desenvolvimento de Negócios e Licenciamento da Bayer Pharmaceuticals.A Bayer está aproveitando a Iambic Therapeutics para implementar modelos de IA de ponta n
Multiverse Computing lança modelo gratuito de IA generativa compactada Multiverse Computing lança modelo gratuito de IA generativa compactada Os grandes modelos de linguagem enfrentam um desafio significativo: seu tamanho imenso. A startup espanhola Multiverse Computing está enfrentando esse problema com a criação de modelos compactados, pr
Recomendações de tópicos especiais relacionados
Negócios As melhores ferramentas de pesquisa competitiva baseadas em IA para pequenas empresas
As melhores ferramentas de pesquisa competitiva baseadas em IA para pequenas empresas

As melhores e mais bem avaliadas ferramentas de pesquisa competitiva com IA de 2026 para pequenas empresas! A XIX.AI selecionou uma coleção extremamente poderosa e revolucionária, atualizada semanalmente com testes rigorosos no mundo real e classificações detalhadas. Você encontrará uma comparação abrangente entre versões gratuitas e pagas para ajudá-lo a identificar as ferramentas imperdíveis que aumentam sua produtividade e lhe proporcionam uma vantagem competitiva. Explore agora para descobrir a ferramenta perfeita para você!

9 ferramentas
xix.ai
Edição de imagem Ferramentas de Retoque com IA do Photoshop para Moda E-commerce, Limpeza de Pele e Consistência de Cor
Ferramentas de Retoque com IA do Photoshop para Moda E-commerce, Limpeza de Pele e Consistência de Cor

2026 Últimas Melhores Ferramentas de Retoque com IA do Photoshop para roupas de comércio eletrônico, limpeza de pele e consistência de cores! Esta lista curada de alta classificação apresenta soluções poderosas que mudam o jogo, ajudando você a aumentar a eficiência da escrita, simplificar a criação de conteúdo e obter resultados visuais perfeitos sem esforço. Cada ferramenta passou por testes do mundo real através de classificações atualizadas semanalmente, com detalhes completos sobre comparação entre gratuito e pago. Com o apoio da XIX.AI, é o guia essencial para quem deseja desbloquear sua vantagem com IA. Explore agora!

10 ferramentas
xix.ai
Incitar As melhores bibliotecas de prompts de IA para fluxos de trabalho do ChatGPT
As melhores bibliotecas de prompts de IA para fluxos de trabalho do ChatGPT

As melhores e mais bem avaliadas bibliotecas de prompts de IA de 2026 para otimizar todos os tipos de fluxos de trabalho do ChatGPT. A XIX.AI selecionou uma coleção poderosa e revolucionária, submetida a rigorosos testes no mundo real para garantir o máximo desempenho. Você encontra comparações detalhadas entre opções gratuitas e pagas, além de classificações de especialistas, para ajudá-lo a escolher as ferramentas indispensáveis que aumentam sua produtividade e potencializam suas vantagens em IA. Explore agora!

11 ferramentas
xix.ai
Educação e Aprendizagem Plataformas de Construção de Questionários de IA para Professores, Tutores e Programas de Aprendizagem Baseados em Coortes
Plataformas de Construção de Questionários de IA para Professores, Tutores e Programas de Aprendizagem Baseados em Coortes

2026 Últimas Melhores Plataformas de Construção de Questionários com IA para Professores, Tutores e Programas de Aprendizagem Baseados em Coortes! A XIX.AI compilou uma lista de ferramentas poderosas e transformadoras, testadas em cenários reais, para garantir classificações precisas. Essas plataformas imperdíveis ajudam a aumentar a eficiência na escrita, otimizar a criação de conteúdo e simplificar o design de questionários em todos os cenários de aprendizado. Explore agora para descobrir a ferramenta perfeita para desbloquear sua vantagem com IA no ensino!

13 ferramentas
xix.ai
código Ferramentas de revisão de pull requests com IA para equipes do GitHub que lidam com refatorações, bugs e falhas de segurança
Ferramentas de revisão de pull requests com IA para equipes do GitHub que lidam com refatorações, bugs e falhas de segurança

As melhores e mais recentes ferramentas de 2026 para revisão de pull requests com IA para equipes do GitHub estão aqui no XIX.AI! Esta lista selecionada e com as melhores avaliações apresenta soluções poderosas e revolucionárias que otimizam a refatoração, a correção de bugs e a detecção de falhas de segurança em todos os fluxos de trabalho das equipes. Aproveite uma comparação entre versões gratuitas e pagas, além de testes reais e classificações detalhadas para ajudá-lo a encontrar a ferramenta perfeita que aumenta significativamente a produtividade. Explore agora para descobrir sua vantagem com IA!

12 ferramentas
xix.ai
Conversão de texto para fala As melhores ferramentas de conversão de texto em fala com IA para narrações com voz natural
As melhores ferramentas de conversão de texto em fala com IA para narrações com voz natural

As melhores e mais bem avaliadas ferramentas de conversão de texto em fala com IA de 2026 para dublagens naturais estão aqui no XIX.AI! Esta lista selecionada apresenta opções poderosas e revolucionárias que oferecem vozes cristalinas para todos os tipos de uso, respaldadas por testes reais e rankings atualizados semanalmente. Veja uma comparação entre versões gratuitas e pagas para encontrar a solução imperdível que aumentará sua produtividade instantaneamente. Explore agora para aproveitar toda a vantagem da IA!

11 ferramentas
xix.ai
Comentários (0)
0/500
OR