opção
Lar
Notícias
Ex -Deepseeker e Collaborators lançam um novo método para treinar agentes de IA confiáveis: Ragen

Ex -Deepseeker e Collaborators lançam um novo método para treinar agentes de IA confiáveis: Ragen

4 de Maio de 2025
278

Ex -Deepseeker e Collaborators lançam um novo método para treinar agentes de IA confiáveis: Ragen

O Ano dos Agentes de IA: Um Olhar Mais Atento sobre as Expectativas e Realidades de 2025

2025 foi anunciado por muitos especialistas como o ano em que os agentes de IA — sistemas de IA especializados alimentados por modelos de linguagem avançados e multimodais de empresas como OpenAI, Anthropic, Google e DeepSeek — finalmente ocupariam o centro do palco. No entanto, de acordo com uma recente enquete da VentureBeat na rede social X, a maioria dos agentes de IA ainda está em estágios experimentais, presos em uma espécie de limbo corporativo.

Mas há um vislumbre de esperança no horizonte. Um esforço colaborativo de pesquisadores da Northwestern University, Microsoft, Stanford e da University of Washington, incluindo Zihan Wang, ex-pesquisador da DeepSeek e agora doutorando em ciência da computação na Northwestern, apresentou o RAGEN. Este novo sistema visa treinar e avaliar agentes de IA para torná-los mais confiáveis e adaptáveis para uso empresarial no mundo real.

RAGEN: Uma Nova Abordagem para Treinamento de Agentes de IA

Ao contrário de tarefas estáticas, como resolução de problemas matemáticos ou geração de código, o RAGEN foca em interações dinâmicas de múltiplas rodadas, onde os agentes precisam se adaptar, lembrar e raciocinar em meio à incerteza. O sistema é construído sobre um framework personalizado de aprendizado por reforço (RL) chamado StarPO (Otimização de Política de Estado-Pensamento-Ações-Recompensa), que enfatiza o aprendizado por experiência, em vez de memorização mecânica. O StarPO analisa sequências completas de tomada de decisão, não apenas respostas de etapa única.

O StarPO opera em duas fases: uma etapa de rollout, onde o LLM gera sequências completas de interação guiadas por raciocínio, e uma etapa de atualização, onde o modelo é otimizado usando recompensas cumulativas normalizadas. Essa abordagem oferece um ciclo de aprendizado mais estável e interpretável em comparação com métodos tradicionais de otimização de políticas.

Os pesquisadores testaram esse framework usando versões ajustadas dos modelos Qwen da Alibaba, especificamente Qwen 1.5 e Qwen 2.5, escolhidos por seus pesos abertos e fortes capacidades de seguir instruções. Essa escolha facilitou a reprodutibilidade e comparações consistentes de linha de base em tarefas simbólicas.

A Armadilha do Eco: Um Desafio no Aprendizado por Reforço

Zihan Wang destacou um problema crítico no treinamento de RL em uma thread amplamente compartilhada no X: *Por que seu treinamento de RL sempre colapsa?* A equipe identificou que, embora os agentes de LLM inicialmente produzam respostas bem fundamentadas, os sistemas de RL frequentemente recompensam atalhos, levando a comportamentos repetitivos que degradam o desempenho — um fenômeno que eles chamaram de "Armadilha do Eco".

Essa regressão é alimentada por loops de feedback onde certas frases ou estratégias recebem altas recompensas no início, incentivando o uso excessivo e sufocando a exploração Kimberly. Os sintomas são claros: quedas na variância de recompensa, picos de gradiente e rastros de raciocínio que desaparecem.

Ambientes de Teste do RAGEN

Para estudar esses comportamentos em um ambiente controlado, o RAGEN avalia agentes em três ambientes simbólicos:

  • Bandit: Uma tarefa estocástica de turno único que testa o raciocínio simbólico de risco-recompensa.
  • Sokoban: Um quebra-cabeça determinístico de múltiplos turnos envolvendo decisões irreversíveis.
  • Frozen Lake: Uma tarefa estocástica de múltiplos turnos que exige planejamento adaptativo.

Cada ambiente é projetado para minimizar vieses do mundo real e focar exclusivamente nas estratégias de tomada de decisão desenvolvidas durante o treinamento. Por exemplo, no ambiente Bandit, os agentes devem raciocinar simbolicamente sobre os braços Dragon e Phoenix, que representam diferentes distribuições de recompensa, interpretando-os como "força" e "esperança" para prever resultados.

Estabilizando o Aprendizado por Reforço com StarPO-S

Para combater o colapso do treinamento, os pesquisadores apresentaram o StarPO-S, uma versão estabilizada do framework original. O StarPO-S inclui três intervenções principais:

  1. Filtragem de rollout baseada em incerteza: Priorizando rollouts onde o agente demonstra incerteza nos resultados.
  2. Remoção da penalidade KL: Permitindo que o modelo se desvie mais livremente de sua política original e explore novos comportamentos.
  3. Clipping assimétrico de PPO: Amplificando trajetórias de alta recompensa mais do que as de baixa recompensa para impulsionar o aprendizado.

Essas mudanças ajudam a retardar ou eliminar o colapso do treinamento e melhorar o desempenho em todas as três tarefas. Como Wang disse, "StarPO-S… funciona em todas as 3 tarefas. Alivia o colapso. Melhor recompensa."

O que Faz um Bom Modelo de IA Agêntica?

O sucesso do treinamento de RL depende não apenas da arquitetura, mas também da qualidade dos dados gerados pelos agentes. A equipe identificou três dimensões cruciais que impactam significativamente o treinamento:

  • Diversidade de tarefas: Expor o modelo a uma ampla gama de cenários iniciais melhora a generalização.
  • Granularidade de interação: Permitir múltiplas ações por turno possibilita um planejamento mais significativo.
  • Frescor do rollout: Manter os dados de treinamento alinhados com a política atual do modelo evita sinais de aprendizado desatualizados.

Esses fatores contribuem para um processo de treinamento mais estável e eficaz. Um site de demonstração interativa no Github visualiza os rollouts de agentes como turnos completos de diálogo, incluindo não apenas ações, mas também o processo de pensamento passo a passo que os precede. Por exemplo, ao resolver um problema matemático, um agente pode primeiro 'pensar' em isolar uma variável antes de enviar uma resposta como 'x = 5'. Esses pensamentos intermediários são visíveis e rastreáveis, adicionando transparência a como os agentes tomam decisões.

Quando o Raciocínio Acaba

Embora o raciocínio explícito melhore o desempenho em tarefas simples de turno único, como Bandit, ele tende a decair durante o treinamento de múltiplos turnos. Apesar do uso de prompts estruturados e tokens, os rastros de raciocínio frequentemente diminuem ou desaparecem, a menos que sejam diretamente recompensados. Isso destaca uma limitação em como as recompensas são normalmente projetadas: focar na conclusão da tarefa pode negligenciar a qualidade do processo por trás dela. A equipe experimentou penalidades baseadas em formato para encorajar um raciocínio melhor estruturado, mas reconhece que um modelamento de recompensa mais refinado provavelmente é necessário.

Ferramentas Abertas e Direções Futuras

O RAGEN, junto com seus frameworks StarPO e StarPO-S, agora está disponível como um projeto de código aberto em https://github.com/RAGEN-AI/RAGEN. No entanto, no momento da redação, nenhuma licença explícita está listada no repositório do GitHub, o que pode limitar seu uso ou redistribuição por outros.

O sistema fornece uma base valiosa para aqueles interessados em desenvolver agentes de IA que não apenas completem tarefas, mas também pensem, planejem e evoluam. À medida que a IA avança para maior autonomia, projetos como o RAGEN ajudam a iluminar o que é necessário para treinar modelos que aprendem com as consequências de suas próprias ações.

Perguntas Pendentes para Adoção Empresarial no Mundo Real

Embora o artigo do RAGEN ofereça um roteiro técnico detalhado, várias questões práticas permanecem para aqueles que desejam aplicar esses métodos em ambientes empresariais. Por exemplo, quão transferível é a abordagem do RAGEN além de tarefas simbólicas estilizadas? As empresas precisariam projetar ambientes e funções de recompensa completamente novos para usar este sistema em fluxos de trabalho como processamento de faturas ou suporte ao cliente?

Wang, em uma mensagem direta à VentureBeat no X, sugeriu que melhorar a diversidade de tarefas poderia ajudar, já que as tarefas de jogos atuais possuem apenas representações de grade semelhantes, mas carecem de informações semânticas. Ele também expressou otimismo sobre as empresas projetarem seus próprios exercícios de treinamento para agentes de IA usando o RAGEN, observando que o link do GitHub fornece uma introdução simples para adicionar novos ambientes.

Outra área crítica é a escalabilidade. Mesmo com as melhorias fornecidas pelo StarPO-S, o artigo reconhece que o treinamento ainda eventualmente colapsa em horizontes mais longos. Isso levanta a questão: existe um caminho teórico ou prático para sustentar o raciocínio em sequências de tarefas abertas ou em constante evolução?

No momento da redação, nenhuma licença explícita está listada no repositório ou documentação do RAGEN, deixando questões em aberto sobre direitos de uso. Ainda assim, o RAGEN se destaca não apenas como uma contribuição técnica, mas como um passo conceitual em direção a agentes de IA mais autônomos e capazes de raciocínio. Se ele se tornará parte da pilha de IA empresarial ainda está por ser visto, mas suas percepções sobre a dinâmica de aprendizado de agentes já estão ajudando a redefinir a fronteira do treinamento de LLM.

Artigo relacionado
Base44 revela modelo de IA proprietário para fortalecer a defensabilidade na plataforma de programação por vibração Base44 revela modelo de IA proprietário para fortalecer a defensabilidade na plataforma de programação por vibração Base44, a plataforma de vibe coding adquirida pela Wix por US$ 80 milhões há apenas um ano — quando tinha apenas seis meses de existência e uma equipe de oito pessoas — começou a implantar seu modelo de IA proprietário para ajudar os usuários a criar
A startup de geração de vídeos PixVerse levanta US$ 439 milhões, com avaliação ultrapassando US$ 2 bilhões A startup de geração de vídeos PixVerse levanta US$ 439 milhões, com avaliação ultrapassando US$ 2 bilhões A PixVerse, uma startup de geração de vídeos com sede em Cingapura, anunciou hoje o fechamento da extensão de sua Rodada da Série C, levantando um total de US$ 439 milhões na rodada. De acordo com a e
Regras da China para assistentes de IA: o verdadeiro alvo de Pequim Regras da China para assistentes de IA: o verdadeiro alvo de Pequim O conceito de um companheiro de IA pode parecer distópico, mas tornou-se um tema recorrente em discussões mais amplas sobre os riscos da IA generativa. Essencialmente, refere-se a um agente conversaci
Recomendações de tópicos especiais relacionados
escrita Os melhores geradores de esboços com IA para artigos longos de SEO
Os melhores geradores de esboços com IA para artigos longos de SEO

Os melhores e mais bem avaliados geradores de esboços com IA de 2026 para artigos longos de SEO, cuidadosamente selecionados pela XIX.AI. Essas ferramentas poderosas oferecem um auxílio revolucionário na criação rápida de conteúdo de alta qualidade, aumentando significativamente a eficiência na redação. Confira uma comparação entre versões gratuitas e pagas, além de testes práticos e classificações detalhadas, para ajudá-lo a encontrar a opção imperdível que melhor atenda às suas necessidades. Explore agora para aproveitar ao máximo as vantagens da IA.

8 ferramentas
xix.ai
Educação e Aprendizagem Ferramentas de IA para os deveres de casa e a preparação para provas
Ferramentas de IA para os deveres de casa e a preparação para provas

As melhores e mais recentes ferramentas de IA para lição de casa e preparação para provas em 2026! A XIX.AI seleciona uma lista das ferramentas mais bem avaliadas, poderosas e revolucionárias que ajudam os alunos a aumentar a produtividade, agilizar a realização das lições de casa e se sair muito bem nas provas por meio de testes práticos. Veja uma comparação entre versões gratuitas e pagas, classificações detalhadas e opções imperdíveis para aproveitar ao máximo as vantagens da IA. Explore agora!

10 ferramentas
xix.ai
Composição musical Ferramentas de Demonstração Vocal com IA para Compositores, Ganchos, Toplines e Sessões de Rascunho Multilíngues
Ferramentas de Demonstração Vocal com IA para Compositores, Ganchos, Toplines e Sessões de Rascunho Multilíngues

2026 Últimas Melhores Ferramentas de Demonstração Vocal com IA para Compositores, Criadores de Ganchos e Equipes de Conteúdo Multilíngue! A XIX.AI compilou uma lista de ferramentas altamente avaliadas e poderosas, que mudam o jogo e passaram por rigorosos testes no mundo real. Você encontrará dados detalhados de comparação entre versões gratuitas e pagas, classificações abrangentes e opções imperdíveis para ajudá-lo a aumentar a eficiência da escrita e desbloquear seu potencial criativo. Explore agora para descobrir a ferramenta perfeita para todas as suas necessidades de conteúdo!

9 ferramentas
xix.ai
Negócios As melhores ferramentas de pesquisa competitiva baseadas em IA para pequenas empresas
As melhores ferramentas de pesquisa competitiva baseadas em IA para pequenas empresas

As melhores e mais bem avaliadas ferramentas de pesquisa competitiva com IA de 2026 para pequenas empresas! A XIX.AI selecionou uma coleção extremamente poderosa e revolucionária, atualizada semanalmente com testes rigorosos no mundo real e classificações detalhadas. Você encontrará uma comparação abrangente entre versões gratuitas e pagas para ajudá-lo a identificar as ferramentas imperdíveis que aumentam sua produtividade e lhe proporcionam uma vantagem competitiva. Explore agora para descobrir a ferramenta perfeita para você!

9 ferramentas
xix.ai
Edição de imagem Ferramentas de Retoque com IA do Photoshop para Moda E-commerce, Limpeza de Pele e Consistência de Cor
Ferramentas de Retoque com IA do Photoshop para Moda E-commerce, Limpeza de Pele e Consistência de Cor

2026 Últimas Melhores Ferramentas de Retoque com IA do Photoshop para roupas de comércio eletrônico, limpeza de pele e consistência de cores! Esta lista curada de alta classificação apresenta soluções poderosas que mudam o jogo, ajudando você a aumentar a eficiência da escrita, simplificar a criação de conteúdo e obter resultados visuais perfeitos sem esforço. Cada ferramenta passou por testes do mundo real através de classificações atualizadas semanalmente, com detalhes completos sobre comparação entre gratuito e pago. Com o apoio da XIX.AI, é o guia essencial para quem deseja desbloquear sua vantagem com IA. Explore agora!

10 ferramentas
xix.ai
Incitar As melhores bibliotecas de prompts de IA para fluxos de trabalho do ChatGPT
As melhores bibliotecas de prompts de IA para fluxos de trabalho do ChatGPT

As melhores e mais bem avaliadas bibliotecas de prompts de IA de 2026 para otimizar todos os tipos de fluxos de trabalho do ChatGPT. A XIX.AI selecionou uma coleção poderosa e revolucionária, submetida a rigorosos testes no mundo real para garantir o máximo desempenho. Você encontra comparações detalhadas entre opções gratuitas e pagas, além de classificações de especialistas, para ajudá-lo a escolher as ferramentas indispensáveis que aumentam sua produtividade e potencializam suas vantagens em IA. Explore agora!

11 ferramentas
xix.ai
Comentários (11)
0/500
EricJohnson
EricJohnson 30 de Agosto de 2026 à30 13:00:30 WEST

RAGENって名前、なんかかっこいいよね。DeepSeekの元エンジニアが関わってるってだけで期待しちゃう。2025年はエージェント元年って言われてるけど、結局は安定性が鍵だよね。技術的には面白いけど、実用化までにはまだ課題がありそう。今後の展開に注目!🤖✨

CharlesYoung
CharlesYoung 8 de Abril de 2026 à57 19:00:57 WEST

Estaba viendo las noticias sobre el lanzamiento de RAGEN y me preguntaba: ¿están los agentes de IA realmente listos para el uso general? Los anuncios son prometedores, pero en la práctica, seguro que surgen fallos en casos de borde. Sobre todo con la ética y el control. ¿Alguien ha probado realmente estas herramientas? Da un poco de respeto, la verdad 😅.

JosephMartínez
JosephMartínez 4 de Abril de 2026 à41 17:00:41 WEST

這方法聽起來滿有趣的,但訓練出真正可靠的AI代理還是有段距離吧?RAGEN這個方向不錯,但實務上遇到意外狀況時,它們真的能妥善應對嗎?先觀望一下實際應用案例再說...🤔

GregoryRodriguez
GregoryRodriguez 12 de Outubro de 2025 à38 03:30:38 WEST

RAGEN sounds promising, but I'm skeptical about the 'reliable' claim 🤔. Every time a new training method drops, it's hailed as revolutionary... until the limitations surface. Remember when we thought RLHF was the ultimate solution?

ScottEvans
ScottEvans 13 de Agosto de 2025 à59 12:00:59 WEST

RAGEN sounds cool, but will it actually make AI less chaotic or just add more hype to the mix? 🤔 Curious to see if it lives up to the promises!

JimmyRamirez
JimmyRamirez 23 de Julho de 2025 à29 05:59:29 WEST

This RAGEN method sounds like a game-changer for AI reliability! Curious how it stacks up against what OpenAI’s cooking. Anyone tried it yet? 🤔

OR