Lar
A Bailing Team faz parceria com a AReno para criar um ciclo de aprendizado por reforço com um agente de IA local
A capacidade de implantação local não garante o tratamento contínuo de cenários de negócios do mundo real. Em fluxos de trabalho complexos, a IA deve fazer mais do que apenas conversar; ela precisa interpretar regras complexas, respeitar restrições de segurança e utilizar ferramentas externas com precisão para gerar resultados em conformidade. Para resolver esse desafio, a equipe do Ant ASystem e a comunidade de código aberto desenvolveram o AReno, um kit de ferramentas para pós-treinamento de grandes modelos em ambiente local. Recentemente, o AReno foi integrado ao grande modelo BaiLing para estabelecer um fluxo de trabalho leve de pós-treinamento, criando com sucesso um ciclo de Aprendizado por Reforço (RL) Agente-centrado em uma configuração de máquina única.
Para garantir a reprodutibilidade técnica, o jogo da velha foi selecionado como tarefa de validação devido às suas regras claras e ao feedback imediato. O experimento foi executado no hardware DGX Spark, realizando o pós-treinamento no modelo Ling-3.0-tiny (7,9 bilhões de parâmetros no total, 1,3 bilhão ativos). Inicialmente, o modelo compreendia as regras básicas, mas fazia jogadas ilegais. Ao converter as regras da tarefa em um mecanismo preciso de feedback de recompensa e treinar por 400 passos usando o algoritmo GSPO, a recompensa média do modelo aumentou significativamente, e o comprimento da saída se estabilizou. Testes subsequentes confirmaram um salto qualitativo na estabilidade e na racionalidade do modelo no que diz respeito à invocação de ferramentas e à seleção de ações.

Essa exploração valida uma metodologia de adaptação de tarefas transparente e reproduzível: identificar erros, definir feedback verificável e executar treinamento local e novos testes no mesmo ambiente. Essa estrutura vai além dos experimentos com xadrez, aplicando-se perfeitamente a cenários reais de produção, como reparos por chamada de ferramentas, extração estruturada de campos, seguimento de instruções específicas de domínio e agentes inteligentes em processos de negócios.
O Ling-3.0-tiny está disponível em várias versões de código aberto, incluindo BF16, FP8 e INT4. Os desenvolvedores podem acessar esses modelos por meio do Hugging Face ou da Comunidade Moka. Além disso, o repositório de código aberto AReno está disponível para contribuições de código e discussões técnicas.
Artigo relacionado
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário
De acordo com o Business Insider, o Google está testando o Remy, um novo agente pessoal de IA para o Gemini. Esta ferramenta tem como objetivo executar tarefas em nome dos usuários, simplificando tanto os fluxos de trabalho profissionais quanto as ro
Recomendações de tópicos especiais relacionados
Comentários (2)
ローカルデプロイでも実務は甘くないよな。単なるチャットボットじゃダメで、複雑なルール解釈やセキュリティ制約、外部ツール連携までこなせるのが真のAIだ。BailingとARenoの取り組みは的を得ていると思う。
A capacidade de implantação local não garante o tratamento contínuo de cenários de negócios do mundo real. Em fluxos de trabalho complexos, a IA deve fazer mais do que apenas conversar; ela precisa interpretar regras complexas, respeitar restrições de segurança e utilizar ferramentas externas com precisão para gerar resultados em conformidade. Para resolver esse desafio, a equipe do Ant ASystem e a comunidade de código aberto desenvolveram o AReno, um kit de ferramentas para pós-treinamento de grandes modelos em ambiente local. Recentemente, o AReno foi integrado ao grande modelo BaiLing para estabelecer um fluxo de trabalho leve de pós-treinamento, criando com sucesso um ciclo de Aprendizado por Reforço (RL) Agente-centrado em uma configuração de máquina única.
Para garantir a reprodutibilidade técnica, o jogo da velha foi selecionado como tarefa de validação devido às suas regras claras e ao feedback imediato. O experimento foi executado no hardware DGX Spark, realizando o pós-treinamento no modelo Ling-3.0-tiny (7,9 bilhões de parâmetros no total, 1,3 bilhão ativos). Inicialmente, o modelo compreendia as regras básicas, mas fazia jogadas ilegais. Ao converter as regras da tarefa em um mecanismo preciso de feedback de recompensa e treinar por 400 passos usando o algoritmo GSPO, a recompensa média do modelo aumentou significativamente, e o comprimento da saída se estabilizou. Testes subsequentes confirmaram um salto qualitativo na estabilidade e na racionalidade do modelo no que diz respeito à invocação de ferramentas e à seleção de ações.

Essa exploração valida uma metodologia de adaptação de tarefas transparente e reproduzível: identificar erros, definir feedback verificável e executar treinamento local e novos testes no mesmo ambiente. Essa estrutura vai além dos experimentos com xadrez, aplicando-se perfeitamente a cenários reais de produção, como reparos por chamada de ferramentas, extração estruturada de campos, seguimento de instruções específicas de domínio e agentes inteligentes em processos de negócios.
O Ling-3.0-tiny está disponível em várias versões de código aberto, incluindo BF16, FP8 e INT4. Os desenvolvedores podem acessar esses modelos por meio do Hugging Face ou da Comunidade Moka. Além disso, o repositório de código aberto AReno está disponível para contribuições de código e discussões técnicas.
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
ローカルデプロイでも実務は甘くないよな。単なるチャットボットじゃダメで、複雑なルール解釈やセキュリティ制約、外部ツール連携までこなせるのが真のAIだ。BailingとARenoの取り組みは的を得ていると思う。











