Lar
A Meituan LongCat lança o modelo de provador de teoremas de código aberto LongCat-Flash-Prover
Em 24 de março de 2026, a equipe do Meituan LongCat tornou oficialmente de código aberto um modelo especializado de aprendizado profundo para formalização matemática e demonstração de teoremas: o LongCat-Flash-Prover. Esse modelo supera as limitações dos grandes modelos de linguagem no raciocínio lógico rigoroso, dividindo o raciocínio formal em três capacidades principais: autoformalização, esboço de provas e demonstração final. Isso representa uma mudança de paradigma da “previsão probabilística de respostas” para a “prova lógica verificável”.

Utilizando uma estratégia combinada de Raciocínio Integrado por Ferramentas (TIR), o modelo alcançou uma taxa de aprovação de 97,1% no benchmark MiniF2F-Test com apenas 72 etapas de raciocínio, estabelecendo um novo recorde de ponta para provadores de teoremas de código aberto. Seu desempenho também superou significativamente os modelos de código aberto existentes em benchmarks desafiadores de nível de competição, como MathOlympiad-Bench e PutnamBench.

Tecnicamente, o LongCat-Flash-Prover emprega uma estrutura de “iteração híbrida de especialistas” baseada em TIR. Ao integrar a verificação Lean4Server, verificações de consistência semântica e de teoremas, e verificação de legalidade contra nove tipos de comportamentos fraudulentos, o modelo aborda efetivamente brechas lógicas e enganos de código. Durante o treinamento, a equipe introduziu uma estratégia de mascaramento hierárquico e controle de obsolescência no nível de tokens, melhorando consideravelmente a estabilidade do aprendizado por reforço sob a arquitetura Mixture-of-Experts (MoE).
À medida que o raciocínio da IA evolui do tratamento da ambiguidade da linguagem natural para o trabalho com linguagens formais verificáveis, esses provadores de teoremas estão indo além de simples benchmarks algorítmicos. Eles estão se tornando uma infraestrutura fundamental para a pesquisa científica de ponta. Esse avanço sinaliza uma era de aceleração em que a IA participa profundamente da exploração matemática de fronteira e da verificação automatizada de documentos.
GitHub:
https://github.com/meituan-longcat/LongCat-Flash-Prover
Hugging Face:https://huggingface.co/meituan-longcat/LongCat-Flash-Prover
Relatório:
https://github.com/meituan-longcat/LongCat-Flash-Prover/blob/main/LongCat_Flash_Prover_Technical_Report.pdf
Artigo relacionado
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário
De acordo com o Business Insider, o Google está testando o Remy, um novo agente pessoal de IA para o Gemini. Esta ferramenta tem como objetivo executar tarefas em nome dos usuários, simplificando tanto os fluxos de trabalho profissionais quanto as ro
Recomendações de tópicos especiais relacionados
Comentários (2)
Em 24 de março de 2026, a equipe do Meituan LongCat tornou oficialmente de código aberto um modelo especializado de aprendizado profundo para formalização matemática e demonstração de teoremas: o LongCat-Flash-Prover. Esse modelo supera as limitações dos grandes modelos de linguagem no raciocínio lógico rigoroso, dividindo o raciocínio formal em três capacidades principais: autoformalização, esboço de provas e demonstração final. Isso representa uma mudança de paradigma da “previsão probabilística de respostas” para a “prova lógica verificável”.

Utilizando uma estratégia combinada de Raciocínio Integrado por Ferramentas (TIR), o modelo alcançou uma taxa de aprovação de 97,1% no benchmark MiniF2F-Test com apenas 72 etapas de raciocínio, estabelecendo um novo recorde de ponta para provadores de teoremas de código aberto. Seu desempenho também superou significativamente os modelos de código aberto existentes em benchmarks desafiadores de nível de competição, como MathOlympiad-Bench e PutnamBench.

Tecnicamente, o LongCat-Flash-Prover emprega uma estrutura de “iteração híbrida de especialistas” baseada em TIR. Ao integrar a verificação Lean4Server, verificações de consistência semântica e de teoremas, e verificação de legalidade contra nove tipos de comportamentos fraudulentos, o modelo aborda efetivamente brechas lógicas e enganos de código. Durante o treinamento, a equipe introduziu uma estratégia de mascaramento hierárquico e controle de obsolescência no nível de tokens, melhorando consideravelmente a estabilidade do aprendizado por reforço sob a arquitetura Mixture-of-Experts (MoE).
À medida que o raciocínio da IA evolui do tratamento da ambiguidade da linguagem natural para o trabalho com linguagens formais verificáveis, esses provadores de teoremas estão indo além de simples benchmarks algorítmicos. Eles estão se tornando uma infraestrutura fundamental para a pesquisa científica de ponta. Esse avanço sinaliza uma era de aceleração em que a IA participa profundamente da exploração matemática de fronteira e da verificação automatizada de documentos.
GitHub:
https://github.com/meituan-longcat/LongCat-Flash-Prover
Hugging Face:https://huggingface.co/meituan-longcat/LongCat-Flash-Prover
Relatório:
https://github.com/meituan-longcat/LongCat-Flash-Prover/blob/main/LongCat_Flash_Prover_Technical_Report.pdf
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr











