Heim
Meituan LongCat stellt das Open-Source-Theorembeweismodell „LongCat-Flash-Prover“ vor
Am 24. März 2026 hat das Meituan LongCat-Team ein spezielles Deep-Learning-Modell für die mathematische Formalisierung und den Theorembeweis offiziell als Open Source veröffentlicht: LongCat-Flash-Prover. Dieses Modell überwindet die Grenzen großer Sprachmodelle beim strengen logischen Schlussfolgern, indem es das formale Schlussfolgern in drei Kernfunktionen unterteilt: automatische Formalisierung, Beweisskizzierung und endgültiger Beweis. Es stellt einen Paradigmenwechsel von der „probabilistischen Antwortvorhersage“ hin zum „überprüfbaren logischen Beweis“ dar.

Unter Verwendung einer kombinierten TIR-Strategie (Tool-Integrated Reasoning) erreichte das Modell eine Erfolgsquote von 97,1 % beim MiniF2F-Test-Benchmark mit nur 72 Schlussfolgerungsschritten und stellte damit einen neuen Stand-of-the-Art-Rekord für Open-Source-Theorembeweiser auf. Seine Leistung übertraf zudem bestehende Open-Source-Modelle bei anspruchsvollen Benchmarks auf Wettbewerbsniveau wie MathOlympiad-Bench und PutnamBench deutlich.

Technisch gesehen nutzt LongCat-Flash-Prover ein TIR-basiertes „Hybrid-Expert-Iteration“-Framework. Durch die Integration von Lean4Server-Verifikation, semantischen und Theoremen-Konsistenzprüfungen sowie einer Legalitätsprüfung gegen neun Arten von Betrugsverhalten geht das Modell logischen Lücken und Code-Täuschungen wirksam entgegen. Während des Trainings führte das Team eine hierarchische Maskierungsstrategie und eine Verfallsprüfung auf Token-Ebene ein, wodurch die Stabilität des verstärkenden Lernens unter der Mixture-of-Experts (MoE)-Architektur erheblich verbessert wurde.
Da sich das KI-Schlussfolgern von der Verarbeitung natürlicher Sprachmehrdeutigkeiten hin zur Arbeit mit verifizierbaren formalen Sprachen entwickelt, gehen solche Theorembeweiser über einfache algorithmische Benchmarks hinaus. Sie werden zu einer grundlegenden Infrastruktur für die wissenschaftliche Kernforschung. Dieser Durchbruch läutet eine Ära der Beschleunigung ein, in der KI tiefgreifend an der Erforschung mathematischer Grenzgebiete und der automatisierten Dokumentenverifizierung beteiligt ist.
GitHub:
https://github.com/meituan-longcat/LongCat-Flash-Prover
Hugging Face:https://huggingface.co/meituan-longcat/LongCat-Flash-Prover
Bericht:
https://github.com/meituan-longcat/LongCat-Flash-Prover/blob/main/LongCat_Flash_Prover_Technical_Report.pdf
Verwandter Artikel
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13
Google testet den Remy AI Agent für Gemini, da der Fokus auf die Benutzerkontrolle verlagert wird
Laut Business Insider testet Google Remy, einen neuen KI-Personalagenten für Gemini. Dieses Tool soll Aufgaben im Auftrag von Nutzern ausführen und sowohl professionelle Arbeitsabläufe als auch tägliche Routinen optimieren.Derzeit wird Remy in einer
Empfehlungen zu verwandten Spezialthemen
Kommentare (2)
Am 24. März 2026 hat das Meituan LongCat-Team ein spezielles Deep-Learning-Modell für die mathematische Formalisierung und den Theorembeweis offiziell als Open Source veröffentlicht: LongCat-Flash-Prover. Dieses Modell überwindet die Grenzen großer Sprachmodelle beim strengen logischen Schlussfolgern, indem es das formale Schlussfolgern in drei Kernfunktionen unterteilt: automatische Formalisierung, Beweisskizzierung und endgültiger Beweis. Es stellt einen Paradigmenwechsel von der „probabilistischen Antwortvorhersage“ hin zum „überprüfbaren logischen Beweis“ dar.

Unter Verwendung einer kombinierten TIR-Strategie (Tool-Integrated Reasoning) erreichte das Modell eine Erfolgsquote von 97,1 % beim MiniF2F-Test-Benchmark mit nur 72 Schlussfolgerungsschritten und stellte damit einen neuen Stand-of-the-Art-Rekord für Open-Source-Theorembeweiser auf. Seine Leistung übertraf zudem bestehende Open-Source-Modelle bei anspruchsvollen Benchmarks auf Wettbewerbsniveau wie MathOlympiad-Bench und PutnamBench deutlich.

Technisch gesehen nutzt LongCat-Flash-Prover ein TIR-basiertes „Hybrid-Expert-Iteration“-Framework. Durch die Integration von Lean4Server-Verifikation, semantischen und Theoremen-Konsistenzprüfungen sowie einer Legalitätsprüfung gegen neun Arten von Betrugsverhalten geht das Modell logischen Lücken und Code-Täuschungen wirksam entgegen. Während des Trainings führte das Team eine hierarchische Maskierungsstrategie und eine Verfallsprüfung auf Token-Ebene ein, wodurch die Stabilität des verstärkenden Lernens unter der Mixture-of-Experts (MoE)-Architektur erheblich verbessert wurde.
Da sich das KI-Schlussfolgern von der Verarbeitung natürlicher Sprachmehrdeutigkeiten hin zur Arbeit mit verifizierbaren formalen Sprachen entwickelt, gehen solche Theorembeweiser über einfache algorithmische Benchmarks hinaus. Sie werden zu einer grundlegenden Infrastruktur für die wissenschaftliche Kernforschung. Dieser Durchbruch läutet eine Ära der Beschleunigung ein, in der KI tiefgreifend an der Erforschung mathematischer Grenzgebiete und der automatisierten Dokumentenverifizierung beteiligt ist.
GitHub:
https://github.com/meituan-longcat/LongCat-Flash-Prover
Hugging Face:https://huggingface.co/meituan-longcat/LongCat-Flash-Prover
Bericht:
https://github.com/meituan-longcat/LongCat-Flash-Prover/blob/main/LongCat_Flash_Prover_Technical_Report.pdf
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13











