Heim
Meituan stellt das KI-Modell „LongCat-Next“ mit einer einheitlichen Architektur für Bildverarbeitung und Spracherkennung vor

Am 3. April stellte das MiTi-Team offiziell das native multimodale Großmodell LongCat-Next vor. Dieses Modell geht über den herkömmlichen Ansatz „Sprachgrundlage plus Plugins“ hinaus, indem es Bilder, Audio und Text in einen einheitlichen Strom diskreter Token umwandelt. Dadurch kann die KI die physische Welt nativ „sehen“ und „hören“ und diese Eingaben genauso verarbeiten wie Text.
Technischer Kern: DiNA-Architektur ermöglicht „Modalitätsinternalisierung“
Um Barrieren zwischen verschiedenen Datentypen zu beseitigen, entwickelte MiTi die DiNA-Architektur (Discrete Native Autoregressive) und erreichte damit eine tiefgreifende Vereinheitlichung in der multimodalen Modellierung:
Vollständige Modalitätsvereinheitlichung: Das Modell verwendet für Text, Bilder und Audio dieselben Parameter, Aufmerksamkeitsmechanismen und Verlustfunktionen.
Symmetrie von Verständnis und Generierung: Innerhalb eines einzigen mathematischen Rahmens stellt die Vorhersage des nächsten Text-Tokens das „Verstehen“ dar, während die Vorhersage eines Bild-Tokens die „Generierung“ ist. Beide Prozesse zeigen während des Trainings erhebliche synergetische Vorteile.
Extreme Komprimierung: Mithilfe des dNaViT Visual Tokenizer verarbeitet es Eingaben in beliebiger Auflösung. Durch einen 8-schichtigen Residual-Vektorquantisierungs-Prozess erreicht es eine bis zu 28-fache Komprimierung im Pixelraum, während wichtige Details für Aufgaben wie OCR und die Analyse von Finanzdokumenten erhalten bleiben.
Empirische Leistung: Diskrete Modellierung kennt keine inhärenten Grenzen
LongCat-Next liefert eine Leistung, die spezialisierte Modelle in mehreren Benchmarks übertrifft, und stellt damit die traditionelle Vorstellung, dass „Diskretisierung unweigerlich zu Informationsverlust führt“, effektiv in Frage:
Fein abgestimmte Wahrnehmung: Auf dem OmniDocBench für Szenarien mit dichtem Text übertrifft es nicht nur Qwen3-Omni, sondern auch das spezialisierte Bildverarbeitungsmodell Qwen3-VL.
Visuelles Schlussfolgern: Es erzielte beeindruckende 83,1 Punkte bei MathVista und demonstrierte damit robustes, industrietaugliches logisches Schlussfolgern.
Modalitätenübergreifende Zusammenarbeit: Unter Beibehaltung führender Sprachfähigkeiten (C-Eval 86,80) unterstützt es die parallele Generierung von Text und Sprache mit geringer Latenz sowie anpassbares Voice Cloning.
Brancheneinblick: Eine Grundlage für KI in der physischen Welt
Große Sprachmodelle haben sich lange Zeit auf Text konzentriert. Der Durchbruch von LongCat-Next besteht darin, dass es beweist, dass Informationen aus der physischen Welt wie Sprache diskretisiert und modelliert werden können. Wenn eine KI über eine einheitliche „Muttersprache“ verfügt, wird sie intelligenter und intuitiver beim Einsatz von Werkzeugen, beim Schreiben von Code oder beim Interpretieren komplexer Diagramme.
MiTi hat nun das LongCat-Next-Modell und den dNaViT-Tokenizer als Open Source veröffentlicht. Diese effiziente, vielversprechende native diskrete Architektur bietet Entwicklern wesentliche Werkzeuge für den Aufbau von KI, die die reale Welt wahrnehmen und mit ihr interagieren kann.
Verwandter Artikel
Suno fügt Wasserzeichen in Songs ein, während Rechtsstreitigkeiten andauern
Suno, die Plattform, die es Nutzern ermöglicht, KI-generierte Musik zu erstellen, hat neue Funktionen vorgestellt, um plattformproduzierte Tracks zu kennzeichnen, Downloads einzuschränken und die Community-Richtlinien zu aktualisieren, um unbefugte K
Musk räumt ein, dass Grok-Build Benutzercode geleakt hat, verspricht aber, alle historischen Daten zu löschen
Elon Musk wandte sich direkt an die Datenschutzkontroverse um Grok Build, beginnend mit einem einfachen „True“, um die Gültigkeit des Vorfalls zu bestätigen. Er versprach, dass alle zuvor bei SpaceXAI hochgeladenen Benutzerdaten unwiderruflich gelösc
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Empfehlungen zu verwandten Spezialthemen
Kommentare (1)
Interesting approach! Unifying vision and speech into a single stream sounds like a step towards more 'native' multimodal understanding, unlike just bolting on separate modules. Makes me wonder how this affects real-time processing efficiency for delivery robots or AR navigation apps. Could be a game-changer for Meituan's on-demand services if it works smoothly in the wild. 🧐

Am 3. April stellte das MiTi-Team offiziell das native multimodale Großmodell LongCat-Next vor. Dieses Modell geht über den herkömmlichen Ansatz „Sprachgrundlage plus Plugins“ hinaus, indem es Bilder, Audio und Text in einen einheitlichen Strom diskreter Token umwandelt. Dadurch kann die KI die physische Welt nativ „sehen“ und „hören“ und diese Eingaben genauso verarbeiten wie Text.
Technischer Kern: DiNA-Architektur ermöglicht „Modalitätsinternalisierung“
Um Barrieren zwischen verschiedenen Datentypen zu beseitigen, entwickelte MiTi die DiNA-Architektur (Discrete Native Autoregressive) und erreichte damit eine tiefgreifende Vereinheitlichung in der multimodalen Modellierung:
Vollständige Modalitätsvereinheitlichung: Das Modell verwendet für Text, Bilder und Audio dieselben Parameter, Aufmerksamkeitsmechanismen und Verlustfunktionen.
Symmetrie von Verständnis und Generierung: Innerhalb eines einzigen mathematischen Rahmens stellt die Vorhersage des nächsten Text-Tokens das „Verstehen“ dar, während die Vorhersage eines Bild-Tokens die „Generierung“ ist. Beide Prozesse zeigen während des Trainings erhebliche synergetische Vorteile.
Extreme Komprimierung: Mithilfe des dNaViT Visual Tokenizer verarbeitet es Eingaben in beliebiger Auflösung. Durch einen 8-schichtigen Residual-Vektorquantisierungs-Prozess erreicht es eine bis zu 28-fache Komprimierung im Pixelraum, während wichtige Details für Aufgaben wie OCR und die Analyse von Finanzdokumenten erhalten bleiben.
Empirische Leistung: Diskrete Modellierung kennt keine inhärenten Grenzen
LongCat-Next liefert eine Leistung, die spezialisierte Modelle in mehreren Benchmarks übertrifft, und stellt damit die traditionelle Vorstellung, dass „Diskretisierung unweigerlich zu Informationsverlust führt“, effektiv in Frage:
Fein abgestimmte Wahrnehmung: Auf dem OmniDocBench für Szenarien mit dichtem Text übertrifft es nicht nur Qwen3-Omni, sondern auch das spezialisierte Bildverarbeitungsmodell Qwen3-VL.
Visuelles Schlussfolgern: Es erzielte beeindruckende 83,1 Punkte bei MathVista und demonstrierte damit robustes, industrietaugliches logisches Schlussfolgern.
Modalitätenübergreifende Zusammenarbeit: Unter Beibehaltung führender Sprachfähigkeiten (C-Eval 86,80) unterstützt es die parallele Generierung von Text und Sprache mit geringer Latenz sowie anpassbares Voice Cloning.
Brancheneinblick: Eine Grundlage für KI in der physischen Welt
Große Sprachmodelle haben sich lange Zeit auf Text konzentriert. Der Durchbruch von LongCat-Next besteht darin, dass es beweist, dass Informationen aus der physischen Welt wie Sprache diskretisiert und modelliert werden können. Wenn eine KI über eine einheitliche „Muttersprache“ verfügt, wird sie intelligenter und intuitiver beim Einsatz von Werkzeugen, beim Schreiben von Code oder beim Interpretieren komplexer Diagramme.
MiTi hat nun das LongCat-Next-Modell und den dNaViT-Tokenizer als Open Source veröffentlicht. Diese effiziente, vielversprechende native diskrete Architektur bietet Entwicklern wesentliche Werkzeuge für den Aufbau von KI, die die reale Welt wahrnehmen und mit ihr interagieren kann.
Suno fügt Wasserzeichen in Songs ein, während Rechtsstreitigkeiten andauern
Suno, die Plattform, die es Nutzern ermöglicht, KI-generierte Musik zu erstellen, hat neue Funktionen vorgestellt, um plattformproduzierte Tracks zu kennzeichnen, Downloads einzuschränken und die Community-Richtlinien zu aktualisieren, um unbefugte K
Musk räumt ein, dass Grok-Build Benutzercode geleakt hat, verspricht aber, alle historischen Daten zu löschen
Elon Musk wandte sich direkt an die Datenschutzkontroverse um Grok Build, beginnend mit einem einfachen „True“, um die Gültigkeit des Vorfalls zu bestätigen. Er versprach, dass alle zuvor bei SpaceXAI hochgeladenen Benutzerdaten unwiderruflich gelösc
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Interesting approach! Unifying vision and speech into a single stream sounds like a step towards more 'native' multimodal understanding, unlike just bolting on separate modules. Makes me wonder how this affects real-time processing efficiency for delivery robots or AR navigation apps. Could be a game-changer for Meituan's on-demand services if it works smoothly in the wild. 🧐











