Heim
Qwen 3.5-Omni bricht mit 215 SOTA-Modellen alle Rekorde und läutet damit das Zeitalter der All-Senses-KI ein
Tongyi Lab hat gestern Abend offiziell das neue multimodale Großmodell Qwen3.5-Omni vorgestellt. Dieses Modell stellt im Vergleich zu seinem Vorgänger einen bedeutenden Fortschritt in den Bereichen Verständnis, Interaktion und Aufgabenausführung dar und wandelt KI von einem „bildschirmgebundenen Assistenten“ in einen „intelligenten Agenten, der die physische Welt versteht“.
Kernfortschritte: Vollmodalität und 215 SOTA-Benchmarks
Qwen3.5-Omni verfügt über eine native „Full-Modality“-Architektur, die es ihm ermöglicht, Text, Bilder, Audio und Video nahtlos zu verarbeiten. In Bewertungen, die audiovisuelle Analyse, Schlussfolgerungen, Dialog und Übersetzung umfassten, erzielte das Modell 215 State-of-the-Art (SOTA)-Ergebnisse. Bemerkenswert ist, dass seine allgemeinen Fähigkeiten zum Verstehen und Erkennen von Audio Modelle wie Gemini-3.1Pro übertroffen haben, während seine visuelle und textuelle Leistung weiterhin auf höchstem Niveau liegt und mit seinem Pendant, dem Qwen3.5-Modell ähnlicher Größenordnung, mithalten kann.

Technische Architektur: Hybrid-Attention MoE
Das Modell baut auf dem klassischen Thinker-Talker-Framework auf, wobei die Architektur grundlegend überarbeitet wurde:
Thinker (Verständniszentrum): Aufgerüstet zu einem Hybrid-Attention Mixture of Experts (MoE), das einen extrem langen Kontext von 256K Tokens unterstützt. Dies ermöglicht die Verarbeitung von bis zu 10 Stunden Audio oder 1 Stunde Video, wobei mithilfe der TMRoPE-Technologie feine Details in langen Sequenzen präzise erfasst werden.
Talker (Ausdruckszentrum): Integriert neue ARIA-Technologie und RVQ-Codierung und ersetzt damit rechenintensive DiT-Prozesse. Dies behebt nicht nur häufige Probleme bei der Audiogenerierung wie das Überspringen von Wörtern und die falsche Aussprache von Zahlen, sondern verleiht dem Modell auch robuste Echtzeit-Sprachsteuerungsfähigkeiten.
Anwendungen in der Praxis: Von Vibe-Codierung bis hin zum Klonen von Stimmen
Die Fähigkeiten von Qwen3.5-Omni ermöglichen mehrere transformative Anwendungsszenarien:
Natürliche, emergente Vibe-Codierung: Das Modell zeigt ohne spezifisches Training ein beeindruckendes Verständnis und eine beeindruckende Generierung von Code, wodurch es Python-Code oder Front-End-Prototypen direkt aus der Videologik erzeugen kann.
Menschenähnliche Echtzeit-Interaktion: Unterstützt semantische Unterbrechungen. Es kann zwischen Hintergrundgeräuschen (wie Husten) und absichtlichen Unterbrechungen unterscheiden, und Benutzer können Tonfall (z. B. „fröhlich“) und Lautstärke über einfache Anweisungen anpassen.
Detaillierte Videoanalyse: Kann strukturierte, mit Zeitstempeln versehene Untertitel generieren und dabei Aktionen, Wechsel der Hintergrundmusik und Kameraübergänge innerhalb von Videos präzise identifizieren.
Personalisiertes Stimmklonen: Benutzer können eine äußerst natürliche, personalisierte „digitale Stimme“ erstellen, indem sie eine kurze Audio-Probe hochladen; dabei werden 113 Sprachen unterstützt.
Qwen3.5-Omni ist ab sofort auf der Alibaba Cloud BaiLian-Plattform in den Versionen Plus, Flash und Light verfügbar. Eine Echtzeit-Dialog-API (Realtime) und eine Demo sind zudem über die ModelScope-Community zugänglich.
Verwandter Artikel
Musk räumt ein, dass Grok-Build Benutzercode geleakt hat, verspricht aber, alle historischen Daten zu löschen
Elon Musk wandte sich direkt an die Datenschutzkontroverse um Grok Build, beginnend mit einem einfachen „True“, um die Gültigkeit des Vorfalls zu bestätigen. Er versprach, dass alle zuvor bei SpaceXAI hochgeladenen Benutzerdaten unwiderruflich gelösc
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13
Empfehlungen zu verwandten Spezialthemen
Kommentare (1)
Tongyi Lab hat gestern Abend offiziell das neue multimodale Großmodell Qwen3.5-Omni vorgestellt. Dieses Modell stellt im Vergleich zu seinem Vorgänger einen bedeutenden Fortschritt in den Bereichen Verständnis, Interaktion und Aufgabenausführung dar und wandelt KI von einem „bildschirmgebundenen Assistenten“ in einen „intelligenten Agenten, der die physische Welt versteht“.
Kernfortschritte: Vollmodalität und 215 SOTA-Benchmarks
Qwen3.5-Omni verfügt über eine native „Full-Modality“-Architektur, die es ihm ermöglicht, Text, Bilder, Audio und Video nahtlos zu verarbeiten. In Bewertungen, die audiovisuelle Analyse, Schlussfolgerungen, Dialog und Übersetzung umfassten, erzielte das Modell 215 State-of-the-Art (SOTA)-Ergebnisse. Bemerkenswert ist, dass seine allgemeinen Fähigkeiten zum Verstehen und Erkennen von Audio Modelle wie Gemini-3.1Pro übertroffen haben, während seine visuelle und textuelle Leistung weiterhin auf höchstem Niveau liegt und mit seinem Pendant, dem Qwen3.5-Modell ähnlicher Größenordnung, mithalten kann.

Technische Architektur: Hybrid-Attention MoE
Das Modell baut auf dem klassischen Thinker-Talker-Framework auf, wobei die Architektur grundlegend überarbeitet wurde:
Thinker (Verständniszentrum): Aufgerüstet zu einem Hybrid-Attention Mixture of Experts (MoE), das einen extrem langen Kontext von 256K Tokens unterstützt. Dies ermöglicht die Verarbeitung von bis zu 10 Stunden Audio oder 1 Stunde Video, wobei mithilfe der TMRoPE-Technologie feine Details in langen Sequenzen präzise erfasst werden.
Talker (Ausdruckszentrum): Integriert neue ARIA-Technologie und RVQ-Codierung und ersetzt damit rechenintensive DiT-Prozesse. Dies behebt nicht nur häufige Probleme bei der Audiogenerierung wie das Überspringen von Wörtern und die falsche Aussprache von Zahlen, sondern verleiht dem Modell auch robuste Echtzeit-Sprachsteuerungsfähigkeiten.
Anwendungen in der Praxis: Von Vibe-Codierung bis hin zum Klonen von Stimmen
Die Fähigkeiten von Qwen3.5-Omni ermöglichen mehrere transformative Anwendungsszenarien:
Natürliche, emergente Vibe-Codierung: Das Modell zeigt ohne spezifisches Training ein beeindruckendes Verständnis und eine beeindruckende Generierung von Code, wodurch es Python-Code oder Front-End-Prototypen direkt aus der Videologik erzeugen kann.
Menschenähnliche Echtzeit-Interaktion: Unterstützt semantische Unterbrechungen. Es kann zwischen Hintergrundgeräuschen (wie Husten) und absichtlichen Unterbrechungen unterscheiden, und Benutzer können Tonfall (z. B. „fröhlich“) und Lautstärke über einfache Anweisungen anpassen.
Detaillierte Videoanalyse: Kann strukturierte, mit Zeitstempeln versehene Untertitel generieren und dabei Aktionen, Wechsel der Hintergrundmusik und Kameraübergänge innerhalb von Videos präzise identifizieren.
Personalisiertes Stimmklonen: Benutzer können eine äußerst natürliche, personalisierte „digitale Stimme“ erstellen, indem sie eine kurze Audio-Probe hochladen; dabei werden 113 Sprachen unterstützt.
Qwen3.5-Omni ist ab sofort auf der Alibaba Cloud BaiLian-Plattform in den Versionen Plus, Flash und Light verfügbar. Eine Echtzeit-Dialog-API (Realtime) und eine Demo sind zudem über die ModelScope-Community zugänglich.
Musk räumt ein, dass Grok-Build Benutzercode geleakt hat, verspricht aber, alle historischen Daten zu löschen
Elon Musk wandte sich direkt an die Datenschutzkontroverse um Grok Build, beginnend mit einem einfachen „True“, um die Gültigkeit des Vorfalls zu bestätigen. Er versprach, dass alle zuvor bei SpaceXAI hochgeladenen Benutzerdaten unwiderruflich gelösc
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13











