Heim
Alibaba stellt „Qwen-UI-Agent“ vor, ein multimodales Grundmodell für reale Anwendungsfälle
Alibaba hat offiziell „Qwen-UI-Agent“ vorgestellt, ein Grundmodell für GUI-Agenten, das für den Einsatz in realen Umgebungen konzipiert ist. Das Modell deckt mobile, Desktop-, Web- und Deep-Search-Umgebungen ab und geht über herkömmliche Simulationstests hinaus, um nahtlos auf komplexen physischen Geräten zu funktionieren.

Leistung, die die Branchenführer übertrifft
Qwen-UI-Agent hat sowohl in anerkannten Benchmarks als auch in Live-Umgebungen außergewöhnliche Fähigkeiten unter Beweis gestellt:
Leistung im Mobilbereich: Im „MobileWorld“-Benchmark erzielte es beeindruckende 82,1 % und übertraf damit mehrere große internationale Flaggschiff-Modelle. In seinem maßgeschneiderten Benchmark „MobileWorld-Real“, der über 100 reale Geräte umfasst, erreichte die Erfolgsquote 92,2 %, mit nahezu perfekten Ergebnissen bei den „Android Daily“-Aufgaben. Desktop-Leistung: Mit einer Punktzahl von 79,5 % im „OSWorld-Verified“-Test reduzierte das Modell die Anzahl der Ausführungsschritte bei mehreren Aufgaben im Vergleich zu Basismodellen erheblich.Web- und allgemeine Fähigkeiten: Im WebArena-Webtest belegte es unter allen Vergleichsmodellen den ersten Platz. Seine allgemeinen und agentenbasierten Fähigkeiten übertreffen die des Basistrainingsmodells, sodass es Long-Tail-Anfragen mühelos bewältigen kann.Die Lücke zwischen Simulation und Realität schließen
Um die Kluft zwischen Simulation und realer Anwendung zu schließen, nutzt Qwen-UI-Agent eine Live-Mobilumgebung mit über 100 physischen Smartphones und mehr als 150 Anwendungen. Diese Umgebung unterstützt die Erstellung von Aufgaben, die Erfassung von Verlaufsdaten und das Modelltraining. Das Team führte außerdem „MobileWorld-Real“ ein, einen Benchmark mit echten Geräten und über 400 Aufgaben, der eine präzise Modellauswahl auf der Grundlage der tatsächlichen Geräteleistung ermöglicht.

Optimierte Befehle und robuste Sicherheit
Über die üblichen GUI-Funktionen hinaus kann das Modell Befehle direkt über die Befehlszeile ausführen. Durch die Ausgabe von Batch-Aktionen in einer einzigen Entscheidung verkürzt es die Ausführungsabläufe und steigert die Effizienz. Ein umfassender Sicherheitsmechanismus ist in den gesamten Prozess integriert: Das Modell lehnt Aufgaben ab, die unzulässige oder risikoreiche Anfragen beinhalten, und bricht diese ab. Bei sensiblen Aktionen wie Zahlungen, Datenlöschungen oder Datenschutzberechtigungen hält es an kritischen Schritten inne, um auf die Bestätigung des Nutzers zu warten.
Darüber hinaus unterstützt das Modell onlinebasiertes verstärkendes Lernen bei Abläufen mit mehr als 100 Schritten. In Kombination mit adaptivem Curriculum-Lernen verbessert es kontinuierlich seine Fähigkeit, anspruchsvolle langfristige Aufgaben zu bewältigen.
Projekt-Homepage: https://tongyi-mai.github.io/Qwen-UI-Agent/
Verwandter Artikel
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13
Google testet den Remy AI Agent für Gemini, da der Fokus auf die Benutzerkontrolle verlagert wird
Laut Business Insider testet Google Remy, einen neuen KI-Personalagenten für Gemini. Dieses Tool soll Aufgaben im Auftrag von Nutzern ausführen und sowohl professionelle Arbeitsabläufe als auch tägliche Routinen optimieren.Derzeit wird Remy in einer
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)
Alibaba hat offiziell „Qwen-UI-Agent“ vorgestellt, ein Grundmodell für GUI-Agenten, das für den Einsatz in realen Umgebungen konzipiert ist. Das Modell deckt mobile, Desktop-, Web- und Deep-Search-Umgebungen ab und geht über herkömmliche Simulationstests hinaus, um nahtlos auf komplexen physischen Geräten zu funktionieren.

Leistung, die die Branchenführer übertrifft
Qwen-UI-Agent hat sowohl in anerkannten Benchmarks als auch in Live-Umgebungen außergewöhnliche Fähigkeiten unter Beweis gestellt:
Leistung im Mobilbereich: Im „MobileWorld“-Benchmark erzielte es beeindruckende 82,1 % und übertraf damit mehrere große internationale Flaggschiff-Modelle. In seinem maßgeschneiderten Benchmark „MobileWorld-Real“, der über 100 reale Geräte umfasst, erreichte die Erfolgsquote 92,2 %, mit nahezu perfekten Ergebnissen bei den „Android Daily“-Aufgaben. Desktop-Leistung: Mit einer Punktzahl von 79,5 % im „OSWorld-Verified“-Test reduzierte das Modell die Anzahl der Ausführungsschritte bei mehreren Aufgaben im Vergleich zu Basismodellen erheblich.Web- und allgemeine Fähigkeiten: Im WebArena-Webtest belegte es unter allen Vergleichsmodellen den ersten Platz. Seine allgemeinen und agentenbasierten Fähigkeiten übertreffen die des Basistrainingsmodells, sodass es Long-Tail-Anfragen mühelos bewältigen kann.Die Lücke zwischen Simulation und Realität schließen
Um die Kluft zwischen Simulation und realer Anwendung zu schließen, nutzt Qwen-UI-Agent eine Live-Mobilumgebung mit über 100 physischen Smartphones und mehr als 150 Anwendungen. Diese Umgebung unterstützt die Erstellung von Aufgaben, die Erfassung von Verlaufsdaten und das Modelltraining. Das Team führte außerdem „MobileWorld-Real“ ein, einen Benchmark mit echten Geräten und über 400 Aufgaben, der eine präzise Modellauswahl auf der Grundlage der tatsächlichen Geräteleistung ermöglicht.

Optimierte Befehle und robuste Sicherheit
Über die üblichen GUI-Funktionen hinaus kann das Modell Befehle direkt über die Befehlszeile ausführen. Durch die Ausgabe von Batch-Aktionen in einer einzigen Entscheidung verkürzt es die Ausführungsabläufe und steigert die Effizienz. Ein umfassender Sicherheitsmechanismus ist in den gesamten Prozess integriert: Das Modell lehnt Aufgaben ab, die unzulässige oder risikoreiche Anfragen beinhalten, und bricht diese ab. Bei sensiblen Aktionen wie Zahlungen, Datenlöschungen oder Datenschutzberechtigungen hält es an kritischen Schritten inne, um auf die Bestätigung des Nutzers zu warten.
Darüber hinaus unterstützt das Modell onlinebasiertes verstärkendes Lernen bei Abläufen mit mehr als 100 Schritten. In Kombination mit adaptivem Curriculum-Lernen verbessert es kontinuierlich seine Fähigkeit, anspruchsvolle langfristige Aufgaben zu bewältigen.
Projekt-Homepage: https://tongyi-mai.github.io/Qwen-UI-Agent/
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13











