Heim
TIPSv2 von Google DeepMind: Eine KI, die Bilder wirklich versteht und nicht nur flüchtig betrachtet
Das Bildverständnis durch KI weist derzeit eine wesentliche Einschränkung auf.
Auf die Frage „Was ist auf diesem Bild zu sehen?“ kann es eine detaillierte Antwort geben. Die Frage „Wo befindet sich das linke Hinterbein des Pandas?“ führt jedoch zu vagen Antworten. Dies ist kein Fehler eines bestimmten Modells, sondern ein hartnäckiges Problem im gesamten Bereich der großen visuell-sprachlichen Modelle: starkes globales Verständnis, aber schwache lokale Lokalisierung.
Google DeepMind hat in seiner neuesten Veröffentlichung TIPSv2 vorgestellt, das speziell zur Lösung dieses schwierigen Problems entwickelt wurde.

Das Forschungsteam machte eine kontraintuitive Beobachtung: Bei feinmaschigen Segmentierungsaufgaben schneiden kleinere „Schüler“-Modelle häufig besser ab als größere „Lehrer“-Modelle. Dies geschieht, weil durch die Destillation der Maskierungsmechanismus entfernt wird, wodurch das Modell gezwungen ist, jedes Detail des gesamten Bildes zu lernen, was eine Form der „Vollbereichsüberwachung“ schafft. Motiviert durch diese Erkenntnis führte TIPSv2 drei wesentliche Verbesserungen ein.
Erstens: iBOT++. Bei herkömmlichem Vortraining wird der Verlust nur für maskierte Bereiche berechnet, wodurch sichtbare Bereiche vernachlässigt werden, was zu einer Abweichung der lokalen Semantik führt. iBOT++ verlangt vom Modell eine präzise Überwachung aller sichtbaren Bereiche und wertet die Aufgabe damit effektiv von einem „Puzzlespiel“ zu einem „sorgfältigen Lesen des gesamten Textes“ auf. Diese einzelne Verbesserung steigerte die Zero-Shot-Segmentationsleistung um 14,1 Prozentpunkte.
Zweitens: Head-only EMA. Herkömmliches selbstüberwachtes Training erfordert, zwei nahezu identische große Modelle im Speicher zu halten, was sehr ressourcenintensiv ist. TIPSv2 hat herausgefunden, dass der bild-text-kontrastive Verlust allein ausreicht, um das Backbone-Netzwerk zu stabilisieren, sodass EMA nur auf den finalen Projektionskopf angewendet werden muss, wodurch die Notwendigkeit entfällt, das Backbone zu duplizieren. Dies reduziert die Anzahl der Trainingsparameter um etwa 42 % und beschleunigt den Prozess fast ohne Leistungseinbußen.
Drittens: Textpaarung mit mehreren Granularitätsstufen. Während des Trainings werden kurze Webbeschreibungen, mitteldetailierte Beschreibungen und lange Beschreibungen, die von Gemini generiert wurden, zufällig gemischt und dem Modell zugeführt, wobei zwischen einfachen und schwierigen Aufgaben abgewechselt wird. Dies verhindert, dass sich das Modell bei einfachen Aufgaben ausruht, und stellt gleichzeitig sicher, dass keine Details übersehen werden.
Die Endergebnisse sind überzeugend. TIPSv2 wurde einer Frozen-Evaluation über neun Aufgaben und 20 maßgebliche Datensätze unterzogen. Die Zero-Shot-Semantiksegmentierung erreichte einen neuen Branchen-Benchmark, während die Bild-Text-Suche und -Klassifizierung Vergleichsmodelle mit 56 % mehr Parametern übertraf. Auch rein visuelle Aufgaben gehörten zu den Spitzenreitern.
Der Code und die Modellgewichte für TIPSv2 sind vollständig als Open Source verfügbar. Für Teams, die in den Bereichen medizinische Bildgebung, autonomes Fahren, industrielle Inspektion und anderen Domänen arbeiten, die ein hochpräzises Bildverständnis erfordern, ist diese Lösung einen genauen Blick wert.
Artikel: https://www.alphaxiv.org/abs/2604.12012
Verwandter Artikel
Suno fügt Wasserzeichen in Songs ein, während Rechtsstreitigkeiten andauern
Suno, die Plattform, die es Nutzern ermöglicht, KI-generierte Musik zu erstellen, hat neue Funktionen vorgestellt, um plattformproduzierte Tracks zu kennzeichnen, Downloads einzuschränken und die Community-Richtlinien zu aktualisieren, um unbefugte K
Musk räumt ein, dass Grok-Build Benutzercode geleakt hat, verspricht aber, alle historischen Daten zu löschen
Elon Musk wandte sich direkt an die Datenschutzkontroverse um Grok Build, beginnend mit einem einfachen „True“, um die Gültigkeit des Vorfalls zu bestätigen. Er versprach, dass alle zuvor bei SpaceXAI hochgeladenen Benutzerdaten unwiderruflich gelösc
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)
Das Bildverständnis durch KI weist derzeit eine wesentliche Einschränkung auf.
Auf die Frage „Was ist auf diesem Bild zu sehen?“ kann es eine detaillierte Antwort geben. Die Frage „Wo befindet sich das linke Hinterbein des Pandas?“ führt jedoch zu vagen Antworten. Dies ist kein Fehler eines bestimmten Modells, sondern ein hartnäckiges Problem im gesamten Bereich der großen visuell-sprachlichen Modelle: starkes globales Verständnis, aber schwache lokale Lokalisierung.
Google DeepMind hat in seiner neuesten Veröffentlichung TIPSv2 vorgestellt, das speziell zur Lösung dieses schwierigen Problems entwickelt wurde.

Das Forschungsteam machte eine kontraintuitive Beobachtung: Bei feinmaschigen Segmentierungsaufgaben schneiden kleinere „Schüler“-Modelle häufig besser ab als größere „Lehrer“-Modelle. Dies geschieht, weil durch die Destillation der Maskierungsmechanismus entfernt wird, wodurch das Modell gezwungen ist, jedes Detail des gesamten Bildes zu lernen, was eine Form der „Vollbereichsüberwachung“ schafft. Motiviert durch diese Erkenntnis führte TIPSv2 drei wesentliche Verbesserungen ein.
Erstens: iBOT++. Bei herkömmlichem Vortraining wird der Verlust nur für maskierte Bereiche berechnet, wodurch sichtbare Bereiche vernachlässigt werden, was zu einer Abweichung der lokalen Semantik führt. iBOT++ verlangt vom Modell eine präzise Überwachung aller sichtbaren Bereiche und wertet die Aufgabe damit effektiv von einem „Puzzlespiel“ zu einem „sorgfältigen Lesen des gesamten Textes“ auf. Diese einzelne Verbesserung steigerte die Zero-Shot-Segmentationsleistung um 14,1 Prozentpunkte.
Zweitens: Head-only EMA. Herkömmliches selbstüberwachtes Training erfordert, zwei nahezu identische große Modelle im Speicher zu halten, was sehr ressourcenintensiv ist. TIPSv2 hat herausgefunden, dass der bild-text-kontrastive Verlust allein ausreicht, um das Backbone-Netzwerk zu stabilisieren, sodass EMA nur auf den finalen Projektionskopf angewendet werden muss, wodurch die Notwendigkeit entfällt, das Backbone zu duplizieren. Dies reduziert die Anzahl der Trainingsparameter um etwa 42 % und beschleunigt den Prozess fast ohne Leistungseinbußen.
Drittens: Textpaarung mit mehreren Granularitätsstufen. Während des Trainings werden kurze Webbeschreibungen, mitteldetailierte Beschreibungen und lange Beschreibungen, die von Gemini generiert wurden, zufällig gemischt und dem Modell zugeführt, wobei zwischen einfachen und schwierigen Aufgaben abgewechselt wird. Dies verhindert, dass sich das Modell bei einfachen Aufgaben ausruht, und stellt gleichzeitig sicher, dass keine Details übersehen werden.
Die Endergebnisse sind überzeugend. TIPSv2 wurde einer Frozen-Evaluation über neun Aufgaben und 20 maßgebliche Datensätze unterzogen. Die Zero-Shot-Semantiksegmentierung erreichte einen neuen Branchen-Benchmark, während die Bild-Text-Suche und -Klassifizierung Vergleichsmodelle mit 56 % mehr Parametern übertraf. Auch rein visuelle Aufgaben gehörten zu den Spitzenreitern.
Der Code und die Modellgewichte für TIPSv2 sind vollständig als Open Source verfügbar. Für Teams, die in den Bereichen medizinische Bildgebung, autonomes Fahren, industrielle Inspektion und anderen Domänen arbeiten, die ein hochpräzises Bildverständnis erfordern, ist diese Lösung einen genauen Blick wert.
Artikel: https://www.alphaxiv.org/abs/2604.12012
Suno fügt Wasserzeichen in Songs ein, während Rechtsstreitigkeiten andauern
Suno, die Plattform, die es Nutzern ermöglicht, KI-generierte Musik zu erstellen, hat neue Funktionen vorgestellt, um plattformproduzierte Tracks zu kennzeichnen, Downloads einzuschränken und die Community-Richtlinien zu aktualisieren, um unbefugte K
Musk räumt ein, dass Grok-Build Benutzercode geleakt hat, verspricht aber, alle historischen Daten zu löschen
Elon Musk wandte sich direkt an die Datenschutzkontroverse um Grok Build, beginnend mit einem einfachen „True“, um die Gültigkeit des Vorfalls zu bestätigen. Er versprach, dass alle zuvor bei SpaceXAI hochgeladenen Benutzerdaten unwiderruflich gelösc
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek











