Option
Heim
Nachricht
Meta FAIR stellt fünf bahnbrechende Fortschritte bei der menschenähnlichen KI vor

Meta FAIR stellt fünf bahnbrechende Fortschritte bei der menschenähnlichen KI vor

28. Dezember 2025
225

Das Fundamental AI Research (FAIR)-Team von Meta hat fünf neue Projekte vorgestellt, die seine Arbeit im Bereich der fortgeschrittenen maschinellen Intelligenz (AMI) vorantreiben.

Diese neuesten Veröffentlichungen konzentrieren sich auf die Verbesserung der KI-Wahrnehmung – also darauf, wie Maschinen sensorische Eingaben verarbeiten – sowie auf Fortschritte in den Bereichen Sprachmodelle, Robotik und kollaborative KI-Agenten.

Meta erklärte, sein Ziel sei es, Maschinen zu bauen, „die in der Lage sind, sensorische Daten aus unserer Welt zu erfassen, zu verarbeiten und zu interpretieren und diese Informationen zu nutzen, um Entscheidungen mit menschenähnlicher Intelligenz und Geschwindigkeit zu treffen“.

Die fünf neuen Initiativen stellen eine Reihe miteinander verbundener Bemühungen dar, um dieses ehrgeizige Ziel zu erreichen.

Perception Encoder: Schärfung der visuellen Intelligenz der KI

Ein Eckpfeiler der neuen Veröffentlichungen ist der Perception Encoder, ein groß angelegter Bildkodierer, der für außergewöhnliche Leistungen bei verschiedenen Bild- und Videotask entwickelt wurde.

Vision Encoder fungieren als „Augen“ von KI-Systemen und ermöglichen ihnen, visuelle Informationen zu erfassen.

Meta weist auf die wachsende Schwierigkeit hin, Encoder für fortschrittliche KI zu entwickeln, die Vision mit Sprache verbinden, sowohl Bilder als auch Videos kompetent verarbeiten und unter schwierigen Bedingungen, einschließlich gegnerischer Angriffe, zuverlässig bleiben müssen.

Laut Meta sollte der ideale Encoder ein breites Spektrum an Konzepten erkennen und gleichzeitig feine Details wahrnehmen – wie beispielsweise „ein unter dem Meeresboden verstecktes Stachelrochen, einen kleinen Stieglitz im Hintergrund eines Bildes oder ein sich schnell bewegendes Agouti auf einer Nachtsichtkamera für Wildtiere”.

Meta gibt an, dass der Perception Encoder „hervorragende Leistungen bei der Zero-Shot-Bild- und Videoklassifizierung und -wiederauffindung erbringt und alle aktuellen Open-Source- und proprietären Modelle für diese Aufgaben übertrifft“.

Darüber hinaus verbessern seine Wahrnehmungsfähigkeiten Berichten zufolge die Leistung bei Sprachaufgaben.

In Kombination mit einem großen Sprachmodell (LLM) soll der Encoder andere Bild-Encoder in Bereichen wie visueller Fragebeantwortung (VQA), Untertitelung, Dokumentenverständnis und Grounding (Verknüpfung von Text mit bestimmten Teilen eines Bildes) übertreffen. Berichten zufolge verbessert er auch die Leistung bei Aufgaben, mit denen LLMs normalerweise Schwierigkeiten haben, wie z. B. dem Verstehen räumlicher Beziehungen (z. B. „wenn sich ein Objekt hinter einem anderen befindet“) oder der Kamerabewegung relativ zu einem Objekt.

„Da der Perception Encoder nun in neue Anwendungen integriert wird, sind wir gespannt, wie seine fortschrittlichen visuellen Fähigkeiten noch komplexere KI-Systeme unterstützen werden“, kommentierte Meta.

Perception Language Model (PLM): Fortschritte in der offenen Bild-Sprache-Forschung

Zusammen mit dem Encoder arbeitet das Perception Language Model (PLM), ein offenes und reproduzierbares Vision-Language-Modell, das für komplexe visuelle Erkennungsaufgaben entwickelt wurde.

PLM wurde unter Verwendung umfangreicher synthetischer Daten sowie offener Bild-Sprache-Datensätze trainiert, wobei bewusst auf Wissen aus externen proprietären Modellen verzichtet wurde.

In Anbetracht der Mängel bestehender Daten zum Verständnis von Videos stellte das FAIR-Team 2,5 Millionen neue, von Menschen gekennzeichnete Beispiele zusammen, die sich auf detaillierte Video-Fragenbeantwortung und zeitlich-räumliche Untertitelung konzentrieren. Meta behauptet, dies sei der „bislang größte Datensatz seiner Art“.

PLM ist in Versionen mit 1, 3 und 8 Milliarden Parametern verfügbar, um den Anforderungen der akademischen Forschung gerecht zu werden, die vollständige Transparenz erfordert.

Zusammen mit den Modellen veröffentlicht Meta PLM-VideoBench, einen neuen Benchmark, der speziell entwickelt wurde, um Fähigkeiten zu testen, die von bestehenden Benchmarks oft übersehen werden, nämlich „fein abgestimmtes Verständnis von Aktivitäten und räumlich-zeitlich fundiertes Denken”.

Meta hofft, dass die Bereitstellung offener Modelle, eines großen Datensatzes und eines anspruchsvollen Benchmarks die Open-Source-Community stärken wird.

Meta Locate 3D: Roboter mit Situationsbewusstsein ausstatten

Meta Locate 3D schlägt eine Brücke zwischen Sprachbefehlen und physischen Aktionen. Dieses End-to-End-Modell wurde entwickelt, um Robotern zu ermöglichen, Objekte in einem 3D-Raum auf der Grundlage von offenen Abfragen in natürlicher Sprache genau zu finden.

Meta Locate 3D verarbeitet 3D-Punktwolken direkt von RGB-D-Sensoren (wie sie in einigen Robotern oder Tiefenkameras zu finden sind). Bei einer Textanweisung wie „Blumenvase in der Nähe der TV-Konsole“ analysiert das System räumliche Beziehungen und den Kontext, um das richtige Objekt zu identifizieren und es beispielsweise von einer „Vase auf dem Tisch“ zu unterscheiden.

Das System besteht aus drei Hauptkomponenten: einem Vorverarbeitungsschritt, der 2D-Merkmale in 3D-Punktwolken mit Merkmalen umwandelt; dem 3D-JEPA-Encoder (ein vortrainiertes Modell, das eine kontextualisierte 3D-Weltdarstellung erstellt); und dem Locate 3D-Decoder, der die 3D-Darstellung und die Sprachabfrage verwendet, um Begrenzungsrahmen und Masken für die angegebenen Objekte zu generieren.

Neben dem Modell veröffentlicht Meta einen umfangreichen neuen Datensatz für die Objektlokalisierung auf der Grundlage von Referenzausdrücken. Er umfasst 130.000 Sprachanmerkungen in 1.346 Szenen aus den Datensätzen ARKitScenes, ScanNet und ScanNet++ und verdoppelt damit effektiv die vorhandenen annotierten Daten in diesem Bereich.

Meta betrachtet diese Technologie als unverzichtbar für die Entwicklung leistungsfähigerer Robotersysteme, darunter auch das eigene PARTNR-Roboterprojekt, das eine natürlichere Interaktion und Zusammenarbeit zwischen Mensch und Roboter ermöglicht.

Dynamic Byte Latent Transformer: Effiziente und robuste Sprachmodellierung

Nach einer Ende 2024 veröffentlichten Studie veröffentlicht Meta nun die Modellgewichte für seinen Dynamic Byte Latent Transformer mit 8 Milliarden Parametern.

Diese Architektur unterscheidet sich von traditionellen tokenbasierten Sprachmodellen und arbeitet direkt auf Byte-Ebene. Meta behauptet, dass diese Methode eine ähnliche Leistung in großem Maßstab erzielt und gleichzeitig erhebliche Vorteile in Bezug auf Inferenz-Effizienz und Robustheit bietet.

Herkömmliche LLMs teilen Text in „Token” auf, was zu Problemen mit Rechtschreibfehlern, neuen Wörtern oder feindlichen Eingaben führen kann. Modelle auf Byte-Ebene verarbeiten Rohbytes und bieten damit potenziell eine größere Widerstandsfähigkeit.

Meta berichtet, dass der Dynamic Byte Latent Transformer „Tokenizer-basierte Modelle bei verschiedenen Aufgaben übertrifft und einen durchschnittlichen Robustheitsvorteil von +7 Punkten (bei gestörtem HellaSwag) aufweist und bei Aufgaben aus dem CUTE-Token-Verständnis-Benchmark bis zu +55 Punkte erreicht”.

Durch die Veröffentlichung der Gewichte zusammen mit der zuvor geteilten Codebasis ermutigt Meta die Forschungsgemeinschaft, diesen alternativen Ansatz zur Sprachmodellierung zu untersuchen.

Collaborative Reasoner: Weiterentwicklung sozial intelligenter KI-Agenten

Die letzte Veröffentlichung, Collaborative Reasoner, befasst sich mit der komplexen Herausforderung, KI-Agenten zu entwickeln, die effektiv mit Menschen oder anderen KIs zusammenarbeiten können.

Meta stellt fest, dass die Zusammenarbeit mit Menschen oft zu besseren Ergebnissen führt, und möchte KI mit ähnlichen Fähigkeiten für Aufgaben wie die Unterstützung bei Hausaufgaben oder die Vorbereitung auf ein Vorstellungsgespräch ausstatten.

Eine solche Zusammenarbeit erfordert nicht nur Problemlösungsfähigkeiten, sondern auch soziale Kompetenzen wie Kommunikation, Empathie, Feedback geben und das Verstehen der Perspektiven anderer (Theorie des Geistes), die sich in der Regel über mehrere Gesprächsrunden hinweg entfalten.

Aktuelle LLM-Trainings- und Bewertungsmethoden übersehen oft diese sozialen und kollaborativen Dimensionen. Darüber hinaus ist das Sammeln relevanter Gesprächsdaten kostspielig und schwierig.

Collaborative Reasoner bietet einen Rahmen zur Bewertung und Verbesserung dieser Fähigkeiten. Es umfasst zielorientierte Aufgaben, die mehrstufiges Denken erfordern, das durch den Dialog zwischen zwei Agenten erreicht wird. Der Rahmen testet Fähigkeiten wie konstruktive Meinungsverschiedenheiten, Überzeugungskraft und das Erreichen einer für beide Seiten optimalen Lösung.

Die Bewertungen von Meta zeigten, dass aktuelle Modelle oft nicht in der Lage sind, Zusammenarbeit konsequent zur Verbesserung der Ergebnisse zu nutzen. Um dieses Problem anzugehen, schlagen sie eine Selbstverbesserungstechnik vor, bei der ein LLM-Agent mit sich selbst zusammenarbeitet und synthetische Interaktionsdaten verwendet werden.

Die Generierung dieser Daten in großem Maßstab wird durch eine neue leistungsstarke Modell-Serving-Engine namens Matrix ermöglicht. Die Anwendung dieser Methode auf mathematische, wissenschaftliche und soziale Denkaufgaben führte Berichten zufolge zu Verbesserungen von bis zu 29,4 % im Vergleich zur Standardleistung einer einzelnen LLM nach dem „Chain-of-Thought”-Prinzip.

Durch die Open-Source-Veröffentlichung der Datenerzeugungs- und Modellierungspipeline will Meta die Forschung zur Entwicklung wirklich „sozialer Agenten, die mit Menschen und anderen Agenten zusammenarbeiten können” beschleunigen.

Zusammen unterstreichen diese fünf Veröffentlichungen die anhaltenden erheblichen Investitionen von Meta in die grundlegende KI-Forschung, insbesondere in die Schaffung der grundlegenden Komponenten für Maschinen, die die Welt auf menschenähnlichere Weise wahrnehmen, verstehen und mit ihr interagieren können.

Siehe auch: Meta wird KI-Modelle mit EU-Nutzerdaten trainieren

Möchten Sie mehr über KI und Big Data von Branchenführern erfahren? Besuchen Sie die AI & Big Data Expo in Amsterdam, Kalifornien und London. Diese umfassende Veranstaltung findet zusammen mit anderen wichtigen Veranstaltungen statt, darunter die Intelligent Automation Conference, BlockX, Digital Transformation Week und die Cyber Security & Cloud Expo.

Entdecken Sie hier weitere bevorstehende Veranstaltungen und Webinare zum Thema Unternehmenstechnologie, die von TechForge angeboten werden.

Verwandter Artikel
Google testet den Remy AI Agent für Gemini, da der Fokus auf die Benutzerkontrolle verlagert wird Google testet den Remy AI Agent für Gemini, da der Fokus auf die Benutzerkontrolle verlagert wird Laut Business Insider testet Google Remy, einen neuen KI-Personalagenten für Gemini. Dieses Tool soll Aufgaben im Auftrag von Nutzern ausführen und sowohl professionelle Arbeitsabläufe als auch tägliche Routinen optimieren.Derzeit wird Remy in einer
Ollie setzt auf Datenschutz, um das Rennen um den KI-Assistenten zu gewinnen Ollie setzt auf Datenschutz, um das Rennen um den KI-Assistenten zu gewinnen Um wirklich hilfreich zu sein, muss ein KI-Assistent seinen Nutzer genau verstehen. Ollie, ein für den Alltag konzipierter persönlicher Assistent, basiert auf der Prämisse, dass dies nicht mit der Wei
So wird die „AI LIVE: London“ KI und industrielle Automatisierung beleuchten So wird die „AI LIVE: London“ KI und industrielle Automatisierung beleuchten Auf dem Gipfel werden Führungskräfte der obersten Ebene aus aller Welt zusammenkommen, um dringende Herausforderungen in globalen Branchen zu erörtern – von KI-getriebenen Umbrüchen bis hin zu wirtsch
Empfehlungen zu verwandten Spezialthemen
SEO Die besten KI-Tools zur SERP-Analyse für die Suchstrategie
Die besten KI-Tools zur SERP-Analyse für die Suchstrategie

Die besten und am besten bewerteten KI-Tools zur SERP-Analyse für Suchstrategien im Jahr 2026 wurden von XIX.AI anhand strenger Praxistests und wöchentlich aktualisierter Rankings zusammengestellt. Diese leistungsstarken Tools helfen Ihnen dabei, verborgene Optimierungsmöglichkeiten aufzudecken, die Performance Ihrer Inhalte zu steigern und sich einen Wettbewerbsvorteil in der Suche zu verschaffen. Entdecken Sie noch heute das perfekte Tool, um Ihre Suchstrategie auf ein neues Niveau zu heben. Jetzt entdecken!

13 Tools
xix.ai
Datenanalyse Die besten KI-Tools zur Erkennung von Anomalien für das KPI-Monitoring in SaaS- und E-Commerce-Teams
Die besten KI-Tools zur Erkennung von Anomalien für das KPI-Monitoring in SaaS- und E-Commerce-Teams

2026 Neueste Besten Top-bewertete KI-Anomalienerkennungstools für KPI-Monitoring in SaaS- und E-Commerce-Teams! XIX.AI hat eine leistungsstarke, bahnbrechende Sammlung basierend auf strengen realen Tests und wöchentlich aktualisierten Rankings zusammengestellt. Sie finden detaillierte kostenlose vs. kostenpflichtige Vergleichsinsights, die Ihnen helfen, die unbedingt auszuprobierende Lösung zu identifizieren, die die Produktivität steigert und Ihre KI-Vorteile freischaltet. Jetzt erkunden!

10 Tools
xix.ai
Schreiben Die besten KI-Generatoren für Gliederungen von langen SEO-Artikeln
Die besten KI-Generatoren für Gliederungen von langen SEO-Artikeln

Die besten und am besten bewerteten KI-Outline-Generatoren für lange SEO-Artikel im Jahr 2026, sorgfältig zusammengestellt von XIX.AI. Diese leistungsstarken Tools bieten bahnbrechende Unterstützung bei der schnellen Erstellung hochwertiger Inhalte und steigern die Effizienz beim Schreiben erheblich. Erhalten Sie einen Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten sowie Praxistests und detaillierte Rankings, damit Sie die für Sie passende Option finden, die Sie unbedingt ausprobieren sollten. Entdecken Sie jetzt die Möglichkeiten und sichern Sie sich Ihren KI-Vorteil.

8 Tools
xix.ai
Bildung und Lernen KI-Lernhilfen für Hausaufgaben und Prüfungsvorbereitung
KI-Lernhilfen für Hausaufgaben und Prüfungsvorbereitung

Die besten KI-Lernhilfen für Hausaufgaben und Prüfungsvorbereitung im Jahr 2026! XIX.AI hat eine Liste der besten leistungsstarken, bahnbrechenden Tools zusammengestellt, die Schülern helfen, ihre Produktivität zu steigern, Hausaufgaben effizienter zu erledigen und Prüfungen dank praxisnaher Tests mit Bravour zu meistern. Erhalten Sie einen Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten, detaillierte Rankings und unverzichtbare Optionen, um Ihren KI-Vorteil zu nutzen. Entdecken Sie es jetzt!

10 Tools
xix.ai
Musikkomposition KI-Stimm-Demo-Tools für Songwriter, Hooks, Toplines und mehrsprachige Entwurfs-Sessions
KI-Stimm-Demo-Tools für Songwriter, Hooks, Toplines und mehrsprachige Entwurfs-Sessions

2026 Neueste und beste KI-Stimm-Demo-Tools für Songwriter, Hook-Ersteller und mehrsprachige Content-Teams! XIX.AI hat eine hochbewertete Liste leistungsstarker, bahnbrechender Tools zusammengestellt, die strengen Praxistests unterzogen wurden. Sie finden detaillierte Vergleichsdaten zu kostenlosen und kostenpflichtigen Optionen, umfassende Rankings und empfehlenswerte Auswahlmöglichkeiten, die Ihnen helfen, Ihre Schreibeffizienz zu steigern und Ihr kreatives Potenzial zu entfalten. Entdecken Sie jetzt das perfekte Tool für all Ihre Content-Bedürfnisse!

9 Tools
xix.ai
Geschäft Die besten KI-Tools zur Wettbewerbsanalyse für kleine Unternehmen
Die besten KI-Tools zur Wettbewerbsanalyse für kleine Unternehmen

Die besten und am besten bewerteten KI-Tools für die Wettbewerbsanalyse für kleine Unternehmen im Jahr 2026! XIX.AI hat eine äußerst leistungsstarke, bahnbrechende Auswahl zusammengestellt, die wöchentlich anhand strenger Praxistests und detaillierter Rankings aktualisiert wird. Hier finden Sie einen umfassenden Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten, der Ihnen dabei hilft, die unverzichtbaren Tools zu identifizieren, die Ihre Produktivität steigern und Ihnen einen Wettbewerbsvorteil verschaffen. Entdecken Sie jetzt das perfekte Tool für sich!

9 Tools
xix.ai
Kommentare (1)
0/500
StevenMartin
StevenMartin 1. Januar 2026 13:30:56 MEZ

So these advancements focus on perception and reasoning, huh? As someone who deals with automation at work, I find the 'AMI' goal both exciting and a bit unsettling. It feels like we're closing the loop between what a machine 'sees' and what it 'understands', which could revolutionize everything from logistics to creative tools. But honestly, I hope the focus stays on augmenting human ability rather than just chasing benchmarks that sound cool in research papers. The ethics of human-like perception need to be front and center. 🧠

OR