Option
Heim
Nachricht
Neue Studie enthüllt, wie viel Daten LLMs tatsächlich speichern

Neue Studie enthüllt, wie viel Daten LLMs tatsächlich speichern

6. Juli 2025
189

Neue Studie enthüllt, wie viel Daten LLMs tatsächlich speichern

Wie viel speichern AI-Modelle tatsächlich? Neue Forschung enthüllt überraschende Erkenntnisse

Wir alle wissen, dass große Sprachmodelle (LLMs) wie ChatGPT, Claude und Gemini auf riesigen Datensätzen trainiert werden – Billionen von Wörtern aus Büchern, Websites, Code und sogar Multimedia wie Bildern und Audio. Aber was passiert genau mit all diesen Daten? Verstehen diese Modelle Sprache wirklich oder geben sie nur gespeicherte Textfragmente wieder?

Eine bahnbrechende neue Studie von Meta, Google DeepMind, Cornell und NVIDIA liefert endlich konkrete Antworten – und die Ergebnisse könnten Sie überraschen.

Die große Frage: Speicherung vs. Verallgemeinerung

Im Kern funktionieren LLMs, indem sie statistische Muster in der Sprache erkennen. Wenn Sie ChatGPT nach Äpfeln fragen, „weiß“ es nicht, was ein Apfel im menschlichen Sinne ist – stattdessen erkennt es, dass das Wort „Apfel“ häufig neben Begriffen wie „Frucht“, „rot“, „Obstgarten“ oder sogar „iPhone“ vorkommt. Dieses statistische Verständnis ist in Milliarden von Parametern (im Wesentlichen einstellbaren Einstellungen im neuronalen Netzwerk der KI) codiert.

Doch hier ist die Millionen-Dollar-Frage: Wie viel des Wissens eines LLMs stammt aus verallgemeinertem Lernen und wie viel ist nur wörtliche Speicherung?

Dies ist nicht nur akademisch – es hat reale rechtliche Auswirkungen. Wenn KI-Modelle große Teile urheberrechtlich geschützter Texte kopieren, könnten Klagen von Künstlern, Autoren und Verlagen an Fahrt gewinnen. Aber wenn sie tatsächlich Muster lernen statt exakter Inhalte, könnten KI-Unternehmen stärkere Argumente für eine faire Nutzung haben.

Die Antwort: 3,6 Bits pro Parameter

Die Studie ergab, dass LLMs eine feste Speicherkapazität von etwa 3,6 Bits pro Parameter haben. Was bedeutet das in der Praxis?

  • Ein Bit ist die kleinste digitale Einheit (0 oder 1).
  • 3,6 Bits können etwa 12 verschiedene Werte speichern – wie die Auswahl eines Monats im Jahr oder das Würfeln mit einem 12-seitigen Würfel.
  • Es reicht nicht aus, um einen vollständigen englischen Buchstaben zu speichern (der ~4,7 Bits benötigt), aber es könnte einen Buchstaben aus einem reduzierten Satz von 10 häufigen Buchstaben codieren.
  • In Bytes sind 3,6 Bits nur 0,45 Bytes – weniger als die Hälfte eines standardmäßigen ASCII-Zeichens.

Entscheidend ist, dass diese Zahl bei verschiedenen Modellgrößen, Architekturen und sogar Präzisionsstufen konstant blieb (wobei vollpräzise Modelle etwas höher bei 3,83 Bits/Parameter lagen).

Die große Überraschung: Mehr Daten = Weniger Speicherung

Hier wird es wirklich interessant: Training mit mehr Daten erhöht die Speicherung nicht – es reduziert sie tatsächlich.

Wie der Haupforscher Jack Morris erklärte:

„Training mit mehr Daten zwingt Modelle, weniger pro Datenpunkt zu speichern.“

Stellen Sie es sich so vor: Wenn eine KI ein festes „Speicherbudget“ hat, bedeutet das Verteilen über einen größeren Datensatz, dass jede einzelne Information weniger dedizierten Speicherplatz erhält. Also fördern größere Datensätze die Verallgemeinerung statt bloßes Abschreiben – was Bedenken über das Wiedergeben urheberrechtlich geschützter oder sensibler Inhalte lindern könnte.

Wie haben die Forscher dies gemessen?

Um Speicherung von Verallgemeinerung zu isolieren, trainierten sie Modelle auf komplett zufälligen Bitfolgen – Daten ohne jegliche Muster oder Struktur.

Warum? Weil, wenn ein Modell eine zufällige Zeichenfolge rekonstruiert, es sie gespeichert haben muss – es gibt keine zugrunde liegende Logik, die man ableiten könnte.

Dieser Ansatz erlaubte es ihnen:
✔ Reines Speichern zu messen, getrennt von erlernten Mustern.
✔ Zu bestätigen, dass Speicherung vorhersehbar mit der Modellgröße skaliert.
✔ Zu zeigen, dass Verallgemeinerung einsetzt, wenn Datensätze größer werden.

Reale Auswirkungen

  • Kleinere Datensätze führen zu mehr Speicherung.
  • Größere Datensätze drängen Modelle zur Verallgemeinerung (mit einem vorübergehenden „Double Descent“-Leistungsabfall).
  • Höhere Präzision (z. B. float32 vs. bfloat16) erhöht die Speicherkapazität leicht (von 3,51 auf 3,83 Bits/Parameter).

Einzigartige Daten werden eher gespeichert

Während die Studie sich auf Durchschnittswerte konzentriert, besonders einzigartige oder stilisierte Inhalte (wie seltene Codeschnipsel oder markantes Schreiben) könnten anfälliger für Speicherung sein.

Allerdings werden Mitgliedschafts-Inferenzangriffe (der Versuch, festzustellen, ob bestimmte Daten im Trainingssatz waren) unzuverlässig, wenn Datensätze wachsen – was die Idee unterstützt, dass groß angelegtes Training Datenschutzrisiken reduziert.

In Perspektive gesetzt

  • Ein 500K-Parameter-Modell kann etwa 225 KB Daten speichern.
  • Ein 1,5B-Parameter-Modell kann etwa 675 MB speichern.
  • Das reicht nicht, um ganze Bücher oder Bilder zu reproduzieren, aber es erklärt verteilte textuelle Muster.

Rechtliche Folgen?

Diese Forschung könnte eine Schlüsselrolle in laufenden KI-Urheberrechtsklagen spielen. Wenn Gerichte erkennen, dass LLMs hauptsächlich verallgemeinern statt kopieren, könnten KI-Unternehmen stärkere Argumente für faire Nutzung haben.

Das Fazit

Mehr Daten = sicherere, verallgemeinerte KI. Anstatt große Datensätze zu fürchten, könnten wir sie tatsächlich wollen – weil sie Modelle zum Verstehen statt zum Speichern drängen.

Diese Studie vertieft nicht nur unser Verständnis von KI – sie könnte die Art und Weise, wie wir diese mächtigen Systeme regulieren, entwickeln und ihnen vertrauen, grundlegend verändern.

Verwandter Artikel
Sam Altman löst eine Debatte über die Verlangsamung der KI-Entwicklung aus Sam Altman löst eine Debatte über die Verlangsamung der KI-Entwicklung aus Bei Apple Podcasts anhörenBei Spotify anhörenDer CEO von OpenAI, Sam Altman, hat kürzlich vorgeschlagen, es könnte an der Zeit sein, „das Tempo der KI-Entwicklung zu drosseln“, um der Gesellschaft Zeit zu geben, „sich um einige dieser neuen Fähigkei
OpenAI beklagt sich über Apples Handelsgeheimnis-Klage OpenAI beklagt sich über Apples Handelsgeheimnis-Klage OpenAI widerlegte am Dienstag Apples Vorwürfe wegen Verletzung von Geschäftsgeheimnissen und argumentierte, der Klage fehle jede Grundlage.„Wir nehmen diese Behauptungen ernst, sehen jedoch keine Beweise, die sie stützen“, erklärte OpenAI, wie Bloom
OpenAI-Robotik-Chefin Caitlin Kalinowski tritt zurück wegen Pentagon-Partnerschaft OpenAI-Robotik-Chefin Caitlin Kalinowski tritt zurück wegen Pentagon-Partnerschaft Der Leiter der Robotik-Abteilung von OpenAI, Caitlin Kalinowski, ist zurückgetreten, nachdem das Unternehmen eine umstrittene Partnerschaft mit dem Verteidigungsministerium eingegangen war.„Dies war keine einfache Entscheidung“, erklärte Kalinowski
Empfehlungen zu verwandten Spezialthemen
Musikkomposition KI-Stimm-Demo-Tools für Songwriter, Hooks, Toplines und mehrsprachige Entwurfs-Sessions
KI-Stimm-Demo-Tools für Songwriter, Hooks, Toplines und mehrsprachige Entwurfs-Sessions

2026 Neueste und beste KI-Stimm-Demo-Tools für Songwriter, Hook-Ersteller und mehrsprachige Content-Teams! XIX.AI hat eine hochbewertete Liste leistungsstarker, bahnbrechender Tools zusammengestellt, die strengen Praxistests unterzogen wurden. Sie finden detaillierte Vergleichsdaten zu kostenlosen und kostenpflichtigen Optionen, umfassende Rankings und empfehlenswerte Auswahlmöglichkeiten, die Ihnen helfen, Ihre Schreibeffizienz zu steigern und Ihr kreatives Potenzial zu entfalten. Entdecken Sie jetzt das perfekte Tool für all Ihre Content-Bedürfnisse!

9 Tools
xix.ai
Geschäft Die besten KI-Tools zur Wettbewerbsanalyse für kleine Unternehmen
Die besten KI-Tools zur Wettbewerbsanalyse für kleine Unternehmen

Die besten und am besten bewerteten KI-Tools für die Wettbewerbsanalyse für kleine Unternehmen im Jahr 2026! XIX.AI hat eine äußerst leistungsstarke, bahnbrechende Auswahl zusammengestellt, die wöchentlich anhand strenger Praxistests und detaillierter Rankings aktualisiert wird. Hier finden Sie einen umfassenden Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten, der Ihnen dabei hilft, die unverzichtbaren Tools zu identifizieren, die Ihre Produktivität steigern und Ihnen einen Wettbewerbsvorteil verschaffen. Entdecken Sie jetzt das perfekte Tool für sich!

9 Tools
xix.ai
Bildbearbeitung Photoshop-KI-Retuschierungstools für E-Commerce-Bekleidung, Hautbereinigung und Farbkonstanz
Photoshop-KI-Retuschierungstools für E-Commerce-Bekleidung, Hautbereinigung und Farbkonstanz

2026 Neueste beste Photoshop-KI-Retuschierungstools für E-Commerce-Bekleidung, Hautbereinigung und Farbkonsistenz! Diese hoch bewertete kuratierte Liste bietet leistungsstarke, bahnbrechende Lösungen, die Ihnen helfen, die Schreibeffizienz zu steigern, die Content-Erstellung zu optimieren und mühelos perfekte visuelle Ergebnisse zu erzielen. Jedes Tool wurde durch wöchentlich aktualisierte Rankings mit echten Tests geprüft, einschließlich detaillierter Vergleiche zwischen kostenlosen und kostenpflichtigen Versionen. Unterstützt von XIX.AI ist es der unverzichtbare Leitfaden für alle, die ihre KI-Vorteile nutzen möchten. Jetzt entdecken!

10 Tools
xix.ai
Prompt Die besten KI-Prompt-Bibliotheken für ChatGPT-Workflows
Die besten KI-Prompt-Bibliotheken für ChatGPT-Workflows

Die besten und am besten bewerteten KI-Prompt-Bibliotheken des Jahres 2026 zur Optimierung aller Arten von ChatGPT-Workflows. XIX.AI hat eine leistungsstarke, bahnbrechende Sammlung zusammengestellt, die strengen Praxistests unterzogen wird, um Spitzenleistung zu gewährleisten. Hier finden Sie detaillierte Vergleiche zwischen kostenlosen und kostenpflichtigen Angeboten sowie Experten-Rankings, die Ihnen dabei helfen, die unverzichtbaren Tools auszuwählen, mit denen Sie Ihre Produktivität steigern und Ihren KI-Vorteil ausschöpfen können. Entdecken Sie sie jetzt!

11 Tools
xix.ai
Bildung und Lernen AI Quiz Builder Plattformen für Lehrer, Nachhilfelehrer und kohortenbasierte Lernprogramme
AI Quiz Builder Plattformen für Lehrer, Nachhilfelehrer und kohortenbasierte Lernprogramme

2026 Neueste und beste KI-Quiz-Erstellungstools für Lehrer, Nachhilfelehrer und kohortenbasierte Lernprogramme! XIX.AI hat eine hochbewertete Liste leistungsstarker, bahnbrechender Tools zusammengestellt, die realen Tests unterzogen wurden, um genaue Rankings zu liefern. Diese unbedingt auszuprobierenden Plattformen helfen dabei, die Schreibeffizienz zu steigern, die Inhaltserstellung zu optimieren und das Quiz-Design in allen Lernszenarien zu vereinfachen. Entdecken Sie jetzt Ihr perfektes Tool, um Ihren KI-Vorteil im Unterricht voll auszuschöpfen!

13 Tools
xix.ai
Code KI-Tools zur Überprüfung von Pull-Requests für GitHub-Teams, die sich mit Refactorings, Fehlern und Sicherheitslücken befassen
KI-Tools zur Überprüfung von Pull-Requests für GitHub-Teams, die sich mit Refactorings, Fehlern und Sicherheitslücken befassen

Die besten neuen KI-Tools zur Pull-Request-Prüfung für GitHub-Teams im Jahr 2026 finden Sie hier auf XIX.AI! Diese sorgfältig zusammengestellte Liste mit den besten Bewertungen präsentiert leistungsstarke, bahnbrechende Lösungen, die Refactoring, Fehlerbehebung und die Erkennung von Sicherheitslücken in allen Team-Workflows optimieren. Profitieren Sie von einem Vergleich zwischen kostenlosen und kostenpflichtigen Tools sowie von Praxistests und detaillierten Rankings, die Ihnen helfen, das perfekte Tool zu finden, mit dem Sie Ihre Produktivität deutlich steigern können. Entdecken Sie die Tools jetzt und sichern Sie sich Ihren KI-Vorteil!

12 Tools
xix.ai
Kommentare (2)
0/500
LawrenceWilliams
LawrenceWilliams 24. August 2025 05:01:17 MESZ

This study on LLMs memorizing data is wild! 🤯 I’m kinda spooked thinking about how much these models might 'remember' from the web. Could they accidentally spill sensitive info one day?

EdwardYoung
EdwardYoung 10. August 2025 01:01:00 MESZ

This study on LLMs memorizing data is wild! 😮 I wonder how much of my old Reddit posts are stuck in these models’ brains. Kinda creepy but fascinating!

OR