вариант
Дом
Новости
Новая статья раскрывает, сколько данных на самом деле запоминают LLM

Новая статья раскрывает, сколько данных на самом деле запоминают LLM

6 июля 2025 г.
189

Новая статья раскрывает, сколько данных на самом деле запоминают LLM

Сколько на самом деле запоминают модели ИИ? Новое исследование раскрывает удивительные выводы

Все мы знаем, что большие языковые модели (LLM), такие как ChatGPT, Claude и Gemini, обучаются на огромных наборах данных — триллионах слов из книг, веб-сайтов, кода и даже мультимедиа, таких как изображения и аудио. Но что именно происходит с этими данными? Действительно ли эти модели понимают язык, или они просто воспроизводят запомненные фрагменты?

Новаторское исследование от Meta, Google DeepMind, Корнелла и NVIDIA наконец-то дает конкретные ответы — и результаты могут вас удивить.

Главный вопрос: запоминание против обобщения

В основе своей LLM работают, обнаруживая статистические закономерности в языке. Когда вы спрашиваете ChatGPT о яблоках, он не "знает", что такое яблоко в человеческом смысле — вместо этого он распознает, что слово "яблоко" часто встречается рядом с терминами, такими как "фрукт", "красный", "сад" или даже "iPhone". Это статистическое понимание закодировано в миллиардах параметров (по сути, настраиваемых настроек в нейронной сети ИИ).

Но вот вопрос на миллион долларов: Сколько знаний LLM основано на обобщённом обучении, а сколько — на дословном запоминании?

Это не просто академический вопрос — он имеет реальные юридические последствия. Если обнаружится, что модели ИИ копируют большие куски защищённого авторским правом текста, иски от художников, авторов и издателей могут набрать силу. Но если они действительно обучаются шаблонам, а не точному содержимому, у компаний ИИ может быть более сильная защита на основе добросовестного использования.

Ответ: 3.6 бита на параметр

Исследование показало, что LLM имеют фиксированную ёмкость запоминания около 3.6 битов на параметр. Что это значит на практике?

  • Один бит — это наименьшая цифровая единица (0 или 1).
  • 3.6 бита могут хранить около 12 различных значений — как выбор месяца года или бросок 12-гранного кубика.
  • Этого недостаточно для хранения полной английской буквы (для которой нужно ~4.7 бита), но можно закодировать символ из ограниченного набора из 10 распространённых букв.
  • В байтах 3.6 бита — это всего 0.45 байта — менее половины стандартного символа ASCII.

Критически важно, что это число оставалось стабильным для разных размеров моделей, архитектур и даже уровней точности (хотя модели полной точности достигали немного выше — 3.83 бита/параметр).

Большой сюрприз: больше данных = меньше запоминания

Вот где становится действительно интересно: Обучение на больших объёмах данных не увеличивает запоминание — оно его уменьшает.

Как объяснил ведущий исследователь Джек Моррис:

"Обучение на больших данных заставляет модели меньше запоминать на каждый образец."

Представьте это так: если у ИИ есть фиксированный "бюджет памяти", распределение его на больший набор данных означает, что каждая отдельная часть получает меньше выделенного хранилища. Таким образом, большие наборы данных способствуют обобщению, а не механическому копированию — что может смягчить опасения по поводу воспроизведения ИИ защищённого авторским правом или конфиденциального контента.

Связанная статья
Сэм Альтман вызывает споры о замедлении развития ИИ Сэм Альтман вызывает споры о замедлении развития ИИ Слушайте наApple PodcastsСлушайте наSpotifyГенеральный директор OpenAI Сэм Алтман недавно предположил, что, возможно, пришло время «сдерживать темпы развития ИИ», чтобы позволить обществу «укрепиться вокруг некоторых из этих новых уровней возможност
OpenAI оспаривает иск Apple о нарушении торговых тайн OpenAI оспаривает иск Apple о нарушении торговых тайн OpenAI опровергла утверждения Apple о нарушении торговых тайк во вторник, заявив, что иск не имеет оснований.«Мы относимся к этим заявлениям серьезно, но не видим никаких доказательств, подтверждающих их», — stated OpenAI, как сообщил Ed Ludlow из B
Глава робототехники OpenAI Кейтлин Калиновски уходит в отставку из-за партнерства с Пентагоном Глава робототехники OpenAI Кейтлин Калиновски уходит в отставку из-за партнерства с Пентагоном Руководитель направления робототехники OpenAI Кейтлин Калиновски ушла в отставку после скандального партнерства компании с Министерством обороны США.«Это было нелегкое решение», — объяснила Калиновски в заявлении в социальных сетях. «Хотя ИИ играет
Рекомендации по связанным специальным темам
Бизнес Лучшие инструменты для анализа конкурентов на основе искусственного интеллекта для малого бизнеса
Лучшие инструменты для анализа конкурентов на основе искусственного интеллекта для малого бизнеса

2026: новейшие, лучшие и самые высокооцененные инструменты для анализа конкурентов на базе ИИ для малого бизнеса! XIX.AI подготовила чрезвычайно мощную подборку, способную кардинально изменить ситуацию на рынке, которая еженедельно обновляется на основе тщательных тестов в реальных условиях и подробных рейтингов. Вы найдете здесь исчерпывающее сравнение бесплатных и платных версий, которое поможет вам определить инструменты, которые обязательно стоит попробовать, чтобы повысить свою продуктивность и получить конкурентное преимущество. Ознакомьтесь с ней прямо сейчас, чтобы найти идеальный инструмент для себя!

9 инструментов
xix.ai
Редактирование изображений Инструменты ИИ-ретуши в Photoshop для электронной коммерции, одежды, очистки кожи и обеспечения цветового единообразия
Инструменты ИИ-ретуши в Photoshop для электронной коммерции, одежды, очистки кожи и обеспечения цветового единообразия

2026 Latest Best Photoshop AI retouch tools for ecommerce apparel, skin cleanup, and color consistency! This top-rated curated list features powerful game-changing solutions that help you boost writing efficiency, streamline content creation, and achieve perfect visual results effortlessly. Each tool has undergone real-world tests through weekly updated rankings, complete with free vs paid comparison details. Backed by XIX.AI, it’s the must-try guide for anyone aiming to unlock your AI edge. Explore now!

10 инструментов
xix.ai
Быстрый Лучшие библиотеки подсказок для ИИ в рабочих процессах ChatGPT
Лучшие библиотеки подсказок для ИИ в рабочих процессах ChatGPT

2026: новейшие и лучшие библиотеки подсказок для ИИ с высоким рейтингом, предназначенные для оптимизации всех типов рабочих процессов ChatGPT. XIX.AI подготовила мощную, революционную подборку, прошедшую тщательные тесты в реальных условиях для обеспечения максимальной производительности. Вы найдёте подробные сравнения бесплатных и платных вариантов, а также рейтинги экспертов, которые помогут вам выбрать инструменты, которые обязательно стоит попробовать, чтобы повысить свою продуктивность и раскрыть весь потенциал ИИ. Откройте для себя их прямо сейчас!

11 инструментов
xix.ai
Образование и обучение Платформы для создания викторин с ИИ для учителей, репетиторов и программ обучения в группах
Платформы для создания викторин с ИИ для учителей, репетиторов и программ обучения в группах

2026 Latest Best AI Quiz Builder Platforms for Teachers, Tutors, and Cohort-Based Learning Programs! XIX.AI has curated a top-rated list of powerful game-changing tools that go through real-world tests to deliver accurate rankings. These must-try platforms help boost writing efficiency, streamline content creation, and simplify quiz design across all learning scenarios. Explore now to discover your perfect tool for unlocking your AI edge in teaching!

13 инструментов
xix.ai
код Инструменты на базе ИИ для проверки пулл-реквестов в командах GitHub, занимающихся рефакторингом, устранением ошибок и устранением уязвимостей
Инструменты на базе ИИ для проверки пулл-реквестов в командах GitHub, занимающихся рефакторингом, устранением ошибок и устранением уязвимостей

2026 года: лучшие инструменты для проверки пул-реквестов с помощью ИИ для команд GitHub — уже здесь, на XIX.AI! В этом тщательно отобранном списке, получившем высокие оценки, представлены мощные революционные решения, которые оптимизируют рефакторинг, исправление ошибок и выявление уязвимостей в безопасности во всех рабочих процессах команды. Воспользуйтесь сравнением бесплатных и платных инструментов, а также результатами реальных тестов и подробными рейтингами, которые помогут вам найти идеальный инструмент, значительно повышающий производительность. Ознакомьтесь с ними прямо сейчас, чтобы раскрыть весь потенциал искусственного интеллекта!

12 инструментов
xix.ai
Преобразование текста в речь Лучшие инструменты преобразования текста в речь на базе ИИ для создания естественного озвучивания
Лучшие инструменты преобразования текста в речь на базе ИИ для создания естественного озвучивания

2026 года: самые новые, лучшие и высокооцененные инструменты преобразования текста в речь на базе ИИ для естественного озвучивания — уже здесь, на XIX.AI! В этом тщательно отобранном списке представлены мощные, революционные решения, обеспечивающие кристально чистый голос для любого сценария использования, подтвержденные реальными тестами и еженедельно обновляемым рейтингом. Воспользуйтесь сравнением бесплатных и платных версий, чтобы найти решение, которое обязательно стоит попробовать и которое мгновенно повысит вашу продуктивность. Откройте для себя все возможности ИИ прямо сейчас!

11 инструментов
xix.ai
Комментарии (2)
0/500
LawrenceWilliams
LawrenceWilliams 24 августа 2025 г., 6:01:17 GMT+03:00

This study on LLMs memorizing data is wild! 🤯 I’m kinda spooked thinking about how much these models might 'remember' from the web. Could they accidentally spill sensitive info one day?

EdwardYoung
EdwardYoung 10 августа 2025 г., 2:01:00 GMT+03:00

This study on LLMs memorizing data is wild! 😮 I wonder how much of my old Reddit posts are stuck in these models’ brains. Kinda creepy but fascinating!

OR