Плагин AI от Sakana AI упрощает обработку документов для крупных моделей
Проблемы крупных языковых моделей с обработкой длинных текстов, часто называемые «проблемой памяти», вскоре могут остаться в прошлом. Недавно токийский стартап Sakana AI, занимающийся искусственным интеллектом, представил две революционные технологии: Text-to-LoRA (T2L) и Doc-to-LoRA (D2L). Используя инновационную архитектуру «суперсети», эти технологии позволяют крупным моделям «поглощать» объемные документы или осваивать новые задачи менее чем за секунду, и все это без повторного обучения.

Разработчики ИИ долгое время сталкивались с трудным выбором: впихивать длинные документы в окно чата — что замедляет ответы и потребляет много памяти — или платить высокую цену за тонкую настройку модели. Sakana AI предлагает третий вариант. За одноразовую плату за предварительное обучение она генерирует крошечные весовые плагины (LoRA) для недорогой и эффективной адаптации модели.
Doc-to-LoRA: потребность в памяти снижается с 12 ГБ до всего 50 МБ
Это самая впечатляющая технология в последней версии. Обработка документа из 128 000 токенов (примерно 100 000 слов) традиционными методами требует более 12 ГБ видеопамяти для хранения информации. С помощью D2L модель может напрямую «переварить» эту информацию в плагин размером менее 50 МБ.
Невероятная скорость: старым технологиям требуется от 40 до 100 секунд на обработку документа, тогда как D2L справляется с этим менее чем за 1 секунду.
Расширение границ: это позволяет моделям обрабатывать текст, который в четыре раза длиннее их исходного контекстного окна, достигая почти идеальной точности в тестах на поиск «иголки в стоге сена».
Text-to-LoRA: адаптация ИИ к повседневному языку
Text-to-LoRA делает модели более отзывчивыми. Пользователи просто описывают задачу на естественном языке — например, «помоги мне решить сложную задачу математического олимпиады» — и система автоматически генерирует специальный плагин для повышения производительности. Эксперименты показывают, что адаптеры, созданные таким образом, могут превосходить по производительности специализированные модели, обученные с нуля на задачах по математике и логическому мышлению.
Мощная кросс-модальная технология: позволяющая текстовым моделям «видеть» изображения
Исследователи обнаружили неожиданный бонус: D2L демонстрирует сильные кросс-модальные способности. Путем отображения визуальной информации в параметры чисто текстовой модели, модель, которая никогда ранее не обрабатывала изображения, может классифицировать их с точностью **75,03%**.
Достижения Sakana AI значительно снижают барьер для частных лиц и компаний при настройке частных моделей ИИ. Они также прокладывают новый путь к разработке более легкого и интеллектуального общего искусственного интеллекта (AGI).
Статья: https://arxiv.org/pdf/2602.15902
Связанная статья
Шесть технологических гигантов поддерживают Linux Foundation с суммой $12,5 млн для борьбы с шумом уязвимостей в ИИ
Для борьбы с потоком низкокачественных отчетов о безопасности, генерируемых инструментами автоматизации на базе ИИ, шесть крупных технологических компаний — Anthropic, Amazon (AWS), GitHub, Google, Microsoft и OpenAI — совместно выделили 12,5 млн дол
Маск рассматривал возможность оставить OpenAI своим детям, пока Альтман давал показания
Утром генеральный директор OpenAI Сэм Альтман выступил в суде, чтобы ответить на иск бывшего сооснователя Илона Маска, оспаривающего корпоративную структуру компании.Когда его спросили об утверждении Маска о том, что другие основатели «похитили благ
Сэм Альтман вызывает споры о замедлении развития ИИ
Слушайте наApple PodcastsСлушайте наSpotifyГенеральный директор OpenAI Сэм Алтман недавно предположил, что, возможно, пришло время «сдерживать темпы развития ИИ», чтобы позволить обществу «укрепиться вокруг некоторых из этих новых уровней возможност
Рекомендации по связанным специальным темам
Комментарии (0)
Проблемы крупных языковых моделей с обработкой длинных текстов, часто называемые «проблемой памяти», вскоре могут остаться в прошлом. Недавно токийский стартап Sakana AI, занимающийся искусственным интеллектом, представил две революционные технологии: Text-to-LoRA (T2L) и Doc-to-LoRA (D2L). Используя инновационную архитектуру «суперсети», эти технологии позволяют крупным моделям «поглощать» объемные документы или осваивать новые задачи менее чем за секунду, и все это без повторного обучения.

Разработчики ИИ долгое время сталкивались с трудным выбором: впихивать длинные документы в окно чата — что замедляет ответы и потребляет много памяти — или платить высокую цену за тонкую настройку модели. Sakana AI предлагает третий вариант. За одноразовую плату за предварительное обучение она генерирует крошечные весовые плагины (LoRA) для недорогой и эффективной адаптации модели.
Doc-to-LoRA: потребность в памяти снижается с 12 ГБ до всего 50 МБ
Это самая впечатляющая технология в последней версии. Обработка документа из 128 000 токенов (примерно 100 000 слов) традиционными методами требует более 12 ГБ видеопамяти для хранения информации. С помощью D2L модель может напрямую «переварить» эту информацию в плагин размером менее 50 МБ.
Невероятная скорость: старым технологиям требуется от 40 до 100 секунд на обработку документа, тогда как D2L справляется с этим менее чем за 1 секунду.
Расширение границ: это позволяет моделям обрабатывать текст, который в четыре раза длиннее их исходного контекстного окна, достигая почти идеальной точности в тестах на поиск «иголки в стоге сена».
Text-to-LoRA: адаптация ИИ к повседневному языку
Text-to-LoRA делает модели более отзывчивыми. Пользователи просто описывают задачу на естественном языке — например, «помоги мне решить сложную задачу математического олимпиады» — и система автоматически генерирует специальный плагин для повышения производительности. Эксперименты показывают, что адаптеры, созданные таким образом, могут превосходить по производительности специализированные модели, обученные с нуля на задачах по математике и логическому мышлению.
Мощная кросс-модальная технология: позволяющая текстовым моделям «видеть» изображения
Исследователи обнаружили неожиданный бонус: D2L демонстрирует сильные кросс-модальные способности. Путем отображения визуальной информации в параметры чисто текстовой модели, модель, которая никогда ранее не обрабатывала изображения, может классифицировать их с точностью **75,03%**.
Достижения Sakana AI значительно снижают барьер для частных лиц и компаний при настройке частных моделей ИИ. Они также прокладывают новый путь к разработке более легкого и интеллектуального общего искусственного интеллекта (AGI).
Статья: https://arxiv.org/pdf/2602.15902
Шесть технологических гигантов поддерживают Linux Foundation с суммой $12,5 млн для борьбы с шумом уязвимостей в ИИ
Для борьбы с потоком низкокачественных отчетов о безопасности, генерируемых инструментами автоматизации на базе ИИ, шесть крупных технологических компаний — Anthropic, Amazon (AWS), GitHub, Google, Microsoft и OpenAI — совместно выделили 12,5 млн дол
Маск рассматривал возможность оставить OpenAI своим детям, пока Альтман давал показания
Утром генеральный директор OpenAI Сэм Альтман выступил в суде, чтобы ответить на иск бывшего сооснователя Илона Маска, оспаривающего корпоративную структуру компании.Когда его спросили об утверждении Маска о том, что другие основатели «похитили благ
Сэм Альтман вызывает споры о замедлении развития ИИ
Слушайте наApple PodcastsСлушайте наSpotifyГенеральный директор OpenAI Сэм Алтман недавно предположил, что, возможно, пришло время «сдерживать темпы развития ИИ», чтобы позволить обществу «укрепиться вокруг некоторых из этих новых уровней возможност





Дом






