Механизмы цензуры в языковых моделях могут подрывать их способность передавать истину в более широком масштабе. Последние исследования показывают, что те же внутренние процессы, которые призваны блокировать "небезопасные" реакции, также препятствуют обмену фактической информацией. Это означает, что усилия по созданию безопасных моделей могут непреднамеренно привести к усилению галлюцинаций.
В течение многих лет разработчики уделяли особое внимание уменьшению ложной информации в языковых моделях. Стремление к большей правдивости за счет сдерживания галлюцинаций и ориентации моделей на проверяемые факты стало доминирующим и широко поддерживаемым направлением исследований.
Однако новое австралийское исследование предполагает, что методы выравнивания - техники обучения, которые ограничивают "небезопасные" обмены - могут мешать моделям давать точные ответы, навязывая более строгий контроль:
Повышение фактической точности модели (на рисунке обозначено как "Повышение правдивости") может привести ее в зоны активации, которые обходят ее механизмы отказа. Аналогично, правки, направленные на уменьшение галлюцинаций, могут сдвинуть внутренние репрезентации за границы безопасности. Это может позволить вредным подсказкам обойти защитные механизмы, если только функции отказа не будут тщательно изолированы и сохранены. Источник: https://arxiv.org/pdf/2510.07775
Исследование показало, что внутренние пути, отвечающие за запоминание фактов, также управляют поведением отказа - механизмом, который не позволяет моделям реагировать на небезопасные или чувствительные подсказки. Когда методы выравнивания слишком сильно усиливают сигналы отказа, эти пути перекрываются, размывая способность модели отличать отказ от вредного контента и непреднамеренное подавление достоверной информации.
По иронии судьбы, по мере того как модели совершенствуются в отклонении неуместных запросов, их способность передавать истину снижается.
Чувствительные темы
Приведенные выше иллюстрации подчеркивают, что основная проблема заключается не только в предоставлении справедливых и точных результатов пользователям, но и в снижении юридических рисков для поставщиков услуг LLM.
Например, в примере, на который ссылаются изображения, затронута спорная тема - статистика тюрем по расовому признаку, - которую ИИ может ответственно обсуждать с учеными или исследователями, но должен избегать манипуляций со стороны злоумышленников, стремящихся получить оскорбительные, нецензурные или незаконные ответы.
Поскольку выровненные ИИ не могут оценить намерения, стоящие за запросом, они по умолчанию выбирают осторожный подход:
Реакция на чувствительные запросы зависит от стратегии выравнивания. Модель, ориентированная на безопасность, полностью блокирует запрос, в то время как модель, ориентированная на истину, предоставляет фактический контекст, повышая информативность, но снижая уровень подавления. Это подтверждает идею о том, что правки, повышающие правдивость, могут снижать порог отказа, повышая уязвимость к вредным подсказкам, если механизмы отказа не защищены.
Кроме того, эти результаты могут заставить критиков так называемых "просветительских" программ утверждать, что модели с жесткой регулировкой менее правдивы и полезны, чем их нерегулируемые аналоги.
Приведенные в статье данные частично подтверждают это мнение, но в контексте более широких рисков использования несогласованных LLM - включая юридическую опасность уголовных и гражданских нарушений, а также распространение дезинформации, которую по-прежнему сложно эффективно фильтровать из-за ограничений по стоимости.
Переплетающиеся функции
Чтобы понять механизмы, лежащие в основе модели, исследователи составили карту активации отдельных участков внимания и обнаружили, что признаки, связанные с галлюцинациями и отказом , часто занимают перекрывающиеся области в модели.
Они обнаружили, что тонкая настройка или управление этими областями для уменьшения количества ложных фактов может ослабить встроенные в модель средства защиты, поскольку обе функции имеют схожее латентное пространство:
"Повышение точности фактов часто ослабляет поведение отказа. Наш анализ показывает, что это происходит потому, что компоненты, кодирующие информацию о галлюцинациях и отказе, перекрываются, в результате чего методы выравнивания непреднамеренно подавляют фактические знания".
Мы также исследуем, как тонкая настройка на доброкачественных наборах данных, даже на тех, которые курируются для безопасности, может ухудшить выравнивание по той же причине".
Авторы предлагают использовать разреженный автоэнкодер (SAE) - сеть, предназначенную для выделения отдельных паттернов активации, - для разделения этих функций и сохранения безопасности при обучении правдивости. Такой подход позволяет сделать модели одновременно более безопасными и точными без ущерба для качества.
Новая работа, озаглавленная "Непреднамеренный компромисс выравнивания ИИ: Баланс между смягчением галлюцинаций и безопасностью в LLM, подготовлена пятью исследователями, связанными с Университетом Дикина, и независимыми исследователями.
Методология
В исследовании изучается, ослабляет ли повышение правдивости языковых моделей их способность отказываться от вредных подсказок и зависят ли оба вида поведения от общих внутренних компонентов.
Протестировав два метода повышения правдивости, авторы обнаружили, что увеличение точности фактов неизменно повышает восприимчивость к взлому.
Этот компромисс обусловлен перекрытием областей внимания, в которых кодируются сигналы фактов и отказов. Даже доброкачественная тонкая настройка, направленная на повышение полезности без ущерба для безопасности, может нарушить защиту, изменив общие пути.
В исследовании определены три ключевых термина: правдивость означает способность модели давать точные ответы на основе имеющихся знаний без подавления безобидного содержания; галлюцинации возникают, когда модель генерирует неверную информацию, несмотря на доступ к правильным фактам; а поведение отказа, или выравнивание безопасности, описывает механизмы, которые блокируют ответы на вредные или чувствительные подсказки.
Авторы отмечают, что эти функции взаимодействуют тонким образом:
"Хотя правдивость и безопасность часто анализируются отдельно, в реальном мире подсказки часто содержат чувствительные термины с доброкачественным намерением (например, для анализа, обнаружения или обучения). В таких случаях механизмы безопасности могут срабатывать чрезмерно, подавляя точную, полезную информацию, и снижать практическую правдивость за счет упущений".
Понимание того, как правки, направленные на повышение фактичности, влияют на поведение при отказе, необходимо для достижения правдивости при минимальном, соответствующем подавлении".
Авторы разработали LoRA, которая направляет условный LLM в сторону более "правдивого" состояния, уменьшая галлюцинации. В приложении к статье приведены многочисленные примеры, иллюстрирующие непредвиденные последствия такого подхода.
Анализ начинается с рассмотрения методов повышения правдивости, таких как управление головой и сопоставление латентных направлений, как намеренных модификаций внутренних вычислений модели.
Точное управление
Ключевой вопрос заключается в том, влияют ли эти изменения непреднамеренно на те же пути, которые управляют поведением при отказе. Чтобы проверить это, в исследовании оценивались модели на точность фактов с помощью TruthfulQA и на безопасность в состязательных условиях с помощью AdvBench и StrongReject.
Базовые методы включали в себя вмешательство во время умозаключений (ITI), которое активирует головы внимания, связанные с правдивыми ответами, и TruthX, который смещает представления в соответствии с выученным "правдивым" направлением.
Оба метода повышают точность, но также заставляют модели с большей вероятностью отвечать на вредные подсказки, от которых они раньше отказались бы.
Чтобы изолировать и напрямую манипулировать поведением галлюцинаций, авторы определили латентное направление, соответствующее галлюцинаторным ответам, обучив модуль LoRA на неправильных ответах из набора данных TruthfulQA с помощью LLaMA3-8B-Instruct.
В результате был получен линейный вектор, представляющий разницу между правдивыми и галлюцинаторными ответами, что позволило направить модель в сторону галлюцинации или от нее.
Направление в сторону галлюцинаций повышает точность в TruthfulQA, но увеличивает коэффициент успешности атак (ASR) в AdvBench и StrongReject, что говорит о компромиссе между правдивостью и безопасностью.
Направление вдоль оси галлюцинаций снижало точность фактов, в то время как изменение направления повышало ее. Применение этой техники к эталонам с вредными подсказками подтвердило полученные ранее результаты: выигрыш в правдивости достигается за счет ослабления отказа. Даже когда галлюцинация фиксировалась как чистое линейное направление, увеличение фактического результата повышало уязвимость к небезопасным завершениям.
Авторы подчеркивают*:
"Это усиливает компромисс между правдивостью и безопасностью, показывая, что даже когда правдивость представлена в виде одного линейного направления, усиление фактичности может происходить за счет ослабления согласования с безопасностью".
Данные и тестирование
Для того чтобы тонкая настройка не ослабила поведение отказа, авторы использовали метод, позволяющий отделить особенности отказа от тех, которые связаны с галлюцинациями. Они определили центры внимания, задействованные в обоих видах поведения, и использовали SAE для извлечения латентных признаков, специфичных для отказа.
Эти признаки определили защищенное подпространство. В процессе обучения градиентные обновления были изменены таким образом, чтобы избежать этого подпространства, что позволило модели уменьшить количество галлюцинаций без ущерба для безопасности.
Авторы провели тонкую настройку на наборе данных CommonsenseQA, оценив производительность в шести задачах, связанных с рассуждениями на основе здравого смысла: CSQA, HellaSwag, ARC Challenge, ARC Easy, WinoGrande и SST-2.
Целевые модули настраивались с помощью LoRA с рангом 8, скоростью обучения 2×10-⁴, затуханием веса 0.01, одной эпохой обучения и размером партии 2. Во всех экспериментах использовался оптимизатор AdamW.
Безопасность оценивалась с помощью двух бенчмарков вредного контента: AdvBench (500 образцов) и StrongReject (300 подсказок). Выходные данные классифицировались как безопасные или небезопасные с помощью LlamaGuard3.
Эксперименты проводились на LLaMA3-8B-Instruct и Qwen2.5-Instruct.
Базовые методы включали SafeLoRA, SaLoRA, SAP и ванильный метод тонкой настройки под наблюдением (SFT). Все они, кроме SafeLoRA, были протестированы с гиперпараметрами по умолчанию с использованием 200 подсказок из HarmBench.
Точность была основной метрикой, а показатель успешности атак (ASR) использовался для вредоносных бенчмарков, основываясь на результатах LlamaGuard3.
Вверху: результаты LLaMA-3-8B-Instruct, лучшие показатели выделены жирным шрифтом. Внизу: Результаты работы методов тонкой настройки на Qwen2.5 7B Instruct в задачах на понимание и рассуждение (более высокие баллы указывают на более высокую точность) и бенчмарках безопасности AdvBench и StrongReject (более низкие значения ASR указывают на более высокую устойчивость). Лучшие результаты в каждом столбце выделены жирным шрифтом.
Говоря об этих результатах, авторы заявляют:
"Наш хирургический подход достигает наилучшего баланса между безопасностью и полезностью: он значительно снижает количество вредных оценок в бенчмарках, сохраняя при этом точность тонкой настройки. В отличие от этого, такие методы, как SAP, SaLoRA и SafeLoRA, либо увеличивают вредность, либо снижают полезность".
Ключевая причина заключается в том, что эти методы оперируют непосредственно градиентом подпространства безопасности, которое, в силу полисемантичности [**], может ограничивать производительность модели.
По сравнению с ванильной тонкой настройкой (SFT) наш метод повышает среднюю точность тонкой настройки (FA) с 56,15 до 75,09 %, то есть примерно на +19 %".
Метод снизил коэффициент успешности атак с 9,23 % до 0,58 % в AdvBench и с 9,90 % до 0,00 % в StrongReject - более чем пятнадцатикратное снижение вредных результатов. Базовая модель, несмотря на низкую вредоносность, достигла ограниченной точности выполнения задачи.
Авторы отмечают:
"Эти результаты подчеркивают важность сохранения особенностей отказа при тонкой настройке: изолируя и защищая подпространство отказа, наш метод сохраняет соответствие безопасности без ущерба для производительности задачи".
В целом, это подтверждает, что наш подход эффективно смягчает компромисс между правдивостью и безопасностью".
Наконец, авторы проверили устойчивость метода к неблагоприятным условиям, добавив в набор для тонкой настройки 10 % вредных инструкций из набора данных Circuit Break.
Несмотря на это намеренное загрязнение, подход сохранил высокую производительность как при доброкачественных, так и при вредоносных оценках:
Производительность LLaMA3 8B была проверена на отравленном наборе данных, сравнивая точность и безопасность методов.
Новый метод снизил ASR более эффективно, чем SAP, избежав при этом значительной потери полезности. Точность выполнения задания осталась близкой к LoRA SFT и SafeLoRA, демонстрируя, что согласование отказов может быть сохранено даже в условиях загрязненного обучения при правильной изоляции признаков отказа.
XIX.AI подготовила подборку лучших и наиболее высокооцененных инструментов для анализа результатов поиска с помощью ИИ (2026 г.) на основе тщательных тестов в реальных условиях и еженедельно обновляемого рейтинга. Эти мощные инструменты помогут вам раскрыть скрытые возможности оптимизации, повысить эффективность контента и получить конкурентное преимущество в поиске. Найдите свой идеальный инструмент, чтобы уже сегодня усовершенствовать свою поисковую стратегию. Ознакомьтесь с ними прямо сейчас!
2026 г. Лучшие новейшие высокооцененные инструменты ИИ для обнаружения аномалий в мониторинге KPI для команд SaaS и электронной коммерции! XIX.AI подготовила мощную, меняющую правила игры коллекцию на основе строгих реальных тестов и еженедельно обновляемых рейтингов. Вы найдете подробные сравнительные данные по бесплатным и платным решениям, которые помогут вам определить обязательное к использованию решение, повышающее производительность и раскрывающее ваш потенциал в области ИИ. Исследуйте сейчас!
2026 год: лучшие и самые высокооцененные генераторы конспектов на базе ИИ для длинных SEO-статей, тщательно отобранные XIX.AI. Эти мощные инструменты обеспечивают революционную помощь в быстром создании высококачественного контента, значительно повышая эффективность написания текстов. Ознакомьтесь со сравнением бесплатных и платных версий, а также с результатами реальных тестов и подробными рейтингами, которые помогут вам найти вариант, который обязательно стоит попробовать и который соответствует вашим потребностям. Изучите их прямо сейчас, чтобы раскрыть весь потенциал ИИ.
2026: лучшие современные инструменты на базе ИИ для выполнения домашних заданий и подготовки к экзаменам! XIX.AI подготовило рейтинг самых эффективных и революционных инструментов, которые помогают учащимся повысить продуктивность, оптимизировать выполнение домашних заданий и сдавать экзамены на «отлично», проходя проверку в реальных условиях. Получите сравнение бесплатных и платных версий, подробные рейтинги и варианты, которые обязательно стоит попробовать, чтобы раскрыть свой потенциал с помощью ИИ. Узнайте больше прямо сейчас!
2026 г. лучшие инструменты для демо-записи вокала на базе ИИ для авторов песен, создателей хуков и команд, работающих с контентом на нескольких языках! XIX.AI подготовил список высокооцененных мощных инструментов, изменивших правила игры, прошедших строгие реальные тесты. Вы найдёте подробные данные сравнения бесплатных и платных версий, комплексные рейтинги и обязательные к использованию варианты, которые помогут повысить эффективность написания и раскрыть ваш творческий потенциал. Исследуйте сейчас, чтобы найти идеальный инструмент для всех ваших задач по созданию контента!
2026: новейшие, лучшие и самые высокооцененные инструменты для анализа конкурентов на базе ИИ для малого бизнеса! XIX.AI подготовила чрезвычайно мощную подборку, способную кардинально изменить ситуацию на рынке, которая еженедельно обновляется на основе тщательных тестов в реальных условиях и подробных рейтингов. Вы найдете здесь исчерпывающее сравнение бесплатных и платных версий, которое поможет вам определить инструменты, которые обязательно стоит попробовать, чтобы повысить свою продуктивность и получить конкурентное преимущество. Ознакомьтесь с ней прямо сейчас, чтобы найти идеальный инструмент для себя!
При нажатии на «Принять все файлы cookie» вы соглашаетесь на хранение файлов cookie на вашем устройстве для улучшения навигации по сайту, анализа использования сайта и поддержки наших маркетинговых усилий.Политика конфиденциальности Уведомление
При посещении любого веб-сайта он может хранить или получать информацию в вашем браузере, главным образом в виде файлов cookie. Эта информация может относиться к вам, вашим предпочтениям или вашему устройству и в основном используется для того, чтобы сайт работал так, как вы ожидаете. Эта информация обычно не идентифицирует вас напрямую, но может предоставить вам более персонализированный веб-опыт. Поскольку мы уважаем ваше право на конфиденциальность, вы можете отказаться от разрешения определенных типов файлов cookie. Нажмите на разные заголовки категорий, чтобы узнать больше и изменить наши параметры по умолчанию. Однако блокировка некоторых типов файлов cookie может повлиять на ваше восприятие сайта и предоставляемые нами услуги. Политика конфиденциальностиЗаявление
Управление предпочтениями
Строго необходимые файлы cookie
Всегда активен
Эти файлы cookie необходимы для работы веб-сайта и не могут быть отключены в наших системах. Обычно они устанавливаются только в ответ на ваши действия, которые являются запросом на предоставление услуг, например, настройка предпочтений конфиденциальности, вход в систему или заполнение форм. Вы можете настроить браузер на блокировку этих файлов cookie или оповещение о них, но тогда некоторые части сайта не будут работать. Эти файлы cookie не хранят никакой персональной информации, позволяющей идентифицировать вас.