Метапознание может стать ключом к устранению галлюцинаций в крупных моделях
Галлюцинации крупных моделей — когда ИИ с абсолютной уверенностью выдает неверные с фактической точки зрения сведения — уже давно являются одной из основных проблем в отрасли искусственного интеллекта. Эта проблема приобретает особое значение в таких сферах с высоким уровнем риска, как здравоохранение и право.
На протяжении многих лет в отрасли в основном применялись две стратегии борьбы с галлюцинациями: одна заключалась в массовом расширении объема обучающих данных с целью сделать ИИ «всезнающим»; другая — в создании защитных механизмов, побуждающих ИИ «молчать» в случае неуверенности. Однако оба подхода имеют явные ограничения. Первый подход не может охватить все существующие факты, оставляя «слепые зоны». Второй часто приводит к высокому «налогу на полезность»: стремясь исключить ошибки, ИИ в итоге отказывается отвечать на многие правильные вопросы, что значительно ухудшает пользовательский опыт.
Недавно в статье, написанной совместно исследователями Google Research и Тель-Авивского университета, была предложена новая точка зрения на эту дилемму: метапознание. Исследование показывает, что ключ к решению проблемы галлюцинаций заключается не в том, чтобы заставить ИИ никогда не ошибаться, а в том, чтобы дать ему возможность «знать, что он знает — и чего не знает».

Рисунок: Разница между калибровкой и дискриминационной способностью. Слева показана хорошо откалиброванная модель (красная линия, близкая к диагонали), а справа — суровая реальность: даже при идеальной калибровке снижение уровня ошибок с 25 % до 5 % требует потери 52 % правильных ответов.
В статье дается новое определение галлюцинаций: основной вопрос заключается не в том, являются ли результаты ИИ неправильными, а в том, вводят ли они пользователей в заблуждение уверенным тоном, когда система испытывает неуверенность. Исследователи утверждают, что ИИ должен обладать способностью к «честной неопределённости». То есть, когда внутреннее состояние модели сигнализирует о колебаниях или низкой уверенности, его формулировки должны отражать осторожность и сдержанность — а не притворяться, будто он излагает абсолютные факты.
Метапознание означает осознание ИИ своих собственных когнитивных процессов. Это требует от крупных моделей чуткого восприятия своих внутренних состояний и, на основе этого восприятия, честного выражения уровня уверенности. В эпоху ИИ-агентов эта способность особенно важна. Система ИИ без метапознания подобна пилоту без приборной панели — она не может определить, когда следует задействовать внешние инструменты, и не может проверить надежность результатов поиска, что делает её подверженной неправомерному использованию инструментов и даже «слепому пилотированию».

Рисунок: Фактическая производительность основных моделей на наборе данных SimpleQA Verified. Пятиконечная звезда в правом верхнем углу обозначает идеальную цель; «Discrimination Gap» (разрыв в дискриминации) указывает на расстояние между текущими моделями и этим идеалом, а «Utility Tax» (налог на полезность) показывает цену, которую Claude Opus4 платит за достижение высокой точности.
Конечно, реализация этого подхода сопряжена со значительными трудностями. Например, как отличить «истинную метапознавательность» от «намеренного демонстрирования неопределённости» и как избежать негативных последствий RLHF (обучения с подкреплением на основе обратной связи от человека) — ведь люди склонны отдавать предпочтение уверенным ответам, что в некотором смысле фактически побуждает ИИ учиться симулировать уверенность.
Для будущего развития ИИ исследование предлагает практические рекомендации: показатели оценки технологий борьбы с галлюцинациями не должны больше ориентироваться исключительно на точность, а должны оценивать баланс между «полезностью и уровнем ошибок». ИИ не обязательно должен стать непогрешимой машиной, но он должен обладать базовым профессиональным качеством: способностью честно различать «я уверен» и «я предполагаю». Именно это чёткое осознание границ собственных знаний является ключевым путем к повышению доверия к ИИ и его реальной ценности.
Связанная статья
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её
Google тестирует агента Remy AI для Gemini по мере смещения фокуса на управление пользователями
Согласно Business Insider, Google тестирует Remy, нового ИИ-персонального агента для Gemini. Этот инструмент предназначен для выполнения задач от имени пользователей, упрощая как профессиональные рабочие процессы, так и повседневные рутины.В настоящ
Рекомендации по связанным специальным темам
Комментарии (0)
Галлюцинации крупных моделей — когда ИИ с абсолютной уверенностью выдает неверные с фактической точки зрения сведения — уже давно являются одной из основных проблем в отрасли искусственного интеллекта. Эта проблема приобретает особое значение в таких сферах с высоким уровнем риска, как здравоохранение и право.
На протяжении многих лет в отрасли в основном применялись две стратегии борьбы с галлюцинациями: одна заключалась в массовом расширении объема обучающих данных с целью сделать ИИ «всезнающим»; другая — в создании защитных механизмов, побуждающих ИИ «молчать» в случае неуверенности. Однако оба подхода имеют явные ограничения. Первый подход не может охватить все существующие факты, оставляя «слепые зоны». Второй часто приводит к высокому «налогу на полезность»: стремясь исключить ошибки, ИИ в итоге отказывается отвечать на многие правильные вопросы, что значительно ухудшает пользовательский опыт.
Недавно в статье, написанной совместно исследователями Google Research и Тель-Авивского университета, была предложена новая точка зрения на эту дилемму: метапознание. Исследование показывает, что ключ к решению проблемы галлюцинаций заключается не в том, чтобы заставить ИИ никогда не ошибаться, а в том, чтобы дать ему возможность «знать, что он знает — и чего не знает».

Рисунок: Разница между калибровкой и дискриминационной способностью. Слева показана хорошо откалиброванная модель (красная линия, близкая к диагонали), а справа — суровая реальность: даже при идеальной калибровке снижение уровня ошибок с 25 % до 5 % требует потери 52 % правильных ответов.
В статье дается новое определение галлюцинаций: основной вопрос заключается не в том, являются ли результаты ИИ неправильными, а в том, вводят ли они пользователей в заблуждение уверенным тоном, когда система испытывает неуверенность. Исследователи утверждают, что ИИ должен обладать способностью к «честной неопределённости». То есть, когда внутреннее состояние модели сигнализирует о колебаниях или низкой уверенности, его формулировки должны отражать осторожность и сдержанность — а не притворяться, будто он излагает абсолютные факты.
Метапознание означает осознание ИИ своих собственных когнитивных процессов. Это требует от крупных моделей чуткого восприятия своих внутренних состояний и, на основе этого восприятия, честного выражения уровня уверенности. В эпоху ИИ-агентов эта способность особенно важна. Система ИИ без метапознания подобна пилоту без приборной панели — она не может определить, когда следует задействовать внешние инструменты, и не может проверить надежность результатов поиска, что делает её подверженной неправомерному использованию инструментов и даже «слепому пилотированию».

Рисунок: Фактическая производительность основных моделей на наборе данных SimpleQA Verified. Пятиконечная звезда в правом верхнем углу обозначает идеальную цель; «Discrimination Gap» (разрыв в дискриминации) указывает на расстояние между текущими моделями и этим идеалом, а «Utility Tax» (налог на полезность) показывает цену, которую Claude Opus4 платит за достижение высокой точности.
Конечно, реализация этого подхода сопряжена со значительными трудностями. Например, как отличить «истинную метапознавательность» от «намеренного демонстрирования неопределённости» и как избежать негативных последствий RLHF (обучения с подкреплением на основе обратной связи от человека) — ведь люди склонны отдавать предпочтение уверенным ответам, что в некотором смысле фактически побуждает ИИ учиться симулировать уверенность.
Для будущего развития ИИ исследование предлагает практические рекомендации: показатели оценки технологий борьбы с галлюцинациями не должны больше ориентироваться исключительно на точность, а должны оценивать баланс между «полезностью и уровнем ошибок». ИИ не обязательно должен стать непогрешимой машиной, но он должен обладать базовым профессиональным качеством: способностью честно различать «я уверен» и «я предполагаю». Именно это чёткое осознание границ собственных знаний является ключевым путем к повышению доверия к ИИ и его реальной ценности.
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её





Дом






