Anthropic вводит функцию прекращения оскорбительных чатов для моделей Claude

Компания Anthropic представила новый функционал, позволяющий отдельным продвинутым моделям прерывать беседу в "редких, экстремальных случаях постоянного вредного или оскорбительного взаимодействия с пользователем". Примечательно, что Anthropic заявляет, что эта мера применяется не для защиты пользователей, а для защиты самой модели ИИ.
Уточним, что компания не утверждает, что ее модели ИИ Claude обладают чувством или могут испытывать вред от общения с пользователями. Как объясняет Anthropic, компания по-прежнему "не уверена в потенциальном моральном статусе Claude и других больших языковых моделей, как в настоящее время, так и в будущем".
Тем не менее, в заявлении упоминается недавно созданная программа по изучению "благосостояния моделей", что указывает на то, что Anthropic придерживается осторожного подхода, "работая над выявлением и реализацией недорогих мер по снижению рисков для благосостояния моделей, если такое благосостояние станет актуальным".
В настоящее время эта новая возможность ограничена моделями Claude Opus 4 и 4.1, разработанными специально для "экстремальных случаев", таких как "запросы на сексуальный контент с участием несовершеннолетних или попытки получить информацию, позволяющую осуществлять крупномасштабное насилие или террористическую деятельность".
Хотя такие запросы могут вызвать у Anthropic проблемы с законом или связями с общественностью (как, например, недавние сообщения о том, что ChatGPT может усилить бредовое мышление пользователей), компания сообщает, что во время предварительного тестирования Claude Opus 4 продемонстрировал "сильное предпочтение против" выполнения таких запросов и показал "модели, указывающие на дистресс", когда его заставляли отвечать.
Что касается новых возможностей завершения разговора, Anthropic поясняет, что "Клод проинструктирован использовать эту функцию только в качестве последнего средства после того, как многочисленные попытки перенаправления потерпели неудачу и продуктивный диалог стал невозможен, или когда пользователи явно просят завершить чат".
Anthropic также уточняет, что Claude "было дано указание не использовать эту функцию в ситуациях, когда пользователи могут столкнуться с неминуемым риском причинения вреда себе или другим".
Мероприятие TechcrunchТяжеловесы технологического и венчурного рынка присоединяются к программе Disrupt 2025
Netflix, ElevenLabs, Wayve, Sequoia Capital, Elad Gil - вот лишь некоторые из лидеров индустрии, которые примут участие в программе Disrupt 2025. Они поделятся важнейшими идеями, которые помогут ускорить рост стартапов и отточить ваши конкурентные преимущества. Не пропустите 20-ю годовщину TechCrunch Disrupt - купите билет прямо сейчас и сэкономьте более 600 долларов до повышения цен.
К программе Disrupt 2025 присоединятся ведущие технологические и венчурные компании
Netflix, ElevenLabs, Wayve, Sequoia Capital - среди выдающихся инноваторов, присоединившихся к программе Disrupt 2025. Они готовы предоставить ценные идеи, которые будут способствовать развитию стартапов и укреплению ваших конкурентных позиций. Присоединяйтесь к нам на празднование 20-летия TechCrunch Disrupt - купите билет сегодня и сэкономьте до $675 до изменения цен.
Сан-Франциско | 27-29 октября 2025 г. ЗАРЕГИСТРИРОВАТЬСЯ СЕЙЧАСЕсли Клод все же прервет разговор, Anthropic отмечает, что пользователи все равно смогут начать новые разговоры с той же учетной записи и создать альтернативные ветки разговора, изменив свои предыдущие ответы.
"Мы подходим к этой функции как к постоянному эксперименту и будем продолжать совершенствовать нашу методику", - заявляет компания.
Связанная статья
Anthropic выходит на рынок юридических технологий ИИ по мере усиления конкуренции
Anthropic unveiled a suite of new chatbot capabilities on Tuesday, aimed at delivering automated support to legal practices. Эти инструменты были представлены во вторник и направлены на предоставление автоматизированной поддержки юридическим фирмам.
Anthropic выпускает Opus 4.8 с новым инструментом для динамической организации рабочего процесса
В четверг компания Anthropic представила Opus 4.8 — новую версию своей флагманской общедоступной модели. Стоимость обновления осталась на прежнем уровне, и теперь оно доступно на всех платформах.Выпус
Anthropic представляет Claude Fable 5 — публичную версию Mythos
Компания Anthropic впервые предоставляет широкой публике доступ к своей самой мощной модели искусственного интеллекта — однако с соблюдением мер безопасности.Во вторник компания представила Claude Fa
Рекомендации по связанным специальным темам
Комментарии (1)

Компания Anthropic представила новый функционал, позволяющий отдельным продвинутым моделям прерывать беседу в "редких, экстремальных случаях постоянного вредного или оскорбительного взаимодействия с пользователем". Примечательно, что Anthropic заявляет, что эта мера применяется не для защиты пользователей, а для защиты самой модели ИИ.
Уточним, что компания не утверждает, что ее модели ИИ Claude обладают чувством или могут испытывать вред от общения с пользователями. Как объясняет Anthropic, компания по-прежнему "не уверена в потенциальном моральном статусе Claude и других больших языковых моделей, как в настоящее время, так и в будущем".
Тем не менее, в заявлении упоминается недавно созданная программа по изучению "благосостояния моделей", что указывает на то, что Anthropic придерживается осторожного подхода, "работая над выявлением и реализацией недорогих мер по снижению рисков для благосостояния моделей, если такое благосостояние станет актуальным".
В настоящее время эта новая возможность ограничена моделями Claude Opus 4 и 4.1, разработанными специально для "экстремальных случаев", таких как "запросы на сексуальный контент с участием несовершеннолетних или попытки получить информацию, позволяющую осуществлять крупномасштабное насилие или террористическую деятельность".
Хотя такие запросы могут вызвать у Anthropic проблемы с законом или связями с общественностью (как, например, недавние сообщения о том, что ChatGPT может усилить бредовое мышление пользователей), компания сообщает, что во время предварительного тестирования Claude Opus 4 продемонстрировал "сильное предпочтение против" выполнения таких запросов и показал "модели, указывающие на дистресс", когда его заставляли отвечать.
Что касается новых возможностей завершения разговора, Anthropic поясняет, что "Клод проинструктирован использовать эту функцию только в качестве последнего средства после того, как многочисленные попытки перенаправления потерпели неудачу и продуктивный диалог стал невозможен, или когда пользователи явно просят завершить чат".
Anthropic также уточняет, что Claude "было дано указание не использовать эту функцию в ситуациях, когда пользователи могут столкнуться с неминуемым риском причинения вреда себе или другим".
Мероприятие TechcrunchТяжеловесы технологического и венчурного рынка присоединяются к программе Disrupt 2025
Netflix, ElevenLabs, Wayve, Sequoia Capital, Elad Gil - вот лишь некоторые из лидеров индустрии, которые примут участие в программе Disrupt 2025. Они поделятся важнейшими идеями, которые помогут ускорить рост стартапов и отточить ваши конкурентные преимущества. Не пропустите 20-ю годовщину TechCrunch Disrupt - купите билет прямо сейчас и сэкономьте более 600 долларов до повышения цен.
К программе Disrupt 2025 присоединятся ведущие технологические и венчурные компании
Netflix, ElevenLabs, Wayve, Sequoia Capital - среди выдающихся инноваторов, присоединившихся к программе Disrupt 2025. Они готовы предоставить ценные идеи, которые будут способствовать развитию стартапов и укреплению ваших конкурентных позиций. Присоединяйтесь к нам на празднование 20-летия TechCrunch Disrupt - купите билет сегодня и сэкономьте до $675 до изменения цен.
Сан-Франциско | 27-29 октября 2025 г. ЗАРЕГИСТРИРОВАТЬСЯ СЕЙЧАСЕсли Клод все же прервет разговор, Anthropic отмечает, что пользователи все равно смогут начать новые разговоры с той же учетной записи и создать альтернативные ветки разговора, изменив свои предыдущие ответы.
"Мы подходим к этой функции как к постоянному эксперименту и будем продолжать совершенствовать нашу методику", - заявляет компания.
Anthropic выходит на рынок юридических технологий ИИ по мере усиления конкуренции
Anthropic unveiled a suite of new chatbot capabilities on Tuesday, aimed at delivering automated support to legal practices. Эти инструменты были представлены во вторник и направлены на предоставление автоматизированной поддержки юридическим фирмам.
Anthropic выпускает Opus 4.8 с новым инструментом для динамической организации рабочего процесса
В четверг компания Anthropic представила Opus 4.8 — новую версию своей флагманской общедоступной модели. Стоимость обновления осталась на прежнем уровне, и теперь оно доступно на всех платформах.Выпус
Anthropic представляет Claude Fable 5 — публичную версию Mythos
Компания Anthropic впервые предоставляет широкой публике доступ к своей самой мощной модели искусственного интеллекта — однако с соблюдением мер безопасности.Во вторник компания представила Claude Fa





Дом






