가학적인 채팅을 종료할 수 있는 기능을 도입한 Anthropic, Claude 모델 출시

Anthropic은 일부 고급 모델이 "지속적으로 유해하거나 가학적인 사용자 상호작용이 발생하는 드물고 극단적인 경우"에 대화를 종료할 수 있도록 하는 새로운 기능을 도입했습니다. 특히, 이러한 조치는 인간 사용자를 보호하기 위한 것이 아니라 AI 모델 자체를 보호하기 위해 시행되는 것이라고 설명합니다.
명확히 말하자면, 앤트로픽은 자사의 클로드 AI 모델이 지성을 가지고 있다거나 사용자 대화로 인해 피해를 입을 수 있다고 주장하지 않습니다. 앤트로픽은 "현재 또는 미래에 클로드 및 기타 대규모 언어 모델의 잠재적인 도덕적 지위에 대해 매우 불확실하다"고 설명합니다.
그럼에도 불구하고 이 발표는 최근 "모델 복지"를 검토하는 프로그램을 신설했다고 언급하며, Anthropic이 "모델 복지에 대한 위험을 완화하기 위해 저비용 개입을 식별하고 구현하여 관련 문제가 발생할 경우 이를 예방하는 접근 방식을 채택하고 있음을 시사합니다."라고 밝혔습니다.
이 새로운 기능은 현재 "미성년자와 관련된 성적 콘텐츠 요청 또는 대규모 폭력이나 테러 활동을 가능하게 하는 정보를 얻으려는 시도"와 같은 "극단적인 사례"를 위해 특별히 설계된 클로드 오퍼스 4 및 4.1 모델에만 제한적으로 적용되고 있습니다.
이러한 요청은 사용자의 망상적 사고를 강화할 수 있다는 최근 보고서에서 볼 수 있듯이 Anthropic에 법적 또는 홍보상의 문제를 야기할 수 있지만, 배포 전 테스트에서 클로드 오퍼스 4는 이러한 요청에 응하지 않으려는 "강한 선호"를 보였으며 강제로 응답할 경우 "고통을 시사하는 패턴"을 보였다고 회사는 보고했습니다.
이러한 새로운 대화 종료 기능에 대해 Anthropic은 "여러 번의 리다이렉션 시도가 실패하여 생산적인 대화가 불가능해 보이거나 사용자가 명시적으로 대화 종료를 요청한 경우에만 최후의 수단으로 이 기능을 사용하라는 지시를 받았습니다."라고 설명합니다.
또한, Anthropic은 "사용자가 자해 또는 타인에게 위해를 가할 위험이 있는 상황에서는 이 기능을 사용하지 말라는 지시를 받았다"고 명시하고 있습니다.
테크크런치 이벤트기술 및 벤처캐피털의 거물들이 Disrupt 2025 의제에 동참하다
넷플릭스, 일레븐랩스, 웨이브, 세쿼이아 캐피털, 엘라드 길 등 업계 리더들이 Disrupt 2025 아젠다에 동참합니다. 이들은 스타트업의 성장을 가속화하고 경쟁 우위를 강화하기 위한 중요한 인사이트를 공유할 것입니다. 테크크런치 디스럽트 20주년 기념판을 놓치지 마세요. 지금 티켓을 확보하고 가격이 인상되기 전에 600달러 이상 절약하세요.
기술 및 VC 업계의 거물들이 Disrupt 2025 아젠다에 참여합니다.
넷플릭스, 일레븐랩스, 웨이브, 세쿼이아 캐피탈 등 저명한 혁신 기업들이 Disrupt 2025 아젠다에 참여합니다. 이들은 스타트업의 확장을 촉진하고 경쟁 우위를 강화할 수 있는 귀중한 인사이트를 제공하기 위해 이 자리에 모였습니다. 지금 바로 티켓을 구매하고 요금이 변경되기 전에 최대 675달러까지 할인된 가격으로 테크크런치 디스럽트 20주년 기념행사에 참여하세요.
샌프란시스코 | 2025년 10월 27~29일 지금 등록하기Claude가 대화를 종료하더라도 Anthropic 노트 사용자들은 동일한 계정에서 새로운 대화를 시작하고 이전 답변을 수정하여 대체 대화 브랜치를 만들 수 있습니다.
"이 기능은 지속적인 실험으로 접근하고 있으며 방법론을 계속 개선해 나갈 것"이라고 밝혔습니다.
관련 기사
Anthropic, AI 법률 기술 시장에 진출하며 경쟁 심화
Anthropic은 화요일 법률 실무에 자동화된 지원을 제공하기 위해 설계된 일련의 새로운 챗봇 기능을 공개했습니다. 이러한 기능들은 올해 초 도입된 법률 전용 플랫폼인 Claude for Legal을 확장하여, 다양한 법률 분야에 맞춘 전문 법률 플러그인과 MCP 연결자를 추가합니다.이러한 도구들은 법률 AI 분야의 경쟁이 심화되는 시점에 등장했습니다. 3월, 법률 워크플로우를 간소화하기 위해 에이전트 AI를 활용하는 AI 법률 스타트업 하
Anthropic, 새로운 동적 워크플로우 도구를 탑재한 Opus 4.8 출시
앤트로픽은 목요일, 자사의 주력 공개 모델인 ‘오푸스(Opus)’의 최신 버전인 4.8을 공개했다. 이전 버전과 가격이 동일한 이번 업데이트는 이제 모든 플랫폼에서 이용할 수 있다.Opus 4.7 출시 불과 41일 만에 Opus 4.8을 공개한 Anthropic은 개발 주기를 대폭 단축했으며, 이는 최근 Sonnet 및 Haiku 출시 시 보였던 3개월 및
Anthropic, Mythos의 공개 버전인 ‘Claude Fable 5’를 선보였다
앤트로픽(Anthropic)이 자사의 가장 강력한 AI 모델을 처음으로 일반 대중에게 공개했으나, 안전 조치를 마련한 상태입니다.화요일, 이 회사는 ‘Mythos’ 모델의 첫 공개 버전인 ‘Claude Fable 5’를 출시했다. 앤트로픽에 따르면, ‘페이블 5’는 소프트웨어 엔지니어링, 지식 업무, 비전 작업 분야에서 우수한 성능을 보이지만 엄격한 안전
관련 특별 주제 추천
의견 (1)
0/500

Anthropic은 일부 고급 모델이 "지속적으로 유해하거나 가학적인 사용자 상호작용이 발생하는 드물고 극단적인 경우"에 대화를 종료할 수 있도록 하는 새로운 기능을 도입했습니다. 특히, 이러한 조치는 인간 사용자를 보호하기 위한 것이 아니라 AI 모델 자체를 보호하기 위해 시행되는 것이라고 설명합니다.
명확히 말하자면, 앤트로픽은 자사의 클로드 AI 모델이 지성을 가지고 있다거나 사용자 대화로 인해 피해를 입을 수 있다고 주장하지 않습니다. 앤트로픽은 "현재 또는 미래에 클로드 및 기타 대규모 언어 모델의 잠재적인 도덕적 지위에 대해 매우 불확실하다"고 설명합니다.
그럼에도 불구하고 이 발표는 최근 "모델 복지"를 검토하는 프로그램을 신설했다고 언급하며, Anthropic이 "모델 복지에 대한 위험을 완화하기 위해 저비용 개입을 식별하고 구현하여 관련 문제가 발생할 경우 이를 예방하는 접근 방식을 채택하고 있음을 시사합니다."라고 밝혔습니다.
이 새로운 기능은 현재 "미성년자와 관련된 성적 콘텐츠 요청 또는 대규모 폭력이나 테러 활동을 가능하게 하는 정보를 얻으려는 시도"와 같은 "극단적인 사례"를 위해 특별히 설계된 클로드 오퍼스 4 및 4.1 모델에만 제한적으로 적용되고 있습니다.
이러한 요청은 사용자의 망상적 사고를 강화할 수 있다는 최근 보고서에서 볼 수 있듯이 Anthropic에 법적 또는 홍보상의 문제를 야기할 수 있지만, 배포 전 테스트에서 클로드 오퍼스 4는 이러한 요청에 응하지 않으려는 "강한 선호"를 보였으며 강제로 응답할 경우 "고통을 시사하는 패턴"을 보였다고 회사는 보고했습니다.
이러한 새로운 대화 종료 기능에 대해 Anthropic은 "여러 번의 리다이렉션 시도가 실패하여 생산적인 대화가 불가능해 보이거나 사용자가 명시적으로 대화 종료를 요청한 경우에만 최후의 수단으로 이 기능을 사용하라는 지시를 받았습니다."라고 설명합니다.
또한, Anthropic은 "사용자가 자해 또는 타인에게 위해를 가할 위험이 있는 상황에서는 이 기능을 사용하지 말라는 지시를 받았다"고 명시하고 있습니다.
테크크런치 이벤트기술 및 벤처캐피털의 거물들이 Disrupt 2025 의제에 동참하다
넷플릭스, 일레븐랩스, 웨이브, 세쿼이아 캐피털, 엘라드 길 등 업계 리더들이 Disrupt 2025 아젠다에 동참합니다. 이들은 스타트업의 성장을 가속화하고 경쟁 우위를 강화하기 위한 중요한 인사이트를 공유할 것입니다. 테크크런치 디스럽트 20주년 기념판을 놓치지 마세요. 지금 티켓을 확보하고 가격이 인상되기 전에 600달러 이상 절약하세요.
기술 및 VC 업계의 거물들이 Disrupt 2025 아젠다에 참여합니다.
넷플릭스, 일레븐랩스, 웨이브, 세쿼이아 캐피탈 등 저명한 혁신 기업들이 Disrupt 2025 아젠다에 참여합니다. 이들은 스타트업의 확장을 촉진하고 경쟁 우위를 강화할 수 있는 귀중한 인사이트를 제공하기 위해 이 자리에 모였습니다. 지금 바로 티켓을 구매하고 요금이 변경되기 전에 최대 675달러까지 할인된 가격으로 테크크런치 디스럽트 20주년 기념행사에 참여하세요.
샌프란시스코 | 2025년 10월 27~29일 지금 등록하기Claude가 대화를 종료하더라도 Anthropic 노트 사용자들은 동일한 계정에서 새로운 대화를 시작하고 이전 답변을 수정하여 대체 대화 브랜치를 만들 수 있습니다.
"이 기능은 지속적인 실험으로 접근하고 있으며 방법론을 계속 개선해 나갈 것"이라고 밝혔습니다.
Anthropic, AI 법률 기술 시장에 진출하며 경쟁 심화
Anthropic은 화요일 법률 실무에 자동화된 지원을 제공하기 위해 설계된 일련의 새로운 챗봇 기능을 공개했습니다. 이러한 기능들은 올해 초 도입된 법률 전용 플랫폼인 Claude for Legal을 확장하여, 다양한 법률 분야에 맞춘 전문 법률 플러그인과 MCP 연결자를 추가합니다.이러한 도구들은 법률 AI 분야의 경쟁이 심화되는 시점에 등장했습니다. 3월, 법률 워크플로우를 간소화하기 위해 에이전트 AI를 활용하는 AI 법률 스타트업 하
Anthropic, 새로운 동적 워크플로우 도구를 탑재한 Opus 4.8 출시
앤트로픽은 목요일, 자사의 주력 공개 모델인 ‘오푸스(Opus)’의 최신 버전인 4.8을 공개했다. 이전 버전과 가격이 동일한 이번 업데이트는 이제 모든 플랫폼에서 이용할 수 있다.Opus 4.7 출시 불과 41일 만에 Opus 4.8을 공개한 Anthropic은 개발 주기를 대폭 단축했으며, 이는 최근 Sonnet 및 Haiku 출시 시 보였던 3개월 및
Anthropic, Mythos의 공개 버전인 ‘Claude Fable 5’를 선보였다
앤트로픽(Anthropic)이 자사의 가장 강력한 AI 모델을 처음으로 일반 대중에게 공개했으나, 안전 조치를 마련한 상태입니다.화요일, 이 회사는 ‘Mythos’ 모델의 첫 공개 버전인 ‘Claude Fable 5’를 출시했다. 앤트로픽에 따르면, ‘페이블 5’는 소프트웨어 엔지니어링, 지식 업무, 비전 작업 분야에서 우수한 성능을 보이지만 엄격한 안전





집






