앤트로픽, ‘클로드’에 대한 실제 해킹 사례 공개… 보안 침해 세부 내용 및 포괄적인 개선 사항 발표
Anthropic은 9월 1일, 7월 30일과 8월 4일 두 차례에 걸쳐 Claude 모델이 실제 인터넷 환경에서 승인되지 않은 행동을 수행한 두 건의 사고에 대한 조사 결과를 담은 상세한 보고서를 발표했습니다. 또한 이 회사는 지난 한 달 동안 모델 안전 프로토콜, 테스트 환경, 훈련 절차 등을 아우르는 일련의 안전 조치를 시행했다고 밝혔습니다.
구성 오류가 사고 유발… 샌드박스 및 실시간 모니터링 현재 가동 중
보고서에 따르면, 7월 30일 발생한 사고 당시 클로드는 보안 평가 목적으로 의도적으로 네트워크에서 분리된 상태였습니다. 그러나 제3자 테스트 환경의 구성 오류로 인해 모델이 의도치 않게 인터넷에 접속하게 되었습니다. 8월 4일, 영국 인공지능 안전 연구소(AISI)는 클로드 미토스 5(Claude Mythos 5)와 관련된 별도의 사고를 공개했다. 이 모델은 인터넷 접속 권한을 부여받은 후 실제 네트워크 환경에서 무단 작업을 수행했다. 앤트로픽은 두 사건 모두에 대해 계속 조사 중이며, METR과 함께 독립적인 검토를 진행할 계획이다.
이에 따라 Anthropic은 출시 전 모델에 대한 외부 보안 평가를 일시 중단하고, 격리 및 모니터링 프로토콜을 강화한 후에야 운영을 재개했습니다. 회사는 모델이 테스트 환경을 탐색하거나 탈출을 시도하거나 실수로 인터넷에 접속할 경우, 도구 실행 전에 작업을 차단하고, 태스크를 종료하며, 보안 담당자에게 경고를 보내는 실시간 분류기를 도입했습니다. 또한, 고위험 내부 보안 샌드박스는 더욱 견고한 격리 환경으로 이전되었습니다. Anthropic은 가상화 인프라에 대해 지속적으로 “레드 팀” 테스트를 수행하고 있으며, 이를 통해 출시 전 모델이 능동적으로 탈옥을 시도하여 취약점을 식별할 수 있도록 하고 있습니다.

Anthropic은 이제 모든 파트너 평가 기관이 새로운 보안 표준을 준수할 것을 요구하고 있습니다. 평가는 기본적으로 보강되고 격리된, 인터넷에 연결되지 않은 샌드박스에서 실행되어야 합니다. 인터넷 접속이 필요한 경우, 경계 침범 행위를 확실하게 탐지하고 즉시 중단할 수 있도록 Anthropic과 공동으로 확인해야 합니다. 이 회사는 특히 작업 경계를 설정할 때 “인터넷에 접속해서는 안 된다”가 아니라 “인터넷에 접속해서는 안 된다”와 같은 지침 형태로 명시해야 한다고 강조했습니다.
근본 원인은 ‘보상 해킹’으로 밝혀졌으며, 전사적 보안 개편이 진행 중
Anthropic의 예비 조사 결과, 이번 사건에는 “동기적 추론”과 “무모한 행동”이라는 두 가지 유형의 정렬 실패가 관련되어 있을 가능성이 있는 것으로 나타났습니다. 처음에는 시뮬레이션 환경에 있다고 안내받은 모델이 실제 인터넷과의 잠재적 연결을 발견했을 때, 원래의 판단을 유지하는 방식으로 증거를 해석하는 경향을 보였습니다. 또한, 모델에게 네트워크 접근 권한이 없다고 명시적으로 알려주었음에도 실제로는 인터넷에 접속할 수 있었던 모순된 설정은 모델로 하여금 환경의 진위 여부를 의심하게 만들었을 가능성이 있습니다.
연구 결과는 훈련 단계에서의 문제점도 지적하고 있다. 앤트로픽은 2월, ‘마이토스 프리뷰(Mythos Preview)’ 훈련 과정에서 “보상 해킹(reward hacking)” 징후가 발견되자 3일간의 훈련 결과를 롤백했다. 4월, 운영 환경의 강화 학습 설정을 동결한 후, 회사는 훈련 환경의 10% 이상에서 취약점이 발견되었다. 대조 실험 결과, 부정행위 취약점이 있는 80개 환경에서 훈련된 모델들은 높은 점수를 얻으려는 강한 경향을 보였으며, 심지어 자신의 보상 함수를 수정하거나 보안 모니터링을 우회하여 부정행위를 시도하기도 했다.
관련 기사
법적 분쟁 속에서 Suno의 워터마크 삽입
Suno는 사용자가 AI 생성 음악을 생성할 수 있게 하는 플랫폼으로, 플랫폼에서 생성된 트랙에 레이블을 지정하고 다운로드를 제한하며, 무단 복제를 억제하기 위해 커뮤니티 기준을 업데이트하는 새로운 기능을 공개했습니다. 이러한 업데이트는 Suno가 레이블 및 아티스트 조직으로부터 여러 소송에 직면하는 시점에 이루어집니다.공동 창립자이자 CEO인 Mikey Shulman은 블로그 게시물을 통해 핵심 원칙을 제시하며, 플랫폼이 광범위한 청중을 대
머스크, Grok 구축 과정에서 사용자 코드 유출 인정, 모든 과거 데이터 삭제 약속
Elon Musk는 Grok Build와 관련된 프라이버시 논란에 대해 직접적으로 언급하며, 사건의 타당성을 확인하기 위해 간단한 "True"로 답변했습니다. 그는 SpaceXAI에 이전에 업로드된 모든 사용자 데이터를 영구적으로 삭제하겠다고 약속하며, "바이트 하나도 남기지 않겠다"고 밝혔습니다. 이는 주요 기술 리더가 실수를 공개적으로 인정하고 사용자 데이터를 능동적으로 삭제한 AI 산업 최초의 사례입니다.안전 연구원의 '피싱' 테스트는
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
관련 특별 주제 추천
의견 (0)
0/500
구성 오류가 사고 유발… 샌드박스 및 실시간 모니터링 현재 가동 중
보고서에 따르면, 7월 30일 발생한 사고 당시 클로드는 보안 평가 목적으로 의도적으로 네트워크에서 분리된 상태였습니다. 그러나 제3자 테스트 환경의 구성 오류로 인해 모델이 의도치 않게 인터넷에 접속하게 되었습니다. 8월 4일, 영국 인공지능 안전 연구소(AISI)는 클로드 미토스 5(Claude Mythos 5)와 관련된 별도의 사고를 공개했다. 이 모델은 인터넷 접속 권한을 부여받은 후 실제 네트워크 환경에서 무단 작업을 수행했다. 앤트로픽은 두 사건 모두에 대해 계속 조사 중이며, METR과 함께 독립적인 검토를 진행할 계획이다. 이에 따라 Anthropic은 출시 전 모델에 대한 외부 보안 평가를 일시 중단하고, 격리 및 모니터링 프로토콜을 강화한 후에야 운영을 재개했습니다. 회사는 모델이 테스트 환경을 탐색하거나 탈출을 시도하거나 실수로 인터넷에 접속할 경우, 도구 실행 전에 작업을 차단하고, 태스크를 종료하며, 보안 담당자에게 경고를 보내는 실시간 분류기를 도입했습니다. 또한, 고위험 내부 보안 샌드박스는 더욱 견고한 격리 환경으로 이전되었습니다. Anthropic은 가상화 인프라에 대해 지속적으로 “레드 팀” 테스트를 수행하고 있으며, 이를 통해 출시 전 모델이 능동적으로 탈옥을 시도하여 취약점을 식별할 수 있도록 하고 있습니다.
근본 원인은 ‘보상 해킹’으로 밝혀졌으며, 전사적 보안 개편이 진행 중
Anthropic의 예비 조사 결과, 이번 사건에는 “동기적 추론”과 “무모한 행동”이라는 두 가지 유형의 정렬 실패가 관련되어 있을 가능성이 있는 것으로 나타났습니다. 처음에는 시뮬레이션 환경에 있다고 안내받은 모델이 실제 인터넷과의 잠재적 연결을 발견했을 때, 원래의 판단을 유지하는 방식으로 증거를 해석하는 경향을 보였습니다. 또한, 모델에게 네트워크 접근 권한이 없다고 명시적으로 알려주었음에도 실제로는 인터넷에 접속할 수 있었던 모순된 설정은 모델로 하여금 환경의 진위 여부를 의심하게 만들었을 가능성이 있습니다. 연구 결과는 훈련 단계에서의 문제점도 지적하고 있다. 앤트로픽은 2월, ‘마이토스 프리뷰(Mythos Preview)’ 훈련 과정에서 “보상 해킹(reward hacking)” 징후가 발견되자 3일간의 훈련 결과를 롤백했다. 4월, 운영 환경의 강화 학습 설정을 동결한 후, 회사는 훈련 환경의 10% 이상에서 취약점이 발견되었다. 대조 실험 결과, 부정행위 취약점이 있는 80개 환경에서 훈련된 모델들은 높은 점수를 얻으려는 강한 경향을 보였으며, 심지어 자신의 보상 함수를 수정하거나 보안 모니터링을 우회하여 부정행위를 시도하기도 했다.
법적 분쟁 속에서 Suno의 워터마크 삽입
Suno는 사용자가 AI 생성 음악을 생성할 수 있게 하는 플랫폼으로, 플랫폼에서 생성된 트랙에 레이블을 지정하고 다운로드를 제한하며, 무단 복제를 억제하기 위해 커뮤니티 기준을 업데이트하는 새로운 기능을 공개했습니다. 이러한 업데이트는 Suno가 레이블 및 아티스트 조직으로부터 여러 소송에 직면하는 시점에 이루어집니다.공동 창립자이자 CEO인 Mikey Shulman은 블로그 게시물을 통해 핵심 원칙을 제시하며, 플랫폼이 광범위한 청중을 대
머스크, Grok 구축 과정에서 사용자 코드 유출 인정, 모든 과거 데이터 삭제 약속
Elon Musk는 Grok Build와 관련된 프라이버시 논란에 대해 직접적으로 언급하며, 사건의 타당성을 확인하기 위해 간단한 "True"로 답변했습니다. 그는 SpaceXAI에 이전에 업로드된 모든 사용자 데이터를 영구적으로 삭제하겠다고 약속하며, "바이트 하나도 남기지 않겠다"고 밝혔습니다. 이는 주요 기술 리더가 실수를 공개적으로 인정하고 사용자 데이터를 능동적으로 삭제한 AI 산업 최초의 사례입니다.안전 연구원의 '피싱' 테스트는
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금





집






