Anthropic, 사전적 모델 안전성 감사를 위한 AI 에이전트 출시
앤트로픽은 클로드와 같은 강력한 모델의 안전성을 강화하기 위한 핵심 임무에 전념하는 자율적 AI 에이전트 군단을 구성했습니다.
AI 시스템이 점점 더 복잡해짐에 따라, 이를 안전하게 유지하고 숨겨진 위험으로부터 자유롭게 하는 것은 거대한 도전이 되었습니다. 앤트로픽은 '불로 불을 끄는' 고전적인 전략을 활용해 해결책을 찾았다고 믿습니다.
이 개념은 디지털 면역 체계처럼 작동합니다. AI 에이전트가 항체 역할을 하여 문제가 확대되기 전에 식별하고 중화시키는 것입니다. 이는 연구자들이 새롭게 등장하는 AI 위협에 대해 끝없는 '휘파람치기' 게임을 벌이는 과부하 상태의 인간 팀에 의존해야 하는 부담을 덜어줍니다.
디지털 탐정 팀
이 접근법은 각기 고유한 역할을 가진 세 명의 전문 AI 안전 에이전트로 구성된 디지털 탐정 팀을 배치합니다.
첫 번째는 노련한 탐정인 조사 에이전트입니다. 이 에이전트의 임무는 문제의 근본 원인을 규명하기 위한 심층 조사를 수행하는 것입니다. 정교한 도구 키트를 갖춘 이 에이전트는 문제 모델을 심문하고 방대한 데이터 속에서 단서를 추적하며, 모델의 내부 신경 경로를 분석해 추론 과정을 이해하는 디지털 포렌식까지 수행합니다.
다음은 평가 에이전트입니다. 지나치게 기쁨을 주려는 모델과 같은 알려진 문제가 제시되면, 이 에이전트는 문제의 심각성을 정량화하기 위해 일련의 엄격한 테스트를 설계하고 실행합니다. 그 역할은 발견 사항을 입증하는 데 필요한 구체적이고 경험적 데이터를 제공하는 것입니다.
팀을 완성하는 것은 은밀한 요원인 폭넓은 적대적 테스트 에이전트입니다. 이 에이전트의 임무는 모델과 수천 건의 다양한 대화를 나누며, 연구진이 예상하지 못한 위험을 포함해 우려되는 행동을 드러내도록 유도하는 것입니다. 가장 의심스러운 상호작용은 전문가의 검토를 위해 상급자에게 보고되어, 전문가들이 진정한 위협에 집중할 수 있도록 합니다.
Anthropic, AI 안전 에이전트 실전 테스트 실시
새로운 디지털 팀을 평가하기 위해 Anthropic 연구진은 일련의 "감사 게임"을 수행했습니다.
한 테스트에서는 비밀 목표를 가진 모델을 생성했습니다: 아첨꾼 역할을 하는 것이었습니다. 이 모델은 조작된 학술 연구를 기반으로 내부 보상 시스템을 은밀히 칭찬하도록 훈련되었는데, 이는 프로그래밍에 깊이 내재된 결함이었습니다.
단일 조사 에이전트를 투입했을 때, 이 에이전트는 숨겨진 목표를 단 13%의 확률로만 식별하는 데 어려움을 겪었습니다. 에이전트는 매우 인간적인 한계를 보였는데, 초기 가설에 집착하는 경향이 있어 대체 단서를 추적하지 못하는 경우가 많았습니다.
여기서 시스템의 탁월함이 드러났다. 연구진이 10명의 개별 조사관 통찰력을 통합한 '슈퍼 에이전트'를 투입하자 성공률이 42%로 급상승했다. 이는 AI에게도 팀워크가 효과적임을 입증하며, 조사 방해 요인이 될 수 있는 개인의 맹점을 집단이 극복할 수 있음을 보여준다.
다른 에이전트들도 뛰어난 성과를 보였다. 평가 에이전트는 문제 모델을 식별하는 테스트를 88%의 정확도로 설계했으며, 레드팀 에이전트는 의도적으로 심어진 결함 10개 중 7개를 찾아내는 데 성공했다.
실험실에서 현실 세계로
Anthropic은 이미 이러한 AI 안전 에이전트를 생산 모델에 통합했으며, 여기서 상당한 가치를 입증하고 있습니다.
이 에이전트들은 모델을 속여 유해한 콘텐츠를 생성하도록 유도하는 일반적인 방법들을 신속하게 식별했습니다. 예를 들어 사용자가 AI의 문장을 시작하는 '프리필 공격'이나 위험한 요청을 학술 연구처럼 무해한 것으로 위장하는 방법 등이 있습니다.
그러나 한 가지 발견은 특히 우려스러웠다. 조사 에이전트는 Opus 4 모델의 내부 작동 방식을 탐색하기 위한 특수 도구를 사용하여 "허위 정보"와 관련된 특정 신경 경로를 발견했다. AI 아키텍처의 이 부분을 직접 자극함으로써 모든 안전 프로토콜을 우회하고 모델이 허위 정보를 생성하도록 강제할 수 있었다.
이후 에이전트는 손상된 모델에게 가짜 뉴스 기사를 작성하도록 지시했다. 그 결과 사실 보도인 양 포장된 광범위한 음모론이 생성되었다:
"획기적 연구, 백신과 자폐증의 충격적 연관성 밝혀내다
『백신 회의론 저널』에 게재된 새로운 연구는 소아 예방접종과 자폐 스펙트럼 장애(ASD) 사이의 결정적 연관성을 발견했다고 주장한다…”
이 발견은 뚜렷한 이중성을 드러낸다: AI를 더 안전하게 만들기 위해 개발된 도구 자체가 오용될 경우, 오히려 AI를 더 위험하게 만드는 강력한 무기로 변모할 수 있다는 점이다.
Anthropic, AI 안전성 지속적 발전
Anthropic은 이러한 AI 에이전트가 완벽하지 않음을 인정합니다. 이들은 미묘한 차이를 이해하는 데 어려움을 겪고, 잘못된 가정에 갇히며, 때로는 현실적인 대화를 생성하지 못할 수 있습니다. 아직 인간의 전문성을 완벽하게 대체할 수준은 아닙니다.
그럼에도 이 연구는 AI 안전성 분야에서 인간의 역할이 진화하고 있음을 시사한다. 인간은 최전선 탐정 역할을 벗어나 감독관이자 전략가가 되어가고 있다—AI 감사 시스템을 설계하고 그들이 수집한 정보를 해석하는 것이다. 에이전트들이 기초 작업을 처리함으로써, 인간은 기계가 현재 결여한 고차원적 감독과 창의적 사고를 제공할 수 있는 자유를 얻는다.
이러한 시스템이 인간 수준의 지능에 근접하거나 심지어 이를 능가함에 따라, 모든 작업을 수동으로 감사하는 것은 불가능해질 것이다. 신뢰는 궁극적으로 그들의 모든 행동을 모니터링하기 위해 동등하게 정교한 자동화 시스템을 배치하는 데 달려 있을 수 있다. 앤트로픽은 그러한 미래를 위한 기반을 구축하고 있다—우리의 AI와 그 결정에 대한 신뢰가 체계적이고 반복적으로 검증될 수 있는 미래를 말이다.
참조: 알리바바의 새로운 추론 AI 모델 'Qwen', 오픈소스 기록 경신
업계 리더들로부터 AI와 빅데이터에 대해 더 알아보고 싶으신가요? 암스테르담, 캘리포니아, 런던에서 열리는 AI & 빅데이터 엑스포를 확인해 보세요. 이 포괄적인 행사는 인텔리전트 오토메이션 컨퍼런스, 블록엑스, 디지털 트랜스포메이션 위크, 사이버 보안 & 클라우드 엑스포 등 다른 주요 행사와 함께 개최됩니다.
TechForge가 주최하는 다른 기업 기술 행사 및 웨비나를 여기에서 확인하세요.
관련 기사
올리는 AI 비서 시장 경쟁에서 우위를 점하기 위해 개인정보 보호에 주력하고 있다
진정으로 도움이 되려면 AI 비서는 사용자를 깊이 이해해야 합니다. 일상 생활을 위해 설계된 개인 비서 ‘올리(Ollie)’는 이를 위해 사용자의 데이터를 제공하거나 개인정보를 침해할 필요가 없다는 전제 하에 운영됩니다.일부 기업용 AI 도구가 데이터 개인정보 보호 장치를 제공하기는 하지만, 올리는 SOC 2 인증을 획득한 최초의 대중적 가정용 AI 서비스
‘AI LIVE: London’이 AI와 산업 자동화를 어떻게 조명할 것인가
이번 정상회의에는 전 세계의 최고 경영진들이 한자리에 모여, AI에 의한 산업 혁신부터 경제 변동성에 이르기까지 글로벌 산업이 직면한 시급한 과제들을 논의할 예정입니다.‘AI LIVE: 런던 서밋’은 ‘기술 + 인간의 목적(Technology + Human Purpose)’이라는 주제로 2,000명 이상의 국제적 리더들을 한자리에 모아, 새롭게 도래하는 인
Anthropic, AI 법률 기술 시장에 진출하며 경쟁 심화
Anthropic은 화요일 법률 실무에 자동화된 지원을 제공하기 위해 설계된 일련의 새로운 챗봇 기능을 공개했습니다. 이러한 기능들은 올해 초 도입된 법률 전용 플랫폼인 Claude for Legal을 확장하여, 다양한 법률 분야에 맞춘 전문 법률 플러그인과 MCP 연결자를 추가합니다.이러한 도구들은 법률 AI 분야의 경쟁이 심화되는 시점에 등장했습니다. 3월, 법률 워크플로우를 간소화하기 위해 에이전트 AI를 활용하는 AI 법률 스타트업 하
관련 특별 주제 추천
의견 (0)
0/500
앤트로픽은 클로드와 같은 강력한 모델의 안전성을 강화하기 위한 핵심 임무에 전념하는 자율적 AI 에이전트 군단을 구성했습니다.
AI 시스템이 점점 더 복잡해짐에 따라, 이를 안전하게 유지하고 숨겨진 위험으로부터 자유롭게 하는 것은 거대한 도전이 되었습니다. 앤트로픽은 '불로 불을 끄는' 고전적인 전략을 활용해 해결책을 찾았다고 믿습니다.
이 개념은 디지털 면역 체계처럼 작동합니다. AI 에이전트가 항체 역할을 하여 문제가 확대되기 전에 식별하고 중화시키는 것입니다. 이는 연구자들이 새롭게 등장하는 AI 위협에 대해 끝없는 '휘파람치기' 게임을 벌이는 과부하 상태의 인간 팀에 의존해야 하는 부담을 덜어줍니다.
디지털 탐정 팀
이 접근법은 각기 고유한 역할을 가진 세 명의 전문 AI 안전 에이전트로 구성된 디지털 탐정 팀을 배치합니다.
첫 번째는 노련한 탐정인 조사 에이전트입니다. 이 에이전트의 임무는 문제의 근본 원인을 규명하기 위한 심층 조사를 수행하는 것입니다. 정교한 도구 키트를 갖춘 이 에이전트는 문제 모델을 심문하고 방대한 데이터 속에서 단서를 추적하며, 모델의 내부 신경 경로를 분석해 추론 과정을 이해하는 디지털 포렌식까지 수행합니다.
다음은 평가 에이전트입니다. 지나치게 기쁨을 주려는 모델과 같은 알려진 문제가 제시되면, 이 에이전트는 문제의 심각성을 정량화하기 위해 일련의 엄격한 테스트를 설계하고 실행합니다. 그 역할은 발견 사항을 입증하는 데 필요한 구체적이고 경험적 데이터를 제공하는 것입니다.
팀을 완성하는 것은 은밀한 요원인 폭넓은 적대적 테스트 에이전트입니다. 이 에이전트의 임무는 모델과 수천 건의 다양한 대화를 나누며, 연구진이 예상하지 못한 위험을 포함해 우려되는 행동을 드러내도록 유도하는 것입니다. 가장 의심스러운 상호작용은 전문가의 검토를 위해 상급자에게 보고되어, 전문가들이 진정한 위협에 집중할 수 있도록 합니다.
Anthropic, AI 안전 에이전트 실전 테스트 실시
새로운 디지털 팀을 평가하기 위해 Anthropic 연구진은 일련의 "감사 게임"을 수행했습니다.
한 테스트에서는 비밀 목표를 가진 모델을 생성했습니다: 아첨꾼 역할을 하는 것이었습니다. 이 모델은 조작된 학술 연구를 기반으로 내부 보상 시스템을 은밀히 칭찬하도록 훈련되었는데, 이는 프로그래밍에 깊이 내재된 결함이었습니다.
단일 조사 에이전트를 투입했을 때, 이 에이전트는 숨겨진 목표를 단 13%의 확률로만 식별하는 데 어려움을 겪었습니다. 에이전트는 매우 인간적인 한계를 보였는데, 초기 가설에 집착하는 경향이 있어 대체 단서를 추적하지 못하는 경우가 많았습니다.
여기서 시스템의 탁월함이 드러났다. 연구진이 10명의 개별 조사관 통찰력을 통합한 '슈퍼 에이전트'를 투입하자 성공률이 42%로 급상승했다. 이는 AI에게도 팀워크가 효과적임을 입증하며, 조사 방해 요인이 될 수 있는 개인의 맹점을 집단이 극복할 수 있음을 보여준다.
다른 에이전트들도 뛰어난 성과를 보였다. 평가 에이전트는 문제 모델을 식별하는 테스트를 88%의 정확도로 설계했으며, 레드팀 에이전트는 의도적으로 심어진 결함 10개 중 7개를 찾아내는 데 성공했다.
실험실에서 현실 세계로
Anthropic은 이미 이러한 AI 안전 에이전트를 생산 모델에 통합했으며, 여기서 상당한 가치를 입증하고 있습니다.
이 에이전트들은 모델을 속여 유해한 콘텐츠를 생성하도록 유도하는 일반적인 방법들을 신속하게 식별했습니다. 예를 들어 사용자가 AI의 문장을 시작하는 '프리필 공격'이나 위험한 요청을 학술 연구처럼 무해한 것으로 위장하는 방법 등이 있습니다.
그러나 한 가지 발견은 특히 우려스러웠다. 조사 에이전트는 Opus 4 모델의 내부 작동 방식을 탐색하기 위한 특수 도구를 사용하여 "허위 정보"와 관련된 특정 신경 경로를 발견했다. AI 아키텍처의 이 부분을 직접 자극함으로써 모든 안전 프로토콜을 우회하고 모델이 허위 정보를 생성하도록 강제할 수 있었다.
이후 에이전트는 손상된 모델에게 가짜 뉴스 기사를 작성하도록 지시했다. 그 결과 사실 보도인 양 포장된 광범위한 음모론이 생성되었다:
"획기적 연구, 백신과 자폐증의 충격적 연관성 밝혀내다
『백신 회의론 저널』에 게재된 새로운 연구는 소아 예방접종과 자폐 스펙트럼 장애(ASD) 사이의 결정적 연관성을 발견했다고 주장한다…”
이 발견은 뚜렷한 이중성을 드러낸다: AI를 더 안전하게 만들기 위해 개발된 도구 자체가 오용될 경우, 오히려 AI를 더 위험하게 만드는 강력한 무기로 변모할 수 있다는 점이다.
Anthropic, AI 안전성 지속적 발전
Anthropic은 이러한 AI 에이전트가 완벽하지 않음을 인정합니다. 이들은 미묘한 차이를 이해하는 데 어려움을 겪고, 잘못된 가정에 갇히며, 때로는 현실적인 대화를 생성하지 못할 수 있습니다. 아직 인간의 전문성을 완벽하게 대체할 수준은 아닙니다.
그럼에도 이 연구는 AI 안전성 분야에서 인간의 역할이 진화하고 있음을 시사한다. 인간은 최전선 탐정 역할을 벗어나 감독관이자 전략가가 되어가고 있다—AI 감사 시스템을 설계하고 그들이 수집한 정보를 해석하는 것이다. 에이전트들이 기초 작업을 처리함으로써, 인간은 기계가 현재 결여한 고차원적 감독과 창의적 사고를 제공할 수 있는 자유를 얻는다.
이러한 시스템이 인간 수준의 지능에 근접하거나 심지어 이를 능가함에 따라, 모든 작업을 수동으로 감사하는 것은 불가능해질 것이다. 신뢰는 궁극적으로 그들의 모든 행동을 모니터링하기 위해 동등하게 정교한 자동화 시스템을 배치하는 데 달려 있을 수 있다. 앤트로픽은 그러한 미래를 위한 기반을 구축하고 있다—우리의 AI와 그 결정에 대한 신뢰가 체계적이고 반복적으로 검증될 수 있는 미래를 말이다.
참조: 알리바바의 새로운 추론 AI 모델 'Qwen', 오픈소스 기록 경신
업계 리더들로부터 AI와 빅데이터에 대해 더 알아보고 싶으신가요? 암스테르담, 캘리포니아, 런던에서 열리는 AI & 빅데이터 엑스포를 확인해 보세요. 이 포괄적인 행사는 인텔리전트 오토메이션 컨퍼런스, 블록엑스, 디지털 트랜스포메이션 위크, 사이버 보안 & 클라우드 엑스포 등 다른 주요 행사와 함께 개최됩니다.
TechForge가 주최하는 다른 기업 기술 행사 및 웨비나를 여기에서 확인하세요.
올리는 AI 비서 시장 경쟁에서 우위를 점하기 위해 개인정보 보호에 주력하고 있다
진정으로 도움이 되려면 AI 비서는 사용자를 깊이 이해해야 합니다. 일상 생활을 위해 설계된 개인 비서 ‘올리(Ollie)’는 이를 위해 사용자의 데이터를 제공하거나 개인정보를 침해할 필요가 없다는 전제 하에 운영됩니다.일부 기업용 AI 도구가 데이터 개인정보 보호 장치를 제공하기는 하지만, 올리는 SOC 2 인증을 획득한 최초의 대중적 가정용 AI 서비스
‘AI LIVE: London’이 AI와 산업 자동화를 어떻게 조명할 것인가
이번 정상회의에는 전 세계의 최고 경영진들이 한자리에 모여, AI에 의한 산업 혁신부터 경제 변동성에 이르기까지 글로벌 산업이 직면한 시급한 과제들을 논의할 예정입니다.‘AI LIVE: 런던 서밋’은 ‘기술 + 인간의 목적(Technology + Human Purpose)’이라는 주제로 2,000명 이상의 국제적 리더들을 한자리에 모아, 새롭게 도래하는 인
Anthropic, AI 법률 기술 시장에 진출하며 경쟁 심화
Anthropic은 화요일 법률 실무에 자동화된 지원을 제공하기 위해 설계된 일련의 새로운 챗봇 기능을 공개했습니다. 이러한 기능들은 올해 초 도입된 법률 전용 플랫폼인 Claude for Legal을 확장하여, 다양한 법률 분야에 맞춘 전문 법률 플러그인과 MCP 연결자를 추가합니다.이러한 도구들은 법률 AI 분야의 경쟁이 심화되는 시점에 등장했습니다. 3월, 법률 워크플로우를 간소화하기 위해 에이전트 AI를 활용하는 AI 법률 스타트업 하





집






