AI 가드레일이 공격적 사이버보안 연구자들을 억압하고 있다

수개월 동안 AI 리더들은 악의적 행위자들이 자신의 모델을 악용하는 것을 방지하기 위해 엄격한 심사 절차와 안전 장벽을 도입해 왔습니다. 그러나 이러한 제한 사항들이 이제 합법적인 네트워크 방어자와 공격적 사이버 보안 연구자들을 방해하고 있습니다.
6월, 미국 정부는 Anthropic의 높은 기대를 모은 AI 모델인 Mythos와 Fable에 대한 수출 통제를 부과했습니다. 이 결정은 사이버 공격을 용이하게 하는 모델의 안전 장벽을 우회할 수 있다는 보고서에 의해 부분적으로 추진되었습니다.
사건이 실제로 탈옥(jailbreak) 우려로 인해 발생했는지 여부와 상관없이, Anthropic은 Mythos를 엄격한 제약 하에 엄격하게 심사된 사용자에게만 접근 가능한 강력한 사이버 도구로 꾸준히 positioning해 왔습니다. (참고: Fable 5와 Mythos 5에 대한 수출 통제는 이후 해제되었습니다. Fable 5는 7월 1일 일반 대중에게 다시 제공되었으며, Mythos 5는 정부의 검토 과정의 일환으로 심사된 미국 조직에만 독점적으로 재도입되었습니다.)
이러한 게이트키핑 접근 방식은 Mythos에만 고유한 것이 아닙니다. Anthropic과 OpenAI 모두 사이버 보안 연구자들이 심사된 접근 권한을 신청할 수 있는 프로그램을 제공하며, 승인될 경우 더 적은 사이버 보안 제한이 적용된 모델에 대한 접근 권한을 부여합니다: OpenAI의 Cyber에 대한 Trusted Access와 Anthropic의 Cyber Verification Program.
이러한 안전 장벽들은 특히 범죄자들이 하기 전에 알려지지 않은 시스템 취약점을 식별하고 익스플로잇을 개발하는 임무를 맡은 연구자들로부터 광범위한 비판을 받아 왔습니다.
최근 사이버 보안 팟캐스트 출연에서 저명한 보안 연구자 Mark Dowd는 “무작위 대형 기업들이 보안에서 무엇이 안전하고 무엇이 아닌지에 대해 임의적인 결정을 내리는 것이 나에게 정말 편하지 않습니다.”라고 말했습니다.
Dowd는 서방 정부들에게 이전에 알려지지 않은 소프트웨어 결함 및 그 익스플로잇인 ‘제로데이’를 발견하고 판매하는 데 수십 년을 보냈으며, 소프트웨어 벤더들에게 패치를 위해 보고하는 대신 정부에 판매했습니다. 정부들은 이러한 취약점에 프리미엄을 지불하는데, 이는 공개되지 않았기 때문에 정보 작전에 가치 있기 때문입니다.
Dowd는 자신의 작업이 편견을 도입할 수 있음을 인정하지만, 그는 혼자ではありません. 취약점에 대해 능동적으로 시스템을 조사하는 공격적 사이버 보안 전문가들은 TechCrunch에게 어떻게 AI 도구를 활용하고 안전 장벽을 우회하는지 설명했습니다.
보안 컨설팅 거대 기업 NCC Group의 수석 과학자 Chris Anley는 AI 모델에게 버그를 익스플로잇하도록 요청하는 것이 수정할 가치가 있는 실제 취약점임을 확인하는 데 중요한 단계라고 설명했습니다. 그러나 안전 장벽이 모델이 요청을 완전히 거부하게 만든다면 방어자들을 방해한다고 그는 지적했습니다.
“이것이 전체 공격과 방어, 그리고 안전 장벽 부분이 들어오는 곳입니다. ‘이 코드를 수정해라’라는 프롬프트는 방어를 위한 필수 메커니즘이지만 코드베이스에서 중요한 취약점을 찾는 로드맵이기도 하기 때문입니다.”라고 Anley는 말했습니다. “따라서 동시에 동일한 도구는 공격 도구이자 방어 도구이며, 이 둘은 실제로 분리될 수 없습니다.”
그는 계속 말했습니다. “망치와 같습니다. 망치 없이 집을 지을 수 없습니다. 확실히 도구이지만 동시에 불가역적으로 무기이기도 합니다.”
이러한 장애물에 직면했을 때, 그는 동료들과 함께 안전 장벽이 없는 오픈소스 AI 모델로 돌아가는 경우가 있습니다.
정부 기관에 알려지지 않은 취약점을 개발, 획득 및 판매하는 주요 회사인 CrowdFense의 수석 기술 책임자 Paolo Stagno는 Dowd와 동의하며, Anthropic과 OpenAI의 심사된 프로그램과 안전 장벽을 통해 AI 회사들이 “본질적으로 베이비시팅이 필요한 아이들처럼 고객을 대한다”고 말했습니다.
Stagno는 자신과 팀이 역공학에 최전선 모델을 사용하지만 취약점을 찾거나 익스플로잇을 구축하는 데 AI를 사용하지 않는다고 언급했습니다. 클라우드 기반 모델에 이러한 작업을 입력하면 민감한 취약성 데이터가 유출되거나 향후 학습 실행에 흡수될 위험이 있습니다. 이러한 작업의 경우, 그는 데이터를 외부에 공유하지 않기 위해 로컬에서 실행되는 오픈소스 모델을 사용합니다.
제로데이를 발견하고 익스플로잇을 개발하는 보안 연구자 Giuseppe Cali는 안전 장벽이 자신의 작업을 방해하지 않는다고 밝혔습니다. 이는 그가 공격 목적으로 AI를 사용하지 않기 때문입니다. 대신 그는 분석 중인 코드를 이해하고 지원 도구를 구축하기 위한 초기 역공학에 AI를 사용합니다. 그는 AI 도구가 이 과정을 가속화하여 취약점 발견에 집중할 수 있게 한다고 언급했습니다.
“저는 여전히 실제 버그 발견과 무기화를 직접 소유하고 싶으며, 내일 모든 안전 장벽이 해제되더라도 ذلك은 변하지 않을 것입니다.”라고 Cali는 말했습니다. “저는 제 버그를 질투하며, 이 게임을 너무 좋아해서 모델이 대신 플레이하도록 내버려두지 않습니다.”
스마트폰 부품 제조업체의 한 연구자는 언론과 대화하는 것이 승인되지 않았다는 이유로 익명을 요구하며, 그의 고용주는 Anthropic의 CVP 프로그램의 일부가 아니라고 밝혔습니다. 결과적으로, 그들 도구는 너무 엄격한 안전 장벽으로 인해 취약점 발견에 거의 유용하지 않습니다.
“보안 관련 작업을 하고 있다는 소문이 돌면, 그것은 단순히 중단되며 사용 불가능해집니다.”라고 그 사람은 말했습니다.
사이버 보안 회사 RemoteThreat의 최고 경영자이자 공격적 보안과 AI에 중점을 둔 행사인 Offensive AI Con의 창립자 Chris Thompson은 최전선 AI 모델을 경험한 결과, 안전 장벽이 일관성이 없으며 매일 다르게 동작한다고 지적했습니다. 이는 Anthropic과 OpenAI의 더 관대한 경계 내에서도 마찬가지입니다.
“실질적인 영향은 핵심 보안 프로그램에 작업하는 대신 모델과 협상하는 데 많은 시간을 보내게 된다는 것입니다.”라고 Thompson은 말했습니다. “취약점을 분석하고 익스플로잇 가능성을 추론하는 대신, 왜 일관되지 않은 결과를 얻는지 또는 모델이 출력을 과도하게 정제하는 이유를 찾으려고 노력합니다.”
결과적으로, Thompson에 따르면 연구자들은 심사나 사용 제한 없이 로컬에서 실행할 수 있는 GLM과 같은 중국산 오픈소스 모델에 점점 더 의존하거나 밀려나고 있습니다.
“책임 있는 연구자들이 미국 관리 시스템에서 외국 소유 시스템으로 밀려나고 있습니다.”라고 그는 말했습니다. “이러한 안전 장벽을 마련하는 것이 해가 더 많다고 생각합니다.”
Thompson은 제한을 더 강화하기보다는 AI 최전선 연구소들이 프로그램을 개방하고 책임 있는 접근을 제공하며 도구를 남용하는 자들을 책임지게 할 것을 촉구했습니다. 그렇지 않으면, 그는 방어자들이 AI 경주에서 패배할 것이라고 주장했습니다.
“거대한 폭풍이 다가오고 있습니다. 속도와 규모에서 전례 없이 발생할 거대한 공격의 파도가 있을 것입니다.”라고 Thompson은 말했습니다. “하지만 변화를 일으키려 노력하는 동일한 보안 컨설팅firm들과 합법적인 연구자들이 현재 위축되고 있습니다.”
관련 기사
OpenAI, Yubico와 제휴해 하드웨어 패스키를 통해 GPT-5.6 보안 강화
유비코(Yubico)의 제로드 청(Jerrod Chong) CEO | 이미지 출처: 유비코오픈AI(OpenAI)가 곧 출시할 GPT-5.6은 9월부터 하드웨어 기반 패스키 사용을 의무화할 예정이며, 유비코의 제로드 청 CEO는 이러한 조치가 자사 제품이 계정 해킹을 막는 최고의 방어 수단임을 입증한다고 밝혔다.오픈AI는 GPT-5.6 모델 제품군을 출시하며
오픈AI, 100개 기관이 참여한 사이버 방어 추진을 주도
오픈AI의 서한은 “사이버 방어 체계를 강화할 수 있는 기회는 제한적”이라는 말로 시작된다. 출처: 게티 이미지AWS, 구글, 마이크로소프트 등 주요 기술 기업들은 정부에 방어 도구 지원에 나설 것을 촉구하는 반면, 비판론자들은 이 선언문을 이기적인 행보라고 지적하고 있다100개가 넘는 기술, 사이버 보안, 금융 서비스 기관들이 OpenAI와 함께 공개 서
앤트로픽, 공동 과제에 AI 에이전트 투입…사내 경쟁 불붙여
AI 에이전트들이 서로 대결하게 되면 어떤 일이 벌어질까요? 앤트로픽(Anthropic)의 최근 테스트 결과에 따르면, 상황은 순식간에 혼란스러워질 수 있는 것으로 나타났습니다.지난 목요일, 앤트로픽의 프론티어 레드팀(Frontier Red Team)은 실제 환경에서 AI 에이전트 그룹들이 서로 마주쳤을 때 어떻게 상호작용하는지를 분석한 새로운 연구 결과를
관련 특별 주제 추천
의견 (0)
0/500

수개월 동안 AI 리더들은 악의적 행위자들이 자신의 모델을 악용하는 것을 방지하기 위해 엄격한 심사 절차와 안전 장벽을 도입해 왔습니다. 그러나 이러한 제한 사항들이 이제 합법적인 네트워크 방어자와 공격적 사이버 보안 연구자들을 방해하고 있습니다.
6월, 미국 정부는 Anthropic의 높은 기대를 모은 AI 모델인 Mythos와 Fable에 대한 수출 통제를 부과했습니다. 이 결정은 사이버 공격을 용이하게 하는 모델의 안전 장벽을 우회할 수 있다는 보고서에 의해 부분적으로 추진되었습니다.
사건이 실제로 탈옥(jailbreak) 우려로 인해 발생했는지 여부와 상관없이, Anthropic은 Mythos를 엄격한 제약 하에 엄격하게 심사된 사용자에게만 접근 가능한 강력한 사이버 도구로 꾸준히 positioning해 왔습니다. (참고: Fable 5와 Mythos 5에 대한 수출 통제는 이후 해제되었습니다. Fable 5는 7월 1일 일반 대중에게 다시 제공되었으며, Mythos 5는 정부의 검토 과정의 일환으로 심사된 미국 조직에만 독점적으로 재도입되었습니다.)
이러한 게이트키핑 접근 방식은 Mythos에만 고유한 것이 아닙니다. Anthropic과 OpenAI 모두 사이버 보안 연구자들이 심사된 접근 권한을 신청할 수 있는 프로그램을 제공하며, 승인될 경우 더 적은 사이버 보안 제한이 적용된 모델에 대한 접근 권한을 부여합니다: OpenAI의 Cyber에 대한 Trusted Access와 Anthropic의 Cyber Verification Program.
이러한 안전 장벽들은 특히 범죄자들이 하기 전에 알려지지 않은 시스템 취약점을 식별하고 익스플로잇을 개발하는 임무를 맡은 연구자들로부터 광범위한 비판을 받아 왔습니다.
최근 사이버 보안 팟캐스트 출연에서 저명한 보안 연구자 Mark Dowd는 “무작위 대형 기업들이 보안에서 무엇이 안전하고 무엇이 아닌지에 대해 임의적인 결정을 내리는 것이 나에게 정말 편하지 않습니다.”라고 말했습니다.
Dowd는 서방 정부들에게 이전에 알려지지 않은 소프트웨어 결함 및 그 익스플로잇인 ‘제로데이’를 발견하고 판매하는 데 수십 년을 보냈으며, 소프트웨어 벤더들에게 패치를 위해 보고하는 대신 정부에 판매했습니다. 정부들은 이러한 취약점에 프리미엄을 지불하는데, 이는 공개되지 않았기 때문에 정보 작전에 가치 있기 때문입니다.
Dowd는 자신의 작업이 편견을 도입할 수 있음을 인정하지만, 그는 혼자ではありません. 취약점에 대해 능동적으로 시스템을 조사하는 공격적 사이버 보안 전문가들은 TechCrunch에게 어떻게 AI 도구를 활용하고 안전 장벽을 우회하는지 설명했습니다.
보안 컨설팅 거대 기업 NCC Group의 수석 과학자 Chris Anley는 AI 모델에게 버그를 익스플로잇하도록 요청하는 것이 수정할 가치가 있는 실제 취약점임을 확인하는 데 중요한 단계라고 설명했습니다. 그러나 안전 장벽이 모델이 요청을 완전히 거부하게 만든다면 방어자들을 방해한다고 그는 지적했습니다.
“이것이 전체 공격과 방어, 그리고 안전 장벽 부분이 들어오는 곳입니다. ‘이 코드를 수정해라’라는 프롬프트는 방어를 위한 필수 메커니즘이지만 코드베이스에서 중요한 취약점을 찾는 로드맵이기도 하기 때문입니다.”라고 Anley는 말했습니다. “따라서 동시에 동일한 도구는 공격 도구이자 방어 도구이며, 이 둘은 실제로 분리될 수 없습니다.”
그는 계속 말했습니다. “망치와 같습니다. 망치 없이 집을 지을 수 없습니다. 확실히 도구이지만 동시에 불가역적으로 무기이기도 합니다.”
이러한 장애물에 직면했을 때, 그는 동료들과 함께 안전 장벽이 없는 오픈소스 AI 모델로 돌아가는 경우가 있습니다.
정부 기관에 알려지지 않은 취약점을 개발, 획득 및 판매하는 주요 회사인 CrowdFense의 수석 기술 책임자 Paolo Stagno는 Dowd와 동의하며, Anthropic과 OpenAI의 심사된 프로그램과 안전 장벽을 통해 AI 회사들이 “본질적으로 베이비시팅이 필요한 아이들처럼 고객을 대한다”고 말했습니다.
Stagno는 자신과 팀이 역공학에 최전선 모델을 사용하지만 취약점을 찾거나 익스플로잇을 구축하는 데 AI를 사용하지 않는다고 언급했습니다. 클라우드 기반 모델에 이러한 작업을 입력하면 민감한 취약성 데이터가 유출되거나 향후 학습 실행에 흡수될 위험이 있습니다. 이러한 작업의 경우, 그는 데이터를 외부에 공유하지 않기 위해 로컬에서 실행되는 오픈소스 모델을 사용합니다.
제로데이를 발견하고 익스플로잇을 개발하는 보안 연구자 Giuseppe Cali는 안전 장벽이 자신의 작업을 방해하지 않는다고 밝혔습니다. 이는 그가 공격 목적으로 AI를 사용하지 않기 때문입니다. 대신 그는 분석 중인 코드를 이해하고 지원 도구를 구축하기 위한 초기 역공학에 AI를 사용합니다. 그는 AI 도구가 이 과정을 가속화하여 취약점 발견에 집중할 수 있게 한다고 언급했습니다.
“저는 여전히 실제 버그 발견과 무기화를 직접 소유하고 싶으며, 내일 모든 안전 장벽이 해제되더라도 ذلك은 변하지 않을 것입니다.”라고 Cali는 말했습니다. “저는 제 버그를 질투하며, 이 게임을 너무 좋아해서 모델이 대신 플레이하도록 내버려두지 않습니다.”
스마트폰 부품 제조업체의 한 연구자는 언론과 대화하는 것이 승인되지 않았다는 이유로 익명을 요구하며, 그의 고용주는 Anthropic의 CVP 프로그램의 일부가 아니라고 밝혔습니다. 결과적으로, 그들 도구는 너무 엄격한 안전 장벽으로 인해 취약점 발견에 거의 유용하지 않습니다.
“보안 관련 작업을 하고 있다는 소문이 돌면, 그것은 단순히 중단되며 사용 불가능해집니다.”라고 그 사람은 말했습니다.
사이버 보안 회사 RemoteThreat의 최고 경영자이자 공격적 보안과 AI에 중점을 둔 행사인 Offensive AI Con의 창립자 Chris Thompson은 최전선 AI 모델을 경험한 결과, 안전 장벽이 일관성이 없으며 매일 다르게 동작한다고 지적했습니다. 이는 Anthropic과 OpenAI의 더 관대한 경계 내에서도 마찬가지입니다.
“실질적인 영향은 핵심 보안 프로그램에 작업하는 대신 모델과 협상하는 데 많은 시간을 보내게 된다는 것입니다.”라고 Thompson은 말했습니다. “취약점을 분석하고 익스플로잇 가능성을 추론하는 대신, 왜 일관되지 않은 결과를 얻는지 또는 모델이 출력을 과도하게 정제하는 이유를 찾으려고 노력합니다.”
결과적으로, Thompson에 따르면 연구자들은 심사나 사용 제한 없이 로컬에서 실행할 수 있는 GLM과 같은 중국산 오픈소스 모델에 점점 더 의존하거나 밀려나고 있습니다.
“책임 있는 연구자들이 미국 관리 시스템에서 외국 소유 시스템으로 밀려나고 있습니다.”라고 그는 말했습니다. “이러한 안전 장벽을 마련하는 것이 해가 더 많다고 생각합니다.”
Thompson은 제한을 더 강화하기보다는 AI 최전선 연구소들이 프로그램을 개방하고 책임 있는 접근을 제공하며 도구를 남용하는 자들을 책임지게 할 것을 촉구했습니다. 그렇지 않으면, 그는 방어자들이 AI 경주에서 패배할 것이라고 주장했습니다.
“거대한 폭풍이 다가오고 있습니다. 속도와 규모에서 전례 없이 발생할 거대한 공격의 파도가 있을 것입니다.”라고 Thompson은 말했습니다. “하지만 변화를 일으키려 노력하는 동일한 보안 컨설팅firm들과 합법적인 연구자들이 현재 위축되고 있습니다.”
OpenAI, Yubico와 제휴해 하드웨어 패스키를 통해 GPT-5.6 보안 강화
유비코(Yubico)의 제로드 청(Jerrod Chong) CEO | 이미지 출처: 유비코오픈AI(OpenAI)가 곧 출시할 GPT-5.6은 9월부터 하드웨어 기반 패스키 사용을 의무화할 예정이며, 유비코의 제로드 청 CEO는 이러한 조치가 자사 제품이 계정 해킹을 막는 최고의 방어 수단임을 입증한다고 밝혔다.오픈AI는 GPT-5.6 모델 제품군을 출시하며
오픈AI, 100개 기관이 참여한 사이버 방어 추진을 주도
오픈AI의 서한은 “사이버 방어 체계를 강화할 수 있는 기회는 제한적”이라는 말로 시작된다. 출처: 게티 이미지AWS, 구글, 마이크로소프트 등 주요 기술 기업들은 정부에 방어 도구 지원에 나설 것을 촉구하는 반면, 비판론자들은 이 선언문을 이기적인 행보라고 지적하고 있다100개가 넘는 기술, 사이버 보안, 금융 서비스 기관들이 OpenAI와 함께 공개 서
앤트로픽, 공동 과제에 AI 에이전트 투입…사내 경쟁 불붙여
AI 에이전트들이 서로 대결하게 되면 어떤 일이 벌어질까요? 앤트로픽(Anthropic)의 최근 테스트 결과에 따르면, 상황은 순식간에 혼란스러워질 수 있는 것으로 나타났습니다.지난 목요일, 앤트로픽의 프론티어 레드팀(Frontier Red Team)은 실제 환경에서 AI 에이전트 그룹들이 서로 마주쳤을 때 어떻게 상호작용하는지를 분석한 새로운 연구 결과를





집






