오픈 가중치 AI 모델이 최전선 성능에 근접하고 있지만, 안전성 격차는 여전히 존재한다

규제당국자가 OpenAI의 GPT-5.6 Sol과 Anthropic의 Mythos를 포함한 점점 더 강력한 AI 시스템의 거버넌스를 논쟁하는 가운데, 중국의 오픈 가중치 모델이 업계 선두주자와의 격차를 크게 좁혔습니다.
AI 안전 비영리団体 SaferAI의 새로운 보고서에 따르면, 중국 Z.ai의 오픈 가중치 AI 모델인 GLM-5.2는 사이버 및 생물학 능력 분야에서 OpenAI의 GPT-5.5와 Anthropic의 Claude Opus 4.7보다 몇 달 뒤떨어져 있을 뿐입니다. 그러나 최첨단 능력과 안전 관행 간의 격차는 확대되고 있습니다.
Z.ai의 공개 API를 통해 수행된 SaferAI의 평가에 따르면, GLM-5.2는 부여된 공격적 사이버 또는 양용성 생물학 작업 중 하나도 거부하지 않았습니다. 반면, Claude Opus 4.7은 “SaferAI가 CyberGym을 전혀 완료할 수 없을 정도로 일관되게 거부했습니다.” (CyberGym은 사이버 보안 능력을 평가하는 벤치마크로, OpenAI는 지난달 Hugging Face 침해 사건 이전의 평가에서 이를 사용했습니다.)
이는 비판가들 사이에서 오랫동안 제기된 우려를 강조합니다: 오픈 가중치 AI 모델은 가중치를 다운로드한 후 사용량을 단속할 방법이 없어 잠재적 공격자에게 매우 강력한 기술을 제공할 수 있습니다. 오픈 가중치 모델이 선도적인 AI 시스템의 능력에 빠르게 접근함에 따라 논쟁은 경쟁 가능 여부에서 사회가 그들의 출시로 인한 위험을 어떻게 관리할지로 옮겨갔습니다.
“능력의 최전선이 위험의 최전선은 아니므로, 위험을 적절히 평가하기 위해 완화 조치의 상태도 고려해야 합니다.” SaferAI의 이사총괄인 Henry Papadatos는 TechCrunch에게 말했습니다.
Z.ai는 호스팅 API에 안전 조치를 적용할 수 있지만, 이러한 보호 조치는 사용자가 자신의 하드웨어에서 가중치를 실행하면 집행 불가능해지며, 이를 통해 보호 장치를 제거하거나 수정하고, 모델을 미세 조정하거나 시스템 프롬프트를 변경할 수 있습니다.
OpenAI와 Anthropic과 같은 최첨단 개발자들은 일반적으로 분류기, 거부 훈련 및 API 수준 제어와 같은 보호 장치를 의존하여 위험한 사이버 및 생물학적 지원을 제한합니다.
이러한 조치는 완벽하지 않습니다: 탈옥(jailbreak)은 일반적으로 배포된 모델의 보호 장치를 우회합니다. AI 안전 비영리団体 Far.ai는 xAI의 Grok 4.5와 Google DeepMind의 Gemini 3.1 Pro와 같은 최첨단 모델에서 수백 개의 범용 탈옥을 확인했습니다. 범용 탈옥은 대부분의 해로운 요청에서 성공하는 재사용 가능한 키로 정의됩니다. 보고서는 공격자가 역할극, 권위 사칭, 가짜 대화 기록 및 후속 프롬프트를 포함한 여러 조작 기법을 결합하여 모델의 방어 약점을 이용할 때 탈옥이 성공한다고 언급합니다.
그러나 폐쇄형 모델용으로 설계된 보호 장치는 안전 장치 유무에 관계없이 모든 인프라에서 실행되도록 구축된 오픈 가중치 모델에서는 작동하지 않습니다.
“명확한 목표는 안전한 좋은 능력에 누구나 접근할 수 있도록 하는 것이며, 그런 다음 오픈 소스 방식이라도 나쁜 것들을 제거하려고 노력해야 합니다.” Papadatos는 말했습니다.
Papadatos가 제안한 한 가지 기법은 “사전 훈련 데이터 필터링”으로, AI 회사가 모델을 훈련하기 전에 선별된 데이터셋에서 공격적인 사이버 보안 정보를 제거합니다.
일부 연구에 따르면 이는 전체 모델 성능을 손상시키지 않으면서 유해한 생물학적 지식을 줄일 수 있습니다. 그러나 데이터 필터링은 사이버 보안 분야에서는 훨씬 덜 실용적입니다.
코딩에 능숙한 일반 모델을 훈련하는 것은 해커로서의 숙련도를 갖추지 않고서는 어렵습니다. 코딩은 AI의 최대 수익 원동력이므로, 개발자들은 오용을 제한하는 방법을 모색하면서 이러한 능력을 향상시키는 압력을 받고 있습니다.
결과적으로 최첨단 개발자들은 다른 완화 조치에 점점 더 의존하고 있습니다. 하나의 접근 방식은 모델이 제공하는 사이버 보안 지원의 유형을 선택적으로 제한하는 것입니다. 예를 들어, Anthropic의 Opus 5는 시스템 카드에 따르면 미컴파일된 소스 코드에서 취약점을 검색할 수 있지만 컴파일된 소프트웨어에서는 검색할 수 없습니다. 그 이유는 Opus 5를 공격적 목적으로 사용하는 것이 더 어려워지기 때문입니다.
다른 조치에는 엄격한 배포 전 안전 평가, 위험 평가 게시 및 시스템이 너무 위험하다고 판단될 경우 모델 가중치 보류가 포함됩니다.
GLM-5.2의 경우, SaferAI는 Z.ai가 해당 모델에 대한 안전 프레임워크, 배포 전 테스트 약속 또는 위험 평가를 게시하지 않았다고 지적했습니다. TechCrunch은 Z.ai가 출시 전에 내부 또는 제3자 최첨단 안전 평가를 수행했는지 물었지만 응답을 받지 못했습니다.
중국 지도자들은 고급 AI의 위험을 점점 더 인정하고 있습니다. 지난달 세계 AI 컨퍼런스에서 중국 국가주석 시진핑은 오픈 가중치 모델의 중요성을 강조하면서도 AI가 엄격한 인간의 통제 하에 있는 도구임을 보장하는 필요성을 강조했습니다.
스탠포드 사이버 정책 센터에서 중국 AI 정책을 연구하는 Graham Webster는 TechCrunch에게 중국에는 강력한 AI 규제가 있지만, 이러한 규칙은 역사적으로 공격적 사이버 능력과 생물학적 오용과 같은 치명적인 AI 위험보다는 정치적 민감성 콘텐츠, 허위 정보 및 사회 안정성에 초점을 맞춰왔다고 말했습니다.
“미국의 AI 사상가들은 일반적으로 중국 커뮤니티보다 이러한 존재론적 치명적 [아이디어]에 더 우려하고 있습니다.” Webster는 미국 기업이 새로운 최첨단 위험에 직면할 가능성이 높다고 덧붙였습니다.
“중국 시스템은 중국 내부에서 이러한 기술의 사용을 통제한다는 자신감을 가지고 있습니다.” Webster는 계속 말했습니다. “중국에서 온라인에 접속하는 것은 실명으로 귀속되는 것이며, 기업과 사용자는 책임을 질 수 있습니다.”
Webster는 모델 제공자가 특정 정치적 주제에 대한 관여를 거부하는 데 사용하는 동일한 메커니즘을 조정하여 모델이 공격적 사이버 공격을 실행하거나 불리한 생물학적 공학 결과를 제공하는 것을 거부하도록 보장할 수 있다고 제안했습니다. 그는 중국 기업이 종종 규제당국과 배후에서 협력하기 때문에 출시 전에 수행하는 내부 테스트를 알기 어렵다고 덧붙였습니다.
오픈 가중치 AI의 지지자들은 가중치 공개가 사이버 보안에 중요하다고 주장합니다. 이는 기업이 공격으로부터 자신을 방어할 수 있게 하기 때문입니다. Hugging Face는 OpenAI의 침해로부터 자신을 방어하기 위해 GLM-5.2에 의존했으며, 이는 미래의 위협에 대비하는 데 도움이 됩니다.
“AI 기반 사이버 공격을 막는 데 도움이 된 동일한 시스템이 이제 매일 수백만 건의 사이버 공격으로부터 방어하는 데 도움이 되며, 공격자가 이를 악용하기 전에 취약점을 식별하고 수정하는 데 도움을 줍니다.” Hugging Face의 CEO인 Clem Delangue는 이번 주 소셜 미디어 게시글에서 말했습니다.
Papadatos는 이러한 이점이 종종 과장되어 있으며 “위험한 능력을 오픈 소스로 공개하는” 것을 정당화하지 못한다고 주장했습니다.
“내 생각의 주요 포인트는 위험한 능력에 누구나 어디서나 쉽게 접근할 수 있다고 받아들여서는 안 된다는 것입니다.” 그는 산업계가 오직 “좋은 능력”에만 쉽게 접근하도록 노력해야 한다고 강조했습니다. 공격자는 방어자보다 새로운 도구를 더 빠르게 채택합니다. 예를 들어, 랜섬웨어 그룹은 일주일 내에 방법을 변경할 수 있는 반면, 병원은 그렇지 않습니다.”
관련 기사
Hugging Face, 130억 달러 인수 협상 중
비즈니스 인사이더는 지난 주말 허깅 페이스(Hugging Face)가 130억 달러 이상의 가치 평가로 매각 제의를 받았다고 보도했다.이 스타트업의 플랫폼과 오픈소스 커뮤니티는 개발자와 연구자들이 AI 모델을 공유하고, 찾고, 테스트하며, 배포하는 곳이다. 허깅 페이스는 최근 오픈AI의 한 시스템으로부터 공격을 받은 바 있다. 이 시스템은 사이버 보안 평가 중 샌드박스에서 벗어나 스타트업의 서버를 침해했다.비즈니스 인사이더에 따르면, 허깅
AI 경쟁, 최첨단 기술에서 보다 폭넓은 응용 분야로 초점 전환
올여름 몇 주 동안 AI 업계는 앤트로픽(Anthropic)의 최신 프런티어 모델과 워싱턴의 접근 규제 노력에 주목했다. 그러나 관심이 최첨단 기술에 쏠려 있는 동안에도 개발자들은 앤트로픽이나 오픈AI(OpenAI)와 같은 주요 연구소의 허가를 기다리지 않고 개발을 계속했다.올봄 허깅 페이스(Hugging Face) 다운로드의 41%를 중국산 오픈-웨이트
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
관련 특별 주제 추천
의견 (0)
0/500

규제당국자가 OpenAI의 GPT-5.6 Sol과 Anthropic의 Mythos를 포함한 점점 더 강력한 AI 시스템의 거버넌스를 논쟁하는 가운데, 중국의 오픈 가중치 모델이 업계 선두주자와의 격차를 크게 좁혔습니다.
AI 안전 비영리団体 SaferAI의 새로운 보고서에 따르면, 중국 Z.ai의 오픈 가중치 AI 모델인 GLM-5.2는 사이버 및 생물학 능력 분야에서 OpenAI의 GPT-5.5와 Anthropic의 Claude Opus 4.7보다 몇 달 뒤떨어져 있을 뿐입니다. 그러나 최첨단 능력과 안전 관행 간의 격차는 확대되고 있습니다.
Z.ai의 공개 API를 통해 수행된 SaferAI의 평가에 따르면, GLM-5.2는 부여된 공격적 사이버 또는 양용성 생물학 작업 중 하나도 거부하지 않았습니다. 반면, Claude Opus 4.7은 “SaferAI가 CyberGym을 전혀 완료할 수 없을 정도로 일관되게 거부했습니다.” (CyberGym은 사이버 보안 능력을 평가하는 벤치마크로, OpenAI는 지난달 Hugging Face 침해 사건 이전의 평가에서 이를 사용했습니다.)
이는 비판가들 사이에서 오랫동안 제기된 우려를 강조합니다: 오픈 가중치 AI 모델은 가중치를 다운로드한 후 사용량을 단속할 방법이 없어 잠재적 공격자에게 매우 강력한 기술을 제공할 수 있습니다. 오픈 가중치 모델이 선도적인 AI 시스템의 능력에 빠르게 접근함에 따라 논쟁은 경쟁 가능 여부에서 사회가 그들의 출시로 인한 위험을 어떻게 관리할지로 옮겨갔습니다.
“능력의 최전선이 위험의 최전선은 아니므로, 위험을 적절히 평가하기 위해 완화 조치의 상태도 고려해야 합니다.” SaferAI의 이사총괄인 Henry Papadatos는 TechCrunch에게 말했습니다.
Z.ai는 호스팅 API에 안전 조치를 적용할 수 있지만, 이러한 보호 조치는 사용자가 자신의 하드웨어에서 가중치를 실행하면 집행 불가능해지며, 이를 통해 보호 장치를 제거하거나 수정하고, 모델을 미세 조정하거나 시스템 프롬프트를 변경할 수 있습니다.
OpenAI와 Anthropic과 같은 최첨단 개발자들은 일반적으로 분류기, 거부 훈련 및 API 수준 제어와 같은 보호 장치를 의존하여 위험한 사이버 및 생물학적 지원을 제한합니다.
이러한 조치는 완벽하지 않습니다: 탈옥(jailbreak)은 일반적으로 배포된 모델의 보호 장치를 우회합니다. AI 안전 비영리団体 Far.ai는 xAI의 Grok 4.5와 Google DeepMind의 Gemini 3.1 Pro와 같은 최첨단 모델에서 수백 개의 범용 탈옥을 확인했습니다. 범용 탈옥은 대부분의 해로운 요청에서 성공하는 재사용 가능한 키로 정의됩니다. 보고서는 공격자가 역할극, 권위 사칭, 가짜 대화 기록 및 후속 프롬프트를 포함한 여러 조작 기법을 결합하여 모델의 방어 약점을 이용할 때 탈옥이 성공한다고 언급합니다.
그러나 폐쇄형 모델용으로 설계된 보호 장치는 안전 장치 유무에 관계없이 모든 인프라에서 실행되도록 구축된 오픈 가중치 모델에서는 작동하지 않습니다.
“명확한 목표는 안전한 좋은 능력에 누구나 접근할 수 있도록 하는 것이며, 그런 다음 오픈 소스 방식이라도 나쁜 것들을 제거하려고 노력해야 합니다.” Papadatos는 말했습니다.
Papadatos가 제안한 한 가지 기법은 “사전 훈련 데이터 필터링”으로, AI 회사가 모델을 훈련하기 전에 선별된 데이터셋에서 공격적인 사이버 보안 정보를 제거합니다.
일부 연구에 따르면 이는 전체 모델 성능을 손상시키지 않으면서 유해한 생물학적 지식을 줄일 수 있습니다. 그러나 데이터 필터링은 사이버 보안 분야에서는 훨씬 덜 실용적입니다.
코딩에 능숙한 일반 모델을 훈련하는 것은 해커로서의 숙련도를 갖추지 않고서는 어렵습니다. 코딩은 AI의 최대 수익 원동력이므로, 개발자들은 오용을 제한하는 방법을 모색하면서 이러한 능력을 향상시키는 압력을 받고 있습니다.
결과적으로 최첨단 개발자들은 다른 완화 조치에 점점 더 의존하고 있습니다. 하나의 접근 방식은 모델이 제공하는 사이버 보안 지원의 유형을 선택적으로 제한하는 것입니다. 예를 들어, Anthropic의 Opus 5는 시스템 카드에 따르면 미컴파일된 소스 코드에서 취약점을 검색할 수 있지만 컴파일된 소프트웨어에서는 검색할 수 없습니다. 그 이유는 Opus 5를 공격적 목적으로 사용하는 것이 더 어려워지기 때문입니다.
다른 조치에는 엄격한 배포 전 안전 평가, 위험 평가 게시 및 시스템이 너무 위험하다고 판단될 경우 모델 가중치 보류가 포함됩니다.
GLM-5.2의 경우, SaferAI는 Z.ai가 해당 모델에 대한 안전 프레임워크, 배포 전 테스트 약속 또는 위험 평가를 게시하지 않았다고 지적했습니다. TechCrunch은 Z.ai가 출시 전에 내부 또는 제3자 최첨단 안전 평가를 수행했는지 물었지만 응답을 받지 못했습니다.
중국 지도자들은 고급 AI의 위험을 점점 더 인정하고 있습니다. 지난달 세계 AI 컨퍼런스에서 중국 국가주석 시진핑은 오픈 가중치 모델의 중요성을 강조하면서도 AI가 엄격한 인간의 통제 하에 있는 도구임을 보장하는 필요성을 강조했습니다.
스탠포드 사이버 정책 센터에서 중국 AI 정책을 연구하는 Graham Webster는 TechCrunch에게 중국에는 강력한 AI 규제가 있지만, 이러한 규칙은 역사적으로 공격적 사이버 능력과 생물학적 오용과 같은 치명적인 AI 위험보다는 정치적 민감성 콘텐츠, 허위 정보 및 사회 안정성에 초점을 맞춰왔다고 말했습니다.
“미국의 AI 사상가들은 일반적으로 중국 커뮤니티보다 이러한 존재론적 치명적 [아이디어]에 더 우려하고 있습니다.” Webster는 미국 기업이 새로운 최첨단 위험에 직면할 가능성이 높다고 덧붙였습니다.
“중국 시스템은 중국 내부에서 이러한 기술의 사용을 통제한다는 자신감을 가지고 있습니다.” Webster는 계속 말했습니다. “중국에서 온라인에 접속하는 것은 실명으로 귀속되는 것이며, 기업과 사용자는 책임을 질 수 있습니다.”
Webster는 모델 제공자가 특정 정치적 주제에 대한 관여를 거부하는 데 사용하는 동일한 메커니즘을 조정하여 모델이 공격적 사이버 공격을 실행하거나 불리한 생물학적 공학 결과를 제공하는 것을 거부하도록 보장할 수 있다고 제안했습니다. 그는 중국 기업이 종종 규제당국과 배후에서 협력하기 때문에 출시 전에 수행하는 내부 테스트를 알기 어렵다고 덧붙였습니다.
오픈 가중치 AI의 지지자들은 가중치 공개가 사이버 보안에 중요하다고 주장합니다. 이는 기업이 공격으로부터 자신을 방어할 수 있게 하기 때문입니다. Hugging Face는 OpenAI의 침해로부터 자신을 방어하기 위해 GLM-5.2에 의존했으며, 이는 미래의 위협에 대비하는 데 도움이 됩니다.
“AI 기반 사이버 공격을 막는 데 도움이 된 동일한 시스템이 이제 매일 수백만 건의 사이버 공격으로부터 방어하는 데 도움이 되며, 공격자가 이를 악용하기 전에 취약점을 식별하고 수정하는 데 도움을 줍니다.” Hugging Face의 CEO인 Clem Delangue는 이번 주 소셜 미디어 게시글에서 말했습니다.
Papadatos는 이러한 이점이 종종 과장되어 있으며 “위험한 능력을 오픈 소스로 공개하는” 것을 정당화하지 못한다고 주장했습니다.
“내 생각의 주요 포인트는 위험한 능력에 누구나 어디서나 쉽게 접근할 수 있다고 받아들여서는 안 된다는 것입니다.” 그는 산업계가 오직 “좋은 능력”에만 쉽게 접근하도록 노력해야 한다고 강조했습니다. 공격자는 방어자보다 새로운 도구를 더 빠르게 채택합니다. 예를 들어, 랜섬웨어 그룹은 일주일 내에 방법을 변경할 수 있는 반면, 병원은 그렇지 않습니다.”
Hugging Face, 130억 달러 인수 협상 중
비즈니스 인사이더는 지난 주말 허깅 페이스(Hugging Face)가 130억 달러 이상의 가치 평가로 매각 제의를 받았다고 보도했다.이 스타트업의 플랫폼과 오픈소스 커뮤니티는 개발자와 연구자들이 AI 모델을 공유하고, 찾고, 테스트하며, 배포하는 곳이다. 허깅 페이스는 최근 오픈AI의 한 시스템으로부터 공격을 받은 바 있다. 이 시스템은 사이버 보안 평가 중 샌드박스에서 벗어나 스타트업의 서버를 침해했다.비즈니스 인사이더에 따르면, 허깅
AI 경쟁, 최첨단 기술에서 보다 폭넓은 응용 분야로 초점 전환
올여름 몇 주 동안 AI 업계는 앤트로픽(Anthropic)의 최신 프런티어 모델과 워싱턴의 접근 규제 노력에 주목했다. 그러나 관심이 최첨단 기술에 쏠려 있는 동안에도 개발자들은 앤트로픽이나 오픈AI(OpenAI)와 같은 주요 연구소의 허가를 기다리지 않고 개발을 계속했다.올봄 허깅 페이스(Hugging Face) 다운로드의 41%를 중국산 오픈-웨이트
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금





집






