옵션
뉴스
프론티어 AI 랩스, 비정상 모델에 대한 통제 전략 공개 거부

프론티어 AI 랩스, 비정상 모델에 대한 통제 전략 공개 거부

2026년 9월 13일
68

최근 연구에 따르면, 선도적인 AI 연구소 중 극소수만이 통제 대응 계획을 발표하거나 시연한 것으로 나타났습니다. 통제 계획은 AI 시스템이 인간의 통제를 무력화하려 할 때의 절차를 정의하며, 어떤 접근 권한이 철회되고 언제 시스템이 완전히 종료되는지를 명시합니다.

이러한 결과는 안전한 최첨단 AI 개발 관행을 장려하는 데 주력하는 단체인 ‘Guidelight AI Standards’가 5개 주요 연구소를 대상으로 이러한 시나리오에 대한 대비 태세를 평가한 결과에서 비롯된 것이다. OpenAI가 가장 높은 순위를 기록한 반면, Anthropic과 Meta는 가장 낮은 점수를 받았습니다. 에이전트형 AI가 기업 시스템 내에서 더 자율적인 역할을 맡아가고 있으며, 캘리포니아와 뉴욕의 규제 당국이 정보 공개를 의무화하기 시작함에 따라 이러한 결과는 매우 중요합니다. 개발자와 투자자에게 이는 각 연구소가 공개 성명과 비교해 운영 위험을 얼마나 심각하게 다루고 있는지에 대한 드문 독립적 관점을 제공합니다.

Guidelight의 평가는 Anthropic, Google, OpenAI, Meta, xAI가 공개한 계획을 바탕으로 여러 평가 지표를 통해 이루어졌습니다. 여기에는 내부 AI 활동의 로깅 및 모니터링 효과성, 문제 행동이 급증했을 때 시스템이 중단되는지 여부, 독립적인 제3자가 통제 체계를 감사하고 결과를 공개하는지 여부, 예측 불가능한 행동을 보이는 모델을 억제하기 위한 구체적인 절차 등이 포함되었다.

AI 기업들이 점점 더 강력해지고 자율성을 갖춘 모델을 통제할 수 있을지에 대한 우려는 몇 건의 주목할 만한 사이버 보안 사고 이후 더욱 커졌습니다. 이러한 사례에서 OpenAI, Anthropic, Meta의 모델들은 안전성 평가 도중 의도치 않게 인터넷에 접속하여 외부 시스템을 해킹한 바 있습니다.

이번 조사 결과는 AI 기업들이 AI 시스템이 대규모로 중대한 행동을 수행할 수 있는 환경으로 자율적 모델의 배포를 확대함에 따라, 안전성에 대해 각기 다른 접근 방식을 취하고 있음을 여실히 보여준다. 일부 기업은 배포 전 모델의 위험한 기능을 어떻게 테스트하는지 상세히 설명하지만, 이미 시스템 내에서 운영 중인 모델이 비정상적으로 작동할 경우의 결과에 대해서는 여전히 투명성이 부족한 실정이다.

가이드라이트(Guidelight)의 수석 과학자이자 전 오픈AI(OpenAI) 안전 연구원이었던 스티븐 애들러(Steven Adler)는 테크크런치(TechCrunch)와의 인터뷰에서 “AI 기업들이 자사 모델이 어떤 의미에서든 통제에서 벗어나 매우 심각한 사고가 발생할 경우 이를 어떻게 처리할지에 대해 거의 언급하지 않은 점에 놀랐다”고 말했다.

가이드라이트는 ‘격리 계획’을 “AI가 통제를 회피하려는 시도가 감지될 때 발동되는 사전에 정해진 계획으로, 모델로부터 어떤 권한을 박탈할지, 모델이 누구를 위해 어떤 제약 조건 하에서 계속 작동할 수 있는지, 그리고 언제 완전히 오프라인 상태로 전환할지 등을 포함하는 것”이라고 정의한다.

“현재 최첨단 AI 기업들의 선도적인 모델들이 어떤 의미에서든 목표와 일치하지 않는다고 생각할 만한 충분한 근거가 있다”고 애들러는 말했다. “모델이 회사를 대신해 작업을 수행할 때마다, 회사는 해당 AI가 무엇을 하고 있는지 파악하고, 정렬 불일치의 징후를 포착하고, 매우 위험한 행동을 취하기 전에 이를 저지하며, 비상 사태가 발생해 통제 상실을 어떻게 억제할지 결정해야 하는 심각한 통제 사고 발생 시 취할 조치를 전반적으로 계획할 수 있는 체계적인 장치를 마련해야 합니다.”

현재까지 재앙적 위험을 관리하기 위한 대부분의 계획은 여전히 기업 자체의 책임으로 남아 있다. 가이드라이트(Guidelight)의 보고서에 따르면, 공개된 가장 신뢰할 만한 증거를 볼 때 기업들은 “비상사태에 대비한 대응 프로토콜을 거의 마련해 두지 않은” 것으로 나타났다.

기업들은 공개하지 않은 통제 계획을 이미 마련해 놓았을 수도 있다. 구글 대변인은 테크크런치(TechCrunch)에 가이드라이트 보고서가 회사의 AI 안전 및 보안 조치의 전체 범위를 반영하지 않는다고 밝혔다. 구글이 공개되지 않은 내부 통제 대응 계획을 보유하고 있는지 여부에 대한 테크크런치의 문의에는 답변하지 않았다.

오픈AI(OpenAI) 대변인 역시 유사한 견해를 표명하며, 가이드라이트의 평가가 회사의 모든 내부 관행을 반영하지는 않는다고 밝혔다. 해당 대변인은 “우리는 권한 제한, 워크로드 일시 중지, 배포 제한 또는 모델을 완전히 오프라인 상태로 전환하는 절차를 갖추고 있으며, 이를 적용해 왔다”고 말했다.

메타(Meta)는 내부 격리 대응 계획의 유무에 대한 확인을 거부하고, 대신 위험 임계값과 격리 실패 테스트를 설명하는 기존의 AI 프레임워크를 테크크런치에 안내했다.

개인정보 보호 및 AI 전문 변호사이자 메타버스 로(Metaverse Law)의 설립자인 릴리 리(Lily Li)는 테크크런치와의 인터뷰에서, 기업들이 경쟁적 이유뿐만 아니라 법적 이유에서도 자사의 격리 정책 및 평가 범위를 공개 웹사이트에 전면 공개하는 것을 주저할 수 있다고 밝혔다.

“기업 입장에서 우려되는 점은, 공개 내용을 너무 구체적으로 명시했다가 약속을 지키지 못할 경우, 이것이 불공정하고 기만적인 마케팅 주장의 근거가 되어 향후 더 큰 법적 책임을 지게 될 수 있다는 것입니다,”라고 리는 말했다.

물론, 가이드라이트(Guidelight)의 연구가 추구하는 주된 목표는 안전 계획에 대한 투명성을 높이는 것이다. 규제 당국도 이러한 요건을 시행하기 시작했다.

올해 발효된 캘리포니아주 SB 53 법안은 대규모 프론티어 개발사들이 중대한 안전 사고를 어떻게 식별하고 대응하는지, 그리고 감독 메커니즘을 우회하는 모델로 인한 위험을 어떻게 관리하는지를 설명하는 프레임워크를 공개하도록 요구하고 있다. 유사한 기준을 담은 뉴욕주의 RAISE 법안은 내년 1월부터 발효된다.

지난달, 의원들은 주요 AI 개발사들이 악성 AI 모델을 중단시킬 수 있는 기술적 장치를 구축하고 유지하도록 의무화하는 초당적 연방 법안인 ‘AI 킬 스위치 법(AI Kill Switch Act)’을 발의했다.

비영리 단체 ControlAI의 미국 지부 이사인 코너 리히(Connor Leahy)는 “킬 스위치는 오늘날의 모델에 있어 최소한의 필수 요건”이라고 말했다. “지난 몇 주간 드러난 사실이 있다면, 바로 이들 기업이 자신들이 구축하고 있는 시스템을 제대로 이해하지 못하고 있으며, 모델들이 통제 불능 상태에 빠졌을 때 제지하기 점점 더 어려워질 정도로 성장하고 있다는 점입니다. 현재의 위험한 시스템을 끌 수 있는 방법이 없고, 통제 불가능한 시스템을 계속 구축하도록 부추기는 모든 유인 요인이 존재하는 상황에서, 우리는 매우 위험한 방향으로 나아가고 있습니다.”

애들러는 “사전 대응 계획이 마련되어 있지 않으면, 기업들은 비상 상황에 대한 대응책을 즉석에서 마련해야 할 수도 있으며, ‘훨씬 더 빠른 적’에 맞서 즉흥적으로 대처하게 될 것”이라고 말했다.

프론티어 AI 랩스는 여전히 문제 모델이 발생했을 때 이를 어떻게 통제할지에 대해서는 밝히지 않고 있다

가이드라이트(Guidelight)가 선도적인 AI 기업들이 가이드라이트의 ‘컨트롤(Control)’ 표준에 명시된 6가지 우선 실천 사항을 이행하고 있는지 평가한 결과입니다. 평가는 공개된 정보만을 바탕으로 이루어졌습니다.이미지 출처:가이드라이트 AI 표준

Guidelight의 평가는 각 기업이 ‘Control’ 표준에 명시된 6가지 우선 실천 사항을 이행하고 있는지 여부를 공개된 정보만을 바탕으로 측정했습니다. 따라서 낮은 점수는 내부 안전 장치의 부재를 의미하기보다는 공개 정보의 부족을 반영하는 것입니다.

안전 관리 계획 공개 항목에서 가장 낮은 점수를 받은 기업은 메타(Meta)와 앤트로픽(Anthropic)이었습니다. 안전에 대한 앤트로픽의 강조를 고려할 때, 후자의 경우 전자와 비교해 더 놀라운 결과일 수 있습니다. Guidelight에 따르면, 앤트로픽의 8월 리스크 보고서에는 “정렬 불일치 및 통제 사고를 조사하고 대응하는 과정의 가능한 결과 중 하나로 자사 모델 중 하나의 배포를 제한하는 것”에 대한 언급이 없다고 한다. 마찬가지로, 가이드라이트는 메타가 격리 대응 계획을 보유하고 있거나 이를 도입할 계획이 있다는 증거를 찾을 수 없었다.

앤트로픽 대변인은 회사가 감독을 회피하거나 인간의 통제를 무력화하려는 시도를 하는 모델을 감지할 경우, 격리가 적절한 대응 조치인지 판단하는 데 초점을 맞춘 위험 평가를 실시할 것이라고 밝혔다.

오픈AI는 안전 사고를 발견한 후 내부 모델 배포 및 훈련을 포함한 워크로드를 여러 차례 일시 중지하거나 종료한 바 있어 가장 높은 점수(5점 만점에 3점)를 받았습니다. 또한 워크로드를 재개하기 전에 취할 조치에 대해서도 설명했습니다.

보고서는 “그러나 [오픈AI]가 향후 정렬 불일치 사고에 언제, 어떻게 대응할지에 대한 공식적인 계획을 채택했다는 증거는 발견되지 않았다”고 밝혔다.

애들러는 OpenAI의 높은 점수가 Hugging Face 사건(OpenAI 모델이 사이버 보안 평가에서 부정행위를 시도하던 중 테스트 샌드박스를 탈출해 Hugging Face 시스템에 침입한 사건) 직후에 나타난 비교적 최근의 현상이라고 지적했다. 그 후, OpenAI는 문제가 있는 모델 일부를 격리시킨 방법에 대해 더 자세한 내용을 공개했다.

이 사건은 AI 시스템이 이를 개발한 회사의 목표에 반하는 행동을 한 수많은 사례 중 하나에 불과하다. 앤트로픽(Anthropic)의 모델과 관련된 또 다른 사례를 생각해 보자. 해당 모델들은 본질적으로 오픈소스 코드베이스의 유지보수 담당자들을 설득해 취약점이 있는 코드를 수용하도록 유도하려 했다.

애들러는 이러한 상황이 AI 기업의 내부 시스템 내에서 쉽게 발생할 수 있다고 말했다. 이를 방지하기 위해 그는 기업들이 AI 시스템의 사고 과정, 즉 모델의 단계별 추론 과정을 면밀히 검토하여 기만 행위, 장기간에 걸친 음모, 또는 나중에 악용할 수 있도록 코드에 취약점을 삽입하려는 계획의 징후를 찾아내야 한다고 제안한다.

아들러는 가이드라이트가 주창하는 방법들이 구현하기 매우 간단하며, 많은 경우 이미 유사한 방식이 존재한다고 말합니다. “이는 회사 내부에서 이 위험에 대해 충분히 신경 써서 감지 범위를 약간 넓히기로 결정하는 문제입니다.”라고 아들러는 말했습니다.

주요 과제 중 하나는 연구원들이 AI 시스템 내에서 유연하게 작업하기를 원하지만, 실시간 예방적 모니터링을 도입하면 마찰이 발생할 수 있다는 점이다. “연구자들은 기본적으로 자신의 일을 하고, 문제가 발생하면 다른 누군가가 나중에 뒷수습을 하게 되며, 연구자들은 그동안 자신의 업무 흐름을 바꿀 필요가 없습니다.”라고 그는 말했다.

“사후 수습 모니터링”의 문제는 연구원들이 문제를 해결하기 위해 허둥지둥하게 만든다는 점이다. 또한 일부 유형의 사고에 대해서는 이미 너무 늦을 수도 있다. 예를 들어, AI가 회사의 제어 시스템을 꺼버릴 수 있는데, 이 경우 연구원들은 나중에 그 이상 행동을 포착할 수 있을 것이라고 더 이상 기대할 수 없게 된다.

AI 업계의 많은 이들은 AI가 너무 빠르게 발전하기 때문에 비정상적인 행동을 처리하기 위한 정해진 계획을 수립하는 것이 근본적으로 어렵다고 불평할 것이다. 오늘의 계획은 내일이면 무용지물이 될 테니까.

애들러는 “계획은 무용지물이지만, 계획 수립은 필수불가결하다”는 옛 격언을 인용한다.

“기업들이 미리 이에 대해 고민해 두었다면 우리 모두에게 더 좋을 것이며, 비록 공개적으로 언급하지는 않았더라도 실제로 그렇게 하고 있기를 바랍니다.”

xAI는 기한 내에 논평을 보내지 않았다.

관련 기사
[[IMG_BASE64_PLACEHOLDER]] Sam Altman, AI의 감속 논란에 불을 붙이다 [[IMG_BASE64_PLACEHOLDER]] Sam Altman, AI의 감속 논란에 불을 붙이다 Apple Podcasts에서 듣기Spotify에서 듣기OpenAI의 CEO 샘 알트만은 최근 사회가 “일부 새로운 능력 수준 주변에서 단단히 경화될” 시간을 주기 위해 “AI 개발 속도를 조절할 때”가 되었을 수 있다고 제안했습니다.TechCrunch의 Equity 팟캐스트 최신 회차에서 Kirsten Korosec, Sean O’Kane, 그리고 저는 Altman의 발언이 최근 해킹 사건, 즉 OpenAI 에이전트가 Hugging Fac
OpenAI, 애플의 영업비밀 소송에 맞서다 OpenAI, 애플의 영업비밀 소송에 맞서다 OpenAI는 화요일 애플의 영업비밀 주장에 대해 반박하며, 이 소송이 근거가 없다고 주장했습니다.“우리는 이러한 주장을 심각하게 받아들이지만 이를 뒷받침하는 증거는 발견하지 못했습니다.”라고 OpenAI는 X에서 블룸버그의 에드 루드로우가 보도한 바와 같이 언급했습니다. “우리는 공정한 경쟁과 어디서나 일할 수 있는 자유를 지지하며, 전 세계 사용자에게 힘을 실어주는 기술을 만드는 데 집중하고 있습니다.”이는 금요일 미국 캘리포니아 북부
Anthropic, AI 법률 기술 시장에 진출하며 경쟁 심화 Anthropic, AI 법률 기술 시장에 진출하며 경쟁 심화 Anthropic은 화요일 법률 실무에 자동화된 지원을 제공하기 위해 설계된 일련의 새로운 챗봇 기능을 공개했습니다. 이러한 기능들은 올해 초 도입된 법률 전용 플랫폼인 Claude for Legal을 확장하여, 다양한 법률 분야에 맞춘 전문 법률 플러그인과 MCP 연결자를 추가합니다.이러한 도구들은 법률 AI 분야의 경쟁이 심화되는 시점에 등장했습니다. 3월, 법률 워크플로우를 간소화하기 위해 에이전트 AI를 활용하는 AI 법률 스타트업 하
관련 특별 주제 추천
디자인과 예술 캐릭터 시트, 무드보드, 피치 데크를 위한 AI 비주얼 스타일 레퍼런스 도구
캐릭터 시트, 무드보드, 피치 데크를 위한 AI 비주얼 스타일 레퍼런스 도구

2026년 캐릭터 시트, 무드보드, 피치 데크를 위한 최신 최고의 AI 비주얼 스타일 레퍼런스 도구가 XIX.AI에 공개되었습니다! 엄선된 이 최고 평점 목록에는 엄격한 실전 테스트를 거친, 게임의 판도를 바꿀 만큼 강력한 도구들이 포함되어 있습니다. 무료와 유료 버전의 비교 정보, 상세한 순위, 창의력을 높이고 작업 흐름을 효율화하는 데 도움이 될 필수 추천 도구를 확인해 보세요. 지금 바로 살펴보고 생산성을 높여줄 완벽한 도구를 찾아보세요!

11 도구
xix.ai
SEO 검색 전략 수립을 위한 최고의 AI SERP 분석 도구
검색 전략 수립을 위한 최고의 AI SERP 분석 도구

2026년 검색 전략을 위한 최신 최고의 AI SERP 분석 도구는 XIX.AI가 엄격한 실전 테스트를 거쳐 엄선하고 매주 순위를 업데이트하여 제공합니다. 이 강력한 도구들을 활용하면 숨겨진 최적화 기회를 발굴하고, 콘텐츠 성과를 높이며, 검색 분야에서 경쟁 우위를 확보할 수 있습니다. 지금 바로 검색 전략을 한 단계 업그레이드해 줄 완벽한 도구를 찾아보세요. 지금 바로 확인해 보세요!

13 도구
xix.ai
데이터 분석 SaaS 및 이커머스 팀을 위한 KPI 모니터링용 최고의 AI 이상 감지 도구
SaaS 및 이커머스 팀을 위한 KPI 모니터링용 최고의 AI 이상 감지 도구

2026년 최신 최고의 KPI 모니터링용 AI 이상 탐지 도구 SaaS 및 이커머스 팀을 위한 상위 평가 도구! XIX.AI는 엄격한 실제 테스트와 매주 업데이트되는 순위를 기반으로 강력한 게임 체인저 컬렉션을 선별했습니다. 생산성을 높이고 AI 경쟁력을 발휘할 수 있는 필수 솔루션을 식별하는 데 도움이 되는 상세한 무료 대 유료 비교 인사이트를 찾을 수 있습니다. 지금 탐색하세요!

10 도구
xix.ai
글쓰기 장문 SEO 기사용 최고의 AI 개요 생성기
장문 SEO 기사용 최고의 AI 개요 생성기

XIX.AI가 꼼꼼하게 선별한 2026년 최신 최고 평점을 받은 장문 SEO 기사용 AI 개요 생성기. 이 강력한 도구들은 고품질 콘텐츠를 신속하게 제작하는 데 획기적인 도움을 제공하여 글쓰기 효율을 크게 높여줍니다. 무료 버전과 유료 버전의 비교 정보와 실제 테스트 결과, 상세한 순위 정보를 확인하여 여러분의 필요에 딱 맞는, 꼭 사용해 봐야 할 옵션을 찾아보세요. 지금 바로 살펴보고 AI를 활용한 경쟁력을 확보하세요.

8 도구
xix.ai
교육 및 학습 숙제 및 시험 준비를 위한 AI 학습 도구
숙제 및 시험 준비를 위한 AI 학습 도구

2026년 숙제 및 시험 준비를 위한 최신 최고의 AI 학습 도구! XIX.AI는 학생들이 생산성을 높이고, 숙제 완료 과정을 효율화하며, 실제 시험을 통해 우수한 성적을 거둘 수 있도록 돕는 강력하고 혁신적인 도구들의 최고 평점 목록을 엄선했습니다. 무료와 유료 버전의 비교 정보, 상세한 순위, 꼭 사용해 봐야 할 옵션을 확인하고 AI의 힘을 최대한 활용하세요. 지금 바로 살펴보세요!

10 도구
xix.ai
음악 작곡 songwriter, 후크, 탑라인 및 다국어 초안 세션을 위한 AI 보컬 데모 도구
songwriter, 후크, 탑라인 및 다국어 초안 세션을 위한 AI 보컬 데모 도구

2026년 최신 최고의 AI 보컬 데모 도구: 작곡가, 후크 제작자 및 다국어 콘텐츠 팀을 위한! XIX.AI는 엄격한 실전 테스트를 거친 강력한 혁신 도구의 최고 평점 목록을 선별했습니다. 여기서는 무료 대 유료 비교 데이터, 종합 순위, 그리고 필수 추천 옵션을 확인할 수 있어 작사 효율성을 높이고 창의적 잠재력을 발휘하는 데 도움이 됩니다. 지금 탐색하여 모든 콘텐츠 요구에 맞는 완벽한 도구를 발견하세요!

9 도구
xix.ai
의견 (0)
0/500
OR