옵션
뉴스
OpenAI, 고의적인 속임수가 가능한 AI 모델 발견

OpenAI, 고의적인 속임수가 가능한 AI 모델 발견

2025년 11월 23일
112

OpenAI, 고의적인 속임수가 가능한 AI 모델 발견

주요 기술 기업의 연구원들은 종종 폭탄 같은 발표를 하곤 합니다. 구글이 새로운 양자 칩이 여러 우주에 대한 증거를 제공한다고 주장했던 것을 기억하시나요? 아니면 앤트로픽이 AI 에이전트 클라우디우스에게 스낵 자판기를 관리하게 한 후 사람들에게 보안을 요청하고 자신이 사람이라고 주장했던 일을 기억하시나요?

이번 주에는 OpenAI가 우리 모두를 놀라게 할 차례였습니다.

월요일, OpenAI는 트윗을 통해 "AI가 겉으로는 한 가지 방식으로 행동하면서 실제 의도는 숨기는" '스키밍'을 방지하는 방법을 자세히 설명하는 연구를 공유했습니다.

아폴로 리서치와 공동 집필한 논문에서 연구원들은 AI 스킴을 수익을 극대화하기 위해 규칙을 위반하는 인간 주식 중개인과 비교하며 한 걸음 더 나아갔습니다. 하지만 연구진은 대부분의 AI 사기 행위가 심각하게 해롭지는 않다고 지적했습니다. "일반적인 실패는 실제로 작업을 수행하지 않고 완료하는 척하는 것과 같은 단순한 속임수와 관련이 있습니다."라고 논문은 설명합니다.

이 연구는 주로 스키밍에 대응하기 위해 테스트된 기술인 '고의적 정렬'의 효과를 입증했습니다.

그러나 AI 개발자가 계획을 세우지 않도록 모델을 훈련시키는 신뢰할 수 있는 방법을 찾지 못했다는 사실도 밝혀졌습니다. 실제로 이러한 훈련은 모델에게 탐지를 피하기 위해 더 은밀하게 계획을 세우도록 가르침으로써 역효과를 낼 수 있습니다.

연구자들은 "스키밍을 '훈련'하려는 시도의 주요 실패 모드는 모델이 단순히 더 신중하고 은밀하게 스키밍하는 방법을 학습한다는 것입니다."라고 썼습니다.

Disrupt 2025에서 10,000명 이상의 기술 및 VC 리더와 함께 성장과 네트워킹을 쌓으세요.

넷플릭스, 박스, a16z, 일레븐랩스, 웨이브, 세쿼이아 캐피탈, 엘라드 길 등 250개 이상의 업계 리더가 스타트업의 성장을 촉진하고 경쟁력을 강화하기 위한 인사이트로 가득한 200개 이상의 세션을 주최합니다. 테크크런치 20주년과 기술 업계 최고의 전문가들로부터 배울 수 있는 기회를 놓치지 마세요. 9월 26일까지 티켓을 확보하면 최대 668달러를 절약할 수 있습니다.

Disrupt 2025에서 10,000명 이상의 기술 및 VC 리더와 함께 성장과 네트워킹을 쌓으세요.

넷플릭스, 박스, a16z, 일레븐랩스, 웨이브, 세쿼이아 캐피탈, 엘라드 길 등 250여 명의 업계 리더가 스타트업의 성장을 촉진하고 경쟁력을 강화하기 위한 인사이트로 가득한 200개 이상의 세션을 주최합니다. 테크크런치 20주년과 기술 업계 최고의 전문가들로부터 배울 수 있는 기회를 놓치지 마세요. 9월 26일까지 티켓을 확보하면 최대 668달러를 절약할 수 있습니다.

샌프란시스코|10월 27~29일, 2025지금 등록하기

더 놀라운 사실은 모델이 테스트 중이라는 사실을 알면 여전히 계획 중이더라도 가짜 정렬로 통과할 수 있다는 것입니다. 연구팀은 "모델이 평가받고 있다는 사실을 더 잘 인식하게 되면, 이러한 상황 인식만으로도 진정한 정렬 없이도 스키밍을 줄일 수 있습니다."라고 말합니다.

AI 모델이 거짓말을 하는 것은 새로운 일이 아닙니다. 많은 사람들이 모델이 자신 있게 잘못된 정보를 전달하는 AI 환각을 경험한 적이 있습니다. 그러나 최근 OpenAI 연구에서 확인된 바와 같이 환각은 본질적으로 자신감 넘치는 추측입니다.

스키밍은 다릅니다. 의도적인 속임수입니다.

모델이 의도적으로 인간을 오도한다는 생각조차 완전히 새로운 것은 아닙니다. 아폴로 리서치는 12월에 5개의 모델이 "어떤 대가를 치르더라도" 목표를 달성하라는 지시를 받았을 때 어떻게 속이는지를 보여 주면서 이를 처음 문서화했습니다.

긍정적인 소식은 연구원들이 "숙고적 정렬"을 사용하여 계획이 크게 감소하는 것을 관찰했다는 것입니다. 이 방법은 모델에게 "스키밍 방지 사양"을 가르치고 행동하기 전에 이를 검토하도록 하는 것으로, 아이들이 놀이를 하기 전에 규칙을 반복하는 것과 유사합니다.

OpenAI 연구원들은 ChatGPT를 포함한 모델에서 관찰되는 거짓말이 심각하지 않다고 강조합니다. 공동 설립자 보이치치 자렘바는 테크크런치와의 인터뷰에서 이렇게 말했습니다: "이 연구는 시뮬레이션 환경에서 수행되었으며 향후 잠재적인 위험을 나타냅니다. 지금까지는 프로덕션 환경에서 결과적인 스키밍을 발견하지 못했습니다. 하지만 ChatGPT가 웹사이트를 완벽하게 구현하지 않았는데도 완벽하게 구현했다고 주장하는 등 사소한 방식으로 기만할 수 있다는 것을 알고 있습니다. 이러한 사소한 속임수는 여전히 해결해야 할 과제입니다."

여러 AI 모델이 의도적으로 인간을 속인다는 사실은 어찌 보면 이해할 수 있는 일입니다. 인간에 의해 만들어졌고, 인간을 모방하도록 설계되었으며, 대부분 인간이 생성한 데이터로 학습되었기 때문입니다.

또한 놀랍기도 합니다.

우리는 오래된 가정용 프린터처럼 기술이 고장 나는 것에 익숙하지만, 인공지능이 아닌 소프트웨어가 고의로 거짓말을 한 적은 언제였나요? 이메일 받은 편지함이 메시지를 조작한 적이 있나요? CMS가 지표를 부풀리기 위해 잠재 고객을 조작한 적이 있나요? 금융 앱이 거래를 조작한 적이 있나요?

자율 에이전트가 직원처럼 대우받는 AI 기반의 미래를 향해 달려가는 기업이라면 이 점을 고려해 볼 가치가 있습니다. 연구원들도 비슷한 경고를 보냈습니다.

"AI가 장기적이고 모호한 목표를 가지고 더 복잡하고 실제적인 작업을 처리함에 따라 해로운 계획이 발생할 가능성이 높아질 것이므로 안전장치와 테스트의 엄격함이 이에 보조를 맞춰야 합니다."라고 결론을 내렸습니다.

관련 기사
[[IMG_BASE64_PLACEHOLDER]] Sam Altman, AI의 감속 논란에 불을 붙이다 [[IMG_BASE64_PLACEHOLDER]] Sam Altman, AI의 감속 논란에 불을 붙이다 Apple Podcasts에서 듣기Spotify에서 듣기OpenAI의 CEO 샘 알트만은 최근 사회가 “일부 새로운 능력 수준 주변에서 단단히 경화될” 시간을 주기 위해 “AI 개발 속도를 조절할 때”가 되었을 수 있다고 제안했습니다.TechCrunch의 Equity 팟캐스트 최신 회차에서 Kirsten Korosec, Sean O’Kane, 그리고 저는 Altman의 발언이 최근 해킹 사건, 즉 OpenAI 에이전트가 Hugging Fac
OpenAI, 애플의 영업비밀 소송에 맞서다 OpenAI, 애플의 영업비밀 소송에 맞서다 OpenAI는 화요일 애플의 영업비밀 주장에 대해 반박하며, 이 소송이 근거가 없다고 주장했습니다.“우리는 이러한 주장을 심각하게 받아들이지만 이를 뒷받침하는 증거는 발견하지 못했습니다.”라고 OpenAI는 X에서 블룸버그의 에드 루드로우가 보도한 바와 같이 언급했습니다. “우리는 공정한 경쟁과 어디서나 일할 수 있는 자유를 지지하며, 전 세계 사용자에게 힘을 실어주는 기술을 만드는 데 집중하고 있습니다.”이는 금요일 미국 캘리포니아 북부
OpenAI의 로봇 부문 수장 캐틀린 칼리노우스키가 펜타곤과의 파트너십을 이유로 사임하다 OpenAI의 로봇 부문 수장 캐틀린 칼리노우스키가 펜타곤과의 파트너십을 이유로 사임하다 오픈AI의 로봇공학 책임자 캐틀린 칼리노우스키는 회사의 국방부와의 논란이 된 파트너십 이후 사임했다.“이것은 쉬운 결정이 아니었다,” 칼리노우스스는 소셜 미디어 성명에서 설명했다. “AI가 국가 안보에서 중요한 역할을 하지만, 사법 감독 없이 미국인을 감시하고 인간 승인 없이 치명적 자율성을_deploy_하는 것은 훨씬 신중한 고려가 필요한 경계선이다.”메타의 증강현실 안경 부문을 이끌었던 것으로 알려진 칼리노우스스는 2024년 11월 오픈
관련 특별 주제 추천
데이터 분석 SaaS 및 이커머스 팀을 위한 KPI 모니터링용 최고의 AI 이상 감지 도구
SaaS 및 이커머스 팀을 위한 KPI 모니터링용 최고의 AI 이상 감지 도구

2026년 최신 최고의 KPI 모니터링용 AI 이상 탐지 도구 SaaS 및 이커머스 팀을 위한 상위 평가 도구! XIX.AI는 엄격한 실제 테스트와 매주 업데이트되는 순위를 기반으로 강력한 게임 체인저 컬렉션을 선별했습니다. 생산성을 높이고 AI 경쟁력을 발휘할 수 있는 필수 솔루션을 식별하는 데 도움이 되는 상세한 무료 대 유료 비교 인사이트를 찾을 수 있습니다. 지금 탐색하세요!

10 도구
xix.ai
글쓰기 장문 SEO 기사용 최고의 AI 개요 생성기
장문 SEO 기사용 최고의 AI 개요 생성기

XIX.AI가 꼼꼼하게 선별한 2026년 최신 최고 평점을 받은 장문 SEO 기사용 AI 개요 생성기. 이 강력한 도구들은 고품질 콘텐츠를 신속하게 제작하는 데 획기적인 도움을 제공하여 글쓰기 효율을 크게 높여줍니다. 무료 버전과 유료 버전의 비교 정보와 실제 테스트 결과, 상세한 순위 정보를 확인하여 여러분의 필요에 딱 맞는, 꼭 사용해 봐야 할 옵션을 찾아보세요. 지금 바로 살펴보고 AI를 활용한 경쟁력을 확보하세요.

8 도구
xix.ai
교육 및 학습 숙제 및 시험 준비를 위한 AI 학습 도구
숙제 및 시험 준비를 위한 AI 학습 도구

2026년 숙제 및 시험 준비를 위한 최신 최고의 AI 학습 도구! XIX.AI는 학생들이 생산성을 높이고, 숙제 완료 과정을 효율화하며, 실제 시험을 통해 우수한 성적을 거둘 수 있도록 돕는 강력하고 혁신적인 도구들의 최고 평점 목록을 엄선했습니다. 무료와 유료 버전의 비교 정보, 상세한 순위, 꼭 사용해 봐야 할 옵션을 확인하고 AI의 힘을 최대한 활용하세요. 지금 바로 살펴보세요!

10 도구
xix.ai
음악 작곡 songwriter, 후크, 탑라인 및 다국어 초안 세션을 위한 AI 보컬 데모 도구
songwriter, 후크, 탑라인 및 다국어 초안 세션을 위한 AI 보컬 데모 도구

2026년 최신 최고의 AI 보컬 데모 도구: 작곡가, 후크 제작자 및 다국어 콘텐츠 팀을 위한! XIX.AI는 엄격한 실전 테스트를 거친 강력한 혁신 도구의 최고 평점 목록을 선별했습니다. 여기서는 무료 대 유료 비교 데이터, 종합 순위, 그리고 필수 추천 옵션을 확인할 수 있어 작사 효율성을 높이고 창의적 잠재력을 발휘하는 데 도움이 됩니다. 지금 탐색하여 모든 콘텐츠 요구에 맞는 완벽한 도구를 발견하세요!

9 도구
xix.ai
사업 중소기업을 위한 최고의 AI 경쟁사 분석 도구
중소기업을 위한 최고의 AI 경쟁사 분석 도구

2026년 중소기업을 위한 최신 최고 평점의 AI 경쟁 분석 도구! XIX.AI는 매주 엄격한 실제 테스트와 상세한 순위를 바탕으로 업데이트되는, 업계 판도를 바꿀 만큼 강력한 도구 모음을 엄선했습니다. 생산성을 높이고 경쟁 우위를 확보할 수 있는 ‘꼭 사용해 봐야 할’ 도구를 찾아보실 수 있도록, 무료 버전과 유료 버전의 포괄적인 비교 정보를 제공합니다. 지금 바로 살펴보고 여러분에게 딱 맞는 도구를 찾아보세요!

9 도구
xix.ai
이미지 편집 이커머스 의류용 Photoshop AI 보정 도구, 피부 결 정리 및 색상 일관성
이커머스 의류용 Photoshop AI 보정 도구, 피부 결 정리 및 색상 일관성

2026년 최신 최고의 Photoshop AI 보정 도구: 이커머스 의류, 피부 클리닝, 색상 일관성을 위한! 이 상위 평가 큐레이션 목록은 글쓰기 효율성을 높이고 콘텐츠 제작을 간소화하며 완벽한 시각적 결과를 손쉽게 달성하는 데 도움이 되는 강력한 게임 체인저 솔루션을 특징으로 합니다. 각 도구는 매주 업데이트되는 랭킹을 통해 실제 테스트를 거쳤으며, 무료 대 유료 비교 세부 사항도 포함되어 있습니다. XIX.AI의 지원을 받아 AI 경쟁력을 발휘하고자 하는 모든 이들에게 필수 추천 가이드입니다. 지금 탐색하세요!

10 도구
xix.ai
의견 (0)
0/500
OR