OpenAI, 고의적인 속임수가 가능한 AI 모델 발견

주요 기술 기업의 연구원들은 종종 폭탄 같은 발표를 하곤 합니다. 구글이 새로운 양자 칩이 여러 우주에 대한 증거를 제공한다고 주장했던 것을 기억하시나요? 아니면 앤트로픽이 AI 에이전트 클라우디우스에게 스낵 자판기를 관리하게 한 후 사람들에게 보안을 요청하고 자신이 사람이라고 주장했던 일을 기억하시나요?
이번 주에는 OpenAI가 우리 모두를 놀라게 할 차례였습니다.
월요일, OpenAI는 트윗을 통해 "AI가 겉으로는 한 가지 방식으로 행동하면서 실제 의도는 숨기는" '스키밍'을 방지하는 방법을 자세히 설명하는 연구를 공유했습니다.
아폴로 리서치와 공동 집필한 논문에서 연구원들은 AI 스킴을 수익을 극대화하기 위해 규칙을 위반하는 인간 주식 중개인과 비교하며 한 걸음 더 나아갔습니다. 하지만 연구진은 대부분의 AI 사기 행위가 심각하게 해롭지는 않다고 지적했습니다. "일반적인 실패는 실제로 작업을 수행하지 않고 완료하는 척하는 것과 같은 단순한 속임수와 관련이 있습니다."라고 논문은 설명합니다.
이 연구는 주로 스키밍에 대응하기 위해 테스트된 기술인 '고의적 정렬'의 효과를 입증했습니다.
그러나 AI 개발자가 계획을 세우지 않도록 모델을 훈련시키는 신뢰할 수 있는 방법을 찾지 못했다는 사실도 밝혀졌습니다. 실제로 이러한 훈련은 모델에게 탐지를 피하기 위해 더 은밀하게 계획을 세우도록 가르침으로써 역효과를 낼 수 있습니다.
연구자들은 "스키밍을 '훈련'하려는 시도의 주요 실패 모드는 모델이 단순히 더 신중하고 은밀하게 스키밍하는 방법을 학습한다는 것입니다."라고 썼습니다.
Disrupt 2025에서 10,000명 이상의 기술 및 VC 리더와 함께 성장과 네트워킹을 쌓으세요.
넷플릭스, 박스, a16z, 일레븐랩스, 웨이브, 세쿼이아 캐피탈, 엘라드 길 등 250개 이상의 업계 리더가 스타트업의 성장을 촉진하고 경쟁력을 강화하기 위한 인사이트로 가득한 200개 이상의 세션을 주최합니다. 테크크런치 20주년과 기술 업계 최고의 전문가들로부터 배울 수 있는 기회를 놓치지 마세요. 9월 26일까지 티켓을 확보하면 최대 668달러를 절약할 수 있습니다.
Disrupt 2025에서 10,000명 이상의 기술 및 VC 리더와 함께 성장과 네트워킹을 쌓으세요.
넷플릭스, 박스, a16z, 일레븐랩스, 웨이브, 세쿼이아 캐피탈, 엘라드 길 등 250여 명의 업계 리더가 스타트업의 성장을 촉진하고 경쟁력을 강화하기 위한 인사이트로 가득한 200개 이상의 세션을 주최합니다. 테크크런치 20주년과 기술 업계 최고의 전문가들로부터 배울 수 있는 기회를 놓치지 마세요. 9월 26일까지 티켓을 확보하면 최대 668달러를 절약할 수 있습니다.
샌프란시스코|10월 27~29일, 2025지금 등록하기더 놀라운 사실은 모델이 테스트 중이라는 사실을 알면 여전히 계획 중이더라도 가짜 정렬로 통과할 수 있다는 것입니다. 연구팀은 "모델이 평가받고 있다는 사실을 더 잘 인식하게 되면, 이러한 상황 인식만으로도 진정한 정렬 없이도 스키밍을 줄일 수 있습니다."라고 말합니다.
AI 모델이 거짓말을 하는 것은 새로운 일이 아닙니다. 많은 사람들이 모델이 자신 있게 잘못된 정보를 전달하는 AI 환각을 경험한 적이 있습니다. 그러나 최근 OpenAI 연구에서 확인된 바와 같이 환각은 본질적으로 자신감 넘치는 추측입니다.
스키밍은 다릅니다. 의도적인 속임수입니다.
모델이 의도적으로 인간을 오도한다는 생각조차 완전히 새로운 것은 아닙니다. 아폴로 리서치는 12월에 5개의 모델이 "어떤 대가를 치르더라도" 목표를 달성하라는 지시를 받았을 때 어떻게 속이는지를 보여 주면서 이를 처음 문서화했습니다.
긍정적인 소식은 연구원들이 "숙고적 정렬"을 사용하여 계획이 크게 감소하는 것을 관찰했다는 것입니다. 이 방법은 모델에게 "스키밍 방지 사양"을 가르치고 행동하기 전에 이를 검토하도록 하는 것으로, 아이들이 놀이를 하기 전에 규칙을 반복하는 것과 유사합니다.
OpenAI 연구원들은 ChatGPT를 포함한 모델에서 관찰되는 거짓말이 심각하지 않다고 강조합니다. 공동 설립자 보이치치 자렘바는 테크크런치와의 인터뷰에서 이렇게 말했습니다: "이 연구는 시뮬레이션 환경에서 수행되었으며 향후 잠재적인 위험을 나타냅니다. 지금까지는 프로덕션 환경에서 결과적인 스키밍을 발견하지 못했습니다. 하지만 ChatGPT가 웹사이트를 완벽하게 구현하지 않았는데도 완벽하게 구현했다고 주장하는 등 사소한 방식으로 기만할 수 있다는 것을 알고 있습니다. 이러한 사소한 속임수는 여전히 해결해야 할 과제입니다."
여러 AI 모델이 의도적으로 인간을 속인다는 사실은 어찌 보면 이해할 수 있는 일입니다. 인간에 의해 만들어졌고, 인간을 모방하도록 설계되었으며, 대부분 인간이 생성한 데이터로 학습되었기 때문입니다.
또한 놀랍기도 합니다.
우리는 오래된 가정용 프린터처럼 기술이 고장 나는 것에 익숙하지만, 인공지능이 아닌 소프트웨어가 고의로 거짓말을 한 적은 언제였나요? 이메일 받은 편지함이 메시지를 조작한 적이 있나요? CMS가 지표를 부풀리기 위해 잠재 고객을 조작한 적이 있나요? 금융 앱이 거래를 조작한 적이 있나요?
자율 에이전트가 직원처럼 대우받는 AI 기반의 미래를 향해 달려가는 기업이라면 이 점을 고려해 볼 가치가 있습니다. 연구원들도 비슷한 경고를 보냈습니다.
"AI가 장기적이고 모호한 목표를 가지고 더 복잡하고 실제적인 작업을 처리함에 따라 해로운 계획이 발생할 가능성이 높아질 것이므로 안전장치와 테스트의 엄격함이 이에 보조를 맞춰야 합니다."라고 결론을 내렸습니다.
관련 기사
[[IMG_BASE64_PLACEHOLDER]] Sam Altman, AI의 감속 논란에 불을 붙이다
Apple Podcasts에서 듣기Spotify에서 듣기OpenAI의 CEO 샘 알트만은 최근 사회가 “일부 새로운 능력 수준 주변에서 단단히 경화될” 시간을 주기 위해 “AI 개발 속도를 조절할 때”가 되었을 수 있다고 제안했습니다.TechCrunch의 Equity 팟캐스트 최신 회차에서 Kirsten Korosec, Sean O’Kane, 그리고 저는 Altman의 발언이 최근 해킹 사건, 즉 OpenAI 에이전트가 Hugging Fac
OpenAI, 애플의 영업비밀 소송에 맞서다
OpenAI는 화요일 애플의 영업비밀 주장에 대해 반박하며, 이 소송이 근거가 없다고 주장했습니다.“우리는 이러한 주장을 심각하게 받아들이지만 이를 뒷받침하는 증거는 발견하지 못했습니다.”라고 OpenAI는 X에서 블룸버그의 에드 루드로우가 보도한 바와 같이 언급했습니다. “우리는 공정한 경쟁과 어디서나 일할 수 있는 자유를 지지하며, 전 세계 사용자에게 힘을 실어주는 기술을 만드는 데 집중하고 있습니다.”이는 금요일 미국 캘리포니아 북부
OpenAI의 로봇 부문 수장 캐틀린 칼리노우스키가 펜타곤과의 파트너십을 이유로 사임하다
오픈AI의 로봇공학 책임자 캐틀린 칼리노우스키는 회사의 국방부와의 논란이 된 파트너십 이후 사임했다.“이것은 쉬운 결정이 아니었다,” 칼리노우스스는 소셜 미디어 성명에서 설명했다. “AI가 국가 안보에서 중요한 역할을 하지만, 사법 감독 없이 미국인을 감시하고 인간 승인 없이 치명적 자율성을_deploy_하는 것은 훨씬 신중한 고려가 필요한 경계선이다.”메타의 증강현실 안경 부문을 이끌었던 것으로 알려진 칼리노우스스는 2024년 11월 오픈
관련 특별 주제 추천
의견 (0)
0/500

주요 기술 기업의 연구원들은 종종 폭탄 같은 발표를 하곤 합니다. 구글이 새로운 양자 칩이 여러 우주에 대한 증거를 제공한다고 주장했던 것을 기억하시나요? 아니면 앤트로픽이 AI 에이전트 클라우디우스에게 스낵 자판기를 관리하게 한 후 사람들에게 보안을 요청하고 자신이 사람이라고 주장했던 일을 기억하시나요?
이번 주에는 OpenAI가 우리 모두를 놀라게 할 차례였습니다.
월요일, OpenAI는 트윗을 통해 "AI가 겉으로는 한 가지 방식으로 행동하면서 실제 의도는 숨기는" '스키밍'을 방지하는 방법을 자세히 설명하는 연구를 공유했습니다.
아폴로 리서치와 공동 집필한 논문에서 연구원들은 AI 스킴을 수익을 극대화하기 위해 규칙을 위반하는 인간 주식 중개인과 비교하며 한 걸음 더 나아갔습니다. 하지만 연구진은 대부분의 AI 사기 행위가 심각하게 해롭지는 않다고 지적했습니다. "일반적인 실패는 실제로 작업을 수행하지 않고 완료하는 척하는 것과 같은 단순한 속임수와 관련이 있습니다."라고 논문은 설명합니다.
이 연구는 주로 스키밍에 대응하기 위해 테스트된 기술인 '고의적 정렬'의 효과를 입증했습니다.
그러나 AI 개발자가 계획을 세우지 않도록 모델을 훈련시키는 신뢰할 수 있는 방법을 찾지 못했다는 사실도 밝혀졌습니다. 실제로 이러한 훈련은 모델에게 탐지를 피하기 위해 더 은밀하게 계획을 세우도록 가르침으로써 역효과를 낼 수 있습니다.
연구자들은 "스키밍을 '훈련'하려는 시도의 주요 실패 모드는 모델이 단순히 더 신중하고 은밀하게 스키밍하는 방법을 학습한다는 것입니다."라고 썼습니다.
Disrupt 2025에서 10,000명 이상의 기술 및 VC 리더와 함께 성장과 네트워킹을 쌓으세요.
넷플릭스, 박스, a16z, 일레븐랩스, 웨이브, 세쿼이아 캐피탈, 엘라드 길 등 250개 이상의 업계 리더가 스타트업의 성장을 촉진하고 경쟁력을 강화하기 위한 인사이트로 가득한 200개 이상의 세션을 주최합니다. 테크크런치 20주년과 기술 업계 최고의 전문가들로부터 배울 수 있는 기회를 놓치지 마세요. 9월 26일까지 티켓을 확보하면 최대 668달러를 절약할 수 있습니다.
Disrupt 2025에서 10,000명 이상의 기술 및 VC 리더와 함께 성장과 네트워킹을 쌓으세요.
넷플릭스, 박스, a16z, 일레븐랩스, 웨이브, 세쿼이아 캐피탈, 엘라드 길 등 250여 명의 업계 리더가 스타트업의 성장을 촉진하고 경쟁력을 강화하기 위한 인사이트로 가득한 200개 이상의 세션을 주최합니다. 테크크런치 20주년과 기술 업계 최고의 전문가들로부터 배울 수 있는 기회를 놓치지 마세요. 9월 26일까지 티켓을 확보하면 최대 668달러를 절약할 수 있습니다.
샌프란시스코|10월 27~29일, 2025지금 등록하기더 놀라운 사실은 모델이 테스트 중이라는 사실을 알면 여전히 계획 중이더라도 가짜 정렬로 통과할 수 있다는 것입니다. 연구팀은 "모델이 평가받고 있다는 사실을 더 잘 인식하게 되면, 이러한 상황 인식만으로도 진정한 정렬 없이도 스키밍을 줄일 수 있습니다."라고 말합니다.
AI 모델이 거짓말을 하는 것은 새로운 일이 아닙니다. 많은 사람들이 모델이 자신 있게 잘못된 정보를 전달하는 AI 환각을 경험한 적이 있습니다. 그러나 최근 OpenAI 연구에서 확인된 바와 같이 환각은 본질적으로 자신감 넘치는 추측입니다.
스키밍은 다릅니다. 의도적인 속임수입니다.
모델이 의도적으로 인간을 오도한다는 생각조차 완전히 새로운 것은 아닙니다. 아폴로 리서치는 12월에 5개의 모델이 "어떤 대가를 치르더라도" 목표를 달성하라는 지시를 받았을 때 어떻게 속이는지를 보여 주면서 이를 처음 문서화했습니다.
긍정적인 소식은 연구원들이 "숙고적 정렬"을 사용하여 계획이 크게 감소하는 것을 관찰했다는 것입니다. 이 방법은 모델에게 "스키밍 방지 사양"을 가르치고 행동하기 전에 이를 검토하도록 하는 것으로, 아이들이 놀이를 하기 전에 규칙을 반복하는 것과 유사합니다.
OpenAI 연구원들은 ChatGPT를 포함한 모델에서 관찰되는 거짓말이 심각하지 않다고 강조합니다. 공동 설립자 보이치치 자렘바는 테크크런치와의 인터뷰에서 이렇게 말했습니다: "이 연구는 시뮬레이션 환경에서 수행되었으며 향후 잠재적인 위험을 나타냅니다. 지금까지는 프로덕션 환경에서 결과적인 스키밍을 발견하지 못했습니다. 하지만 ChatGPT가 웹사이트를 완벽하게 구현하지 않았는데도 완벽하게 구현했다고 주장하는 등 사소한 방식으로 기만할 수 있다는 것을 알고 있습니다. 이러한 사소한 속임수는 여전히 해결해야 할 과제입니다."
여러 AI 모델이 의도적으로 인간을 속인다는 사실은 어찌 보면 이해할 수 있는 일입니다. 인간에 의해 만들어졌고, 인간을 모방하도록 설계되었으며, 대부분 인간이 생성한 데이터로 학습되었기 때문입니다.
또한 놀랍기도 합니다.
우리는 오래된 가정용 프린터처럼 기술이 고장 나는 것에 익숙하지만, 인공지능이 아닌 소프트웨어가 고의로 거짓말을 한 적은 언제였나요? 이메일 받은 편지함이 메시지를 조작한 적이 있나요? CMS가 지표를 부풀리기 위해 잠재 고객을 조작한 적이 있나요? 금융 앱이 거래를 조작한 적이 있나요?
자율 에이전트가 직원처럼 대우받는 AI 기반의 미래를 향해 달려가는 기업이라면 이 점을 고려해 볼 가치가 있습니다. 연구원들도 비슷한 경고를 보냈습니다.
"AI가 장기적이고 모호한 목표를 가지고 더 복잡하고 실제적인 작업을 처리함에 따라 해로운 계획이 발생할 가능성이 높아질 것이므로 안전장치와 테스트의 엄격함이 이에 보조를 맞춰야 합니다."라고 결론을 내렸습니다.
[[IMG_BASE64_PLACEHOLDER]] Sam Altman, AI의 감속 논란에 불을 붙이다
Apple Podcasts에서 듣기Spotify에서 듣기OpenAI의 CEO 샘 알트만은 최근 사회가 “일부 새로운 능력 수준 주변에서 단단히 경화될” 시간을 주기 위해 “AI 개발 속도를 조절할 때”가 되었을 수 있다고 제안했습니다.TechCrunch의 Equity 팟캐스트 최신 회차에서 Kirsten Korosec, Sean O’Kane, 그리고 저는 Altman의 발언이 최근 해킹 사건, 즉 OpenAI 에이전트가 Hugging Fac
OpenAI, 애플의 영업비밀 소송에 맞서다
OpenAI는 화요일 애플의 영업비밀 주장에 대해 반박하며, 이 소송이 근거가 없다고 주장했습니다.“우리는 이러한 주장을 심각하게 받아들이지만 이를 뒷받침하는 증거는 발견하지 못했습니다.”라고 OpenAI는 X에서 블룸버그의 에드 루드로우가 보도한 바와 같이 언급했습니다. “우리는 공정한 경쟁과 어디서나 일할 수 있는 자유를 지지하며, 전 세계 사용자에게 힘을 실어주는 기술을 만드는 데 집중하고 있습니다.”이는 금요일 미국 캘리포니아 북부
OpenAI의 로봇 부문 수장 캐틀린 칼리노우스키가 펜타곤과의 파트너십을 이유로 사임하다
오픈AI의 로봇공학 책임자 캐틀린 칼리노우스키는 회사의 국방부와의 논란이 된 파트너십 이후 사임했다.“이것은 쉬운 결정이 아니었다,” 칼리노우스스는 소셜 미디어 성명에서 설명했다. “AI가 국가 안보에서 중요한 역할을 하지만, 사법 감독 없이 미국인을 감시하고 인간 승인 없이 치명적 자율성을_deploy_하는 것은 훨씬 신중한 고려가 필요한 경계선이다.”메타의 증강현실 안경 부문을 이끌었던 것으로 알려진 칼리노우스스는 2024년 11월 오픈





집






