새로운 연구에 따르면 GPT-4.5는 튜링 테스트에서 인간의 성능을 능가할 가능성이 높은 것으로 나타났으며, 허위 응답을 생성하는 뛰어난 능력을 보여주었다.
이 순간은 컴퓨터 과학 역사의 연대기에 반드시 기록될 중대한 사건으로 자리매김할 것입니다. 컴퓨터 과학의 아버지로 일컬어지는 영국의 수학자 앨런 튜링이 1950년에 제시한 획기적인 아이디어가 76년 만에 마침내 실증적 연구를 통해 입증되었습니다.
최근 발간된 『미국 국립과학원 회보(PNAS)』에는 캘리포니아 대학교 샌디에이고 캠퍼스(UCSD)가 수행한 선구적인 연구가 실렸다. 인지과학 전문가인 카메론 존스와 벤 버겐이 공동 집필한 논문은 오늘날을 선도하는 대규모 언어 모델들이 엄격한 기준 하에서 고전적인 3자 튜링 테스트를 성공적으로 통과할 수 있음을 입증했다. 더욱 놀라운 점은 특정 상황에서 이러한 AI 시스템이 실제 인간 참가자들보다 더 높은 빈도로 실제 인간으로 오인된다는 사실이다.

주요 실증 데이터:
영광의 등극: 맞춤형 성격 프롬프트를 제공받았을 때, GPT-4.5는 73%의 사례에서 인간으로 식별되었으며, 이는 함께 경쟁한 인간 자원자들의 성공률을 훨씬 능가하는 수치입니다.
대등한 경쟁: 오픈소스 모델인 LLaMa-3.1-405B는 56%의 성공률을 기록했으며, 이는 통계적으로 실제 인간과 구분할 수 없는 성능을 나타냅니다.
프롬프트가 모든 것을 결정한다: 신중하게 작성된 “성격 프롬프트”가 없을 경우, GPT-4.5의 성공률은 36%로 떨어졌고, LLaMa-3.1은 38%로 하락했다. 이러한 AI 시스템이 인간을 모방하는 능력은 여전히 인간 설계자가 제공하는 정확한 지시에 크게 의존하고 있다.
기준선 실패: 1960년대의 규칙 기반 로봇 ELIZA는 23%의 성공률에 그쳤고, 특정 프롬프트가 제공되지 않은 GPT-4o는 21%를 기록했는데, 두 경우 모두 대화가 길어질수록 인공적인 본질이 금세 드러났다.
"거짓말의 게임": 지능은 더 이상 기준이 아니며, 감성 지능과 결함이 위장의 핵심이다
UCSD 학부생과 온라인으로 모집된 자원봉사자 등 약 500명의 평가자가 참여한 이 이중 맹검 무작위 대조 실험에서, 참가자들은 5분에서 15분 동안 진행된 실시간 텍스트 대화를 바탕으로 두 대상 중 어느 쪽이 기계인지 식별하도록 요청받았다.
그러나 결과는 모든 예상을 뒤엎었다. 이전에는 AI가 튜링 테스트를 통과하는 능력이 “모든 것을 아는 계산 능력”에서 비롯된다고 여겨졌으나, 이 연구는 더 불안한 진실을 밝혀냈다. 바로 대규모 언어 모델이 실제 사람과 유사한 방식으로 실수를 하는 법을 배웠기 때문에 인간을 속일 수 있다는 점이다.

[프롬프트 미지정 상태: 방대한 지식 기반, 절대적 합리성] ──► 인간 심사위원: 이건 분명 AI야!
교신 저자인 카메론 존스(Cameron Jones)가 설명했듯이, 적절한 프롬프트가 주어지면 첨단 대규모 언어 모델은 어조, 직설성, 유머 감각, 그리고 실수할 수 있는 성향—즉, 오류를 범하거나 부적절한 말을 하는 경향—을 포함한 인간의 대화 패턴을 정확하게 재현할 수 있다. 이러한 테스트에서 그들이 성공한 것은 수학이나 논리에서 높은 지능을 보여주었기 때문이 아니라, 거의 완벽한 사회적 행동을 보였기 때문이다.
튜링 테스트의 재정의: “지능 측정”에서 “인간성 측정”으로
이 연구의 공동 저자 중 한 명인 벤 버겐 교수는 이번 실험이 과학계 전체로 하여금 튜링 테스트의 근본적인 목적을 재고하도록 촉구한다고 지적했다. 원래 기계가 인간의 지능에 필적할 수 있는지 판단하기 위해 고안된 이 테스트는, 2026년이 되자 AI 시스템이 이미 수많은 분야에서 속도와 정확도 면에서 인간을 능가함에 따라 무의미해졌다.
오늘날의 튜링 테스트는 ‘지능’을 측정하는 데 초점을 두기보다는, 특정 대상이 인간과 얼마나 닮았는지를 평가하는 데 더 중점을 둔다. 본질적으로 이는 기만 경쟁으로 변질되었으며, AI는 탁월한 거짓말쟁이임을 입증하고 있다.
대규모 언어 모델이 15분간의 자유로운 대화 동안 단서 하나도 드러내지 않고 성공적으로 위장할 수 있다면, 오랫동안 온라인 세계의 기반이 되어 온 신뢰 체계가 완전히 무너질 수도 있음을 의미한다.
번영 뒤에 숨은 그림자: ‘자금 세탁 방지’ 방식의 온라인 신원 확인 제도가 곧 도입될 예정
기만이 이토록 저렴하고 효율적으로 이루어지게 되면, 현실 세계의 사회적 위험은 크게 증가합니다. 베르겐 교수는 이러한 발전에 대해 심각한 우려를 표명했습니다. 인간을 완벽하게 사칭할 수 있는 AI 기술은 범죄자, 정치 단체, 또는 극단주의 조직에 의해 악용될 가능성이 매우 높습니다.
온라인 사회적 상호작용이나 고객 서비스 상황에서 사용자들은 자신도 모르게 인간으로 위장한 챗봇에 설득당할 수 있으며, 이로 인해 사회보장번호와 같은 민감한 정보가 유출되거나, 투표 성향이 바뀌거나, 충동적으로 제품을 구매하는 결과로 이어질 수 있습니다.
이러한 중대한 과학적 연구 결과를 바탕으로, 연구팀은 사회에 명확한 경고를 보냈습니다. 앞으로 온라인에서 낯선 사람과 상호작용할 때, 사람들은 인간과 로봇을 항상 100% 정확하게 구별할 수 있다는 가정을 대폭 줄여야 합니다. 악화되고 있는 온라인 신뢰 문제를 해결하기 위해서는, 더 엄격한 디지털 신원 확인 시스템과 AI 생성 콘텐츠에 대응하기 위한 메커니즘을 조속히 개발하고 도입해야 합니다.
관련 기사
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
스웨덴의 AI 스타트업 로버블 아이즈, 주요 자금 조달 라운드 이후 132억 달러의 기업 가치 달성
AI 기반 코딩 도구가 인기를 얻으면서 스웨덴 스타트업 로버블(Lovable)이 주요 자금 조달 라운드를 성사시켰다. 이 회사는 30억 달러를 조달하여 지난 12월 기록된 66억 달러의 두 배인 132억 달러의 기업 가치를 달성할 수 있을 것으로 기대된다. 멘로 벤처스(Menlo Ventures)가 이 투자 라운드를 주도할 것으로 예상된다.로버블의 매력은 복잡한 코딩 기술이 필요하지 않은 소프트웨어 제작을 단순화하는 핵심 '바이브 코딩(vib
구글, 사용자 제어 강화에 맞춰 제미니용 레미 AI 에이전트 테스트
비즈니스 인사이더에 따르면, 구글은 제미나이를 위한 새로운 AI 개인 에이전트인 레미를 테스트하고 있습니다. 이 도구는 사용자를 대신하여 작업을 실행하여 전문적인 워크플로우와 일상적인 루틴을 모두 간소화하는 것을 목표로 합니다.현재 레미는 제미나이 애플리케이션의 내부 직원 전용 버전에서 테스트 중입니다. 이 보고서는 내부 문서와 프로젝트에 정통한 두 명의 인물과의 인터뷰를 인용합니다. 내부 자료는 레미를 “24/7 개인 에이전트”로 묘사하며,
관련 특별 주제 추천
의견 (0)
0/500
이 순간은 컴퓨터 과학 역사의 연대기에 반드시 기록될 중대한 사건으로 자리매김할 것입니다. 컴퓨터 과학의 아버지로 일컬어지는 영국의 수학자 앨런 튜링이 1950년에 제시한 획기적인 아이디어가 76년 만에 마침내 실증적 연구를 통해 입증되었습니다.
최근 발간된 『미국 국립과학원 회보(PNAS)』에는 캘리포니아 대학교 샌디에이고 캠퍼스(UCSD)가 수행한 선구적인 연구가 실렸다. 인지과학 전문가인 카메론 존스와 벤 버겐이 공동 집필한 논문은 오늘날을 선도하는 대규모 언어 모델들이 엄격한 기준 하에서 고전적인 3자 튜링 테스트를 성공적으로 통과할 수 있음을 입증했다. 더욱 놀라운 점은 특정 상황에서 이러한 AI 시스템이 실제 인간 참가자들보다 더 높은 빈도로 실제 인간으로 오인된다는 사실이다.

주요 실증 데이터:
영광의 등극: 맞춤형 성격 프롬프트를 제공받았을 때, GPT-4.5는 73%의 사례에서 인간으로 식별되었으며, 이는 함께 경쟁한 인간 자원자들의 성공률을 훨씬 능가하는 수치입니다.
대등한 경쟁: 오픈소스 모델인 LLaMa-3.1-405B는 56%의 성공률을 기록했으며, 이는 통계적으로 실제 인간과 구분할 수 없는 성능을 나타냅니다.
프롬프트가 모든 것을 결정한다: 신중하게 작성된 “성격 프롬프트”가 없을 경우, GPT-4.5의 성공률은 36%로 떨어졌고, LLaMa-3.1은 38%로 하락했다. 이러한 AI 시스템이 인간을 모방하는 능력은 여전히 인간 설계자가 제공하는 정확한 지시에 크게 의존하고 있다.
기준선 실패: 1960년대의 규칙 기반 로봇 ELIZA는 23%의 성공률에 그쳤고, 특정 프롬프트가 제공되지 않은 GPT-4o는 21%를 기록했는데, 두 경우 모두 대화가 길어질수록 인공적인 본질이 금세 드러났다.
"거짓말의 게임": 지능은 더 이상 기준이 아니며, 감성 지능과 결함이 위장의 핵심이다
UCSD 학부생과 온라인으로 모집된 자원봉사자 등 약 500명의 평가자가 참여한 이 이중 맹검 무작위 대조 실험에서, 참가자들은 5분에서 15분 동안 진행된 실시간 텍스트 대화를 바탕으로 두 대상 중 어느 쪽이 기계인지 식별하도록 요청받았다.
그러나 결과는 모든 예상을 뒤엎었다. 이전에는 AI가 튜링 테스트를 통과하는 능력이 “모든 것을 아는 계산 능력”에서 비롯된다고 여겨졌으나, 이 연구는 더 불안한 진실을 밝혀냈다. 바로 대규모 언어 모델이 실제 사람과 유사한 방식으로 실수를 하는 법을 배웠기 때문에 인간을 속일 수 있다는 점이다.

[프롬프트 미지정 상태: 방대한 지식 기반, 절대적 합리성] ──► 인간 심사위원: 이건 분명 AI야!
교신 저자인 카메론 존스(Cameron Jones)가 설명했듯이, 적절한 프롬프트가 주어지면 첨단 대규모 언어 모델은 어조, 직설성, 유머 감각, 그리고 실수할 수 있는 성향—즉, 오류를 범하거나 부적절한 말을 하는 경향—을 포함한 인간의 대화 패턴을 정확하게 재현할 수 있다. 이러한 테스트에서 그들이 성공한 것은 수학이나 논리에서 높은 지능을 보여주었기 때문이 아니라, 거의 완벽한 사회적 행동을 보였기 때문이다.
튜링 테스트의 재정의: “지능 측정”에서 “인간성 측정”으로
이 연구의 공동 저자 중 한 명인 벤 버겐 교수는 이번 실험이 과학계 전체로 하여금 튜링 테스트의 근본적인 목적을 재고하도록 촉구한다고 지적했다. 원래 기계가 인간의 지능에 필적할 수 있는지 판단하기 위해 고안된 이 테스트는, 2026년이 되자 AI 시스템이 이미 수많은 분야에서 속도와 정확도 면에서 인간을 능가함에 따라 무의미해졌다.
오늘날의 튜링 테스트는 ‘지능’을 측정하는 데 초점을 두기보다는, 특정 대상이 인간과 얼마나 닮았는지를 평가하는 데 더 중점을 둔다. 본질적으로 이는 기만 경쟁으로 변질되었으며, AI는 탁월한 거짓말쟁이임을 입증하고 있다.
대규모 언어 모델이 15분간의 자유로운 대화 동안 단서 하나도 드러내지 않고 성공적으로 위장할 수 있다면, 오랫동안 온라인 세계의 기반이 되어 온 신뢰 체계가 완전히 무너질 수도 있음을 의미한다.
번영 뒤에 숨은 그림자: ‘자금 세탁 방지’ 방식의 온라인 신원 확인 제도가 곧 도입될 예정
기만이 이토록 저렴하고 효율적으로 이루어지게 되면, 현실 세계의 사회적 위험은 크게 증가합니다. 베르겐 교수는 이러한 발전에 대해 심각한 우려를 표명했습니다. 인간을 완벽하게 사칭할 수 있는 AI 기술은 범죄자, 정치 단체, 또는 극단주의 조직에 의해 악용될 가능성이 매우 높습니다.
온라인 사회적 상호작용이나 고객 서비스 상황에서 사용자들은 자신도 모르게 인간으로 위장한 챗봇에 설득당할 수 있으며, 이로 인해 사회보장번호와 같은 민감한 정보가 유출되거나, 투표 성향이 바뀌거나, 충동적으로 제품을 구매하는 결과로 이어질 수 있습니다.
이러한 중대한 과학적 연구 결과를 바탕으로, 연구팀은 사회에 명확한 경고를 보냈습니다. 앞으로 온라인에서 낯선 사람과 상호작용할 때, 사람들은 인간과 로봇을 항상 100% 정확하게 구별할 수 있다는 가정을 대폭 줄여야 합니다. 악화되고 있는 온라인 신뢰 문제를 해결하기 위해서는, 더 엄격한 디지털 신원 확인 시스템과 AI 생성 콘텐츠에 대응하기 위한 메커니즘을 조속히 개발하고 도입해야 합니다.
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
스웨덴의 AI 스타트업 로버블 아이즈, 주요 자금 조달 라운드 이후 132억 달러의 기업 가치 달성
AI 기반 코딩 도구가 인기를 얻으면서 스웨덴 스타트업 로버블(Lovable)이 주요 자금 조달 라운드를 성사시켰다. 이 회사는 30억 달러를 조달하여 지난 12월 기록된 66억 달러의 두 배인 132억 달러의 기업 가치를 달성할 수 있을 것으로 기대된다. 멘로 벤처스(Menlo Ventures)가 이 투자 라운드를 주도할 것으로 예상된다.로버블의 매력은 복잡한 코딩 기술이 필요하지 않은 소프트웨어 제작을 단순화하는 핵심 '바이브 코딩(vib





집






