워싱턴 주립대 연구, 복잡한 과학적 판단에서 ChatGPT의 중대한 모순을 밝혀내다

워싱턴 주립대학교(WSU)의 최근 연구에 따르면, ChatGPT는 자신감 있게 답변하지만 복잡한 과학적 주장을 다루는 방식은 무작위 추측과 유사하다고 한다. 이 연구는 정확도가 제한적일 뿐만 아니라 동일한 질문에 대해 모순된 답변이 빈번하게 나온다는 점도 지적했다.
메수트 치체크 교수와 연구팀은 2021년 이후 발행된 경영학 학술지에서 719개의 연구 가설을 추출하여, 사실 확인을 위해 이 가설들을 모델에 반복적으로 입력했다.
ChatGPT의 표면적인 정확도는 약 80%로 보이지만, 무작위 추측을 고려하면 실제 성능은 50% 확률의 동전 던지기보다 약 60% 정도 더 나은 수준에 불과하다. 연구진은 이를 “낮은 D등급”으로 평가했다. 이 모델은 특히 거짓 진술을 식별하는 데서 저조한 성과를 보였으며, 거짓 명제 중 단 16.4%만 올바르게 판별했다.
연구진은 각 가설을 모델에 10회씩 입력한 결과, 모델이 일관된 입장을 유지하는 데 어려움을 겪는다는 사실을 발견했습니다:
답변 변동: 약 73%의 사례에서 모델은 10회 반복에 걸쳐 일관된 결론을 유지했습니다.
극단적인 모순: 일부 경우, 모델은 “참”과 “거짓” 답변을 번갈아 내놓았으며, 정확히 동일한 프롬프트를 사용했음에도 절반은 참이고 절반은 거짓인 극단적인 사례도 있었습니다.
이 연구는 사용자들이 AI의 유창하고 설득력 있는 언어에 쉽게 현혹되지만, 이것이 진정한 추론 능력을 의미하는 것은 아니라고 지적한다.
진정한 이해 부재: 이 모델은 세상과 자신이 말하는 내용을 진정으로 이해하는 인간과 달리, 기억과 패턴 매칭에 의존합니다.
제한적인 버전 발전: 테스트 결과, 업데이트된 ChatGPT-5 mini(2025년 테스트)는 이 특정 과제에서 이전 버전과 유사한 성능을 보였으며, 유의미한 개선점은 나타나지 않았다.
이러한 연구 결과를 바탕으로, 치체크(Cicek)는 경영진들이 복잡한 결정을 내릴 때 높은 수준의 회의적 태도를 유지할 것을 권고한다. 그들은 생성형 AI를 전문적인 판단을 대체할 수 있는 ‘권위’로 간주해서는 안 되며, 모든 출력 결과를 수동으로 검증해야 한다. 조직은 직원들이 AI 도구의 장점과 한계를 모두 이해할 수 있도록 교육을 강화하여, 맹목적인 신뢰로 인한 의사결정 편향을 방지해야 한다.
이 연구는 AI가 급속히 발전하고 있음에도 불구하고, 이 기술의 심층적인 논리적 추론 및 증거 평가 능력은 여전히 개선이 필요하다는 점을 다시 한번 상기시켜 줍니다.
관련 기사
ByteDance의 Seed가 글로벌 캠퍼스 채용을 시작하며, 최상위 대형 모델 인재 영입을 위해 가상 주식을 제공합니다
대규모 언어 모델의 치열한 경쟁 구도에서 최상위 인재 확보는 여전히 가장 중요한 전략적 자산입니다.4월 1일, ByteDance은 대규모 모델 인재 양성 프로그램의 일환으로 글로벌 캠퍼스 채용 프로그램 Seed를 시작한다고 발표했습니다. 이 캠페인은 2027년 졸업 예정자와 현재 인턴을 대상으로 전 세계 AI 분야의 엘리트 연구 및 엔지니어링 전문가를 식별하고 확보하는 것을 목표로 합니다.확장: 전 세계 100명의 "AI 시드" 식별급속한
법적 분쟁 속에서 Suno의 워터마크 삽입
Suno는 사용자가 AI 생성 음악을 생성할 수 있게 하는 플랫폼으로, 플랫폼에서 생성된 트랙에 레이블을 지정하고 다운로드를 제한하며, 무단 복제를 억제하기 위해 커뮤니티 기준을 업데이트하는 새로운 기능을 공개했습니다. 이러한 업데이트는 Suno가 레이블 및 아티스트 조직으로부터 여러 소송에 직면하는 시점에 이루어집니다.공동 창립자이자 CEO인 Mikey Shulman은 블로그 게시물을 통해 핵심 원칙을 제시하며, 플랫폼이 광범위한 청중을 대
머스크, Grok 구축 과정에서 사용자 코드 유출 인정, 모든 과거 데이터 삭제 약속
Elon Musk는 Grok Build와 관련된 프라이버시 논란에 대해 직접적으로 언급하며, 사건의 타당성을 확인하기 위해 간단한 "True"로 답변했습니다. 그는 SpaceXAI에 이전에 업로드된 모든 사용자 데이터를 영구적으로 삭제하겠다고 약속하며, "바이트 하나도 남기지 않겠다"고 밝혔습니다. 이는 주요 기술 리더가 실수를 공개적으로 인정하고 사용자 데이터를 능동적으로 삭제한 AI 산업 최초의 사례입니다.안전 연구원의 '피싱' 테스트는
관련 특별 주제 추천
의견 (0)
0/500

워싱턴 주립대학교(WSU)의 최근 연구에 따르면, ChatGPT는 자신감 있게 답변하지만 복잡한 과학적 주장을 다루는 방식은 무작위 추측과 유사하다고 한다. 이 연구는 정확도가 제한적일 뿐만 아니라 동일한 질문에 대해 모순된 답변이 빈번하게 나온다는 점도 지적했다.
메수트 치체크 교수와 연구팀은 2021년 이후 발행된 경영학 학술지에서 719개의 연구 가설을 추출하여, 사실 확인을 위해 이 가설들을 모델에 반복적으로 입력했다.
ChatGPT의 표면적인 정확도는 약 80%로 보이지만, 무작위 추측을 고려하면 실제 성능은 50% 확률의 동전 던지기보다 약 60% 정도 더 나은 수준에 불과하다. 연구진은 이를 “낮은 D등급”으로 평가했다. 이 모델은 특히 거짓 진술을 식별하는 데서 저조한 성과를 보였으며, 거짓 명제 중 단 16.4%만 올바르게 판별했다.
연구진은 각 가설을 모델에 10회씩 입력한 결과, 모델이 일관된 입장을 유지하는 데 어려움을 겪는다는 사실을 발견했습니다:
답변 변동: 약 73%의 사례에서 모델은 10회 반복에 걸쳐 일관된 결론을 유지했습니다.
극단적인 모순: 일부 경우, 모델은 “참”과 “거짓” 답변을 번갈아 내놓았으며, 정확히 동일한 프롬프트를 사용했음에도 절반은 참이고 절반은 거짓인 극단적인 사례도 있었습니다.
이 연구는 사용자들이 AI의 유창하고 설득력 있는 언어에 쉽게 현혹되지만, 이것이 진정한 추론 능력을 의미하는 것은 아니라고 지적한다.
진정한 이해 부재: 이 모델은 세상과 자신이 말하는 내용을 진정으로 이해하는 인간과 달리, 기억과 패턴 매칭에 의존합니다.
제한적인 버전 발전: 테스트 결과, 업데이트된 ChatGPT-5 mini(2025년 테스트)는 이 특정 과제에서 이전 버전과 유사한 성능을 보였으며, 유의미한 개선점은 나타나지 않았다.
이러한 연구 결과를 바탕으로, 치체크(Cicek)는 경영진들이 복잡한 결정을 내릴 때 높은 수준의 회의적 태도를 유지할 것을 권고한다. 그들은 생성형 AI를 전문적인 판단을 대체할 수 있는 ‘권위’로 간주해서는 안 되며, 모든 출력 결과를 수동으로 검증해야 한다. 조직은 직원들이 AI 도구의 장점과 한계를 모두 이해할 수 있도록 교육을 강화하여, 맹목적인 신뢰로 인한 의사결정 편향을 방지해야 한다.
이 연구는 AI가 급속히 발전하고 있음에도 불구하고, 이 기술의 심층적인 논리적 추론 및 증거 평가 능력은 여전히 개선이 필요하다는 점을 다시 한번 상기시켜 줍니다.
ByteDance의 Seed가 글로벌 캠퍼스 채용을 시작하며, 최상위 대형 모델 인재 영입을 위해 가상 주식을 제공합니다
대규모 언어 모델의 치열한 경쟁 구도에서 최상위 인재 확보는 여전히 가장 중요한 전략적 자산입니다.4월 1일, ByteDance은 대규모 모델 인재 양성 프로그램의 일환으로 글로벌 캠퍼스 채용 프로그램 Seed를 시작한다고 발표했습니다. 이 캠페인은 2027년 졸업 예정자와 현재 인턴을 대상으로 전 세계 AI 분야의 엘리트 연구 및 엔지니어링 전문가를 식별하고 확보하는 것을 목표로 합니다.확장: 전 세계 100명의 "AI 시드" 식별급속한
법적 분쟁 속에서 Suno의 워터마크 삽입
Suno는 사용자가 AI 생성 음악을 생성할 수 있게 하는 플랫폼으로, 플랫폼에서 생성된 트랙에 레이블을 지정하고 다운로드를 제한하며, 무단 복제를 억제하기 위해 커뮤니티 기준을 업데이트하는 새로운 기능을 공개했습니다. 이러한 업데이트는 Suno가 레이블 및 아티스트 조직으로부터 여러 소송에 직면하는 시점에 이루어집니다.공동 창립자이자 CEO인 Mikey Shulman은 블로그 게시물을 통해 핵심 원칙을 제시하며, 플랫폼이 광범위한 청중을 대
머스크, Grok 구축 과정에서 사용자 코드 유출 인정, 모든 과거 데이터 삭제 약속
Elon Musk는 Grok Build와 관련된 프라이버시 논란에 대해 직접적으로 언급하며, 사건의 타당성을 확인하기 위해 간단한 "True"로 답변했습니다. 그는 SpaceXAI에 이전에 업로드된 모든 사용자 데이터를 영구적으로 삭제하겠다고 약속하며, "바이트 하나도 남기지 않겠다"고 밝혔습니다. 이는 주요 기술 리더가 실수를 공개적으로 인정하고 사용자 데이터를 능동적으로 삭제한 AI 산업 최초의 사례입니다.안전 연구원의 '피싱' 테스트는





집






