오픈AI, GPT-5.4 Pro 및 Thinking 에디션 공개

목요일, OpenAI는 “전문적인 업무를 위한 가장 강력하고 효율적인 최첨단 모델”로 소개된 새로운 파운데이션 모델인 GPT-5.4를 공개했습니다. 표준 버전 외에도 GPT-5.4는 추론에 중점을 둔 변형 모델(GPT-5.4 Thinking)과 성능이 최적화된 버전(GPT-5.4 Pro)으로 제공됩니다.
이 모델의 API 버전은 최대 100만 토큰 규모의 컨텍스트 윈도우를 지원하며, 이는 OpenAI가 지금까지 제공한 것 중 가장 큰 컨텍스트 용량입니다.
또한 OpenAI는 토큰 효율성이 향상되었다고 강조하며, GPT-5.4가 이전 모델보다 훨씬 적은 토큰 수로 동일한 문제를 해결할 수 있다고 밝혔습니다.
이 새로운 모델은 벤치마크 결과에서 상당한 개선을 보여주며, 컴퓨터 활용 벤치마크인 OSWorld-Verified와 WebArena Verified에서 기록적인 점수를 달성했습니다. 또한 지식 작업 과제를 평가하는 OpenAI의 GDPval 테스트에서 83%의 점수를 기록하며 새로운 기록을 세웠습니다.
Mercor의 브렌던 푸디(Brendan Foody) CEO의 성명에 따르면, GPT-5.4는 법률 및 금융 분야의 전문 기술을 평가하는 Mercor의 APEX-Agents 벤치마크에서 선두를 달리고 있습니다.
푸디 CEO는 "[GPT-5.4]는 슬라이드 자료, 재무 모델, 법률 분석과 같은 장기적인 결과물 생성에서 탁월한 성능을 발휘하며, 경쟁 모델보다 더 빠르고 저렴한 비용으로 최고 수준의 성능을 제공합니다"라고 밝혔다.
GPT-5.4는 환각 현상과 사실적 오류 감소를 위한 OpenAI의 노력을 이어가고 있다. 회사에 따르면, 이 새로운 모델은 GPT-5.2에 비해 개별 주장에서 오류를 범할 확률이 33% 낮으며, 전체 응답에서 오류가 포함될 확률도 18% 감소했다.
출시와 함께 OpenAI는 GPT-5.4 API의 도구 호출 방식을 재설계하여 'Tool Search'라는 새로운 시스템을 도입했습니다. 이전에는 시스템 프롬프트가 사용 가능한 모든 도구를 사전에 정의해야 했으며, 이는 도구 라이브러리가 확장됨에 따라 상당한 토큰을 소모하는 과정이었습니다. 새로운 시스템은 모델이 필요에 따라 도구 정의를 검색할 수 있게 하여, 도구가 많은 환경에서 요청을 더 빠르고 비용 효율적으로 처리할 수 있게 합니다.
또한 OpenAI는 다단계 작업 수행 중 모델의 추론 과정을 보여주는 '사고의 연쇄(chain-of-thought)'를 평가하기 위한 새로운 안전성 평가 기능을 추가했습니다. AI 안전성 연구자들은 오랫동안 추론 모델이 자신의 사고의 연쇄를 왜곡할 수 있다는 우려를 제기해 왔으며, 테스트 결과 특정 조건 하에서 이러한 현상이 발생할 수 있음이 확인되었습니다.
OpenAI의 새로운 평가 결과에 따르면, GPT-5.4의 'Thinking' 버전에서는 이러한 속임수가 발생할 가능성이 더 낮은 것으로 나타났으며, 이는 "모델이 자신의 추론을 숨길 능력이 부족하며, CoT 모니터링이 여전히 효과적인 안전 도구임을 시사한다"고 합니다.
관련 기사
[[IMG_BASE64_PLACEHOLDER]] Sam Altman, AI의 감속 논란에 불을 붙이다
Apple Podcasts에서 듣기Spotify에서 듣기OpenAI의 CEO 샘 알트만은 최근 사회가 “일부 새로운 능력 수준 주변에서 단단히 경화될” 시간을 주기 위해 “AI 개발 속도를 조절할 때”가 되었을 수 있다고 제안했습니다.TechCrunch의 Equity 팟캐스트 최신 회차에서 Kirsten Korosec, Sean O’Kane, 그리고 저는 Altman의 발언이 최근 해킹 사건, 즉 OpenAI 에이전트가 Hugging Fac
OpenAI, 애플의 영업비밀 소송에 맞서다
OpenAI는 화요일 애플의 영업비밀 주장에 대해 반박하며, 이 소송이 근거가 없다고 주장했습니다.“우리는 이러한 주장을 심각하게 받아들이지만 이를 뒷받침하는 증거는 발견하지 못했습니다.”라고 OpenAI는 X에서 블룸버그의 에드 루드로우가 보도한 바와 같이 언급했습니다. “우리는 공정한 경쟁과 어디서나 일할 수 있는 자유를 지지하며, 전 세계 사용자에게 힘을 실어주는 기술을 만드는 데 집중하고 있습니다.”이는 금요일 미국 캘리포니아 북부
OpenAI의 로봇 부문 수장 캐틀린 칼리노우스키가 펜타곤과의 파트너십을 이유로 사임하다
오픈AI의 로봇공학 책임자 캐틀린 칼리노우스키는 회사의 국방부와의 논란이 된 파트너십 이후 사임했다.“이것은 쉬운 결정이 아니었다,” 칼리노우스스는 소셜 미디어 성명에서 설명했다. “AI가 국가 안보에서 중요한 역할을 하지만, 사법 감독 없이 미국인을 감시하고 인간 승인 없이 치명적 자율성을_deploy_하는 것은 훨씬 신중한 고려가 필요한 경계선이다.”메타의 증강현실 안경 부문을 이끌었던 것으로 알려진 칼리노우스스는 2024년 11월 오픈
관련 특별 주제 추천
의견 (0)
0/500

목요일, OpenAI는 “전문적인 업무를 위한 가장 강력하고 효율적인 최첨단 모델”로 소개된 새로운 파운데이션 모델인 GPT-5.4를 공개했습니다. 표준 버전 외에도 GPT-5.4는 추론에 중점을 둔 변형 모델(GPT-5.4 Thinking)과 성능이 최적화된 버전(GPT-5.4 Pro)으로 제공됩니다.
이 모델의 API 버전은 최대 100만 토큰 규모의 컨텍스트 윈도우를 지원하며, 이는 OpenAI가 지금까지 제공한 것 중 가장 큰 컨텍스트 용량입니다.
또한 OpenAI는 토큰 효율성이 향상되었다고 강조하며, GPT-5.4가 이전 모델보다 훨씬 적은 토큰 수로 동일한 문제를 해결할 수 있다고 밝혔습니다.
이 새로운 모델은 벤치마크 결과에서 상당한 개선을 보여주며, 컴퓨터 활용 벤치마크인 OSWorld-Verified와 WebArena Verified에서 기록적인 점수를 달성했습니다. 또한 지식 작업 과제를 평가하는 OpenAI의 GDPval 테스트에서 83%의 점수를 기록하며 새로운 기록을 세웠습니다.
Mercor의 브렌던 푸디(Brendan Foody) CEO의 성명에 따르면, GPT-5.4는 법률 및 금융 분야의 전문 기술을 평가하는 Mercor의 APEX-Agents 벤치마크에서 선두를 달리고 있습니다.
푸디 CEO는 "[GPT-5.4]는 슬라이드 자료, 재무 모델, 법률 분석과 같은 장기적인 결과물 생성에서 탁월한 성능을 발휘하며, 경쟁 모델보다 더 빠르고 저렴한 비용으로 최고 수준의 성능을 제공합니다"라고 밝혔다.
GPT-5.4는 환각 현상과 사실적 오류 감소를 위한 OpenAI의 노력을 이어가고 있다. 회사에 따르면, 이 새로운 모델은 GPT-5.2에 비해 개별 주장에서 오류를 범할 확률이 33% 낮으며, 전체 응답에서 오류가 포함될 확률도 18% 감소했다.
출시와 함께 OpenAI는 GPT-5.4 API의 도구 호출 방식을 재설계하여 'Tool Search'라는 새로운 시스템을 도입했습니다. 이전에는 시스템 프롬프트가 사용 가능한 모든 도구를 사전에 정의해야 했으며, 이는 도구 라이브러리가 확장됨에 따라 상당한 토큰을 소모하는 과정이었습니다. 새로운 시스템은 모델이 필요에 따라 도구 정의를 검색할 수 있게 하여, 도구가 많은 환경에서 요청을 더 빠르고 비용 효율적으로 처리할 수 있게 합니다.
또한 OpenAI는 다단계 작업 수행 중 모델의 추론 과정을 보여주는 '사고의 연쇄(chain-of-thought)'를 평가하기 위한 새로운 안전성 평가 기능을 추가했습니다. AI 안전성 연구자들은 오랫동안 추론 모델이 자신의 사고의 연쇄를 왜곡할 수 있다는 우려를 제기해 왔으며, 테스트 결과 특정 조건 하에서 이러한 현상이 발생할 수 있음이 확인되었습니다.
OpenAI의 새로운 평가 결과에 따르면, GPT-5.4의 'Thinking' 버전에서는 이러한 속임수가 발생할 가능성이 더 낮은 것으로 나타났으며, 이는 "모델이 자신의 추론을 숨길 능력이 부족하며, CoT 모니터링이 여전히 효과적인 안전 도구임을 시사한다"고 합니다.
[[IMG_BASE64_PLACEHOLDER]] Sam Altman, AI의 감속 논란에 불을 붙이다
Apple Podcasts에서 듣기Spotify에서 듣기OpenAI의 CEO 샘 알트만은 최근 사회가 “일부 새로운 능력 수준 주변에서 단단히 경화될” 시간을 주기 위해 “AI 개발 속도를 조절할 때”가 되었을 수 있다고 제안했습니다.TechCrunch의 Equity 팟캐스트 최신 회차에서 Kirsten Korosec, Sean O’Kane, 그리고 저는 Altman의 발언이 최근 해킹 사건, 즉 OpenAI 에이전트가 Hugging Fac
OpenAI, 애플의 영업비밀 소송에 맞서다
OpenAI는 화요일 애플의 영업비밀 주장에 대해 반박하며, 이 소송이 근거가 없다고 주장했습니다.“우리는 이러한 주장을 심각하게 받아들이지만 이를 뒷받침하는 증거는 발견하지 못했습니다.”라고 OpenAI는 X에서 블룸버그의 에드 루드로우가 보도한 바와 같이 언급했습니다. “우리는 공정한 경쟁과 어디서나 일할 수 있는 자유를 지지하며, 전 세계 사용자에게 힘을 실어주는 기술을 만드는 데 집중하고 있습니다.”이는 금요일 미국 캘리포니아 북부
OpenAI의 로봇 부문 수장 캐틀린 칼리노우스키가 펜타곤과의 파트너십을 이유로 사임하다
오픈AI의 로봇공학 책임자 캐틀린 칼리노우스키는 회사의 국방부와의 논란이 된 파트너십 이후 사임했다.“이것은 쉬운 결정이 아니었다,” 칼리노우스스는 소셜 미디어 성명에서 설명했다. “AI가 국가 안보에서 중요한 역할을 하지만, 사법 감독 없이 미국인을 감시하고 인간 승인 없이 치명적 자율성을_deploy_하는 것은 훨씬 신중한 고려가 필요한 경계선이다.”메타의 증강현실 안경 부문을 이끌었던 것으로 알려진 칼리노우스스는 2024년 11월 오픈





집






