ChatGPT의 Images 2.0 모델은 텍스트 생성에서 뛰어난 성능을 발휘합니다
불과 몇 년 전만 해도 사람이 만든 이미지와 AI가 생성한 이미지를 구분하는 것은 비교적 간단했습니다. 그 당시에는 이미지 모델에게 멕시코 음식점 메뉴를 만들어 달라고 요청하면, “엔추이타(enchuita)”, “추리로스(churiros)”, “부르토(burrto)”, “마르가르타스(margartas)”와 같은 기괴하고 엉뚱한 요리들이 나오는 경우가 흔했습니다.
오늘날, 최신 ChatGPT Images 2.0 모델에 멕시코 음식 메뉴를 요청하면, 실제 식당에서 당장 사용할 수 있을 만큼 완성도 높은 결과물이 나오며, 손님들이 이상함을 눈치채기 어려울 정도입니다. (비록 13.50달러짜리 세비체는 생선 품질에 대해 의문을 제기할 수도 있겠지만요).

이미지 출처: ChatGPT Images 2.0
비교를 위해, 2년 전 DALL-E 3에서 받은 결과물을 보여드립니다. (당시 ChatGPT에는 이미지 생성 기능이 없었습니다):

이미지 출처: Microsoft Designer (DALL-E 3)
역사적으로 AI 이미지 생성기는 철자 처리에서 상당한 어려움을 겪어왔습니다. 이는 주로 무작위 노이즈로부터 이미지를 재구성하는 확산 모델에 의존했기 때문입니다.
"확산 모델은 [...] 주어진 입력을 재구성합니다,"라고 Lesan AI의 창립자이자 CEO인 아스멜라시 테카 하드구(Asmelash Teka Hadgu)는 2024년 테크크런치(TechCrunch)와의 인터뷰에서 설명했습니다. "이미지 속 텍스트는 매우 사소한 요소로 간주할 수 있으므로, 이미지 생성기는 더 많은 픽셀을 차지하는 시각적 패턴을 학습하는 데 우선순위를 둡니다."
그 이후 연구자들은 자기회귀 모델과 같은 이미지 생성을 위한 다른 접근 방식을 탐구해 왔습니다. 이러한 모델은 이미지가 어떻게 보여야 할지 단계별로 예측하며, 대규모 언어 모델(LLM)과 더 유사한 방식으로 작동합니다.
안타깝게도 오픈AI는 이번 주 열린 기자 간담회에서 ChatGPT Images 2.0을 구동하는 구체적인 모델 아키텍처에 대한 질문에 답변을 거부했다.
하지만 회사는 새로운 모델이 "사고 능력"을 갖추고 있다는 점은 분명히 했다. 이를 통해 웹 검색, 단일 프롬프트로 여러 이미지 생성, 자체 출력물 검토가 가능하다. 이러한 기능 덕분에 Images 2.0은 다양한 크기의 마케팅 자료는 물론, 여러 칸으로 구성된 만화도 제작할 수 있다.
또한 OpenAI는 Images 2.0이 일본어, 한국어, 힌디어, 벵골어를 포함한 비라틴 문자 렌더링 능력을 향상시켰다고 밝혔습니다. 이 모델의 지식은 2025년 12월 기준으로 최신화되어 있어, 매우 최근의 사건과 관련된 이미지를 생성할 때 정확도에 영향을 미칠 수 있습니다.
OpenAI는 보도자료를 통해 "Images 2.0은 이미지 생성 분야에서 전례 없는 수준의 디테일과 정확도를 제공합니다. 이 모델은 더 복잡한 장면을 구상할 뿐만 아니라 그 비전을 효과적으로 구현할 수 있습니다. 지시를 정확하게 따르고 요청된 세부 사항을 유지하며, 작은 텍스트, 아이콘, UI 구성 요소, 정교한 구도, 미묘한 스타일적 뉘앙스 등 다른 이미지 모델들이 종종 어려움을 겪는 세밀한 요소들을 최대 2K 해상도로 렌더링합니다"라고 설명했습니다.
이러한 고급 기능 덕분에 이미지 생성은 ChatGPT에 텍스트 질문을 하는 것만큼 즉각적이지는 않습니다. 하지만 다중 패널 만화와 같은 복잡한 콘텐츠를 생성하는 데도 여전히 몇 분밖에 걸리지 않습니다.
화요일부터 모든 ChatGPT 및 Codex 사용자는 Images 2.0을 이용할 수 있으며, 유료 구독자는 더 정교한 결과물을 생성할 수 있습니다. 또한 회사는 gpt-image-2 API를 출시할 예정이며, 가격은 원하는 출력 품질과 해상도에 따라 책정됩니다.
관련 기사
[[IMG_BASE64_PLACEHOLDER]] Sam Altman, AI의 감속 논란에 불을 붙이다
Apple Podcasts에서 듣기Spotify에서 듣기OpenAI의 CEO 샘 알트만은 최근 사회가 “일부 새로운 능력 수준 주변에서 단단히 경화될” 시간을 주기 위해 “AI 개발 속도를 조절할 때”가 되었을 수 있다고 제안했습니다.TechCrunch의 Equity 팟캐스트 최신 회차에서 Kirsten Korosec, Sean O’Kane, 그리고 저는 Altman의 발언이 최근 해킹 사건, 즉 OpenAI 에이전트가 Hugging Fac
OpenAI, 애플의 영업비밀 소송에 맞서다
OpenAI는 화요일 애플의 영업비밀 주장에 대해 반박하며, 이 소송이 근거가 없다고 주장했습니다.“우리는 이러한 주장을 심각하게 받아들이지만 이를 뒷받침하는 증거는 발견하지 못했습니다.”라고 OpenAI는 X에서 블룸버그의 에드 루드로우가 보도한 바와 같이 언급했습니다. “우리는 공정한 경쟁과 어디서나 일할 수 있는 자유를 지지하며, 전 세계 사용자에게 힘을 실어주는 기술을 만드는 데 집중하고 있습니다.”이는 금요일 미국 캘리포니아 북부
OpenAI의 로봇 부문 수장 캐틀린 칼리노우스키가 펜타곤과의 파트너십을 이유로 사임하다
오픈AI의 로봇공학 책임자 캐틀린 칼리노우스키는 회사의 국방부와의 논란이 된 파트너십 이후 사임했다.“이것은 쉬운 결정이 아니었다,” 칼리노우스스는 소셜 미디어 성명에서 설명했다. “AI가 국가 안보에서 중요한 역할을 하지만, 사법 감독 없이 미국인을 감시하고 인간 승인 없이 치명적 자율성을_deploy_하는 것은 훨씬 신중한 고려가 필요한 경계선이다.”메타의 증강현실 안경 부문을 이끌었던 것으로 알려진 칼리노우스스는 2024년 11월 오픈
관련 특별 주제 추천
의견 (0)
0/500
불과 몇 년 전만 해도 사람이 만든 이미지와 AI가 생성한 이미지를 구분하는 것은 비교적 간단했습니다. 그 당시에는 이미지 모델에게 멕시코 음식점 메뉴를 만들어 달라고 요청하면, “엔추이타(enchuita)”, “추리로스(churiros)”, “부르토(burrto)”, “마르가르타스(margartas)”와 같은 기괴하고 엉뚱한 요리들이 나오는 경우가 흔했습니다.
오늘날, 최신 ChatGPT Images 2.0 모델에 멕시코 음식 메뉴를 요청하면, 실제 식당에서 당장 사용할 수 있을 만큼 완성도 높은 결과물이 나오며, 손님들이 이상함을 눈치채기 어려울 정도입니다. (비록 13.50달러짜리 세비체는 생선 품질에 대해 의문을 제기할 수도 있겠지만요).

이미지 출처: ChatGPT Images 2.0
비교를 위해, 2년 전 DALL-E 3에서 받은 결과물을 보여드립니다. (당시 ChatGPT에는 이미지 생성 기능이 없었습니다):

이미지 출처: Microsoft Designer (DALL-E 3)
역사적으로 AI 이미지 생성기는 철자 처리에서 상당한 어려움을 겪어왔습니다. 이는 주로 무작위 노이즈로부터 이미지를 재구성하는 확산 모델에 의존했기 때문입니다.
"확산 모델은 [...] 주어진 입력을 재구성합니다,"라고 Lesan AI의 창립자이자 CEO인 아스멜라시 테카 하드구(Asmelash Teka Hadgu)는 2024년 테크크런치(TechCrunch)와의 인터뷰에서 설명했습니다. "이미지 속 텍스트는 매우 사소한 요소로 간주할 수 있으므로, 이미지 생성기는 더 많은 픽셀을 차지하는 시각적 패턴을 학습하는 데 우선순위를 둡니다."
그 이후 연구자들은 자기회귀 모델과 같은 이미지 생성을 위한 다른 접근 방식을 탐구해 왔습니다. 이러한 모델은 이미지가 어떻게 보여야 할지 단계별로 예측하며, 대규모 언어 모델(LLM)과 더 유사한 방식으로 작동합니다.
안타깝게도 오픈AI는 이번 주 열린 기자 간담회에서 ChatGPT Images 2.0을 구동하는 구체적인 모델 아키텍처에 대한 질문에 답변을 거부했다.
하지만 회사는 새로운 모델이 "사고 능력"을 갖추고 있다는 점은 분명히 했다. 이를 통해 웹 검색, 단일 프롬프트로 여러 이미지 생성, 자체 출력물 검토가 가능하다. 이러한 기능 덕분에 Images 2.0은 다양한 크기의 마케팅 자료는 물론, 여러 칸으로 구성된 만화도 제작할 수 있다.
또한 OpenAI는 Images 2.0이 일본어, 한국어, 힌디어, 벵골어를 포함한 비라틴 문자 렌더링 능력을 향상시켰다고 밝혔습니다. 이 모델의 지식은 2025년 12월 기준으로 최신화되어 있어, 매우 최근의 사건과 관련된 이미지를 생성할 때 정확도에 영향을 미칠 수 있습니다.
OpenAI는 보도자료를 통해 "Images 2.0은 이미지 생성 분야에서 전례 없는 수준의 디테일과 정확도를 제공합니다. 이 모델은 더 복잡한 장면을 구상할 뿐만 아니라 그 비전을 효과적으로 구현할 수 있습니다. 지시를 정확하게 따르고 요청된 세부 사항을 유지하며, 작은 텍스트, 아이콘, UI 구성 요소, 정교한 구도, 미묘한 스타일적 뉘앙스 등 다른 이미지 모델들이 종종 어려움을 겪는 세밀한 요소들을 최대 2K 해상도로 렌더링합니다"라고 설명했습니다.
이러한 고급 기능 덕분에 이미지 생성은 ChatGPT에 텍스트 질문을 하는 것만큼 즉각적이지는 않습니다. 하지만 다중 패널 만화와 같은 복잡한 콘텐츠를 생성하는 데도 여전히 몇 분밖에 걸리지 않습니다.
화요일부터 모든 ChatGPT 및 Codex 사용자는 Images 2.0을 이용할 수 있으며, 유료 구독자는 더 정교한 결과물을 생성할 수 있습니다. 또한 회사는 gpt-image-2 API를 출시할 예정이며, 가격은 원하는 출력 품질과 해상도에 따라 책정됩니다.
[[IMG_BASE64_PLACEHOLDER]] Sam Altman, AI의 감속 논란에 불을 붙이다
Apple Podcasts에서 듣기Spotify에서 듣기OpenAI의 CEO 샘 알트만은 최근 사회가 “일부 새로운 능력 수준 주변에서 단단히 경화될” 시간을 주기 위해 “AI 개발 속도를 조절할 때”가 되었을 수 있다고 제안했습니다.TechCrunch의 Equity 팟캐스트 최신 회차에서 Kirsten Korosec, Sean O’Kane, 그리고 저는 Altman의 발언이 최근 해킹 사건, 즉 OpenAI 에이전트가 Hugging Fac
OpenAI, 애플의 영업비밀 소송에 맞서다
OpenAI는 화요일 애플의 영업비밀 주장에 대해 반박하며, 이 소송이 근거가 없다고 주장했습니다.“우리는 이러한 주장을 심각하게 받아들이지만 이를 뒷받침하는 증거는 발견하지 못했습니다.”라고 OpenAI는 X에서 블룸버그의 에드 루드로우가 보도한 바와 같이 언급했습니다. “우리는 공정한 경쟁과 어디서나 일할 수 있는 자유를 지지하며, 전 세계 사용자에게 힘을 실어주는 기술을 만드는 데 집중하고 있습니다.”이는 금요일 미국 캘리포니아 북부
OpenAI의 로봇 부문 수장 캐틀린 칼리노우스키가 펜타곤과의 파트너십을 이유로 사임하다
오픈AI의 로봇공학 책임자 캐틀린 칼리노우스키는 회사의 국방부와의 논란이 된 파트너십 이후 사임했다.“이것은 쉬운 결정이 아니었다,” 칼리노우스스는 소셜 미디어 성명에서 설명했다. “AI가 국가 안보에서 중요한 역할을 하지만, 사법 감독 없이 미국인을 감시하고 인간 승인 없이 치명적 자율성을_deploy_하는 것은 훨씬 신중한 고려가 필요한 경계선이다.”메타의 증강현실 안경 부문을 이끌었던 것으로 알려진 칼리노우스스는 2024년 11월 오픈





집






