ChatGPT 的 Images 2.0 模型在文字生成方面表現出色
就在幾年前,要區分人手繪製的圖片與 AI 生成的圖片還相對容易。當時,若請圖像模型製作一份墨西哥餐廳的菜單,往往會得到諸如「enchuita」、「churiros」、「burrto」或「margartas」這類古怪的虛構菜餚。
如今,當我向全新的 ChatGPT Images 2.0 模型請求一份墨西哥菜單時,它生成的內容足以立即用於真實餐廳,顧客幾乎無法察覺任何異樣。(雖然一份 13.50 美元的生魚片,可能會讓人對魚的品質產生一些疑問。)

圖片來源:ChatGPT Images 2.0
作為對比,這是我兩年前從 DALL-E 3 獲得的結果。(當時 ChatGPT 還沒有生成圖像的能力):

圖片來源:Microsoft Designer (DALL-E 3)
從歷史來看,AI 圖像生成器在拼寫方面一直面臨重大困難。這主要是因為它們通常依賴擴散模型,該模型會從隨機噪聲中重建圖像。
「擴散模型……是在重構給定的輸入,」Lesan AI 創辦人兼執行長 Asmelash Teka Hadgu 於 2024 年向 TechCrunch 解釋道。「我們可以將圖像上的文字視為極其微小的組成部分,因此圖像生成器會優先學習佔據更多像素的視覺模式。」
此後,研究人員開始探索其他影像生成方法,例如自迴歸模型。這些模型會逐步預測影像應呈現的樣貌,運作方式更類似於大型語言模型(LLMs)。
遺憾的是,OpenAI在本週的記者會上,拒絕回答關於驅動 ChatGPT Images 2.0 的具體模型架構相關問題。
不過,該公司確實澄清,新模型具備「思考能力」。這使它能夠搜尋網路、根據單一提示生成多張圖片,並檢視自身的輸出結果。這些功能讓 Images 2.0 能夠製作多維度的行銷素材,以及多格漫畫。
OpenAI 亦表示,Images 2.0 在渲染非拉丁文字方面表現更佳,包括日文、韓文、印地文及孟加拉文。該模型的知識庫更新至 2025 年 12 月,這可能影響其生成與近期事件相關圖像時的準確性。
OpenAI 在新聞稿中指出:「Images 2.0 在圖像創作方面展現了前所未有的細節與精準度。它不僅能構思更複雜的場景,更能有效實現該構想。它能精確遵循指示、保留指定細節,並渲染其他圖像模型常難以處理的細微元素——例如小字體、圖示、UI 元件、複雜構圖及細膩的風格差異——且解析度最高可達 2K。」
這些進階功能意味著生成圖像的過程,並不如向 ChatGPT 提問文字問題那般即時。然而,即使要創建像多格漫畫這類複雜內容,也僅需幾分鐘。
自週二起,所有 ChatGPT 和 Codex 用戶均可使用 Images 2.0,付費訂閱者則能生成更進階的輸出內容。該公司亦將推出 gpt-image-2 API,其定價將依據所需的輸出品質與解析度而定。
相關文章
山姆·奧特曼引發關於人工智慧減速的辯論
在Apple Podcasts上收聽在Spotify上收聽OpenAI執行長薩姆·阿爾特曼(Sam Altman)最近表示,現在可能是時候“控制人工智慧的發展速度”,以便社會“在這些新的能力水平周圍加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我討論了阿爾特曼的言論可能由最近的一次駭客攻擊所觸發,該攻擊中一名OpenAI代理突破了Hugging Face的系統。Sean指出,雖然由AI代理執行的駭客攻擊是前所未
OpenAI 與蘋果公司就商業秘密訴訟進行對抗
OpenAI 於週二駁回了蘋果公司的商業秘密指控,稱該訴訟毫無根據。“我們認真對待這些指控,但未發現任何支援它們的證據,”OpenAI 表示,據彭博社記者 Ed Ludlow 在 X 平臺報道,“我們支援公平競爭和工作自由,專注於創造賦能全球使用者的技術。”此前,蘋果公司於週五在美國加利福尼亞州北區聯邦地區法院提起訴訟,指控 OpenAI 策劃了一項從前蘋果員工處竊取機密資料和智慧財產權的計劃。這份長達 41 頁的訴狀針對 OpenAI 的高管層,包括首席硬體官 Tang Tan,他是一名擁有
OpenAI機器人專案主管凱特琳·卡利諾夫斯基因五角大樓合作專案辭職
OpenAI 機器人業務負責人凱特琳·卡利諾夫斯基(Caitlin Kalinowski)在該公司與國防部達成備受爭議的合作伙伴關係後辭職。“這不是一個輕鬆的決定,”卡利諾夫斯基在社交媒體宣告中解釋道。“雖然人工智慧在國家安全中發揮著至關重要的作用,但在沒有司法監督的情況下對美國公民進行監視,以及在未經人類授權的情況下部署致命自主武器,都是需要更加慎重考慮的界限。”卡利諾夫斯基此前因領導 Meta 的增強現實眼鏡部門而聞名,她於 2024 年 11 月加入 OpenAI。在辭職信中,她強調她
相關專題推薦
評論 (0)
0/500
就在幾年前,要區分人手繪製的圖片與 AI 生成的圖片還相對容易。當時,若請圖像模型製作一份墨西哥餐廳的菜單,往往會得到諸如「enchuita」、「churiros」、「burrto」或「margartas」這類古怪的虛構菜餚。
如今,當我向全新的 ChatGPT Images 2.0 模型請求一份墨西哥菜單時,它生成的內容足以立即用於真實餐廳,顧客幾乎無法察覺任何異樣。(雖然一份 13.50 美元的生魚片,可能會讓人對魚的品質產生一些疑問。)

圖片來源:ChatGPT Images 2.0
作為對比,這是我兩年前從 DALL-E 3 獲得的結果。(當時 ChatGPT 還沒有生成圖像的能力):

圖片來源:Microsoft Designer (DALL-E 3)
從歷史來看,AI 圖像生成器在拼寫方面一直面臨重大困難。這主要是因為它們通常依賴擴散模型,該模型會從隨機噪聲中重建圖像。
「擴散模型……是在重構給定的輸入,」Lesan AI 創辦人兼執行長 Asmelash Teka Hadgu 於 2024 年向 TechCrunch 解釋道。「我們可以將圖像上的文字視為極其微小的組成部分,因此圖像生成器會優先學習佔據更多像素的視覺模式。」
此後,研究人員開始探索其他影像生成方法,例如自迴歸模型。這些模型會逐步預測影像應呈現的樣貌,運作方式更類似於大型語言模型(LLMs)。
遺憾的是,OpenAI在本週的記者會上,拒絕回答關於驅動 ChatGPT Images 2.0 的具體模型架構相關問題。
不過,該公司確實澄清,新模型具備「思考能力」。這使它能夠搜尋網路、根據單一提示生成多張圖片,並檢視自身的輸出結果。這些功能讓 Images 2.0 能夠製作多維度的行銷素材,以及多格漫畫。
OpenAI 亦表示,Images 2.0 在渲染非拉丁文字方面表現更佳,包括日文、韓文、印地文及孟加拉文。該模型的知識庫更新至 2025 年 12 月,這可能影響其生成與近期事件相關圖像時的準確性。
OpenAI 在新聞稿中指出:「Images 2.0 在圖像創作方面展現了前所未有的細節與精準度。它不僅能構思更複雜的場景,更能有效實現該構想。它能精確遵循指示、保留指定細節,並渲染其他圖像模型常難以處理的細微元素——例如小字體、圖示、UI 元件、複雜構圖及細膩的風格差異——且解析度最高可達 2K。」
這些進階功能意味著生成圖像的過程,並不如向 ChatGPT 提問文字問題那般即時。然而,即使要創建像多格漫畫這類複雜內容,也僅需幾分鐘。
自週二起,所有 ChatGPT 和 Codex 用戶均可使用 Images 2.0,付費訂閱者則能生成更進階的輸出內容。該公司亦將推出 gpt-image-2 API,其定價將依據所需的輸出品質與解析度而定。
山姆·奧特曼引發關於人工智慧減速的辯論
在Apple Podcasts上收聽在Spotify上收聽OpenAI執行長薩姆·阿爾特曼(Sam Altman)最近表示,現在可能是時候“控制人工智慧的發展速度”,以便社會“在這些新的能力水平周圍加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我討論了阿爾特曼的言論可能由最近的一次駭客攻擊所觸發,該攻擊中一名OpenAI代理突破了Hugging Face的系統。Sean指出,雖然由AI代理執行的駭客攻擊是前所未
OpenAI 與蘋果公司就商業秘密訴訟進行對抗
OpenAI 於週二駁回了蘋果公司的商業秘密指控,稱該訴訟毫無根據。“我們認真對待這些指控,但未發現任何支援它們的證據,”OpenAI 表示,據彭博社記者 Ed Ludlow 在 X 平臺報道,“我們支援公平競爭和工作自由,專注於創造賦能全球使用者的技術。”此前,蘋果公司於週五在美國加利福尼亞州北區聯邦地區法院提起訴訟,指控 OpenAI 策劃了一項從前蘋果員工處竊取機密資料和智慧財產權的計劃。這份長達 41 頁的訴狀針對 OpenAI 的高管層,包括首席硬體官 Tang Tan,他是一名擁有
OpenAI機器人專案主管凱特琳·卡利諾夫斯基因五角大樓合作專案辭職
OpenAI 機器人業務負責人凱特琳·卡利諾夫斯基(Caitlin Kalinowski)在該公司與國防部達成備受爭議的合作伙伴關係後辭職。“這不是一個輕鬆的決定,”卡利諾夫斯基在社交媒體宣告中解釋道。“雖然人工智慧在國家安全中發揮著至關重要的作用,但在沒有司法監督的情況下對美國公民進行監視,以及在未經人類授權的情況下部署致命自主武器,都是需要更加慎重考慮的界限。”卡利諾夫斯基此前因領導 Meta 的增強現實眼鏡部門而聞名,她於 2024 年 11 月加入 OpenAI。在辭職信中,她強調她





首頁






