ChatGPT的Images 2.0模型在文本生成方面表现出色
就在几年前,区分人工制作的图像和AI生成的图像还相对容易。那时,如果让图像模型生成一份墨西哥餐厅的菜单,结果往往是些怪诞的、虚构的菜品,比如“enchuita”、“churiros”、“burrto”或“margartas”。
如今,当我向全新的ChatGPT Images 2.0模型请求一份墨西哥菜单时,它生成的内容完全可以直接用于真实餐厅,顾客恐怕也难以察觉任何破绽。(尽管一份售价13.50美元的酸橘汁腌鱼,或许仍会让人对鱼的品质产生疑问。)

图片来源:ChatGPT Images 2.0
作为对比,这是两年前我从 DALL-E 3 获得的结果。(当时 ChatGPT 还未具备图像生成能力):

图片来源:Microsoft Designer (DALL-E 3)
从历史上看,AI图像生成器在拼写方面一直存在显著困难。这主要是因为它们通常依赖扩散模型,该模型通过随机噪声来重建图像。
“扩散模型……是在重构给定的输入,”Lesan AI创始人兼首席执行官Asmelash Teka Hadgu在2024年向TechCrunch解释道,“我们可以将图像上的文字视为一个非常微小的组成部分,因此图像生成器会优先学习占据更多像素的视觉模式。”
此后,研究人员开始探索其他图像生成方法,例如自回归模型。这些模型通过逐步预测图像应呈现的样貌,其运作方式更接近大型语言模型(LLMs)。
遗憾的是,OpenAI在本周的新闻发布会上拒绝回答关于ChatGPT Images 2.0具体模型架构的问题。
不过,该公司明确表示,新模型具备“思考能力”。这使其能够搜索网络、根据单一提示生成多张图片,并审查自身生成的内容。这些功能使Images 2.0能够制作多维度的营销材料,以及多格漫画。
OpenAI还表示,Images 2.0在渲染非拉丁文字方面表现更佳,包括日语、韩语、印地语和孟加拉语。该模型的知识库更新截止至2025年12月,这可能会影响其生成与近期事件相关图像时的准确性。
OpenAI在新闻稿中指出:“Images 2.0在图像创作方面实现了前所未有的细节表现力和准确性。它不仅能构思更复杂的场景,还能有效实现这些构想。它能精准遵循指令,保留指定细节,并渲染出其他图像模型常难以处理的精细元素——例如小字、图标、UI组件、复杂构图以及细微的风格差异——且分辨率最高可达2K。”
这些先进功能意味着图像生成并非像向 ChatGPT 提问那样即时。不过,生成诸如多格漫画等复杂内容,仍只需几分钟。
从本周二起,所有 ChatGPT 和 Codex 用户均可使用 Images 2.0,付费订阅用户可生成更高级的输出内容。该公司还将发布 gpt-image-2 API,其定价将根据所需的输出质量和分辨率而定。
相关文章
山姆·奥特曼引发关于人工智能减速的辩论
在Apple Podcasts上收听在Spotify上收听OpenAI首席执行官萨姆·阿尔特曼(Sam Altman)最近表示,现在可能是时候“控制人工智能的发展速度”,以便社会“在这些新的能力水平周围加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我讨论了阿尔特曼的言论可能由最近的一次黑客攻击所触发,该攻击中一名OpenAI代理突破了Hugging Face的系统。Sean指出,虽然由AI代理执行的黑客攻击是前所未
OpenAI 与苹果公司就商业秘密诉讼进行对抗
OpenAI 于周二驳回了苹果公司的商业秘密指控,称该诉讼毫无根据。“我们认真对待这些指控,但未发现任何支持它们的证据,”OpenAI 表示,据彭博社记者 Ed Ludlow 在 X 平台报道,“我们支持公平竞争和工作自由,专注于创造赋能全球用户的技术。”此前,苹果公司于周五在美国加利福尼亚州北区联邦地区法院提起诉讼,指控 OpenAI 策划了一项从前苹果员工处窃取机密数据和知识产权的计划。这份长达 41 页的诉状针对 OpenAI 的高管层,包括首席硬件官 Tang Tan,他是一名拥有
OpenAI机器人项目主管凯特琳·卡利诺夫斯基因五角大楼合作项目辞职
OpenAI 机器人业务负责人凯特琳·卡利诺夫斯基(Caitlin Kalinowski)在该公司与国防部达成备受争议的合作伙伴关系后辞职。“这不是一个轻松的决定,”卡利诺夫斯基在社交媒体声明中解释道。“虽然人工智能在国家安全中发挥着至关重要的作用,但在没有司法监督的情况下对美国公民进行监视,以及在未经人类授权的情况下部署致命自主武器,都是需要更加慎重考虑的界限。”卡利诺夫斯基此前因领导 Meta 的增强现实眼镜部门而闻名,她于 2024 年 11 月加入 OpenAI。在辞职信中,她强调她
相关专题推荐
评论 (0)
0/500
就在几年前,区分人工制作的图像和AI生成的图像还相对容易。那时,如果让图像模型生成一份墨西哥餐厅的菜单,结果往往是些怪诞的、虚构的菜品,比如“enchuita”、“churiros”、“burrto”或“margartas”。
如今,当我向全新的ChatGPT Images 2.0模型请求一份墨西哥菜单时,它生成的内容完全可以直接用于真实餐厅,顾客恐怕也难以察觉任何破绽。(尽管一份售价13.50美元的酸橘汁腌鱼,或许仍会让人对鱼的品质产生疑问。)

图片来源:ChatGPT Images 2.0
作为对比,这是两年前我从 DALL-E 3 获得的结果。(当时 ChatGPT 还未具备图像生成能力):

图片来源:Microsoft Designer (DALL-E 3)
从历史上看,AI图像生成器在拼写方面一直存在显著困难。这主要是因为它们通常依赖扩散模型,该模型通过随机噪声来重建图像。
“扩散模型……是在重构给定的输入,”Lesan AI创始人兼首席执行官Asmelash Teka Hadgu在2024年向TechCrunch解释道,“我们可以将图像上的文字视为一个非常微小的组成部分,因此图像生成器会优先学习占据更多像素的视觉模式。”
此后,研究人员开始探索其他图像生成方法,例如自回归模型。这些模型通过逐步预测图像应呈现的样貌,其运作方式更接近大型语言模型(LLMs)。
遗憾的是,OpenAI在本周的新闻发布会上拒绝回答关于ChatGPT Images 2.0具体模型架构的问题。
不过,该公司明确表示,新模型具备“思考能力”。这使其能够搜索网络、根据单一提示生成多张图片,并审查自身生成的内容。这些功能使Images 2.0能够制作多维度的营销材料,以及多格漫画。
OpenAI还表示,Images 2.0在渲染非拉丁文字方面表现更佳,包括日语、韩语、印地语和孟加拉语。该模型的知识库更新截止至2025年12月,这可能会影响其生成与近期事件相关图像时的准确性。
OpenAI在新闻稿中指出:“Images 2.0在图像创作方面实现了前所未有的细节表现力和准确性。它不仅能构思更复杂的场景,还能有效实现这些构想。它能精准遵循指令,保留指定细节,并渲染出其他图像模型常难以处理的精细元素——例如小字、图标、UI组件、复杂构图以及细微的风格差异——且分辨率最高可达2K。”
这些先进功能意味着图像生成并非像向 ChatGPT 提问那样即时。不过,生成诸如多格漫画等复杂内容,仍只需几分钟。
从本周二起,所有 ChatGPT 和 Codex 用户均可使用 Images 2.0,付费订阅用户可生成更高级的输出内容。该公司还将发布 gpt-image-2 API,其定价将根据所需的输出质量和分辨率而定。
山姆·奥特曼引发关于人工智能减速的辩论
在Apple Podcasts上收听在Spotify上收听OpenAI首席执行官萨姆·阿尔特曼(Sam Altman)最近表示,现在可能是时候“控制人工智能的发展速度”,以便社会“在这些新的能力水平周围加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我讨论了阿尔特曼的言论可能由最近的一次黑客攻击所触发,该攻击中一名OpenAI代理突破了Hugging Face的系统。Sean指出,虽然由AI代理执行的黑客攻击是前所未
OpenAI 与苹果公司就商业秘密诉讼进行对抗
OpenAI 于周二驳回了苹果公司的商业秘密指控,称该诉讼毫无根据。“我们认真对待这些指控,但未发现任何支持它们的证据,”OpenAI 表示,据彭博社记者 Ed Ludlow 在 X 平台报道,“我们支持公平竞争和工作自由,专注于创造赋能全球用户的技术。”此前,苹果公司于周五在美国加利福尼亚州北区联邦地区法院提起诉讼,指控 OpenAI 策划了一项从前苹果员工处窃取机密数据和知识产权的计划。这份长达 41 页的诉状针对 OpenAI 的高管层,包括首席硬件官 Tang Tan,他是一名拥有
OpenAI机器人项目主管凯特琳·卡利诺夫斯基因五角大楼合作项目辞职
OpenAI 机器人业务负责人凯特琳·卡利诺夫斯基(Caitlin Kalinowski)在该公司与国防部达成备受争议的合作伙伴关系后辞职。“这不是一个轻松的决定,”卡利诺夫斯基在社交媒体声明中解释道。“虽然人工智能在国家安全中发挥着至关重要的作用,但在没有司法监督的情况下对美国公民进行监视,以及在未经人类授权的情况下部署致命自主武器,都是需要更加慎重考虑的界限。”卡利诺夫斯基此前因领导 Meta 的增强现实眼镜部门而闻名,她于 2024 年 11 月加入 OpenAI。在辞职信中,她强调她





首页






