Gemini Nano Banana 增强了企业图像编辑的一致性和规模控制 - 仍有改进空间
双子座 2.5 闪存图像介绍
谷歌推出了 Gemini 2.5 Flash Image,之前在测试阶段内部称为 "nanobanana"。这种先进的模式为企业提供了更大的创意灵活性,实现了图像的快速转换,其精确控制能力超过了以前的版本。
该技术将在现有 Gemini 2.5 Flash 框架的基础上,完全集成到 Gemini 应用程序生态系统中。此次更新大大增强了平台的本地编辑功能,同时在修改后的图像中保持了一致的字符表现形式。例如,用户可以上传宠物照片,然后无缝调整背景或添加配件,而不会影响主体的可识别特征。
在数字编辑中保持真实性
"我们知道,编辑个人照片需要保持真实的肖像--近似是不够的,"Gemini 专家 David Sharon 和 Nicole Brichtova 解释说。"我们的最新进展优先考虑保持您所爱的人的外观一致,无论他们是人类家庭成员还是珍爱的宠物。
此次更新直接解决了业界普遍存在的一个问题,即人工智能的小规模编辑请求会无意中扭曲重要的面部特征或其他关键元素。

所有输出都将采用谷歌专有的 SynthID 水印技术,免费和高级 Gemini 应用程序均可使用。
社交媒体的热议
在 LM Arena 测试中,一个神秘的 "纳米香蕉 "模型在复杂的图像处理任务中表现出色。风险投资家贾斯廷-摩尔(Justine Moore)强调了它能够非常精确地处理复杂的多步骤指令。
"Nano-banana "可以让你上传两张图片,并提示将它们组合在一起。它可以准确无误地执行复杂的多步骤指令"。
当多个早期测试者确认与谷歌的联系时,该模型的起源变得更加清晰,尽管官方的确认仍在等待中。社交媒体上的例子展示了从专业肖像修改到环境改造的各种功能。
行业竞争白热化
此次发布加剧了与 Qwen-Image Edit 和 OpenAI 的 ChatGPT 图像编辑 API 等竞争对手的竞争。传统创意软件巨头 Adobe 继续在 Photoshop 和其他创意套件中整合其 Firefly 模型。
不断发展的编辑功能
自 3 月份推出原生图像编辑功能以来,Gemini 不断扩展功能,帮助企业简化工作流程。现在,该平台无需切换应用程序即可进行全面编辑--用户可以在单一界面中上传、修改甚至将编辑好的图像编译成视频演示文稿。
除基本修改外,Gemini 2.5 Flash Image 还支持复杂的技术,包括
- 无缝图片混合
- 多步骤迭代编辑
- 图像之间的风格转换
- 上下文环境修改
相关文章
Gemini Spark 现在管理 Google Photos 图库
Google 正在通过启用 Gemini Spark 来管理 Google Photos 图库,从而扩大其人工智能集成范围。用户现在可以指示该代理编辑图片、整理相册、从精选照片中生成共享合集、将演唱会传单转换为日历事件,并自动化其他工作流程。Google Photos 负责人 Shimrit Ben-Yair 在 X 平台上宣布了这些新功能,表示符合条件的美国 Gemini AI Pro 和 Ultra 订阅用户将在未来几周内获得英语支持。该公司尚未明确说明这些功能是否会扩展至国际市场,以及
谷歌推出虚假来电检测功能,以防范AI深度伪造冒充诈骗
谷歌周二宣布,Android将推出虚假来电检测功能,以防范利用AI深度伪造技术实施的冒充诈骗。该功能将于本月通过“Phone by Google”在全球范围内面向Android 12及以上版本的设备逐步推出,首先适用于Pixel设备。随着人们越来越不愿接听陌生号码的来电,诈骗分子正改变策略,通过伪造可信的电话号码,并利用AI深度伪造技术模仿权威人士、家人或雇主的语气进行诈骗。例如,某人可能会接到一
Frontier AI Labs 拒绝透露针对失控模型的遏制策略
最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met
相关专题推荐
评论 (1)
0/500
双子座 2.5 闪存图像介绍
谷歌推出了 Gemini 2.5 Flash Image,之前在测试阶段内部称为 "nanobanana"。这种先进的模式为企业提供了更大的创意灵活性,实现了图像的快速转换,其精确控制能力超过了以前的版本。
该技术将在现有 Gemini 2.5 Flash 框架的基础上,完全集成到 Gemini 应用程序生态系统中。此次更新大大增强了平台的本地编辑功能,同时在修改后的图像中保持了一致的字符表现形式。例如,用户可以上传宠物照片,然后无缝调整背景或添加配件,而不会影响主体的可识别特征。
在数字编辑中保持真实性
"我们知道,编辑个人照片需要保持真实的肖像--近似是不够的,"Gemini 专家 David Sharon 和 Nicole Brichtova 解释说。"我们的最新进展优先考虑保持您所爱的人的外观一致,无论他们是人类家庭成员还是珍爱的宠物。
此次更新直接解决了业界普遍存在的一个问题,即人工智能的小规模编辑请求会无意中扭曲重要的面部特征或其他关键元素。

所有输出都将采用谷歌专有的 SynthID 水印技术,免费和高级 Gemini 应用程序均可使用。
社交媒体的热议
在 LM Arena 测试中,一个神秘的 "纳米香蕉 "模型在复杂的图像处理任务中表现出色。风险投资家贾斯廷-摩尔(Justine Moore)强调了它能够非常精确地处理复杂的多步骤指令。
"Nano-banana "可以让你上传两张图片,并提示将它们组合在一起。它可以准确无误地执行复杂的多步骤指令"。
当多个早期测试者确认与谷歌的联系时,该模型的起源变得更加清晰,尽管官方的确认仍在等待中。社交媒体上的例子展示了从专业肖像修改到环境改造的各种功能。
行业竞争白热化
此次发布加剧了与 Qwen-Image Edit 和 OpenAI 的 ChatGPT 图像编辑 API 等竞争对手的竞争。传统创意软件巨头 Adobe 继续在 Photoshop 和其他创意套件中整合其 Firefly 模型。
不断发展的编辑功能
自 3 月份推出原生图像编辑功能以来,Gemini 不断扩展功能,帮助企业简化工作流程。现在,该平台无需切换应用程序即可进行全面编辑--用户可以在单一界面中上传、修改甚至将编辑好的图像编译成视频演示文稿。
除基本修改外,Gemini 2.5 Flash Image 还支持复杂的技术,包括
- 无缝图片混合
- 多步骤迭代编辑
- 图像之间的风格转换
- 上下文环境修改
Gemini Spark 现在管理 Google Photos 图库
Google 正在通过启用 Gemini Spark 来管理 Google Photos 图库,从而扩大其人工智能集成范围。用户现在可以指示该代理编辑图片、整理相册、从精选照片中生成共享合集、将演唱会传单转换为日历事件,并自动化其他工作流程。Google Photos 负责人 Shimrit Ben-Yair 在 X 平台上宣布了这些新功能,表示符合条件的美国 Gemini AI Pro 和 Ultra 订阅用户将在未来几周内获得英语支持。该公司尚未明确说明这些功能是否会扩展至国际市场,以及
谷歌推出虚假来电检测功能,以防范AI深度伪造冒充诈骗
谷歌周二宣布,Android将推出虚假来电检测功能,以防范利用AI深度伪造技术实施的冒充诈骗。该功能将于本月通过“Phone by Google”在全球范围内面向Android 12及以上版本的设备逐步推出,首先适用于Pixel设备。随着人们越来越不愿接听陌生号码的来电,诈骗分子正改变策略,通过伪造可信的电话号码,并利用AI深度伪造技术模仿权威人士、家人或雇主的语气进行诈骗。例如,某人可能会接到一
Frontier AI Labs 拒绝透露针对失控模型的遏制策略
最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met





首页






