谷歌DeepMind的TIPSv2:真正理解图像而非仅是匆匆一瞥的人工智能
当前,AI图像理解存在一个核心局限。
当被问及“这张图片里有什么?”时,它能给出详细的回答。然而,若问“熊猫的左后腿在哪里?”,得到的却是模棱两可的回答。这并非某个特定模型的缺陷,而是整个视觉-语言大型模型领域普遍存在的问题:具备强大的全局理解能力,却缺乏精准的局部定位能力。
谷歌DeepMind在其最新论文中推出了TIPSv2,该模型正是为解决这一难题而专门设计的。

研究团队观察到一个反直觉的现象:在精细分割任务中,较小的学生模型往往表现优于更大的教师模型。这是因为知识蒸馏去除了遮挡机制,迫使模型学习整张图像的每一个细节,从而形成一种“全域监督”。受此启发,TIPSv2引入了三项关键改进。
首先是 iBOT++。传统预训练仅针对遮罩区域计算损失,导致可见区域被忽视,从而造成局部语义漂移。iBOT++ 要求模型对所有可见区域提供精确监督,将任务从“拼图游戏”有效升级为“仔细阅读全文”。这一改进使零样本分割性能提升了 14.1 个百分点。
其次,仅头部 EMA。传统的自监督训练需要在内存中保留两个几乎完全相同的大型模型,这极度消耗资源。TIPSv2 发现,仅图像-文本对比损失就足以稳定骨干网络,因此 EMA 只需应用于最终的投影头,无需复制骨干网络。这将训练参数数量减少了约 42%,使训练速度更快,且性能几乎没有下降。
第三,多粒度文本配对。训练过程中,由 Gemini 生成的短网页描述、中等细节描述和长描述会被随机混合并输入模型,在简单任务和困难任务之间交替进行。这既防止模型在简单任务中懈怠,又确保不会遗漏任何细节。
最终结果令人信服。TIPSv2在九项任务和20个权威数据集上进行了冻结评估。零样本语义分割创下了新的行业基准,而图像文本检索和分类任务的表现则超越了参数多出56%的对比模型。纯视觉任务的表现也名列前茅。
TIPSv2的代码和模型权重已完全开源。对于从事医学影像、自动驾驶、工业检测以及其他需要高精度图像理解领域的团队而言,该解决方案值得深入研究。
论文:https://www.alphaxiv.org/abs/2604.12012
相关文章
字节跳动旗下 Seed 启动全球校园招聘,以虚拟股份争夺顶尖大模型人才
在大型语言模型的竞争格局中,争夺顶尖人才仍然是最关键的战略资产。4月1日,字节跳动宣布启动Seed全球校园招聘计划,作为其大模型人才培养项目的一部分。该活动面向2027届毕业生及现有实习生,旨在全球范围内发掘并锁定AI领域的精英研发与工程人才。规模扩张:全球甄选100名“AI种子”在技术快速进步的背景下,字节跳动有限公司今年大幅增加了对基础AI人才的投入:招聘范围: 该计划旨在从全球范围内招聘约100名专注于大模型的杰出候选人,对象为2027届毕业生。发展路径: Seed计划将核心业务
Suno 在法律诉讼中为歌曲添加水印
Suno,这个允许用户生成由人工智能创作的音乐的平台,近日推出了新功能,包括为平台制作的曲目添加标签、限制下载,并更新社区标准以遏制未经授权的复制品。这些更新是在Suno面临多家唱片公司和艺术家组织提起的多起诉讼之际推出的。在博客文章中,联合创始人兼首席执行官Mikey Shulman概述了核心原则,强调该平台旨在促进原创创作,同时扩大更广泛受众对人工智能音乐工具的访问权限。一个主要的争议点在于,用户将人工智能生成的歌曲上传到其他流媒体服务并通过操纵系统获取收入。Suno表示,现在将采用音频
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据
埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码
相关专题推荐
评论 (0)
0/500
当前,AI图像理解存在一个核心局限。
当被问及“这张图片里有什么?”时,它能给出详细的回答。然而,若问“熊猫的左后腿在哪里?”,得到的却是模棱两可的回答。这并非某个特定模型的缺陷,而是整个视觉-语言大型模型领域普遍存在的问题:具备强大的全局理解能力,却缺乏精准的局部定位能力。
谷歌DeepMind在其最新论文中推出了TIPSv2,该模型正是为解决这一难题而专门设计的。

研究团队观察到一个反直觉的现象:在精细分割任务中,较小的学生模型往往表现优于更大的教师模型。这是因为知识蒸馏去除了遮挡机制,迫使模型学习整张图像的每一个细节,从而形成一种“全域监督”。受此启发,TIPSv2引入了三项关键改进。
首先是 iBOT++。传统预训练仅针对遮罩区域计算损失,导致可见区域被忽视,从而造成局部语义漂移。iBOT++ 要求模型对所有可见区域提供精确监督,将任务从“拼图游戏”有效升级为“仔细阅读全文”。这一改进使零样本分割性能提升了 14.1 个百分点。
其次,仅头部 EMA。传统的自监督训练需要在内存中保留两个几乎完全相同的大型模型,这极度消耗资源。TIPSv2 发现,仅图像-文本对比损失就足以稳定骨干网络,因此 EMA 只需应用于最终的投影头,无需复制骨干网络。这将训练参数数量减少了约 42%,使训练速度更快,且性能几乎没有下降。
第三,多粒度文本配对。训练过程中,由 Gemini 生成的短网页描述、中等细节描述和长描述会被随机混合并输入模型,在简单任务和困难任务之间交替进行。这既防止模型在简单任务中懈怠,又确保不会遗漏任何细节。
最终结果令人信服。TIPSv2在九项任务和20个权威数据集上进行了冻结评估。零样本语义分割创下了新的行业基准,而图像文本检索和分类任务的表现则超越了参数多出56%的对比模型。纯视觉任务的表现也名列前茅。
TIPSv2的代码和模型权重已完全开源。对于从事医学影像、自动驾驶、工业检测以及其他需要高精度图像理解领域的团队而言,该解决方案值得深入研究。
论文:https://www.alphaxiv.org/abs/2604.12012
字节跳动旗下 Seed 启动全球校园招聘,以虚拟股份争夺顶尖大模型人才
在大型语言模型的竞争格局中,争夺顶尖人才仍然是最关键的战略资产。4月1日,字节跳动宣布启动Seed全球校园招聘计划,作为其大模型人才培养项目的一部分。该活动面向2027届毕业生及现有实习生,旨在全球范围内发掘并锁定AI领域的精英研发与工程人才。规模扩张:全球甄选100名“AI种子”在技术快速进步的背景下,字节跳动有限公司今年大幅增加了对基础AI人才的投入:招聘范围: 该计划旨在从全球范围内招聘约100名专注于大模型的杰出候选人,对象为2027届毕业生。发展路径: Seed计划将核心业务
Suno 在法律诉讼中为歌曲添加水印
Suno,这个允许用户生成由人工智能创作的音乐的平台,近日推出了新功能,包括为平台制作的曲目添加标签、限制下载,并更新社区标准以遏制未经授权的复制品。这些更新是在Suno面临多家唱片公司和艺术家组织提起的多起诉讼之际推出的。在博客文章中,联合创始人兼首席执行官Mikey Shulman概述了核心原则,强调该平台旨在促进原创创作,同时扩大更广泛受众对人工智能音乐工具的访问权限。一个主要的争议点在于,用户将人工智能生成的歌曲上传到其他流媒体服务并通过操纵系统获取收入。Suno表示,现在将采用音频
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据
埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码





首页






