Google DeepMindのTIPSv2:画像を「一瞥する」だけでなく、真に理解するAI
現在のAIによる画像理解には、根本的な限界があります。
「この写真には何が写っていますか?」と尋ねれば、詳細な回答が得られます。しかし、「パンダの左後ろ足はどこにありますか?」と尋ねると、曖昧な回答になってしまいます。これは特定のモデルの欠陥ではなく、視覚言語大規模モデル分野全体に共通する根深い課題、すなわち「全体的な理解力は高いが、局所的な位置特定能力は低い」という問題です。
Google DeepMindは最新の論文で、この難題に対処するために特別に設計された「TIPSv2」を発表した。

研究チームは、直感に反する発見をしました。それは、きめ細かいセグメンテーションタスクにおいて、小型の「生徒」モデルが大型の「教師」モデルよりも優れた性能を発揮することが頻繁にあるということです。これは、ディスティレーション(知識の蒸留)によってマスキング機構が取り除かれ、モデルが画像全体の細部まで学習することを余儀なくされるためであり、一種の「全領域監督」が生まれるからです。この知見に基づき、TIPSv2では3つの重要な改良が導入されました。
第一に、iBOT++です。従来の事前学習では、マスクされた領域に対してのみ損失を計算するため、可視領域は放置された状態となり、局所的な意味論がずれてしまいます。iBOT++では、モデルがすべての可視領域に対して正確な監督を行うことを要求し、タスクを「パズルゲーム」から「テキスト全体を注意深く読むこと」へと効果的に昇華させます。この単一の改善により、ゼロショットセグメンテーションの性能が14.1ポイント向上しました。
第二に、Head-only EMAです。従来の自己教師付き学習では、ほぼ同一の2つの大規模モデルをメモリに保持する必要があり、リソースを大量に消費します。TIPSv2は、画像-テキスト対比損失だけでバックボーンネットワークを安定化できることを発見しました。そのため、EMAは最終的な投影ヘッドにのみ適用すればよく、バックボーンを複製する必要がなくなります。これにより、学習パラメータ数が約42%削減され、性能の低下をほとんど伴わずに高速化が実現しました。
第三に、多粒度テキストペアリングです。トレーニング中、Geminiによって生成された短いWeb説明文、中程度の詳細説明文、および長い説明文をランダムに混合し、モデルに入力します。これにより、易しいタスクと難しいタスクを交互に処理します。これにより、モデルが単純なタスクで手を抜くことを防ぎつつ、詳細が見落とされることもありません。
最終的な結果は極めて説得力のあるものです。TIPSv2は、9つのタスクと20の権威あるデータセットにおいてフローズン評価を受けました。ゼロショットセマンティックセグメンテーションでは業界の新たなベンチマークを達成し、画像テキスト検索および分類では、パラメータ数が56%多い比較モデルを上回る性能を示しました。純粋な視覚タスクにおいても、トップクラスの性能を発揮しました。
TIPSv2のコードとモデル重みは完全にオープンソース化されています。医療画像、自動運転、産業用検査、および高精度な画像理解が求められるその他の分野に取り組むチームにとって、このソリューションは注目に値するものです。
論文:https://www.alphaxiv.org/abs/2604.12012
関連記事
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Google、Geminiへの焦点がユーザー制御へシフトする中で、Remy AIエージェントをテスト
『Business Insider』によると、GoogleはGemini向けの新しいAIパーソナルエージェント「Remy」をテスト中である。このツールはユーザーに代わってタスクを実行することを目的としており、業務フローと日常のルーチンの両方を効率化する。現在、RemyはGeminiアプリケーションの社内限定版においてテストが行われている。この報道は社内文書と、プロジェクトに精通した2人の人物へのインタビューを引用している。社内資料では、Remyを「24時間365日のパーソナルエージェント」と位
関連特集おすすめ
コメント (0)
0/500
現在のAIによる画像理解には、根本的な限界があります。
「この写真には何が写っていますか?」と尋ねれば、詳細な回答が得られます。しかし、「パンダの左後ろ足はどこにありますか?」と尋ねると、曖昧な回答になってしまいます。これは特定のモデルの欠陥ではなく、視覚言語大規模モデル分野全体に共通する根深い課題、すなわち「全体的な理解力は高いが、局所的な位置特定能力は低い」という問題です。
Google DeepMindは最新の論文で、この難題に対処するために特別に設計された「TIPSv2」を発表した。

研究チームは、直感に反する発見をしました。それは、きめ細かいセグメンテーションタスクにおいて、小型の「生徒」モデルが大型の「教師」モデルよりも優れた性能を発揮することが頻繁にあるということです。これは、ディスティレーション(知識の蒸留)によってマスキング機構が取り除かれ、モデルが画像全体の細部まで学習することを余儀なくされるためであり、一種の「全領域監督」が生まれるからです。この知見に基づき、TIPSv2では3つの重要な改良が導入されました。
第一に、iBOT++です。従来の事前学習では、マスクされた領域に対してのみ損失を計算するため、可視領域は放置された状態となり、局所的な意味論がずれてしまいます。iBOT++では、モデルがすべての可視領域に対して正確な監督を行うことを要求し、タスクを「パズルゲーム」から「テキスト全体を注意深く読むこと」へと効果的に昇華させます。この単一の改善により、ゼロショットセグメンテーションの性能が14.1ポイント向上しました。
第二に、Head-only EMAです。従来の自己教師付き学習では、ほぼ同一の2つの大規模モデルをメモリに保持する必要があり、リソースを大量に消費します。TIPSv2は、画像-テキスト対比損失だけでバックボーンネットワークを安定化できることを発見しました。そのため、EMAは最終的な投影ヘッドにのみ適用すればよく、バックボーンを複製する必要がなくなります。これにより、学習パラメータ数が約42%削減され、性能の低下をほとんど伴わずに高速化が実現しました。
第三に、多粒度テキストペアリングです。トレーニング中、Geminiによって生成された短いWeb説明文、中程度の詳細説明文、および長い説明文をランダムに混合し、モデルに入力します。これにより、易しいタスクと難しいタスクを交互に処理します。これにより、モデルが単純なタスクで手を抜くことを防ぎつつ、詳細が見落とされることもありません。
最終的な結果は極めて説得力のあるものです。TIPSv2は、9つのタスクと20の権威あるデータセットにおいてフローズン評価を受けました。ゼロショットセマンティックセグメンテーションでは業界の新たなベンチマークを達成し、画像テキスト検索および分類では、パラメータ数が56%多い比較モデルを上回る性能を示しました。純粋な視覚タスクにおいても、トップクラスの性能を発揮しました。
TIPSv2のコードとモデル重みは完全にオープンソース化されています。医療画像、自動運転、産業用検査、および高精度な画像理解が求められるその他の分野に取り組むチームにとって、このソリューションは注目に値するものです。
論文:https://www.alphaxiv.org/abs/2604.12012
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ





家






