Googleが「Gemini Embedding2」を発表:ネイティブのマルチモーダルモデルが意味空間を統合
Googleは最近、新しいネイティブマルチモーダル埋め込みモデル「Gemini Embedding2」を発表しました。このモデルは、テキスト、画像、動画、音声、PDF文書を共通のセマンティックベクトル空間にマッピングすることができ、複雑なAIデータワークフローを効率化し、マルチモーダル検索と理解を向上させるように設計されています。これは、埋め込み技術におけるGoogleの重要な進歩であり、単一モダリティのテキストから統一されたマルチモーダルセマンティックモデリングへの移行を意味します。

これに先立ち、2025年7月にGoogleはテキスト埋め込みモデル「gemini-embedding-001」を発表していました。同モデルは100以上の言語に対応し、多言語ベンチマーク「MTEB」において最高の結果を達成しました。 新しい「Gemini Embedding2」は、Geminiアーキテクチャを基盤としつつ、その適用範囲を大幅に拡大しています。現在では、テキスト、画像、動画、音声、PDFという5つの異なるモダリティを処理し、それらを単一のベクトル空間に投影します。これにより、複数の専用モデルや余分な処理ステップを必要とせずに、異なる種類のメディア間で直接的な意味論的比較が可能になります。この機能は、セマンティック検索、検索強化生成(RAG)、感情分析、データクラスタリングなどのアプリケーションにおいて特に有用です。
入力機能に関しては、新モデルは最大8192トークンのテキストに対応しており、従来の2048トークンという制限の4倍となっています。また、1回のリクエストにつき最大6枚のPNGまたはJPEG画像、最大120秒の動画、最大6ページのPDF文書を処理可能です。 注目すべき機能として、Gemini Embedding2は音声処理をネイティブにサポートしており、音声からテキストへの変換が不要になるため、文字起こしによる情報の損失を防ぐことができます。また、Googleは「インターリーブ入力」技術を導入しました。これにより、開発者は画像と説明文を組み合わせるなど、1つのリクエスト内で複数のモダリティを統合し、それらの間の意味的な関係をより的確に捉えることが可能になります。

アーキテクチャ面では、本モデルは引き続きMatryoshka Representation Learning(MRL)を採用しています。この手法は階層構造を用いてベクトルの次元を動的に調整します。デフォルトの埋め込み次元は3072ですが、1536および768のオプション設定も利用可能であり、開発者は検索精度とストレージ効率のバランスを柔軟に調整できます。
Googleのベンチマーク結果によると、Gemini Embedding2はテキスト、画像、動画、音声の各タスクにおいて業界トップクラスの性能を発揮しています。例えば、テキスト・動画検索では68.8点を記録し、Amazon Nova2Multimodal Embeddings(60.3点)やVoyage Multimodal3.5(55.2点)を上回っています。 テキストと画像の比較では、93.4というスコアを達成し、Amazonのモデルスコア84.0を大幅に上回っています。
Gemini Embedding2は現在、Gemini APIおよびVertex AIを通じて開発者が利用可能です。LangChain、LlamaIndex、Haystack、Weaviate、Qdrant、ChromaDB、Vector Searchなどの主要なフレームワークやベクトルデータベースと統合されています。開発者の導入を支援するため、GoogleはインタラクティブなColabノートブックや、軽量なマルチモーダルセマンティック検索のデモを提供しています。

マルチモーダル・エンベディング分野での競争は激化しています。特に、今年2月下旬には、AI検索エンジンのPerplexityが、オープンソースのエンベディングモデルであるpplx-embed-v1およびpplx -embed-context-v 1を公開しました。
関連記事
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Google、Geminiへの焦点がユーザー制御へシフトする中で、Remy AIエージェントをテスト
『Business Insider』によると、GoogleはGemini向けの新しいAIパーソナルエージェント「Remy」をテスト中である。このツールはユーザーに代わってタスクを実行することを目的としており、業務フローと日常のルーチンの両方を効率化する。現在、RemyはGeminiアプリケーションの社内限定版においてテストが行われている。この報道は社内文書と、プロジェクトに精通した2人の人物へのインタビューを引用している。社内資料では、Remyを「24時間365日のパーソナルエージェント」と位
関連特集おすすめ
コメント (0)
0/500
Googleは最近、新しいネイティブマルチモーダル埋め込みモデル「Gemini Embedding2」を発表しました。このモデルは、テキスト、画像、動画、音声、PDF文書を共通のセマンティックベクトル空間にマッピングすることができ、複雑なAIデータワークフローを効率化し、マルチモーダル検索と理解を向上させるように設計されています。これは、埋め込み技術におけるGoogleの重要な進歩であり、単一モダリティのテキストから統一されたマルチモーダルセマンティックモデリングへの移行を意味します。

これに先立ち、2025年7月にGoogleはテキスト埋め込みモデル「gemini-embedding-001」を発表していました。同モデルは100以上の言語に対応し、多言語ベンチマーク「MTEB」において最高の結果を達成しました。 新しい「Gemini Embedding2」は、Geminiアーキテクチャを基盤としつつ、その適用範囲を大幅に拡大しています。現在では、テキスト、画像、動画、音声、PDFという5つの異なるモダリティを処理し、それらを単一のベクトル空間に投影します。これにより、複数の専用モデルや余分な処理ステップを必要とせずに、異なる種類のメディア間で直接的な意味論的比較が可能になります。この機能は、セマンティック検索、検索強化生成(RAG)、感情分析、データクラスタリングなどのアプリケーションにおいて特に有用です。
入力機能に関しては、新モデルは最大8192トークンのテキストに対応しており、従来の2048トークンという制限の4倍となっています。また、1回のリクエストにつき最大6枚のPNGまたはJPEG画像、最大120秒の動画、最大6ページのPDF文書を処理可能です。 注目すべき機能として、Gemini Embedding2は音声処理をネイティブにサポートしており、音声からテキストへの変換が不要になるため、文字起こしによる情報の損失を防ぐことができます。また、Googleは「インターリーブ入力」技術を導入しました。これにより、開発者は画像と説明文を組み合わせるなど、1つのリクエスト内で複数のモダリティを統合し、それらの間の意味的な関係をより的確に捉えることが可能になります。

アーキテクチャ面では、本モデルは引き続きMatryoshka Representation Learning(MRL)を採用しています。この手法は階層構造を用いてベクトルの次元を動的に調整します。デフォルトの埋め込み次元は3072ですが、1536および768のオプション設定も利用可能であり、開発者は検索精度とストレージ効率のバランスを柔軟に調整できます。
Googleのベンチマーク結果によると、Gemini Embedding2はテキスト、画像、動画、音声の各タスクにおいて業界トップクラスの性能を発揮しています。例えば、テキスト・動画検索では68.8点を記録し、Amazon Nova2Multimodal Embeddings(60.3点)やVoyage Multimodal3.5(55.2点)を上回っています。 テキストと画像の比較では、93.4というスコアを達成し、Amazonのモデルスコア84.0を大幅に上回っています。
Gemini Embedding2は現在、Gemini APIおよびVertex AIを通じて開発者が利用可能です。LangChain、LlamaIndex、Haystack、Weaviate、Qdrant、ChromaDB、Vector Searchなどの主要なフレームワークやベクトルデータベースと統合されています。開発者の導入を支援するため、GoogleはインタラクティブなColabノートブックや、軽量なマルチモーダルセマンティック検索のデモを提供しています。

マルチモーダル・エンベディング分野での競争は激化しています。特に、今年2月下旬には、AI検索エンジンのPerplexityが、オープンソースのエンベディングモデルであるpplx-embed-v1およびpplx -embed-context-v 1を公開しました。
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ





家






