Hogar
Google presenta Gemini Embedding2: un modelo multimodal nativo que unifica los espacios semánticos
Google ha presentado recientemente su nuevo modelo de incrustación multimodal nativo, Gemini Embedding2. Este modelo permite mapear texto, imágenes, vídeos, audio y documentos PDF en un espacio vectorial semántico compartido, diseñado para optimizar los complejos flujos de trabajo de datos de IA y mejorar la recuperación y la comprensión multimodal. Esto supone un avance clave para Google en la tecnología de incrustación, al pasar de la incrustación de texto de una sola modalidad a un modelado semántico multimodal unificado.

Anteriormente, en julio de 2025, Google presentó el modelo de incrustación de texto gemini-embedding-001. Este modelo era compatible con más de 100 idiomas y obtuvo los mejores resultados en el banco de pruebas multilingüe MTEB. El nuevo Gemini Embedding2 se basa en la arquitectura Gemini, pero amplía significativamente su alcance. Ahora procesa cinco modalidades diferentes —texto, imágenes, vídeo, audio y PDF— y las proyecta en un único espacio vectorial. Esto permite realizar comparaciones semánticas directas entre diferentes tipos de medios sin necesidad de múltiples modelos especializados ni pasos de procesamiento adicionales. Esta capacidad resulta especialmente valiosa para aplicaciones como la búsqueda semántica, la generación aumentada por recuperación (RAG), el análisis de sentimientos y la agrupación de datos.
En cuanto a las capacidades de entrada, el nuevo modelo admite hasta 8192 tokens de texto, el cuádruple del límite anterior de 2048 tokens. Puede gestionar hasta seis imágenes PNG o JPEG por solicitud, vídeos de hasta 120 segundos de duración y documentos PDF de hasta seis páginas. Una característica destacable es la compatibilidad nativa de Gemini Embedding2 con el procesamiento de audio, lo que elimina la necesidad de conversión de voz a texto y evita la posible pérdida de información derivada de la transcripción. Google también ha introducido la tecnología de «entrada intercalada», que permite a los desarrolladores combinar múltiples modalidades en una sola solicitud —como mezclar imágenes con texto descriptivo— para captar mejor las relaciones semánticas entre ellas.

Desde el punto de vista arquitectónico, el modelo sigue empleando el Matryoshka Representation Learning (MRL). Esta técnica utiliza una estructura jerárquica para ajustar dinámicamente las dimensiones de los vectores. La dimensión de incrustación predeterminada es 3072, con configuraciones opcionales de 1536 y 768 disponibles, lo que ofrece a los desarrolladores flexibilidad para equilibrar la precisión de la recuperación con la eficiencia del almacenamiento.
Los resultados de las pruebas comparativas de Google indican que Gemini Embedding2 ofrece un rendimiento líder en tareas de texto, imagen, vídeo y voz. Por ejemplo, en la recuperación de texto y vídeo, obtiene una puntuación de 68,8, superando a Amazon Nova2Multimodal Embeddings (60,3) y a Voyage Multimodal3.5 (55,2). En la comparación de texto e imagen, alcanza una puntuación de 93,4, muy por delante de la puntuación del modelo de Amazon, que es de 84,0.
Actualmente, los desarrolladores pueden acceder a Gemini Embedding2 a través de la API de Gemini y Vertex AI. Se integra con marcos de trabajo y bases de datos vectoriales populares como LangChain, LlamaIndex, Haystack, Weaviate, Qdrant, ChromaDB y Vector Search. Para ayudar a los desarrolladores a dar sus primeros pasos, Google ofrece cuadernos Colab interactivos y demostraciones de búsqueda semántica multimodal ligeras.

La competencia en el ámbito de la incrustación multimodal se está recrudeciendo. Cabe destacar que, a finales de febrero de este año, el motor de búsqueda de IA Perplexity lanzó sus modelos de incrustación de código abierto, pplx-embed-v1 y pplx-embed-context-v1.
Artículo relacionado
Cómo corregir las Core Web Vitals para mejorar el posicionamiento SEO
Simplificar los comentarios de las tarjetas de calificación con herramientas de IAIntroducciónHerramientas de IA para generar comentarios de tarjetas de calificaciónMagic SchoolAlmanac AIChat GPTUso de Magic School para generar comentarios de t
Slackbot se convierte en un agente de IA
Slackbot, el asistente automatizado integrado en la plataforma de mensajería corporativa Slack de Salesforce, está evolucionando hacia un agente de inteligencia artificial. El CTO de Salesforce, Parker Harris, prevé que alcance un estatus viral compa
ByteDance Refuerza los Incentivos de IA Central mientras Doubao Aumenta un 14.6%
ByteDance ha convocado recientemente una sesión informativa sobre la participación accionaria de DouBao para presentar nuevas políticas de incentivos para el personal involucrado en la división de DouBao. El precio de ejercicio de las acciones de Dou
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
Google ha presentado recientemente su nuevo modelo de incrustación multimodal nativo, Gemini Embedding2. Este modelo permite mapear texto, imágenes, vídeos, audio y documentos PDF en un espacio vectorial semántico compartido, diseñado para optimizar los complejos flujos de trabajo de datos de IA y mejorar la recuperación y la comprensión multimodal. Esto supone un avance clave para Google en la tecnología de incrustación, al pasar de la incrustación de texto de una sola modalidad a un modelado semántico multimodal unificado.

Anteriormente, en julio de 2025, Google presentó el modelo de incrustación de texto gemini-embedding-001. Este modelo era compatible con más de 100 idiomas y obtuvo los mejores resultados en el banco de pruebas multilingüe MTEB. El nuevo Gemini Embedding2 se basa en la arquitectura Gemini, pero amplía significativamente su alcance. Ahora procesa cinco modalidades diferentes —texto, imágenes, vídeo, audio y PDF— y las proyecta en un único espacio vectorial. Esto permite realizar comparaciones semánticas directas entre diferentes tipos de medios sin necesidad de múltiples modelos especializados ni pasos de procesamiento adicionales. Esta capacidad resulta especialmente valiosa para aplicaciones como la búsqueda semántica, la generación aumentada por recuperación (RAG), el análisis de sentimientos y la agrupación de datos.
En cuanto a las capacidades de entrada, el nuevo modelo admite hasta 8192 tokens de texto, el cuádruple del límite anterior de 2048 tokens. Puede gestionar hasta seis imágenes PNG o JPEG por solicitud, vídeos de hasta 120 segundos de duración y documentos PDF de hasta seis páginas. Una característica destacable es la compatibilidad nativa de Gemini Embedding2 con el procesamiento de audio, lo que elimina la necesidad de conversión de voz a texto y evita la posible pérdida de información derivada de la transcripción. Google también ha introducido la tecnología de «entrada intercalada», que permite a los desarrolladores combinar múltiples modalidades en una sola solicitud —como mezclar imágenes con texto descriptivo— para captar mejor las relaciones semánticas entre ellas.

Desde el punto de vista arquitectónico, el modelo sigue empleando el Matryoshka Representation Learning (MRL). Esta técnica utiliza una estructura jerárquica para ajustar dinámicamente las dimensiones de los vectores. La dimensión de incrustación predeterminada es 3072, con configuraciones opcionales de 1536 y 768 disponibles, lo que ofrece a los desarrolladores flexibilidad para equilibrar la precisión de la recuperación con la eficiencia del almacenamiento.
Los resultados de las pruebas comparativas de Google indican que Gemini Embedding2 ofrece un rendimiento líder en tareas de texto, imagen, vídeo y voz. Por ejemplo, en la recuperación de texto y vídeo, obtiene una puntuación de 68,8, superando a Amazon Nova2Multimodal Embeddings (60,3) y a Voyage Multimodal3.5 (55,2). En la comparación de texto e imagen, alcanza una puntuación de 93,4, muy por delante de la puntuación del modelo de Amazon, que es de 84,0.
Actualmente, los desarrolladores pueden acceder a Gemini Embedding2 a través de la API de Gemini y Vertex AI. Se integra con marcos de trabajo y bases de datos vectoriales populares como LangChain, LlamaIndex, Haystack, Weaviate, Qdrant, ChromaDB y Vector Search. Para ayudar a los desarrolladores a dar sus primeros pasos, Google ofrece cuadernos Colab interactivos y demostraciones de búsqueda semántica multimodal ligeras.

La competencia en el ámbito de la incrustación multimodal se está recrudeciendo. Cabe destacar que, a finales de febrero de este año, el motor de búsqueda de IA Perplexity lanzó sus modelos de incrustación de código abierto, pplx-embed-v1 y pplx-embed-context-v1.
Cómo corregir las Core Web Vitals para mejorar el posicionamiento SEO
Simplificar los comentarios de las tarjetas de calificación con herramientas de IAIntroducciónHerramientas de IA para generar comentarios de tarjetas de calificaciónMagic SchoolAlmanac AIChat GPTUso de Magic School para generar comentarios de t
Slackbot se convierte en un agente de IA
Slackbot, el asistente automatizado integrado en la plataforma de mensajería corporativa Slack de Salesforce, está evolucionando hacia un agente de inteligencia artificial. El CTO de Salesforce, Parker Harris, prevé que alcance un estatus viral compa
ByteDance Refuerza los Incentivos de IA Central mientras Doubao Aumenta un 14.6%
ByteDance ha convocado recientemente una sesión informativa sobre la participación accionaria de DouBao para presentar nuevas políticas de incentivos para el personal involucrado en la división de DouBao. El precio de ejercicio de las acciones de Dou











