谷歌发布Gemini Embedding2:原生多模态模型实现语义空间统一
谷歌近日发布了其全新的原生多模态嵌入模型——Gemini Embedding2。该模型能够将文本、图像、视频、音频和PDF文档映射到一个共享的语义向量空间中,旨在简化复杂的AI数据工作流,并提升多模态检索与理解能力。这标志着谷歌在嵌入技术领域取得了一项重大突破,实现了从单模态文本向统一多模态语义建模的转变。

此前,在2025年7月,谷歌推出了gemini-embedding-001文本嵌入模型。该模型支持100多种语言,并在MTEB多语言基准测试中取得了顶尖成绩。 全新的 Gemini Embedding2 在 Gemini 架构基础上进行了显著扩展。它现可处理文本、图像、视频、音频和 PDF 这五种不同模态,并将它们映射到单一向量空间中。这使得不同类型媒体之间能够进行直接的语义比较,无需多个专用模型或额外的处理步骤。这一能力对于语义搜索、检索增强生成(RAG)、情感分析和数据聚类等应用尤为宝贵。
在输入能力方面,新模型支持多达 8192 个文本令牌,是此前 2048 个令牌限制的四倍。它每条请求可处理多达六张 PNG 或 JPEG 图片、最长 120 秒的视频,以及最多六页的 PDF 文档。 值得注意的是,Gemini Embedding2原生支持音频处理,无需进行语音转文本转换,从而避免了转录过程中可能造成的信息丢失。谷歌还引入了“交错输入”技术,允许开发者在单次请求中混合多种模态——例如将图像与描述性文本结合——以更好地捕捉它们之间的语义关系。

在架构上,该模型继续采用“套娃式表征学习”(MRL)。该技术利用分层结构动态调整向量维度。默认嵌入维度为 3072,并提供 1536 和 768 两种可选配置,使开发者能够灵活地在检索准确性和存储效率之间取得平衡。
谷歌的基准测试结果表明,Gemini Embedding2 在文本、图像、视频和语音任务中均表现优异。例如,在文本-视频检索任务中,其得分达到 68.8,超越了亚马逊 Nova2 多模态嵌入(60.3)和 Voyage Multimodal3.5(55.2)。 在文本-图像检索方面,其得分达到93.4,显著领先于亚马逊模型84.0的得分。
开发者目前可通过Gemini API和Vertex AI 访问 Gemini Embedding2。该模型已集成至 LangChain、LlamaIndex、Haystack、Weaviate、Qdrant、ChromaDB 和 Vector Search 等主流框架及向量数据库。为帮助开发者快速入门,Google 提供了交互式 Colab 笔记本和轻量级多模态语义搜索演示。

多模态嵌入领域的竞争日益白热化。值得注意的是,今年2月下旬,AI搜索引擎Perplexity发布了其开源嵌入模型pplx-embed-v1和pplx-embed-context-v1。
相关文章
如何修复核心网页指标以获得更好的 SEO 排名
利用 AI 工具简化成绩单评语撰写引言用于生成成绩单评语的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成绩单评语登录 Magic School选择成绩单评语工具为学生定制评语使用 Almanac AI 生成成绩单评语设置课程与评分方案配置评语长度与学生信息使用 Almanac AI 生成评语比较 Magic School 与 Almanac AI设置的便捷性可定制性与课程内容的整合速度与效率使用
Slackbot 成为 AI 智能体
Slackbot,嵌入在Salesforce企业消息平台Slack中的自动化助手,正在演变为一个AI智能体。Salesforce首席技术官Parker Harris设想它将达到与OpenAI的ChatGPT相媲美的病毒式传播地位。这家云软件巨头于周二推出了更新版的Slackbot。该新版AI驱动版本面向Business+和Enterprise+客户,可直接在Slack内查找信息、起草电子邮件和安排会议。在获得适当权限的情况下,它还能与Microsoft Teams和Google Drive等企
字节跳动加大核心AI激励,豆包增长14.6%
字节跳动近日召开豆包股权说明会,公布面向豆包部门员工的最新激励政策。豆包股票的行权价已从2026年6月的14.85美元上调至17.02美元,涨幅约为14.6%。此次调整不仅提升了豆包股票的估值,还大幅扩大了其覆盖范围。根据员工岗位的不同,部分员工可能获得相当于其总薪酬约5%的豆包股票。根据新的兑换机制,字节跳动允许员工在整体薪酬包中,将部分现金工资兑换为豆包股权。兑换比例因职级而异,设有20%和30%等不同档位。例如,L2和L3级员工可选择20%的全覆盖兑换比例,而L3和L4级员工的该比例可
相关专题推荐
评论 (0)
0/500
谷歌近日发布了其全新的原生多模态嵌入模型——Gemini Embedding2。该模型能够将文本、图像、视频、音频和PDF文档映射到一个共享的语义向量空间中,旨在简化复杂的AI数据工作流,并提升多模态检索与理解能力。这标志着谷歌在嵌入技术领域取得了一项重大突破,实现了从单模态文本向统一多模态语义建模的转变。

此前,在2025年7月,谷歌推出了gemini-embedding-001文本嵌入模型。该模型支持100多种语言,并在MTEB多语言基准测试中取得了顶尖成绩。 全新的 Gemini Embedding2 在 Gemini 架构基础上进行了显著扩展。它现可处理文本、图像、视频、音频和 PDF 这五种不同模态,并将它们映射到单一向量空间中。这使得不同类型媒体之间能够进行直接的语义比较,无需多个专用模型或额外的处理步骤。这一能力对于语义搜索、检索增强生成(RAG)、情感分析和数据聚类等应用尤为宝贵。
在输入能力方面,新模型支持多达 8192 个文本令牌,是此前 2048 个令牌限制的四倍。它每条请求可处理多达六张 PNG 或 JPEG 图片、最长 120 秒的视频,以及最多六页的 PDF 文档。 值得注意的是,Gemini Embedding2原生支持音频处理,无需进行语音转文本转换,从而避免了转录过程中可能造成的信息丢失。谷歌还引入了“交错输入”技术,允许开发者在单次请求中混合多种模态——例如将图像与描述性文本结合——以更好地捕捉它们之间的语义关系。

在架构上,该模型继续采用“套娃式表征学习”(MRL)。该技术利用分层结构动态调整向量维度。默认嵌入维度为 3072,并提供 1536 和 768 两种可选配置,使开发者能够灵活地在检索准确性和存储效率之间取得平衡。
谷歌的基准测试结果表明,Gemini Embedding2 在文本、图像、视频和语音任务中均表现优异。例如,在文本-视频检索任务中,其得分达到 68.8,超越了亚马逊 Nova2 多模态嵌入(60.3)和 Voyage Multimodal3.5(55.2)。 在文本-图像检索方面,其得分达到93.4,显著领先于亚马逊模型84.0的得分。
开发者目前可通过Gemini API和Vertex AI 访问 Gemini Embedding2。该模型已集成至 LangChain、LlamaIndex、Haystack、Weaviate、Qdrant、ChromaDB 和 Vector Search 等主流框架及向量数据库。为帮助开发者快速入门,Google 提供了交互式 Colab 笔记本和轻量级多模态语义搜索演示。

多模态嵌入领域的竞争日益白热化。值得注意的是,今年2月下旬,AI搜索引擎Perplexity发布了其开源嵌入模型pplx-embed-v1和pplx-embed-context-v1。
如何修复核心网页指标以获得更好的 SEO 排名
利用 AI 工具简化成绩单评语撰写引言用于生成成绩单评语的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成绩单评语登录 Magic School选择成绩单评语工具为学生定制评语使用 Almanac AI 生成成绩单评语设置课程与评分方案配置评语长度与学生信息使用 Almanac AI 生成评语比较 Magic School 与 Almanac AI设置的便捷性可定制性与课程内容的整合速度与效率使用
Slackbot 成为 AI 智能体
Slackbot,嵌入在Salesforce企业消息平台Slack中的自动化助手,正在演变为一个AI智能体。Salesforce首席技术官Parker Harris设想它将达到与OpenAI的ChatGPT相媲美的病毒式传播地位。这家云软件巨头于周二推出了更新版的Slackbot。该新版AI驱动版本面向Business+和Enterprise+客户,可直接在Slack内查找信息、起草电子邮件和安排会议。在获得适当权限的情况下,它还能与Microsoft Teams和Google Drive等企
字节跳动加大核心AI激励,豆包增长14.6%
字节跳动近日召开豆包股权说明会,公布面向豆包部门员工的最新激励政策。豆包股票的行权价已从2026年6月的14.85美元上调至17.02美元,涨幅约为14.6%。此次调整不仅提升了豆包股票的估值,还大幅扩大了其覆盖范围。根据员工岗位的不同,部分员工可能获得相当于其总薪酬约5%的豆包股票。根据新的兑换机制,字节跳动允许员工在整体薪酬包中,将部分现金工资兑换为豆包股权。兑换比例因职级而异,设有20%和30%等不同档位。例如,L2和L3级员工可选择20%的全覆盖兑换比例,而L3和L4级员工的该比例可





首页






