谷歌推出 Gemini 3.5 Transcribe,可在嘈杂环境中实现精准的语音转文字
谷歌已正式推出Gemini 3.5 Transcribe——这是其Gemini系列的最新成员,被定位为该系列中准确率最高的语音识别模型。该模型现已向开发者、企业和普通用户开放,能够解决行业中长期存在的挑战,包括背景噪音、专业术语和自然语音模式。
凭借强大的泛化能力,Gemini 3.5 Transcribe 在过滤背景噪音和处理各专业领域的复杂词汇方面表现尤为出色。 该模型已显著提升了 macOS 版 Gemini 应用以及 Android 版 Gboard 中“Rambler”功能的性能。开发者可利用此工具构建创新解决方案,例如语音助手、实时字幕系统以及通话后分析工作流。

该模型针对日常对话的细微差别进行了优化,能够准确捕捉语义意图并识别自定义词汇,从而协助用户通过语音完成任务。它包含自动自我更正、智能去除口头语(如“嗯”、“啊”)以及自动文本格式化等实用功能。 此外,它还能将文件分析和图像生成等复杂任务委托给其他 Gemini 模型,提供端到端的多模型协作体验。
谷歌的公开数据显示,Gemini 3.5 Transcribe 在流式处理场景下的平均词错误率(WER)仅为 4.0%,在非流式处理场景下则为 2.6%。 即使在嘈杂的环境中,它也能保持较高的识别稳定性,并对订单号和邮政编码等关键的字母数字信息提供卓越的识别准确度。
该模型在多语言支持和个性化方面表现出色,支持 85 种语言,并能适应各种地区口音和方言。对于预处理过的音频,它可提供最多三名说话者的带时间戳的说话人识别功能。此外,它完全支持用户自定义词汇表,能有效处理专业术语、特殊拼写和行业专有名词。
在生态系统集成方面,开发者可通过 Google AI Studio 和 Google Antigravity 上的 Gemini API 预览 Gemini 3.5 Transcribe;普通用户则可在 Android 和 macOS 系统上体验该功能。谷歌计划将该模型集成到 Chrome 浏览器中,实现任何网页输入框的语音输入功能。 此次发布紧随 Gemini 3.7 Flash 的推出、Gemini 向全美 Android 用户开放,以及其与 Waymo 自动驾驶汽车的集成之后,进一步彰显了谷歌在全场景 AI 产品矩阵方面的快速进展。
相关文章
Suno 在法律诉讼中为歌曲添加水印
Suno,这个允许用户生成由人工智能创作的音乐的平台,近日推出了新功能,包括为平台制作的曲目添加标签、限制下载,并更新社区标准以遏制未经授权的复制品。这些更新是在Suno面临多家唱片公司和艺术家组织提起的多起诉讼之际推出的。在博客文章中,联合创始人兼首席执行官Mikey Shulman概述了核心原则,强调该平台旨在促进原创创作,同时扩大更广泛受众对人工智能音乐工具的访问权限。一个主要的争议点在于,用户将人工智能生成的歌曲上传到其他流媒体服务并通过操纵系统获取收入。Suno表示,现在将采用音频
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据
埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
相关专题推荐
评论 (0)
0/500
谷歌已正式推出Gemini 3.5 Transcribe——这是其Gemini系列的最新成员,被定位为该系列中准确率最高的语音识别模型。该模型现已向开发者、企业和普通用户开放,能够解决行业中长期存在的挑战,包括背景噪音、专业术语和自然语音模式。
凭借强大的泛化能力,Gemini 3.5 Transcribe 在过滤背景噪音和处理各专业领域的复杂词汇方面表现尤为出色。 该模型已显著提升了 macOS 版 Gemini 应用以及 Android 版 Gboard 中“Rambler”功能的性能。开发者可利用此工具构建创新解决方案,例如语音助手、实时字幕系统以及通话后分析工作流。

该模型针对日常对话的细微差别进行了优化,能够准确捕捉语义意图并识别自定义词汇,从而协助用户通过语音完成任务。它包含自动自我更正、智能去除口头语(如“嗯”、“啊”)以及自动文本格式化等实用功能。 此外,它还能将文件分析和图像生成等复杂任务委托给其他 Gemini 模型,提供端到端的多模型协作体验。
谷歌的公开数据显示,Gemini 3.5 Transcribe 在流式处理场景下的平均词错误率(WER)仅为 4.0%,在非流式处理场景下则为 2.6%。 即使在嘈杂的环境中,它也能保持较高的识别稳定性,并对订单号和邮政编码等关键的字母数字信息提供卓越的识别准确度。
该模型在多语言支持和个性化方面表现出色,支持 85 种语言,并能适应各种地区口音和方言。对于预处理过的音频,它可提供最多三名说话者的带时间戳的说话人识别功能。此外,它完全支持用户自定义词汇表,能有效处理专业术语、特殊拼写和行业专有名词。
在生态系统集成方面,开发者可通过 Google AI Studio 和 Google Antigravity 上的 Gemini API 预览 Gemini 3.5 Transcribe;普通用户则可在 Android 和 macOS 系统上体验该功能。谷歌计划将该模型集成到 Chrome 浏览器中,实现任何网页输入框的语音输入功能。 此次发布紧随 Gemini 3.7 Flash 的推出、Gemini 向全美 Android 用户开放,以及其与 Waymo 自动驾驶汽车的集成之后,进一步彰显了谷歌在全场景 AI 产品矩阵方面的快速进展。
Suno 在法律诉讼中为歌曲添加水印
Suno,这个允许用户生成由人工智能创作的音乐的平台,近日推出了新功能,包括为平台制作的曲目添加标签、限制下载,并更新社区标准以遏制未经授权的复制品。这些更新是在Suno面临多家唱片公司和艺术家组织提起的多起诉讼之际推出的。在博客文章中,联合创始人兼首席执行官Mikey Shulman概述了核心原则,强调该平台旨在促进原创创作,同时扩大更广泛受众对人工智能音乐工具的访问权限。一个主要的争议点在于,用户将人工智能生成的歌曲上传到其他流媒体服务并通过操纵系统获取收入。Suno表示,现在将采用音频
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据
埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径





首页






