谷歌推出双子座深度思考人工智能,用于并行推理和创意测试
谷歌 DeepMind 推出迄今为止最复杂的人工智能推理模型 Gemini 2.5 Deep Think。这一创新系统可以同时分析多个思维路径,然后选择最佳解决方案。
从本周五开始,谷歌每月 250 美元的高级 Ultra 计划的用户将通过 Gemini 应用程序独享 Gemini 2.5 Deep Think。
在2025年谷歌I/O大会上首次亮相的Gemini 2.5 Deep Think是谷歌首次公开的多代理模型。该系统可同时部署多个人工智能代理来处理复杂的查询,需要更强的计算能力,但却能产生更优越的结果。
Gemini 2.5 Deep Think 的专门版本在今年的国际数学奥林匹克竞赛中获得了金牌。
谷歌在开发 Gemini 2.5 Deep Think 的同时,还与数学家和学者分享了它在国际数学奥林匹克竞赛中获奖的模型。与即时响应的传统人工智能模型不同,这个以研究为重点的版本需要数小时的推理时间。该公司的目标是通过这一举措完善学术应用中的多代理技术。
谷歌强调了 Gemini 2.5 Deep Think 自首次 I/O 发布以来取得的重大进展,包括优化模型推理能力的新型强化学习技术。
"Deep Think擅长解决需要创造性思维、战略规划和迭代改进的问题,"谷歌在一篇TechCrunch独家博客文章中表示。
科技界和风险投资界的重量级人物加入Disrupt 2025议程
包括 Netflix、ElevenLabs、Wayve 和红杉资本在内的行业领导者是 TechCrunch Disrupt 2025 的主角。在我们具有里程碑意义的 20 周年庆典上,您将获得推动初创企业发展的变革性见解。立即购买门票,在价格上涨前可享受高达 675 美元的独家优惠。
技术和风险投资领域的重量级人物加入 Disrupt 2025 议程
包括 Netflix、ElevenLabs、Wayve 和红杉资本在内的行业领导者将担任 TechCrunch Disrupt 2025 的主讲嘉宾。在我们具有里程碑意义的 20 周年庆典上,您将获得推动初创企业成长的变革性见解。立即购买门票,在价格上涨前可独享高达 675 美元的优惠。
Gemini 2.5 Deep Think 在 "人类最后的考试"(Humanity's Last Exam,HLE)中设定了新标准,这是一项跨学科测试人工智能的综合评估。谷歌报告称,在不使用外部工具的情况下,其准确率达到 34.8%,超过了竞争对手 Grok 4(25.4%)和 OpenAI 的 o3(20.3%)。
在竞争激烈的编程任务中,该模型还以 87.6% 的得分在 LiveCodeBench 6 中独占鳌头,超过了 Grok 4(79%)和 OpenAI 的 o3(72%)。

基准测试得分图片来源:谷歌 Gemini 2.5 Deep Think 可以与编程环境和搜索工具无缝集成,同时生成比传统人工智能系统更广泛的输出。
谷歌的内部测试显示,该模型能生成异常详细的网络开发解决方案,有可能加速科学突破。

谷歌 AII 制作的艺术场景图片来源:谷歌 领先的人工智能研究人员越来越多地采用多代理架构。
xAI 的 Grok 4 Heavy 和 OpenAI 尚未发布的 IMO 模型都采用了多代理系统,Anthropic 的研究型人工智能也是如此。虽然这些系统表现出了卓越的性能,但它们的运营成本也使得它们的定价必须高于其他系统。
谷歌计划在未来几周内对 Gemini 2.5 Deep Think 进行有限的 API 访问,以探索企业和开发者应用。
相关文章
Gemini Spark 现在管理 Google Photos 图库
Google 正在通过启用 Gemini Spark 来管理 Google Photos 图库,从而扩大其人工智能集成范围。用户现在可以指示该代理编辑图片、整理相册、从精选照片中生成共享合集、将演唱会传单转换为日历事件,并自动化其他工作流程。Google Photos 负责人 Shimrit Ben-Yair 在 X 平台上宣布了这些新功能,表示符合条件的美国 Gemini AI Pro 和 Ultra 订阅用户将在未来几周内获得英语支持。该公司尚未明确说明这些功能是否会扩展至国际市场,以及
谷歌推出虚假来电检测功能,以防范AI深度伪造冒充诈骗
谷歌周二宣布,Android将推出虚假来电检测功能,以防范利用AI深度伪造技术实施的冒充诈骗。该功能将于本月通过“Phone by Google”在全球范围内面向Android 12及以上版本的设备逐步推出,首先适用于Pixel设备。随着人们越来越不愿接听陌生号码的来电,诈骗分子正改变策略,通过伪造可信的电话号码,并利用AI深度伪造技术模仿权威人士、家人或雇主的语气进行诈骗。例如,某人可能会接到一
Frontier AI Labs 拒绝透露针对失控模型的遏制策略
最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met
相关专题推荐
评论 (1)
0/500
Interesting approach! Parallel reasoning could really speed up complex problem-solving, but I wonder how they ensure the 'optimal' solution isn't just the most predictable one? The testing feature sounds useful for prototyping ideas quickly. Hope it's accessible beyond just high-tier subscribers soon. 🤔
谷歌 DeepMind 推出迄今为止最复杂的人工智能推理模型 Gemini 2.5 Deep Think。这一创新系统可以同时分析多个思维路径,然后选择最佳解决方案。
从本周五开始,谷歌每月 250 美元的高级 Ultra 计划的用户将通过 Gemini 应用程序独享 Gemini 2.5 Deep Think。
在2025年谷歌I/O大会上首次亮相的Gemini 2.5 Deep Think是谷歌首次公开的多代理模型。该系统可同时部署多个人工智能代理来处理复杂的查询,需要更强的计算能力,但却能产生更优越的结果。
Gemini 2.5 Deep Think 的专门版本在今年的国际数学奥林匹克竞赛中获得了金牌。
谷歌在开发 Gemini 2.5 Deep Think 的同时,还与数学家和学者分享了它在国际数学奥林匹克竞赛中获奖的模型。与即时响应的传统人工智能模型不同,这个以研究为重点的版本需要数小时的推理时间。该公司的目标是通过这一举措完善学术应用中的多代理技术。
谷歌强调了 Gemini 2.5 Deep Think 自首次 I/O 发布以来取得的重大进展,包括优化模型推理能力的新型强化学习技术。
"Deep Think擅长解决需要创造性思维、战略规划和迭代改进的问题,"谷歌在一篇TechCrunch独家博客文章中表示。
科技界和风险投资界的重量级人物加入Disrupt 2025议程
包括 Netflix、ElevenLabs、Wayve 和红杉资本在内的行业领导者是 TechCrunch Disrupt 2025 的主角。在我们具有里程碑意义的 20 周年庆典上,您将获得推动初创企业发展的变革性见解。立即购买门票,在价格上涨前可享受高达 675 美元的独家优惠。
技术和风险投资领域的重量级人物加入 Disrupt 2025 议程
包括 Netflix、ElevenLabs、Wayve 和红杉资本在内的行业领导者将担任 TechCrunch Disrupt 2025 的主讲嘉宾。在我们具有里程碑意义的 20 周年庆典上,您将获得推动初创企业成长的变革性见解。立即购买门票,在价格上涨前可独享高达 675 美元的优惠。
Gemini 2.5 Deep Think 在 "人类最后的考试"(Humanity's Last Exam,HLE)中设定了新标准,这是一项跨学科测试人工智能的综合评估。谷歌报告称,在不使用外部工具的情况下,其准确率达到 34.8%,超过了竞争对手 Grok 4(25.4%)和 OpenAI 的 o3(20.3%)。
在竞争激烈的编程任务中,该模型还以 87.6% 的得分在 LiveCodeBench 6 中独占鳌头,超过了 Grok 4(79%)和 OpenAI 的 o3(72%)。

Gemini 2.5 Deep Think 可以与编程环境和搜索工具无缝集成,同时生成比传统人工智能系统更广泛的输出。
谷歌的内部测试显示,该模型能生成异常详细的网络开发解决方案,有可能加速科学突破。

领先的人工智能研究人员越来越多地采用多代理架构。
xAI 的 Grok 4 Heavy 和 OpenAI 尚未发布的 IMO 模型都采用了多代理系统,Anthropic 的研究型人工智能也是如此。虽然这些系统表现出了卓越的性能,但它们的运营成本也使得它们的定价必须高于其他系统。
谷歌计划在未来几周内对 Gemini 2.5 Deep Think 进行有限的 API 访问,以探索企业和开发者应用。
Gemini Spark 现在管理 Google Photos 图库
Google 正在通过启用 Gemini Spark 来管理 Google Photos 图库,从而扩大其人工智能集成范围。用户现在可以指示该代理编辑图片、整理相册、从精选照片中生成共享合集、将演唱会传单转换为日历事件,并自动化其他工作流程。Google Photos 负责人 Shimrit Ben-Yair 在 X 平台上宣布了这些新功能,表示符合条件的美国 Gemini AI Pro 和 Ultra 订阅用户将在未来几周内获得英语支持。该公司尚未明确说明这些功能是否会扩展至国际市场,以及
谷歌推出虚假来电检测功能,以防范AI深度伪造冒充诈骗
谷歌周二宣布,Android将推出虚假来电检测功能,以防范利用AI深度伪造技术实施的冒充诈骗。该功能将于本月通过“Phone by Google”在全球范围内面向Android 12及以上版本的设备逐步推出,首先适用于Pixel设备。随着人们越来越不愿接听陌生号码的来电,诈骗分子正改变策略,通过伪造可信的电话号码,并利用AI深度伪造技术模仿权威人士、家人或雇主的语气进行诈骗。例如,某人可能会接到一
Frontier AI Labs 拒绝透露针对失控模型的遏制策略
最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met
Interesting approach! Parallel reasoning could really speed up complex problem-solving, but I wonder how they ensure the 'optimal' solution isn't just the most predictable one? The testing feature sounds useful for prototyping ideas quickly. Hope it's accessible beyond just high-tier subscribers soon. 🤔





首页






