阿里巴巴开源的 问云 人工智能模型在推理方面打破纪录
阿里巴巴的 Qwen 团队发布了新版开源推理人工智能模型,并展示了出色的基准测试结果。
Introducing Qwen3-235B-A22B-Thinking-2507.在过去的三个月里,Qwen 团队一直在大力提升模型的 "思考能力",努力提高推理过程的质量和深度。
其结果是,该模型在逻辑推理、复杂数学、科学挑战和高级编码等要求最苛刻的领域真正大放异彩。在通常需要人类专业知识的领域,最新的 Qwen 模型为开源人工智能树立了新的标杆。
在推理基准测试中,Qwen 最新的开源人工智能模型在 AIME25 中获得 92.3 分,在 LiveCodeBench v6 编码测试中获得 74.1 分。它在更广泛的能力评估中也表现出色,在Arena-Hard v2(一项评估与人类偏好一致性的指标)上获得了79.7分。

从根本上说,这是一个来自 Qwen 团队的大规模推理人工智能模型,共有 2,350 亿个参数。不过,它采用了专家混合(MoE)架构,这意味着在任何特定时间,只有这些参数的一个子集--约 220 亿个参数--处于活动状态。可以把它想象成一个由 128 名专家组成的庞大团队,随时待命,但只有负责特定任务的前八名专家在实际工作。
Qwen 的突出特点之一是其超强的内存容量。Qwen 的开源人工智能推理模型原生支持 262,144 个词块的上下文长度,为需要理解大量信息的任务提供了显著优势。
对于开发者和爱好者来说,Qwen 团队简化了入门流程。该模型可在 Hugging Face 上访问,并可使用 sglang 或 vllm 等工具进行部署,以建立个人 API 端点。该团队还强调,他们的 Qwen-Agent 框架是利用该模型的工具调用功能的最佳方法。
为使这一开源人工智能推理模型达到最佳性能,Qwen 团队提出了几项建议。他们建议标准任务的输出长度为 32,768 个标记左右,但对于高度复杂的问题,可将输出长度增加到 81,920 个标记,让人工智能有足够的空间 "思考"。他们还建议在提示中使用明确的说明,例如要求对数学问题采用 "逐步推理 "的方法,以获得最精确、最有条理的回答。
新 Qwen 模型的推出提供了一个强大的开源推理人工智能,能够与领先的专有模型竞争,尤其是在应对复杂、智力要求高的挑战方面。我们将拭目以待开发者社区利用这项技术创造出怎样的成果。
另请参见人工智能行动计划:美国的领导地位必须 "不受挑战
想从行业专家那里加深对人工智能和大数据的了解?参加在阿姆斯特丹、加利福尼亚和伦敦举办的人工智能与大数据博览会。这一综合性活动将与智能自动化大会(Intelligent Automation Conference)、BlockX、数字转型周(Digital Transformation Week)和网络安全与云博览会(Cyber Security & Cloud Expo)等其他重要会议同时举行。
点击此处了解由 TechForge 提供支持的更多即将举行的企业技术活动和网络研讨会。
相关文章
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制
根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
奥利押注隐私保护,力争在AI助手竞争中胜出
要真正发挥帮助作用,人工智能助手必须深刻理解其用户。Ollie 是一款专为日常生活设计的个人助理,其运作理念是:实现这一点无需用户交出数据,也不会损害用户的隐私。虽然某些企业级人工智能工具提供了数据隐私保护措施,但Ollie作为首批通过SOC 2认证的主流、面向家庭的人工智能服务之一,尤为突出。该认证框架允许企业通过独立审计证明,其已建立正式的控制措施来保护客户数据,并确保系统安全运行。达成这一里
AI LIVE:伦敦将如何探讨人工智能与工业自动化
本次峰会将汇聚来自全球的高管,共同探讨全球各行业面临的紧迫挑战,涵盖从人工智能驱动的颠覆性变革到经济波动等各个方面。AI LIVE:伦敦峰会将以“技术与人类使命”为主题,汇聚2,000余位国际领袖,共同探讨人工智能的新时代。BizClik旗下品牌《AI Magazine》已公布其在“AI LIVE:伦敦峰会”上举办的关于人工智能与工业自动化的联合炉边谈话环节阵容。该专题讨论会定于10月20日在伦敦
相关专题推荐
评论 (1)
0/500
阿里巴巴的 Qwen 团队发布了新版开源推理人工智能模型,并展示了出色的基准测试结果。
Introducing Qwen3-235B-A22B-Thinking-2507.在过去的三个月里,Qwen 团队一直在大力提升模型的 "思考能力",努力提高推理过程的质量和深度。
其结果是,该模型在逻辑推理、复杂数学、科学挑战和高级编码等要求最苛刻的领域真正大放异彩。在通常需要人类专业知识的领域,最新的 Qwen 模型为开源人工智能树立了新的标杆。
在推理基准测试中,Qwen 最新的开源人工智能模型在 AIME25 中获得 92.3 分,在 LiveCodeBench v6 编码测试中获得 74.1 分。它在更广泛的能力评估中也表现出色,在Arena-Hard v2(一项评估与人类偏好一致性的指标)上获得了79.7分。

从根本上说,这是一个来自 Qwen 团队的大规模推理人工智能模型,共有 2,350 亿个参数。不过,它采用了专家混合(MoE)架构,这意味着在任何特定时间,只有这些参数的一个子集--约 220 亿个参数--处于活动状态。可以把它想象成一个由 128 名专家组成的庞大团队,随时待命,但只有负责特定任务的前八名专家在实际工作。
Qwen 的突出特点之一是其超强的内存容量。Qwen 的开源人工智能推理模型原生支持 262,144 个词块的上下文长度,为需要理解大量信息的任务提供了显著优势。
对于开发者和爱好者来说,Qwen 团队简化了入门流程。该模型可在 Hugging Face 上访问,并可使用 sglang 或 vllm 等工具进行部署,以建立个人 API 端点。该团队还强调,他们的 Qwen-Agent 框架是利用该模型的工具调用功能的最佳方法。
为使这一开源人工智能推理模型达到最佳性能,Qwen 团队提出了几项建议。他们建议标准任务的输出长度为 32,768 个标记左右,但对于高度复杂的问题,可将输出长度增加到 81,920 个标记,让人工智能有足够的空间 "思考"。他们还建议在提示中使用明确的说明,例如要求对数学问题采用 "逐步推理 "的方法,以获得最精确、最有条理的回答。
新 Qwen 模型的推出提供了一个强大的开源推理人工智能,能够与领先的专有模型竞争,尤其是在应对复杂、智力要求高的挑战方面。我们将拭目以待开发者社区利用这项技术创造出怎样的成果。
另请参见人工智能行动计划:美国的领导地位必须 "不受挑战
想从行业专家那里加深对人工智能和大数据的了解?参加在阿姆斯特丹、加利福尼亚和伦敦举办的人工智能与大数据博览会。这一综合性活动将与智能自动化大会(Intelligent Automation Conference)、BlockX、数字转型周(Digital Transformation Week)和网络安全与云博览会(Cyber Security & Cloud Expo)等其他重要会议同时举行。
点击此处了解由 TechForge 提供支持的更多即将举行的企业技术活动和网络研讨会。
奥利押注隐私保护,力争在AI助手竞争中胜出
要真正发挥帮助作用,人工智能助手必须深刻理解其用户。Ollie 是一款专为日常生活设计的个人助理,其运作理念是:实现这一点无需用户交出数据,也不会损害用户的隐私。虽然某些企业级人工智能工具提供了数据隐私保护措施,但Ollie作为首批通过SOC 2认证的主流、面向家庭的人工智能服务之一,尤为突出。该认证框架允许企业通过独立审计证明,其已建立正式的控制措施来保护客户数据,并确保系统安全运行。达成这一里
AI LIVE:伦敦将如何探讨人工智能与工业自动化
本次峰会将汇聚来自全球的高管,共同探讨全球各行业面临的紧迫挑战,涵盖从人工智能驱动的颠覆性变革到经济波动等各个方面。AI LIVE:伦敦峰会将以“技术与人类使命”为主题,汇聚2,000余位国际领袖,共同探讨人工智能的新时代。BizClik旗下品牌《AI Magazine》已公布其在“AI LIVE:伦敦峰会”上举办的关于人工智能与工业自动化的联合炉边谈话环节阵容。该专题讨论会定于10月20日在伦敦





首页






