Claude 4发布:下一代AI模型提升编码和代理性能
Anthropic推出了Claude 4模型系列,为开发人员打造尖端AI助手和编码解决方案带来了重大进步。该系列包括Claude Opus 4,顶级性能模型,以及Claude Sonnet 4,适用于多种应用的通用模型。
Anthropic对其目标充满信心,强调这些模型旨在“全面提升客户的AI策略”。Opus 4定位于“编码、研究、写作和科学探索”的领导者,而Sonnet 4被描述为“从Sonnet 3.7的重大升级”,为日常任务提供“顶级性能”。
Claude Opus 4:顶级编码模型
Anthropic宣称Claude Opus 4是“迄今为止最先进的模型,也是全球领先的编码模型”,其在SWE-bench上获得72.5%的分数,在Terminal-bench上获得43.2%的分数支持了这一说法。
除了速度,Opus 4在持久性方面表现出色,专为“需要专注努力和数千步骤的长时间任务保持一致性能”而设计。想象一个能够“持续工作数小时”的AI——这是Anthropic的承诺。
这比早期的Sonnet模型有了显著飞跃,可能通过应对需要持续努力的挑战重新定义AI代理的范围。
Claude Sonnet 4:日常使用的多功能AI
虽然Opus 4是旗舰产品,但Claude Sonnet 4作为一个动态的通用模型脱颖而出,在广泛的应用中提供了显著的改进。早期用户的初步反馈非常积极。
例如,GitHub指出,“Claude Sonnet 4在代理场景中表现出色”,他们对其印象深刻,计划“将其作为GitHub Copilot中新编码代理的基础”。这是一个强有力的认可。
技术分析师Manus称赞其“增强的遵循复杂指令、提供清晰推理和生成精美输出的能力”。
iGent报告称,Sonnet 4“在自主多功能应用开发中表现出色,问题解决能力显著提高,导航错误从20%降至几乎为零”。这对开发工作流程来说是一个重大胜利。
Sourcegraph认为这是“软件开发的重大进步,能够更长时间保持专注,更深入理解问题,并交付更干净的代码”。
Augment Code强调“更高的成功率、精确的代码编辑以及对复杂任务的细致处理”,使Sonnet 4成为他们的“首选主要模型”。
混合模式和开发者工具
Claude 4系列的一个突出特点是其双模式能力。Opus 4和Sonnet 4均提供快速任务的快速响应和复杂挑战的深入推理模式。
这种高级推理模式包含在Pro、Max、Team和Enterprise Claude计划中。令人兴奋的是,Sonnet 4的增强推理模式也将对免费用户开放,扩大了高质量AI的访问范围。
Anthropic还通过其API引入了强大的开发者工具,以加速高级AI代理的开发:
- 代码执行工具:使模型能够运行代码,为交互式和问题解决应用开启新的可能性。
- MCP连接器:Anthropic的新标准,用于AI助手和软件环境之间的无缝上下文交换。
- Files API:简化直接文件交互,这是实际任务的关键功能。
- 提示缓存:允许开发者缓存提示长达一小时,提升频繁查询的速度和效率。
在现实世界应用中的顶级性能
Anthropic强调,其“Claude 4模型在SWE-bench Verified基准测试中领先,该基准用于现实世界的软件工程任务”。除了编码,它们还在“推理、多模态能力和代理任务”中表现出色。

尽管有这些进步,Anthropic保持了一致的定价。Claude Opus 4的费用为每百万输入令牌15美元,每百万输出令牌75美元。Claude Sonnet 4是更经济实惠的选择,定价为每百万输入令牌3美元,每百万输出令牌15美元,这对现有用户来说是个好消息。
这两种模型均通过Anthropic API、Amazon Bedrock和Google Cloud的Vertex AI提供,使全球开发者和企业能够无缝整合它们。
Anthropic显然专注于增强AI能力,特别是在复杂编码和自主代理任务方面。凭借这些模型和工具,创新潜力已显著提升。
另见:Jony Ive的OpenAI设备细节浮出水面
在阿姆斯特丹、加利福尼亚和伦敦的AI & Big Data Expo上,从行业专家那里了解更多关于AI和大数据的信息。该活动与Intelligent Automation Conference、BlockX、Digital Transformation Week和Cyber Security & Cloud Expo同期举行。
查看TechForge的其他即将举办的企业技术活动和网络研讨会。
相关文章
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制
根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
奥利押注隐私保护,力争在AI助手竞争中胜出
要真正发挥帮助作用,人工智能助手必须深刻理解其用户。Ollie 是一款专为日常生活设计的个人助理,其运作理念是:实现这一点无需用户交出数据,也不会损害用户的隐私。虽然某些企业级人工智能工具提供了数据隐私保护措施,但Ollie作为首批通过SOC 2认证的主流、面向家庭的人工智能服务之一,尤为突出。该认证框架允许企业通过独立审计证明,其已建立正式的控制措施来保护客户数据,并确保系统安全运行。达成这一里
AI LIVE:伦敦将如何探讨人工智能与工业自动化
本次峰会将汇聚来自全球的高管,共同探讨全球各行业面临的紧迫挑战,涵盖从人工智能驱动的颠覆性变革到经济波动等各个方面。AI LIVE:伦敦峰会将以“技术与人类使命”为主题,汇聚2,000余位国际领袖,共同探讨人工智能的新时代。BizClik旗下品牌《AI Magazine》已公布其在“AI LIVE:伦敦峰会”上举办的关于人工智能与工业自动化的联合炉边谈话环节阵容。该专题讨论会定于10月20日在伦敦
相关专题推荐
评论 (2)
0/500
このClaude 4の発表、特にOpusのエージェント性能の向上はすごいね。開発者向けのツールとして、実際のコーディングワークフローにどう組み込まれるのか気になる。他のモデルとの差別化ポイントは何だろう?🤔 競合が激しい分野だけに、具体的なユースケースをもっと見てみたい。
Je suis un peu sceptique sur les annonces de "nouvelle génération" à chaque fois, mais pour le coup, les gains en code et en performance agentique semblent concrets d'après les premiers retours. C'est quand même moins bruyant que les autres 🤔. L'IA pour l'assistance au dev, c'est clairement l'avenir immédiat.
Anthropic推出了Claude 4模型系列,为开发人员打造尖端AI助手和编码解决方案带来了重大进步。该系列包括Claude Opus 4,顶级性能模型,以及Claude Sonnet 4,适用于多种应用的通用模型。
Anthropic对其目标充满信心,强调这些模型旨在“全面提升客户的AI策略”。Opus 4定位于“编码、研究、写作和科学探索”的领导者,而Sonnet 4被描述为“从Sonnet 3.7的重大升级”,为日常任务提供“顶级性能”。
Claude Opus 4:顶级编码模型
Anthropic宣称Claude Opus 4是“迄今为止最先进的模型,也是全球领先的编码模型”,其在SWE-bench上获得72.5%的分数,在Terminal-bench上获得43.2%的分数支持了这一说法。
除了速度,Opus 4在持久性方面表现出色,专为“需要专注努力和数千步骤的长时间任务保持一致性能”而设计。想象一个能够“持续工作数小时”的AI——这是Anthropic的承诺。
这比早期的Sonnet模型有了显著飞跃,可能通过应对需要持续努力的挑战重新定义AI代理的范围。
Claude Sonnet 4:日常使用的多功能AI
虽然Opus 4是旗舰产品,但Claude Sonnet 4作为一个动态的通用模型脱颖而出,在广泛的应用中提供了显著的改进。早期用户的初步反馈非常积极。
例如,GitHub指出,“Claude Sonnet 4在代理场景中表现出色”,他们对其印象深刻,计划“将其作为GitHub Copilot中新编码代理的基础”。这是一个强有力的认可。
技术分析师Manus称赞其“增强的遵循复杂指令、提供清晰推理和生成精美输出的能力”。
iGent报告称,Sonnet 4“在自主多功能应用开发中表现出色,问题解决能力显著提高,导航错误从20%降至几乎为零”。这对开发工作流程来说是一个重大胜利。
Sourcegraph认为这是“软件开发的重大进步,能够更长时间保持专注,更深入理解问题,并交付更干净的代码”。
Augment Code强调“更高的成功率、精确的代码编辑以及对复杂任务的细致处理”,使Sonnet 4成为他们的“首选主要模型”。
混合模式和开发者工具
Claude 4系列的一个突出特点是其双模式能力。Opus 4和Sonnet 4均提供快速任务的快速响应和复杂挑战的深入推理模式。
这种高级推理模式包含在Pro、Max、Team和Enterprise Claude计划中。令人兴奋的是,Sonnet 4的增强推理模式也将对免费用户开放,扩大了高质量AI的访问范围。
Anthropic还通过其API引入了强大的开发者工具,以加速高级AI代理的开发:
- 代码执行工具:使模型能够运行代码,为交互式和问题解决应用开启新的可能性。
- MCP连接器:Anthropic的新标准,用于AI助手和软件环境之间的无缝上下文交换。
- Files API:简化直接文件交互,这是实际任务的关键功能。
- 提示缓存:允许开发者缓存提示长达一小时,提升频繁查询的速度和效率。
在现实世界应用中的顶级性能
Anthropic强调,其“Claude 4模型在SWE-bench Verified基准测试中领先,该基准用于现实世界的软件工程任务”。除了编码,它们还在“推理、多模态能力和代理任务”中表现出色。

尽管有这些进步,Anthropic保持了一致的定价。Claude Opus 4的费用为每百万输入令牌15美元,每百万输出令牌75美元。Claude Sonnet 4是更经济实惠的选择,定价为每百万输入令牌3美元,每百万输出令牌15美元,这对现有用户来说是个好消息。
这两种模型均通过Anthropic API、Amazon Bedrock和Google Cloud的Vertex AI提供,使全球开发者和企业能够无缝整合它们。
Anthropic显然专注于增强AI能力,特别是在复杂编码和自主代理任务方面。凭借这些模型和工具,创新潜力已显著提升。
另见:Jony Ive的OpenAI设备细节浮出水面
在阿姆斯特丹、加利福尼亚和伦敦的AI & Big Data Expo上,从行业专家那里了解更多关于AI和大数据的信息。该活动与Intelligent Automation Conference、BlockX、Digital Transformation Week和Cyber Security & Cloud Expo同期举行。
查看TechForge的其他即将举办的企业技术活动和网络研讨会。
奥利押注隐私保护,力争在AI助手竞争中胜出
要真正发挥帮助作用,人工智能助手必须深刻理解其用户。Ollie 是一款专为日常生活设计的个人助理,其运作理念是:实现这一点无需用户交出数据,也不会损害用户的隐私。虽然某些企业级人工智能工具提供了数据隐私保护措施,但Ollie作为首批通过SOC 2认证的主流、面向家庭的人工智能服务之一,尤为突出。该认证框架允许企业通过独立审计证明,其已建立正式的控制措施来保护客户数据,并确保系统安全运行。达成这一里
AI LIVE:伦敦将如何探讨人工智能与工业自动化
本次峰会将汇聚来自全球的高管,共同探讨全球各行业面临的紧迫挑战,涵盖从人工智能驱动的颠覆性变革到经济波动等各个方面。AI LIVE:伦敦峰会将以“技术与人类使命”为主题,汇聚2,000余位国际领袖,共同探讨人工智能的新时代。BizClik旗下品牌《AI Magazine》已公布其在“AI LIVE:伦敦峰会”上举办的关于人工智能与工业自动化的联合炉边谈话环节阵容。该专题讨论会定于10月20日在伦敦
このClaude 4の発表、特にOpusのエージェント性能の向上はすごいね。開発者向けのツールとして、実際のコーディングワークフローにどう組み込まれるのか気になる。他のモデルとの差別化ポイントは何だろう?🤔 競合が激しい分野だけに、具体的なユースケースをもっと見てみたい。
Je suis un peu sceptique sur les annonces de "nouvelle génération" à chaque fois, mais pour le coup, les gains en code et en performance agentique semblent concrets d'après les premiers retours. C'est quand même moins bruyant que les autres 🤔. L'IA pour l'assistance au dev, c'est clairement l'avenir immédiat.





首页






