Anthropic的最新Claude模型成为潜在的AI领导者:这是如何测试它的方法
Anthropic的最新AI模型,Claude 3.7 Sonnet,以其更长时间、更深入的“思考”能力掀起波澜,为用户提供更细致入微的查询处理方式。此模型不仅是升级,而是AI世界的变革者,融合即时响应与扩展思考能力,满足广泛需求。
Claude 3.7 Sonnet引入混合推理模型,可在普通模式下提供快速简洁的回答,在扩展模式下进行更深入的分析。这种灵活性使其适用于从日常问题到复杂数学和编码挑战的各种场景。若你正在进行编码项目或需解决棘手的数学问题,切换到扩展模式可提供详细解决方案,包含逐步说明。
成本与可访问性
Claude 3.7 Sonnet的基础功能对所有用户开放,但使用扩展模式需订阅Pro或Team计划。这是一项投资,但对于需要额外处理能力的用户来说,值得一试。你可通过Claude网站或开发者API访问此模式,适用于个人和专业用途。
性能与测试
在早期测试中,Claude 3.7 Sonnet表现出显著改进,尤其在处理复杂代码库和高级工具方面。用户成功使用它从零开始构建复杂的Web应用和仪表板,这些任务之前曾难倒其他模型。新模型生成更少错误的量产代码,证明了其增强能力。
在与OpenAI的o1等竞争对手的测试中,Claude 3.7 Sonnet在涉及代理工具和软件工程的测试中脱颖而出。Anthropic将推理能力整合到单一模型而非分散到不同模型的做法,使Claude与众不同,创造更无缝的用户体验。
如何使用Claude 3.7 Sonnet
若你是Pro或Team订阅者,可通过访问网站,从模型下拉菜单选择Claude 3.7 Sonnet,并将思考模式切换到扩展模式,体验Claude的扩展模式。无论你要求Claude创建比较不同AI模型的网页还是解决复杂数学问题,你都能看到过程的每一步。请注意,Claude的知识仅更新至2024年10月,之后实时事件无法知晓。
对于不太复杂的任务,使用普通模式可获得更快、更简洁的回答。关键是选择适合任务的工具。
开发者Claude Code
开发者可使用Claude Code这一命令行工具进行代理编码,目前为有限研究预览版。Claude Code允许开发者直接从终端分配复杂工程任务。它可搜索和读取代码、编辑文件、运行测试,甚至将代码提交并推送至GitHub。早期测试显示,Claude Code能一次性完成原本需超过45分钟手动劳动的任务。
未来几周,Anthropic计划增加功能,如提升工具调用可靠性、支持长时间运行命令、改进应用内渲染。想尝试Claude Code的开发者可在Overview网站加入候补名单,其反馈将帮助塑造工具的未来发展。

Lance Whitney/ZDNET截图
相关文章
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制
根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
相关专题推荐
评论 (2)
0/500
Interesting! The 'extended thinking' feature sounds like it could really help with complex tasks, but I wonder how it impacts response time in real-time applications. The AI race is getting wild – feels like every month there's a new 'game-changer' 😅 Still, keen to see how this stacks up against GPT-4o for my coding projects.
Anthropic的最新AI模型,Claude 3.7 Sonnet,以其更长时间、更深入的“思考”能力掀起波澜,为用户提供更细致入微的查询处理方式。此模型不仅是升级,而是AI世界的变革者,融合即时响应与扩展思考能力,满足广泛需求。
Claude 3.7 Sonnet引入混合推理模型,可在普通模式下提供快速简洁的回答,在扩展模式下进行更深入的分析。这种灵活性使其适用于从日常问题到复杂数学和编码挑战的各种场景。若你正在进行编码项目或需解决棘手的数学问题,切换到扩展模式可提供详细解决方案,包含逐步说明。
成本与可访问性
Claude 3.7 Sonnet的基础功能对所有用户开放,但使用扩展模式需订阅Pro或Team计划。这是一项投资,但对于需要额外处理能力的用户来说,值得一试。你可通过Claude网站或开发者API访问此模式,适用于个人和专业用途。
性能与测试
在早期测试中,Claude 3.7 Sonnet表现出显著改进,尤其在处理复杂代码库和高级工具方面。用户成功使用它从零开始构建复杂的Web应用和仪表板,这些任务之前曾难倒其他模型。新模型生成更少错误的量产代码,证明了其增强能力。
在与OpenAI的o1等竞争对手的测试中,Claude 3.7 Sonnet在涉及代理工具和软件工程的测试中脱颖而出。Anthropic将推理能力整合到单一模型而非分散到不同模型的做法,使Claude与众不同,创造更无缝的用户体验。
如何使用Claude 3.7 Sonnet
若你是Pro或Team订阅者,可通过访问网站,从模型下拉菜单选择Claude 3.7 Sonnet,并将思考模式切换到扩展模式,体验Claude的扩展模式。无论你要求Claude创建比较不同AI模型的网页还是解决复杂数学问题,你都能看到过程的每一步。请注意,Claude的知识仅更新至2024年10月,之后实时事件无法知晓。
对于不太复杂的任务,使用普通模式可获得更快、更简洁的回答。关键是选择适合任务的工具。
开发者Claude Code
开发者可使用Claude Code这一命令行工具进行代理编码,目前为有限研究预览版。Claude Code允许开发者直接从终端分配复杂工程任务。它可搜索和读取代码、编辑文件、运行测试,甚至将代码提交并推送至GitHub。早期测试显示,Claude Code能一次性完成原本需超过45分钟手动劳动的任务。
未来几周,Anthropic计划增加功能,如提升工具调用可靠性、支持长时间运行命令、改进应用内渲染。想尝试Claude Code的开发者可在Overview网站加入候补名单,其反馈将帮助塑造工具的未来发展。
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
Interesting! The 'extended thinking' feature sounds like it could really help with complex tasks, but I wonder how it impacts response time in real-time applications. The AI race is getting wild – feels like every month there's a new 'game-changer' 😅 Still, keen to see how this stacks up against GPT-4o for my coding projects.





首页






