Cursor Composer 2 与 Claude Opus 4.6:基准测试引发新一轮人工智能编程争论
3月19日,Cursor正式发布了其自主研发的编程模型Composer 2。 这一消息在开发者社区中立即引发热议——据 Cursor 称,Composer 2 在 Terminal-Bench 2.0 测试中获得了 61.7% 的得分,在相同的测试条件下,这一成绩显著超过了 Claude Opus 4.6 的 58.0%。
Anthropic的旗舰模型竟被自家IDE内置的模型超越?随着消息传开,相关争论迅速涌现。

三项关键基准测试结果
Cursor 发布了三组基准测试结果,均已公开:
Terminal-Bench 2.0(代理式终端编码任务):Composer 2 得分 61.7%,超越了 Claude Opus 4.6 的 58.0%。 不过,OpenAI GPT-5.4仍以75.1%的成绩保持领先。CursorBench(Cursor内的真实编程场景): Composer 2 达到 61.3%,较前代 Composer 1.5 的 44.2% 大幅跃升,同时也高于 Claude Opus 4.6 的 58.2%。SWE-bench 多语言(多语言软件工程): Composer 2 取得 73.7% 的成绩,较其前代产品有显著提升。不过,有一点值得注意:Anthropic此前曾报告称,在优化设置下,Claude Opus 4.6在Terminal-Bench 2.0上的得分达到65.4%,远高于Cursor引用的58.0%。 这种差异源于测试框架——Cursor使用了Harbor等第三方代理环境,并取五次运行结果的平均值,而Anthropic的数据则来自其自身的优化配置。由于采用的参考系统不同,这两组数据无法直接比较。 Cursor并未回避这一问题;其公告中明确指出“结果取决于智能体、测试框架和设置”。
成本仅为Opus 4.6的十分之一
性价比才是 Composer 2 真正的隐形优势。
其定价为每百万输入/输出令牌 0.50 美元/2.50 美元,相比之下,Claude Opus 4.6 的定价为 5 美元/25 美元,GPT-5.4 为 2.5 美元/15 美元,两者形成鲜明对比。 Cursor 解释称,Composer 2 是专为长周期编码任务从零开始构建的,利用其专有的强化学习(RL)训练和“自我摘要”技术,同时降低了延迟和成本——他们将其描述为“前沿智能 + 极致速度”。
Composer 2 是 Cursor 的第三款自研模型,继 Composer 1(2025 年 10 月)和 1.5 版(2026 年 2 月)之后推出。此次发布重点强调“长周期任务”,并将一个更快、更轻量级的变体设为 Cursor IDE 中的默认模型。
“浴火重生”的深层含义
Cursor 决定将其模型与 Opus 4.6 直接对比,这标志着更广泛的人工智能编码工具格局正在发生转变。
OpenAI 和 Anthropic 在通用前沿能力上展开竞争,而像 Cursor 这样的垂直工具提供商则另辟蹊径:将特定任务的性能打磨到卓越水平,进而利用价格优势脱颖而出。 VentureBeat 和 The New Stack 等媒体指出,Composer 2 将加速“多模型路由”的实际落地——即使用 Opus 或 GPT 进行复杂推理,而将 Composer 2 用于日常高频编码,从而兼得两者的优势。
Claude Opus 4.6 于 2 月 5 日发布,并在 Terminal-Bench 2.0、Humanity's Last Exam 和 GDPval-AA 等多个基准测试中名列前茅。Cursor 的新测试结果至少对该模型在专业编码领域的统治地位提出了质疑。
目前开发者的反响大多积极,但许多人表示希望先观察其在实际项目中的表现再下结论——这是一种合理的态度,毕竟基准测试终究只是基准测试。Cursor 已向订阅用户开放了在 IDE 内免费试用 Composer 2 的权限。
数据来源:Cursor官方公告及主流科技媒体,截至2026年3月20日。最新排名可访问tbench.ai或Cursor官网查看。
相关文章
字节跳动加大核心AI激励,豆包增长14.6%
字节跳动近日召开豆包股权说明会,公布面向豆包部门员工的最新激励政策。豆包股票的行权价已从2026年6月的14.85美元上调至17.02美元,涨幅约为14.6%。此次调整不仅提升了豆包股票的估值,还大幅扩大了其覆盖范围。根据员工岗位的不同,部分员工可能获得相当于其总薪酬约5%的豆包股票。根据新的兑换机制,字节跳动允许员工在整体薪酬包中,将部分现金工资兑换为豆包股权。兑换比例因职级而异,设有20%和30%等不同档位。例如,L2和L3级员工可选择20%的全覆盖兑换比例,而L3和L4级员工的该比例可
MiniMax 推出 10 倍团队计划,以激励全球 AI 专家
MiniMax(稀宇科技)通用人工智能实验室正式推出“10x Team”,这是一项全球人才协作计划。该计划旨在招募跨行业的顶尖专家,探索大模型在垂直领域的深度应用。通过将深厚的行业知识与前沿人工智能技术相结合,MiniMax 致力于将大模型的生产力从通用场景拓展至专业场景,最终推动行业效率实现“十倍增长”。验证行业认知价值,开放多模态核心资源过去与行业专家的合作表明,深厚的专业洞察对于构建高质量、实用的行业专属大模型至关重要。在此基础上,“10x Team”计划将向合作伙伴开放包括多模态模型
韩国启动国家人工智能计算中心建设,投资2.5万亿韩元,目标2028年完成
韩国媒体EtNews报道,韩国AI计算中心(KOACC)的奠基仪式于8月3日在全罗南道顺天市的Solar City数据中心园区举行。该项目总投资额为2.5万亿韩元(约合118.38亿元人民币),计划于2028年投入运营,成为迄今为止韩国在AI基础设施领域规模最大的国家投资之一。该项目的股权分布凸显了深化政企合作的战略意图。三星SDS作为最大股东持有30%的股份,而包括科学技术信息通信部、金融监督院和国家成长基金在内的公共实体合计持有29%的股份。NAVER Cloud紧随其后,持股26.1%,
相关专题推荐
评论 (0)
0/500
3月19日,Cursor正式发布了其自主研发的编程模型Composer 2。 这一消息在开发者社区中立即引发热议——据 Cursor 称,Composer 2 在 Terminal-Bench 2.0 测试中获得了 61.7% 的得分,在相同的测试条件下,这一成绩显著超过了 Claude Opus 4.6 的 58.0%。
Anthropic的旗舰模型竟被自家IDE内置的模型超越?随着消息传开,相关争论迅速涌现。

三项关键基准测试结果
Cursor 发布了三组基准测试结果,均已公开:
Terminal-Bench 2.0(代理式终端编码任务):Composer 2 得分 61.7%,超越了 Claude Opus 4.6 的 58.0%。 不过,OpenAI GPT-5.4仍以75.1%的成绩保持领先。CursorBench(Cursor内的真实编程场景): Composer 2 达到 61.3%,较前代 Composer 1.5 的 44.2% 大幅跃升,同时也高于 Claude Opus 4.6 的 58.2%。SWE-bench 多语言(多语言软件工程): Composer 2 取得 73.7% 的成绩,较其前代产品有显著提升。不过,有一点值得注意:Anthropic此前曾报告称,在优化设置下,Claude Opus 4.6在Terminal-Bench 2.0上的得分达到65.4%,远高于Cursor引用的58.0%。 这种差异源于测试框架——Cursor使用了Harbor等第三方代理环境,并取五次运行结果的平均值,而Anthropic的数据则来自其自身的优化配置。由于采用的参考系统不同,这两组数据无法直接比较。 Cursor并未回避这一问题;其公告中明确指出“结果取决于智能体、测试框架和设置”。
成本仅为Opus 4.6的十分之一
性价比才是 Composer 2 真正的隐形优势。
其定价为每百万输入/输出令牌 0.50 美元/2.50 美元,相比之下,Claude Opus 4.6 的定价为 5 美元/25 美元,GPT-5.4 为 2.5 美元/15 美元,两者形成鲜明对比。 Cursor 解释称,Composer 2 是专为长周期编码任务从零开始构建的,利用其专有的强化学习(RL)训练和“自我摘要”技术,同时降低了延迟和成本——他们将其描述为“前沿智能 + 极致速度”。
Composer 2 是 Cursor 的第三款自研模型,继 Composer 1(2025 年 10 月)和 1.5 版(2026 年 2 月)之后推出。此次发布重点强调“长周期任务”,并将一个更快、更轻量级的变体设为 Cursor IDE 中的默认模型。
“浴火重生”的深层含义
Cursor 决定将其模型与 Opus 4.6 直接对比,这标志着更广泛的人工智能编码工具格局正在发生转变。
OpenAI 和 Anthropic 在通用前沿能力上展开竞争,而像 Cursor 这样的垂直工具提供商则另辟蹊径:将特定任务的性能打磨到卓越水平,进而利用价格优势脱颖而出。 VentureBeat 和 The New Stack 等媒体指出,Composer 2 将加速“多模型路由”的实际落地——即使用 Opus 或 GPT 进行复杂推理,而将 Composer 2 用于日常高频编码,从而兼得两者的优势。
Claude Opus 4.6 于 2 月 5 日发布,并在 Terminal-Bench 2.0、Humanity's Last Exam 和 GDPval-AA 等多个基准测试中名列前茅。Cursor 的新测试结果至少对该模型在专业编码领域的统治地位提出了质疑。
目前开发者的反响大多积极,但许多人表示希望先观察其在实际项目中的表现再下结论——这是一种合理的态度,毕竟基准测试终究只是基准测试。Cursor 已向订阅用户开放了在 IDE 内免费试用 Composer 2 的权限。
数据来源:Cursor官方公告及主流科技媒体,截至2026年3月20日。最新排名可访问tbench.ai或Cursor官网查看。
字节跳动加大核心AI激励,豆包增长14.6%
字节跳动近日召开豆包股权说明会,公布面向豆包部门员工的最新激励政策。豆包股票的行权价已从2026年6月的14.85美元上调至17.02美元,涨幅约为14.6%。此次调整不仅提升了豆包股票的估值,还大幅扩大了其覆盖范围。根据员工岗位的不同,部分员工可能获得相当于其总薪酬约5%的豆包股票。根据新的兑换机制,字节跳动允许员工在整体薪酬包中,将部分现金工资兑换为豆包股权。兑换比例因职级而异,设有20%和30%等不同档位。例如,L2和L3级员工可选择20%的全覆盖兑换比例,而L3和L4级员工的该比例可
MiniMax 推出 10 倍团队计划,以激励全球 AI 专家
MiniMax(稀宇科技)通用人工智能实验室正式推出“10x Team”,这是一项全球人才协作计划。该计划旨在招募跨行业的顶尖专家,探索大模型在垂直领域的深度应用。通过将深厚的行业知识与前沿人工智能技术相结合,MiniMax 致力于将大模型的生产力从通用场景拓展至专业场景,最终推动行业效率实现“十倍增长”。验证行业认知价值,开放多模态核心资源过去与行业专家的合作表明,深厚的专业洞察对于构建高质量、实用的行业专属大模型至关重要。在此基础上,“10x Team”计划将向合作伙伴开放包括多模态模型
韩国启动国家人工智能计算中心建设,投资2.5万亿韩元,目标2028年完成
韩国媒体EtNews报道,韩国AI计算中心(KOACC)的奠基仪式于8月3日在全罗南道顺天市的Solar City数据中心园区举行。该项目总投资额为2.5万亿韩元(约合118.38亿元人民币),计划于2028年投入运营,成为迄今为止韩国在AI基础设施领域规模最大的国家投资之一。该项目的股权分布凸显了深化政企合作的战略意图。三星SDS作为最大股东持有30%的股份,而包括科学技术信息通信部、金融监督院和国家成长基金在内的公共实体合计持有29%的股份。NAVER Cloud紧随其后,持股26.1%,





首页






