选项
首页
新闻
研究发现:实际测试中AI代码的性能被高估了

研究发现:实际测试中AI代码的性能被高估了

2026-05-09
207

METR研究所的研究表明,广泛用于评估人工智能编程能力的SWE-bench Verified基准测试,可能严重高估了人工智能代理在实际软件开发中的表现。该研究发现,被该基准测试标记为“通过”的人工智能生成的代码解决方案中,约有一半在实际项目维护人员进行代码审查时可能会被拒绝,这凸显了自动化评估结果与实际代码质量之间存在巨大差距。

SWE-bench Verified长期以来被视为评估AI辅助软件工程的关键标准,用于测试模型能否解决开源项目中的真实编程任务,并验证代码变更是否通过项目的自动化测试套件。包括Anthropic和OpenAI在内的多家AI公司经常引用该基准测试的结果来展示模型的进步。

QQ20260312-093454.jpg

在这项研究中,METR团队邀请了四位负责维护scikit-learn、Sphinx和pytest等开源项目的资深开发者,对296段AI生成的代码进行人工审查。这些代码样本由五个不同的模型生成:Claude 3.5 Sonnet、Claude 3.7 Sonnet、Claude 4 Opus、Claude 4.5 Sonnet以及GPT-5。 结果显示,维护者实际的代码接受率平均比 SWE-bench 的自动评分低约 24 个百分点——这一差异在统计学上具有显著性。

研究还确定,被拒绝的 AI 代码主要并非源于风格问题,而是存在更实质性的工程缺陷。维护人员将问题归纳为三大类:代码质量未达到项目规范、破坏现有代码结构以及根本性的功能错误。相当一部分案例涉及功能错误,即尽管通过了自动化测试,但代码并未正确解决预期问题。

在模型对比方面,研究发现从Claude 3.5 Sonnet升级至Claude 3.7 Sonnet虽显著提高了基准通过率,但维护人员标记的功能性错误数量也随之增加。 从 Claude 3.7 Sonnet 过渡到 Claude 4 Opus 期间,代码质量问题有所增加,而 Claude 4.5 Sonnet 则在代码质量方面有所改善。相比之下,在此次人工评估中,GPT-5 的整体表现明显逊于 Anthropic 模型系列。

人工智能大脑,大型模型

研究团队还对“任务完成时间”进行了估算分析:根据SWE-bench的自动化评估结果,若要使Claude 4.5 Sonnet以50%的成功率完成任务,需耗费约50分钟的人工时间。然而,根据维护人员的评分,该估算时间仅需约8分钟,这表明基准测试可能将能力高估了多达七倍。

不过,研究人员也强调,这项研究并不意味着AI编程代理的能力存在根本性限制。通过改进提示策略、增加人类反馈或进行多轮迭代,自动化评估与人工审查之间的差距有望缩小。此外,实验设置与实际开发流程存在差异——例如,AI代理仅有一次提交机会,而人类开发者通常可以基于反馈迭代修改代码。

综上所述,该研究得出结论:仅依赖基准测试分数来评估AI编程代理的实际效用可能会引入系统性偏差。随着AI编码模型的快速演进,开发更能反映真实开发环境的评估系统已成为AI软件工程领域的一个关键研究方向。

相关文章
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元 瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元 随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制 Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制 根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
如何修复核心网页指标以获得更好的 SEO 排名 如何修复核心网页指标以获得更好的 SEO 排名 利用 AI 工具简化成绩单评语撰写引言用于生成成绩单评语的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成绩单评语登录 Magic School选择成绩单评语工具为学生定制评语使用 Almanac AI 生成成绩单评语设置课程与评分方案配置评语长度与学生信息使用 Almanac AI 生成评语比较 Magic School 与 Almanac AI设置的便捷性可定制性与课程内容的整合速度与效率使用
相关专题推荐
写作 最适合撰写长篇SEO文章的AI大纲生成器
最适合撰写长篇SEO文章的AI大纲生成器

2026年最新、最受好评的AI大纲生成器,专为长篇SEO文章打造,由XIX.AI精心甄选。这些强大的工具在快速创建高质量内容方面提供了颠覆性的帮助,显著提升了写作效率。 获取免费版与付费版的对比分析,以及实际测试结果和详细排名,助您找到最适合自身需求、不容错过的理想选择。立即探索,解锁您的AI竞争优势。

8 个工具
xix.ai
教育与学习 用于作业和考试备考的AI学习工具
用于作业和考试备考的AI学习工具

2026年最新最佳AI学习工具,助您轻松完成作业和备考!XIX.AI精心筛选出一份广受好评的顶级工具清单,这些功能强大、颠覆传统的工具经过实际测试,能帮助学生提升效率、简化作业流程,并轻松通过考试。 获取免费版与付费版的对比分析、详细排名以及必试选项,释放你的AI优势。立即探索!

10 个工具
xix.ai
音乐创作 面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具
面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具

2026 年最新最佳 AI 人声演示工具,专为词曲创作者、旋律创作者和多语言内容团队打造!XIX.AI 精心整理了一份经过严格真实世界测试的高评分、变革性工具列表。您将找到详细的免费与付费对比数据、全面排名以及必试选项,帮助您提升创作效率并释放创意潜力。立即探索,发现满足您所有内容需求的完美工具!

9 个工具
xix.ai
商业 适合中小企业的最佳AI竞品分析工具
适合中小企业的最佳AI竞品分析工具

2026年最新最佳、评价最高的中小企业AI竞争研究工具!XIX.AI精心精选了一系列功能强大、颠覆行业格局的工具,每周都会根据严格的实际测试和详细排名进行更新。您可以查看全面的免费版与付费版对比,从而找到那些能提升工作效率、助您赢得竞争优势的必试工具。 立即探索,发现最适合您的工具!

9 个工具
xix.ai
图像编辑 用于电商服装、皮肤清洁和色彩一致性的 Photoshop AI 修图工具
用于电商服装、皮肤清洁和色彩一致性的 Photoshop AI 修图工具

2026 年最新最佳 Photoshop AI 修图工具,适用于电商服装、皮肤清洁和色彩一致性!这份顶级精选列表包含强大的变革性解决方案,可帮助您提升写作效率、简化内容创作并轻松实现完美的视觉效果。每个工具都经过实际测试,并通过每周更新的排名进行验证,同时提供免费与付费版本的详细对比。由 XIX.AI 支持,这是任何希望发挥 AI 优势的人必试指南。立即探索!

10 个工具
xix.ai
提示词 适用于 ChatGPT 工作流的最佳 AI 提示词库
适用于 ChatGPT 工作流的最佳 AI 提示词库

2026年最新、最受好评的AI提示词库,可优化各类ChatGPT工作流程。XIX.AI精心整理了一套功能强大、具有颠覆性的提示词库,均经过严格的实际测试,以确保最佳性能。 您可以查看详细的免费版与付费版对比分析以及专家排名,这些内容将帮助您挑选出必试的工具,从而提升工作效率并释放您的AI优势。立即探索!

11 个工具
xix.ai
评论 (2)
0/500
MichaelMartinez
MichaelMartinez 2026-06-28 02:00:18

Interesting findings! I've always suspected those benchmarks were too good to be true. Real-world coding is messy, and it's no surprise that AI agents struggle with edge cases. 😅

GregoryRamirez
GregoryRamirez 2026-05-16 20:00:16

Interessant, aber irgendwie auch nicht überraschend. Benchmarks sind oft zu optimistisch, weil sie in einer kontrollierten Umgebung laufen. In der echten Welt mit Legacy-Code, unklaren Anforderungen und Teamarbeit sieht es dann anders aus. 🤔 Vielleicht sollten wir weniger auf die Marketing-Hypes hören und mehr auf praktische Tests setzen. Wer hat schon Erfahrung mit AI-Coding-Tools im Alltag gemacht?

OR