研究发现:实际测试中AI代码的性能被高估了
METR研究所的研究表明,广泛用于评估人工智能编程能力的SWE-bench Verified基准测试,可能严重高估了人工智能代理在实际软件开发中的表现。该研究发现,被该基准测试标记为“通过”的人工智能生成的代码解决方案中,约有一半在实际项目维护人员进行代码审查时可能会被拒绝,这凸显了自动化评估结果与实际代码质量之间存在巨大差距。
SWE-bench Verified长期以来被视为评估AI辅助软件工程的关键标准,用于测试模型能否解决开源项目中的真实编程任务,并验证代码变更是否通过项目的自动化测试套件。包括Anthropic和OpenAI在内的多家AI公司经常引用该基准测试的结果来展示模型的进步。

在这项研究中,METR团队邀请了四位负责维护scikit-learn、Sphinx和pytest等开源项目的资深开发者,对296段AI生成的代码进行人工审查。这些代码样本由五个不同的模型生成:Claude 3.5 Sonnet、Claude 3.7 Sonnet、Claude 4 Opus、Claude 4.5 Sonnet以及GPT-5。 结果显示,维护者实际的代码接受率平均比 SWE-bench 的自动评分低约 24 个百分点——这一差异在统计学上具有显著性。
研究还确定,被拒绝的 AI 代码主要并非源于风格问题,而是存在更实质性的工程缺陷。维护人员将问题归纳为三大类:代码质量未达到项目规范、破坏现有代码结构以及根本性的功能错误。相当一部分案例涉及功能错误,即尽管通过了自动化测试,但代码并未正确解决预期问题。
在模型对比方面,研究发现从Claude 3.5 Sonnet升级至Claude 3.7 Sonnet虽显著提高了基准通过率,但维护人员标记的功能性错误数量也随之增加。 从 Claude 3.7 Sonnet 过渡到 Claude 4 Opus 期间,代码质量问题有所增加,而 Claude 4.5 Sonnet 则在代码质量方面有所改善。相比之下,在此次人工评估中,GPT-5 的整体表现明显逊于 Anthropic 模型系列。

研究团队还对“任务完成时间”进行了估算分析:根据SWE-bench的自动化评估结果,若要使Claude 4.5 Sonnet以50%的成功率完成任务,需耗费约50分钟的人工时间。然而,根据维护人员的评分,该估算时间仅需约8分钟,这表明基准测试可能将能力高估了多达七倍。
不过,研究人员也强调,这项研究并不意味着AI编程代理的能力存在根本性限制。通过改进提示策略、增加人类反馈或进行多轮迭代,自动化评估与人工审查之间的差距有望缩小。此外,实验设置与实际开发流程存在差异——例如,AI代理仅有一次提交机会,而人类开发者通常可以基于反馈迭代修改代码。
综上所述,该研究得出结论:仅依赖基准测试分数来评估AI编程代理的实际效用可能会引入系统性偏差。随着AI编码模型的快速演进,开发更能反映真实开发环境的评估系统已成为AI软件工程领域的一个关键研究方向。
相关文章
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制
根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
如何修复核心网页指标以获得更好的 SEO 排名
利用 AI 工具简化成绩单评语撰写引言用于生成成绩单评语的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成绩单评语登录 Magic School选择成绩单评语工具为学生定制评语使用 Almanac AI 生成成绩单评语设置课程与评分方案配置评语长度与学生信息使用 Almanac AI 生成评语比较 Magic School 与 Almanac AI设置的便捷性可定制性与课程内容的整合速度与效率使用
相关专题推荐
评论 (2)
0/500
Interesting findings! I've always suspected those benchmarks were too good to be true. Real-world coding is messy, and it's no surprise that AI agents struggle with edge cases. 😅
Interessant, aber irgendwie auch nicht überraschend. Benchmarks sind oft zu optimistisch, weil sie in einer kontrollierten Umgebung laufen. In der echten Welt mit Legacy-Code, unklaren Anforderungen und Teamarbeit sieht es dann anders aus. 🤔 Vielleicht sollten wir weniger auf die Marketing-Hypes hören und mehr auf praktische Tests setzen. Wer hat schon Erfahrung mit AI-Coding-Tools im Alltag gemacht?
METR研究所的研究表明,广泛用于评估人工智能编程能力的SWE-bench Verified基准测试,可能严重高估了人工智能代理在实际软件开发中的表现。该研究发现,被该基准测试标记为“通过”的人工智能生成的代码解决方案中,约有一半在实际项目维护人员进行代码审查时可能会被拒绝,这凸显了自动化评估结果与实际代码质量之间存在巨大差距。
SWE-bench Verified长期以来被视为评估AI辅助软件工程的关键标准,用于测试模型能否解决开源项目中的真实编程任务,并验证代码变更是否通过项目的自动化测试套件。包括Anthropic和OpenAI在内的多家AI公司经常引用该基准测试的结果来展示模型的进步。

在这项研究中,METR团队邀请了四位负责维护scikit-learn、Sphinx和pytest等开源项目的资深开发者,对296段AI生成的代码进行人工审查。这些代码样本由五个不同的模型生成:Claude 3.5 Sonnet、Claude 3.7 Sonnet、Claude 4 Opus、Claude 4.5 Sonnet以及GPT-5。 结果显示,维护者实际的代码接受率平均比 SWE-bench 的自动评分低约 24 个百分点——这一差异在统计学上具有显著性。
研究还确定,被拒绝的 AI 代码主要并非源于风格问题,而是存在更实质性的工程缺陷。维护人员将问题归纳为三大类:代码质量未达到项目规范、破坏现有代码结构以及根本性的功能错误。相当一部分案例涉及功能错误,即尽管通过了自动化测试,但代码并未正确解决预期问题。
在模型对比方面,研究发现从Claude 3.5 Sonnet升级至Claude 3.7 Sonnet虽显著提高了基准通过率,但维护人员标记的功能性错误数量也随之增加。 从 Claude 3.7 Sonnet 过渡到 Claude 4 Opus 期间,代码质量问题有所增加,而 Claude 4.5 Sonnet 则在代码质量方面有所改善。相比之下,在此次人工评估中,GPT-5 的整体表现明显逊于 Anthropic 模型系列。

研究团队还对“任务完成时间”进行了估算分析:根据SWE-bench的自动化评估结果,若要使Claude 4.5 Sonnet以50%的成功率完成任务,需耗费约50分钟的人工时间。然而,根据维护人员的评分,该估算时间仅需约8分钟,这表明基准测试可能将能力高估了多达七倍。
不过,研究人员也强调,这项研究并不意味着AI编程代理的能力存在根本性限制。通过改进提示策略、增加人类反馈或进行多轮迭代,自动化评估与人工审查之间的差距有望缩小。此外,实验设置与实际开发流程存在差异——例如,AI代理仅有一次提交机会,而人类开发者通常可以基于反馈迭代修改代码。
综上所述,该研究得出结论:仅依赖基准测试分数来评估AI编程代理的实际效用可能会引入系统性偏差。随着AI编码模型的快速演进,开发更能反映真实开发环境的评估系统已成为AI软件工程领域的一个关键研究方向。
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
如何修复核心网页指标以获得更好的 SEO 排名
利用 AI 工具简化成绩单评语撰写引言用于生成成绩单评语的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成绩单评语登录 Magic School选择成绩单评语工具为学生定制评语使用 Almanac AI 生成成绩单评语设置课程与评分方案配置评语长度与学生信息使用 Almanac AI 生成评语比较 Magic School 与 Almanac AI设置的便捷性可定制性与课程内容的整合速度与效率使用
Interesting findings! I've always suspected those benchmarks were too good to be true. Real-world coding is messy, and it's no surprise that AI agents struggle with edge cases. 😅
Interessant, aber irgendwie auch nicht überraschend. Benchmarks sind oft zu optimistisch, weil sie in einer kontrollierten Umgebung laufen. In der echten Welt mit Legacy-Code, unklaren Anforderungen und Teamarbeit sieht es dann anders aus. 🤔 Vielleicht sollten wir weniger auf die Marketing-Hypes hören und mehr auf praktische Tests setzen. Wer hat schon Erfahrung mit AI-Coding-Tools im Alltag gemacht?





首页






