选项
首页
新闻
Claude 3.5十四行诗在以Chatgpt为主的AI编码测试中创造性地挣扎

Claude 3.5十四行诗在以Chatgpt为主的AI编码测试中创造性地挣扎

2025-05-04
204

测试Anthropic新款Claude 3.5 Sonnet的能力

上周,我收到Anthropic的电子邮件,宣布Claude 3.5 Sonnet发布。他们宣称它“提升了行业智能标准,在广泛的评估中超越了竞争对手模型和Claude 3 Opus”。他们还声称它非常适合复杂的任务,如代码生成。自然,我必须验证这些说法。

我对各种AI进行了一系列编码测试,你也可以试试。只需访问如何测试AI聊天机器人的编码能力 - 你也可以以获取所有细节。让我们深入探讨Claude 3.5 Sonnet在我的标准测试中的表现,看看它与其他AI如Microsoft Copilot、Meta AI、Meta Code Llama、Google Gemini Advanced和ChatGPT相比如何。

1. 编写WordPress插件

最初,Claude 3.5 Sonnet表现出了很大的潜力。它生成的用户界面令人印象深刻,布局清晰,首次在测试的AI中将数据字段并排放置。

Claude 3.5 Sonnet创建的WordPress插件界面截图David Gewirtz/ZDNET拍摄的截图

引起我注意的是Claude的代码生成方式。它没有像通常那样为PHP、JavaScript和CSS生成单独文件,而是提供了一个自动生成JavaScript和CSS文件的单一PHP文件,放入插件目录。虽然这是一个创新的方法,但有风险,因为它依赖于操作系统设置允许插件写入自己的文件夹——在生产环境中这是一个重大的安全漏洞。

遗憾的是,尽管解决方案很有创意,插件并未正常工作。“随机”按钮毫无反应,鉴于其最初的潜力,这令人失望。

以下是与之前测试的综合结果:

  • Claude 3.5 Sonnet:界面:良好,功能:失败
  • ChatGPT GPT-4o:界面:良好,功能:良好
  • Microsoft Copilot:界面:一般,功能:失败
  • Meta AI:界面:一般,功能:失败
  • Meta Code Llama:完全失败
  • Google Gemini Advanced:界面:良好,功能:失败
  • ChatGPT 4:界面:良好,功能:良好
  • ChatGPT 3.5:界面:良好,功能:良好

2. 重写字符串函数

此测试评估AI在重写代码以满足特定需求(本例中为美元和美分转换)方面的表现。Claude 3.5 Sonnet在去除前导零、正确处理整数和小数以及防止负值方面表现良好。它还智能地对意外输入返回“0”,有助于避免错误。

然而,它未能允许类似“.50”表示50美分的输入,这是需求之一。这意味着修改后的代码在现实场景中无法工作,因此我必须标记为失败。

以下是综合结果:

  • Claude 3.5 Sonnet:失败
  • ChatGPT GPT-4o:成功
  • Microsoft Copilot:失败
  • Meta AI:失败
  • Meta Code Llama:成功
  • Google Gemini Advanced:失败
  • ChatGPT 4:成功
  • ChatGPT 3.5:成功

3. 查找一个烦人的错误

此测试很棘手,因为它要求AI找到一个需要特定WordPress知识的微妙错误。这是我自己错过的错误,最初不得不求助于ChatGPT解决。

Claude 3.5 Sonnet不仅找到并修复了错误,还注意到发布过程中引入的一个错误,我随后进行了更正。这是我发布完整测试集以来测试的AI中的首例。

以下是综合结果:

  • Claude 3.5 Sonnet:成功
  • ChatGPT GPT-4o:成功
  • Microsoft Copilot:失败。非常、热情地、表情丰富地失败。
  • Meta AI:成功
  • Meta Code Llama:失败
  • Google Gemini Advanced:失败
  • ChatGPT 4:成功
  • ChatGPT 3.5:成功

到目前为止,Claude 3.5 Sonnet在三个测试中有两个失败了。让我们看看它在最后一个测试中的表现。

4. 编写脚本

此测试检查AI对专业编程工具如AppleScript和Keyboard Maestro的了解。虽然ChatGPT在这两方面表现出色,但Claude 3.5 Sonnet表现不佳。它编写了一个试图与Chrome交互的AppleScript,但完全忽略了Keyboard Maestro部分。

此外,AppleScript中包含一个语法错误。在尝试使匹配不区分大小写时,Claude生成了一行会导致运行时错误的代码:

if theTab's title contains input ignoring case then

“contains”语句已是不区分大小写,“ignoring case”短语位置错误,导致错误。

以下是综合结果:

  • Claude 3.5 Sonnet:失败
  • ChatGPT GPT-4o:成功但有保留
  • Microsoft Copilot:失败
  • Meta AI:失败
  • Meta Code Llama:失败
  • Google Gemini Advanced:成功
  • ChatGPT 4:成功
  • ChatGPT 3.5:失败

总体结果

以下是Claude 3.5 Sonnet与其他AI的总体表现对比:

  • Claude 3.5 Sonnet:4个中1个成功
  • ChatGPT GPT-4o:4个中4个成功,但有一个奇怪的双重选择答案
  • Microsoft Copilot:4个中0个成功
  • Meta AI:4个中1个成功
  • Meta Code Llama:4个中1个成功
  • Google Gemini Advanced:4个中1个成功
  • ChatGPT 4:4个中4个成功
  • ChatGPT 3.5:4个中3个成功

我对Claude 3.5 Sonnet的表现相当失望。Anthropic承诺它适合编程,但未能达到预期。并非它完全不能编程,只是无法正确编程。我一直希望找到一个能超越ChatGPT的AI,尤其是在这些模型集成到编程环境中时。但目前,我仍会选择ChatGPT来帮助编程,建议你也这样做。

你用过AI进行编程吗?用了哪个,效果如何?请在下方评论中分享你的经验。

在社交媒体上关注我的项目更新,订阅我的每周简讯,并在Twitter/X上通过@DavidGewirtz与我联系,在Facebook上通过Facebook.com/DavidGewirtz,在Instagram上通过Instagram.com/DavidGewirtz,在YouTube上通过YouTube.com/DavidGewirtzTV

相关文章
佛罗里达州就暴力事件起诉 OpenAI 和萨姆·阿尔特曼 佛罗里达州就暴力事件起诉 OpenAI 和萨姆·阿尔特曼 佛罗里达州总检察长于周一提起了一项史无前例的州级诉讼,起诉 OpenAI 及其首席执行官山姆·奥特曼(Sam Altman),指控该公司的 ChatGPT 与多起暴力事件有关。诉讼称,OpenAI 优先考虑赢得“人工智能军备竞赛并积累巨额财富”,而忽视了安全问题。“今天我们宣布了对 OpenAI 及其首席执行官山姆·奥特曼提起的首个全州性诉讼,”佛罗里达州总检察长詹姆斯·乌特迈尔(James Uthmeier)表示。“OpenAI 和奥特曼无视内部和外部的安全警告,使儿童面临巨大风险,并允许
OpenAI 发布了先进的语音模型,旨在实现更自然的实时对话 OpenAI 发布了先进的语音模型,旨在实现更自然的实时对话 OpenAI 推出了两款新的对话模型——GPT-Live-1 和 GPT-Live-1 mini,旨在使对话听起来更自然,并更有效地管理对话轮次。这些全双工模型能够同时说话和聆听,允许用户自然地打断对话,并支持实时翻译等功能。该公司还正在将 GPT-Live-1 mini 作为默认选项,取代 ChatGPT 当前的“高级语音模式”。付费用户将能够使用规模更大的 GPT-Live-1 模型。 此前,
OpenAI 发布了 GPT-5.6,这是其模型系列中的最新成员 OpenAI 发布了 GPT-5.6,这是其模型系列中的最新成员 OpenAI 于周四发布了其最新模型系列,为竞争日益激烈的 AI 领域带来了强大的新选择。GPT-5.6 共有三个版本:Sol(作为主力机型设计)、Terra(中端选项)和 Luna(经济实惠的选择)。这些模型扩展了多个领域的能力,该公司承诺其在企业任务、编程和科学研究方面将表现出色。首席执行官萨姆·奥尔特曼表示,新模型比早期版本效率更高、性价比更优,他近日向CNBC透露,Sol在AI编程任务中的
相关专题推荐
数据分析 适用于 SaaS 和电商团队的 KPI 监控最佳 AI 异常检测工具
适用于 SaaS 和电商团队的 KPI 监控最佳 AI 异常检测工具

2026 年最新最佳顶级评分 AI 异常检测工具,助力 SaaS 和电商团队的 KPI 监控!XIX.AI 基于严格的真实世界测试和每周更新的排名,精心策划了一套强大且颠覆性的工具合集。您将找到详细的免费与付费对比洞察,帮助您识别必须尝试的解决方案,从而提升生产力并释放您的 AI 优势。立即探索!

10 个工具
xix.ai
写作 最适合撰写长篇SEO文章的AI大纲生成器
最适合撰写长篇SEO文章的AI大纲生成器

2026年最新、最受好评的AI大纲生成器,专为长篇SEO文章打造,由XIX.AI精心甄选。这些强大的工具在快速创建高质量内容方面提供了颠覆性的帮助,显著提升了写作效率。 获取免费版与付费版的对比分析,以及实际测试结果和详细排名,助您找到最适合自身需求、不容错过的理想选择。立即探索,解锁您的AI竞争优势。

8 个工具
xix.ai
教育与学习 用于作业和考试备考的AI学习工具
用于作业和考试备考的AI学习工具

2026年最新最佳AI学习工具,助您轻松完成作业和备考!XIX.AI精心筛选出一份广受好评的顶级工具清单,这些功能强大、颠覆传统的工具经过实际测试,能帮助学生提升效率、简化作业流程,并轻松通过考试。 获取免费版与付费版的对比分析、详细排名以及必试选项,释放你的AI优势。立即探索!

10 个工具
xix.ai
音乐创作 面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具
面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具

2026 年最新最佳 AI 人声演示工具,专为词曲创作者、旋律创作者和多语言内容团队打造!XIX.AI 精心整理了一份经过严格真实世界测试的高评分、变革性工具列表。您将找到详细的免费与付费对比数据、全面排名以及必试选项,帮助您提升创作效率并释放创意潜力。立即探索,发现满足您所有内容需求的完美工具!

9 个工具
xix.ai
商业 适合中小企业的最佳AI竞品分析工具
适合中小企业的最佳AI竞品分析工具

2026年最新最佳、评价最高的中小企业AI竞争研究工具!XIX.AI精心精选了一系列功能强大、颠覆行业格局的工具,每周都会根据严格的实际测试和详细排名进行更新。您可以查看全面的免费版与付费版对比,从而找到那些能提升工作效率、助您赢得竞争优势的必试工具。 立即探索,发现最适合您的工具!

9 个工具
xix.ai
图像编辑 用于电商服装、皮肤清洁和色彩一致性的 Photoshop AI 修图工具
用于电商服装、皮肤清洁和色彩一致性的 Photoshop AI 修图工具

2026 年最新最佳 Photoshop AI 修图工具,适用于电商服装、皮肤清洁和色彩一致性!这份顶级精选列表包含强大的变革性解决方案,可帮助您提升写作效率、简化内容创作并轻松实现完美的视觉效果。每个工具都经过实际测试,并通过每周更新的排名进行验证,同时提供免费与付费版本的详细对比。由 XIX.AI 支持,这是任何希望发挥 AI 优势的人必试指南。立即探索!

10 个工具
xix.ai
评论 (11)
0/500
CharlesYoung
CharlesYoung 2025-10-06 22:30:46

Intéressant de voir Claude 3.5 Sonnet avoir du mal avec le codage créatif. Est-ce qu'on attend trop des IA actuellement ? Après tout, l'intelligence humaine reste unique 🤷‍♂️

ScottMitchell
ScottMitchell 2025-05-05 21:17:31

Claude 3.5 Sonnet is pretty good, but it's no match for ChatGPT in coding tests. It's like bringing a knife to a gunfight! 😂 Still, it's an improvement over the last version, so kudos to Anthropic for trying to keep up. Maybe next time, they'll surprise us!

JamesMiller
JamesMiller 2025-05-05 16:59:50

Claude 3.5 Sonnet é bom, mas não chega aos pés do ChatGPT em testes de codificação. É como levar uma faca para uma batalha de armas! 😂 Ainda assim, é uma melhoria em relação à versão anterior, então parabéns à Anthropic por tentar acompanhar. Talvez da próxima vez eles nos surpreendam!

StevenNelson
StevenNelson 2025-05-05 15:23:24

クロード3.5ソネットはコードテストではChatGPTにかなわないですね。まるでナイフを持って銃撃戦に挑むようなものです!😂 でも、前バージョンよりは改善されているので、アントロピックの努力には敬意を表します。次回は驚かせてくれるかも?

JoseDavis
JoseDavis 2025-05-05 14:46:04

Claude 3.5 Sonnet qui galère en codage, c’est un peu décevant vu les promesses d’Anthropic. 😐 ChatGPT garde l’avantage, mais la course à l’IA est fascinante !

HaroldLopez
HaroldLopez 2025-05-05 12:06:54

클로드 3.5 소넷은 코드 테스트에서 ChatGPT에 비해 많이 부족해요. 마치 칼을 들고 총격전에 나서는 느낌이죠! 😂 그래도 이전 버전보다는 나아졌으니, 앤트로픽의 노력에 박수를 보냅니다. 다음에는 놀라게 해줄지 모르겠네요!

OR