选项
首页
新闻
我将gpt -4O通过编码测试进行了,它使它们呈现 - 除了一个奇怪的结果

我将gpt -4O通过编码测试进行了,它使它们呈现 - 除了一个奇怪的结果

2025-04-17
173

我将gpt -4O通过编码测试进行了,它使它们呈现 - 除了一个奇怪的结果

如果你一直在关注科技界,你可能已经知道OpenAI刚刚发布了其最新的大型语言模型GPT-4o,其中“o”代表“omni”。这个新模型承诺在文本、图形和语音方面具有多功能性,我迫不及待地想用我的标准编码测试集来检验它的能力。这些测试已经针对多种AI模型进行了运行,得出了一些非常有趣的结果。坚持看到最后,因为有一个你不想错过的转折。

如果你有兴趣进行自己的实验,请查看这个指南:如何测试AI聊天机器人的编码能力 - 你也可以。它概述了我使用的所有测试,以及它们如何工作和结果中需要关注的内容的详细解释。

现在,让我们深入探讨每个测试的结果,看看GPT-4o与之前的竞争者如Microsoft Copilot、Meta AI、Meta Code Llama、Google Gemini Advanced以及早期版本的ChatGPT相比表现如何。

1. 编写WordPress插件

以下是GPT-4o用户界面的一瞥:

有趣的是,GPT-4o自行决定包含一个JavaScript文件,该文件动态更新两个字段中的行数。虽然提示中没有明确排除JavaScript,但这种创造性的方法出乎意料且有效。JavaScript还增强了Randomize按钮的功能,允许在不刷新整个页面的情况下生成多个结果集。

行排列正确,重复项按照规格适当分开。这是一段扎实的代码,只有一个小问题:Randomize按钮没有单独放在一行上,尽管我在提示中没有明确要求这一点,所以不扣分。

以下是本次及之前测试的综合结果:

  • ChatGPT GPT-4o:界面:良好,功能:良好
  • Microsoft Copilot:界面:合格,功能:失败
  • Meta AI:界面:合格,功能:失败
  • Meta Code Llama:完全失败
  • Google Gemini Advanced:界面:良好,功能:失败
  • ChatGPT 4:界面:良好,功能:良好
  • ChatGPT 3.5:界面:良好,功能:良好

2. 重写字符串函数

此测试评估模型处理美元和美分转换的能力。GPT-4o成功重写了代码,以拒绝可能导致后续行问题的输入,确保仅处理有效的美元和美分值。

我有点失望的是,它没有自动为像.75这样的值添加前导零,转换为0.75。然而,由于我没有明确要求此功能,这不是AI的错。这提醒我们,即使AI提供了功能性代码,你可能仍需优化提示以获得你所需的确切结果。

以下是本次及之前测试的综合结果:

  • ChatGPT GPT-4o:成功
  • Microsoft Copilot:失败
  • Meta AI:失败
  • Meta Code Llama:成功
  • Google Gemini Advanced:失败
  • ChatGPT 4:成功
  • ChatGPT 3.5:成功

3. 查找一个烦人的错误

此测试很有趣,因为解决方案并非一目了然。我在自己的编码中最初被这个错误难住了,所以我向第一个ChatGPT模型求助。它立即找到了错误,当时真是令人震惊。

相比之下,我测试的其他三个大型语言模型错过了这个问题中的误导。错误信息指向代码的某一部分,但实际问题出在别处,需要深入了解WordPress框架才能识别。

幸运的是,GPT-4o正确识别了问题并准确描述了修复方法。

以下是本次及之前测试的综合结果:

  • ChatGPT GPT-4o:成功
  • Microsoft Copilot:失败。极其失败。热情失败。表情符号失败。
  • Meta AI:成功
  • Meta Code Llama:失败
  • Google Gemini Advanced:失败
  • ChatGPT 4:成功
  • ChatGPT 3.5:成功

到目前为止,GPT-4o三战三胜。让我们看看它在最后测试中的表现。

4. 编写脚本

针对此测试,GPT-4o实际上提供了超出我要求的内容。测试涉及使用鲜为人知的Mac脚本工具Keyboard Maestro、Apple的AppleScript和Chrome脚本行为。顺便说一句,Keyboard Maestro对我来说是个游戏改变者,它能够重新编程操作系统和应用程序,使Mac成为我的生产力首选。

要通过测试,AI需要正确概述一个使用Keyboard Maestro代码、AppleScript和Chrome API功能的组合解决方案。

令人惊讶的是,GPT-4o给了我两个不同版本:

两个版本都正确与Keyboard Maestro交互,但它们在处理大小写敏感性上有所不同。左侧版本不正确,因为AppleScript不支持“as lowercase”。右侧版本使用“contains”且不区分大小写,运行良好。

我谨慎地给GPT-4o通过,因为它确实提供了可用的代码。然而,返回两个选项,其中一个不正确,让我需要额外工作来评估和选择正确的一个。这可能与我自己编写代码一样耗时。

以下是本次及之前测试的综合结果:

  • ChatGPT GPT-4o:成功,但有保留
  • Microsoft Copilot:失败
  • Meta AI:失败
  • Meta Code Llama:失败
  • Google Gemini Advanced:成功
  • ChatGPT 4:成功
  • ChatGPT 3.5:失败

总体结果

以下是所有模型在四个测试中的表现:

  • ChatGPT GPT-4o:4个测试全部成功,但有一个奇怪的双选答案
  • Microsoft Copilot:4个测试全部失败
  • Meta AI:4个测试中1个成功
  • Meta Code Llama:4个测试中1个成功
  • Google Gemini Advanced:4个测试中1个成功
  • ChatGPT 4:4个测试全部成功
  • ChatGPT 3.5:4个测试中3个成功

到目前为止,ChatGPT一直是我的编码助手首选。它总是能交付(除了偶尔失误)。其他AI在我的测试中大多表现不佳。但GPT-4o在最后一个双答案回应中给了我一个意外的难题。这让我质疑这个模型内部发生了什么,导致了这样的小问题。

尽管如此,GPT-4o仍是我的编码测试中的最佳表现者,所以我可能会继续使用它并更熟悉它的特性。或者,我可能会回退到ChatGPT Plus中的GPT-3.5或GPT-4。请继续关注;下次ChatGPT更新其模型时,我肯定会重新运行这些测试,看看它能否在所有四个测试中始终选择正确答案。

你有否尝试过用这些AI模型进行编码?你的体验如何?请在下面的评论中告诉我们。

相关文章
字节跳动旗下 Seed 启动全球校园招聘,以虚拟股份争夺顶尖大模型人才 字节跳动旗下 Seed 启动全球校园招聘,以虚拟股份争夺顶尖大模型人才 在大型语言模型的竞争格局中,争夺顶尖人才仍然是最关键的战略资产。4月1日,字节跳动宣布启动Seed全球校园招聘计划,作为其大模型人才培养项目的一部分。该活动面向2027届毕业生及现有实习生,旨在全球范围内发掘并锁定AI领域的精英研发与工程人才。规模扩张:全球甄选100名“AI种子”在技术快速进步的背景下,字节跳动有限公司今年大幅增加了对基础AI人才的投入:招聘范围: 该计划旨在从全球范围内招聘约100名专注于大模型的杰出候选人,对象为2027届毕业生。发展路径: Seed计划将核心业务
Suno 在法律诉讼中为歌曲添加水印 Suno 在法律诉讼中为歌曲添加水印 Suno,这个允许用户生成由人工智能创作的音乐的平台,近日推出了新功能,包括为平台制作的曲目添加标签、限制下载,并更新社区标准以遏制未经授权的复制品。这些更新是在Suno面临多家唱片公司和艺术家组织提起的多起诉讼之际推出的。在博客文章中,联合创始人兼首席执行官Mikey Shulman概述了核心原则,强调该平台旨在促进原创创作,同时扩大更广泛受众对人工智能音乐工具的访问权限。一个主要的争议点在于,用户将人工智能生成的歌曲上传到其他流媒体服务并通过操纵系统获取收入。Suno表示,现在将采用音频
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据 马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据 埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码
相关专题推荐
设计与艺术 适用于角色设定表、灵感板和项目提案演示文稿的 AI 视觉风格参考工具
适用于角色设定表、灵感板和项目提案演示文稿的 AI 视觉风格参考工具

2026年最新最佳AI视觉风格参考工具(适用于角色设定图、灵感板和项目提案)现已登陆XIX.AI!这份精心筛选的高评分清单汇集了经过严格实战测试、功能强大且能彻底改变游戏规则的工具。 您将在此找到免费版与付费版的对比分析、详细排名以及不容错过的精选工具,助您激发创意并优化工作流程。立即探索,发现能有效提升工作效率的理想工具!

11 个工具
xix.ai
搜索引擎优化 最适合制定搜索策略的AI搜索结果页面(SERP)分析工具
最适合制定搜索策略的AI搜索结果页面(SERP)分析工具

2026年最新、最受欢迎且评价最高的人工智能搜索结果页面(SERP)分析工具,均由XIX.AI通过严格的实际测试精心筛选,并每周更新排名。这些强大的工具可助您发掘隐藏的优化机会、提升内容表现,并在搜索领域获得竞争优势。立即寻找最适合您的工具,提升您的搜索策略。现在就来探索吧!

13 个工具
xix.ai
数据分析 适用于 SaaS 和电商团队的 KPI 监控最佳 AI 异常检测工具
适用于 SaaS 和电商团队的 KPI 监控最佳 AI 异常检测工具

2026 年最新最佳顶级评分 AI 异常检测工具,助力 SaaS 和电商团队的 KPI 监控!XIX.AI 基于严格的真实世界测试和每周更新的排名,精心策划了一套强大且颠覆性的工具合集。您将找到详细的免费与付费对比洞察,帮助您识别必须尝试的解决方案,从而提升生产力并释放您的 AI 优势。立即探索!

10 个工具
xix.ai
写作 最适合撰写长篇SEO文章的AI大纲生成器
最适合撰写长篇SEO文章的AI大纲生成器

2026年最新、最受好评的AI大纲生成器,专为长篇SEO文章打造,由XIX.AI精心甄选。这些强大的工具在快速创建高质量内容方面提供了颠覆性的帮助,显著提升了写作效率。 获取免费版与付费版的对比分析,以及实际测试结果和详细排名,助您找到最适合自身需求、不容错过的理想选择。立即探索,解锁您的AI竞争优势。

8 个工具
xix.ai
教育与学习 用于作业和考试备考的AI学习工具
用于作业和考试备考的AI学习工具

2026年最新最佳AI学习工具,助您轻松完成作业和备考!XIX.AI精心筛选出一份广受好评的顶级工具清单,这些功能强大、颠覆传统的工具经过实际测试,能帮助学生提升效率、简化作业流程,并轻松通过考试。 获取免费版与付费版的对比分析、详细排名以及必试选项,释放你的AI优势。立即探索!

10 个工具
xix.ai
音乐创作 面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具
面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具

2026 年最新最佳 AI 人声演示工具,专为词曲创作者、旋律创作者和多语言内容团队打造!XIX.AI 精心整理了一份经过严格真实世界测试的高评分、变革性工具列表。您将找到详细的免费与付费对比数据、全面排名以及必试选项,帮助您提升创作效率并释放创意潜力。立即探索,发现满足您所有内容需求的完美工具!

9 个工具
xix.ai
评论 (22)
0/500
RoyMartínez
RoyMartínez 2026-05-01 10:01:09

GPT-4o klingt beeindruckend, aber diese 'eine seltsame Ausnahme' macht mich neugierig. Was war das für ein seltsames Ergebnis? Vielleicht ein Hinweis darauf, dass KI bei bestimmten Logikaufgaben immer noch überraschend 'menschlich' scheitern kann? 🤔 Die Omni-Fähigkeiten sind cool, aber ich frage mich, wie stabil die Performance in allen Modi wirklich ist.

PaulYoung
PaulYoung 2026-03-15 08:00:58

Bon article ! Les tests de programmation sont toujours révélateurs. Je me demande s’il y a des biais selon les langages utilisés pour l'entraînement… Ou peut-être que c’est lié à la façon dont la requête est formulée ? 🤔

JonathanAllen
JonathanAllen 2025-04-26 19:46:22

GPT-4o é impressionante, passando na maioria dos meus testes de codificação! Mas aquele resultado estranho me deixou confuso. Ainda assim, é versátil em texto, gráficos e voz. Se ao menos pudesse explicar aquele resultado estranho, seria perfeito! 🤔

WillHarris
WillHarris 2025-04-26 02:21:39

GPT-4o thật ấn tượng, vượt qua hầu hết các bài kiểm tra mã hóa của tôi! Nhưng kết quả lạ đó làm tôi bối rối. Tuy nhiên, nó rất linh hoạt trong văn bản, đồ họa và giọng nói. Giá mà nó có thể giải thích kết quả lạ đó, thì sẽ hoàn hảo! 🤔

DonaldGonzález
DonaldGonzález 2025-04-24 19:41:59

GPT-4oは私のコードテストのほとんどを完璧にこなすので感動しました!しかし、その一つの奇妙な結果が気になりました。それでも、テキスト、グラフィック、音声での多様性は素晴らしいです。あの奇妙な結果を説明できれば完璧だったのに!🤔

JustinAnderson
JustinAnderson 2025-04-23 13:12:28

¡El GPT-4o me impresionó con sus habilidades de codificación! Pasó todos mis tests excepto por un resultado extraño que me dejó pensando. Su versatilidad en texto, gráficos y voz es genial! Pero ese fallo, hay que arreglarlo, OpenAI! 😎

OR