我將gpt -4O通過編碼測試進行了,它使它們呈現 - 除了一個奇怪的結果

如果你有在關注科技圈,你可能已經知道 OpenAI 剛剛推出了最新的大型語言模型 GPT-4o,其中「o」代表「omni」。這個新模型承諾在文字、圖形和語音方面具有多功能性,我迫不及待地想用我的標準編碼測試來檢驗它的表現。這些測試已經針對眾多 AI 模型進行過,結果相當引人入勝。請跟著我看到最後,因為有個你不想錯過的轉折。
如果你有興趣進行自己的實驗,請參閱此指南:如何測試 AI 聊天機器人的編碼能力 - 你也可以。它詳細列出了我使用的所有測試,並解釋它們的運作方式以及結果中需要注意的事項。
現在,讓我們來看看每個測試的結果,並比較 GPT-4o 與之前的競爭者如 Microsoft Copilot、Meta AI、Meta Code Llama、Google Gemini Advanced 以及早期版本的 ChatGPT 的表現。
1. 撰寫 WordPress 插件
以下是 GPT-4o 的用戶界面一瞥:
有趣的是,GPT-4o 主動加入了一個 JavaScript 文件,動態更新兩個欄位的行數。雖然提示中未明確排除 JavaScript,但這種創意方法出乎意料且有效。JavaScript 還增強了隨機化按鈕的功能,允許在不重新整理頁面的情況下產生多組結果。
行數排列正確,根據規格適當分隔了重複項。這段程式碼很穩固,只有一個小問題:隨機化按鈕未獨立成行,但因為提示中未明確要求,所以不扣分。
以下是此次及先前測試的總體結果:
- ChatGPT GPT-4o:界面:良好,功能:良好
- Microsoft Copilot:界面:適當,功能:失敗
- Meta AI:界面:適當,功能:失敗
- Meta Code Llama:完全失敗
- Google Gemini Advanced:界面:良好,功能:失敗
- ChatGPT 4:界面:良好,功能:良好
- ChatGPT 3.5:界面:良好,功能:良好
2. 重寫字串函數
此測試評估模型處理美元和分幣轉換的能力。GPT-4o 成功重寫了程式碼,拒絕可能導致後續行出問題的輸入,確保僅處理有效的美元和分幣值。
我有點失望它未自動將 .75 這類值加上前導零轉為 0.75。然而,由於我未明確要求此功能,這不是 AI 的錯。這提醒我們,即使 AI 提供了功能性程式碼,你可能仍需精煉提示以獲得完全符合需求的結果。
以下是此次及先前測試的總體結果:
- ChatGPT GPT-4o:成功
- Microsoft Copilot:失敗
- Meta AI:失敗
- Meta Code Llama:成功
- Google Gemini Advanced:失敗
- ChatGPT 4:成功
- ChatGPT 3.5:成功
3. 找出惱人錯誤
這個測試很有趣,因為解決方案並不顯而易見。我自己在編碼時最初被這個錯誤難倒,於是向第一個 ChatGPT 模型求助,它立即找出了錯誤,當時真是令人震驚。
相比之下,我測試的其他三個 LLM 都錯過了這個問題的誤導。錯誤訊息指向程式碼的某一部分,但實際問題在其他地方,需要對 WordPress 框架有深入了解才能辨識。
幸運的是,GPT-4o 正確辨識了問題並準確描述了修復方法。
以下是此次及先前測試的總體結果:
- ChatGPT GPT-4o:成功
- Microsoft Copilot:失敗。極其慘烈。熱情洋溢。表情符號滿天飛。
- Meta AI:成功
- Meta Code Llama:失敗
- Google Gemini Advanced:失敗
- ChatGPT 4:成功
- ChatGPT 3.5:成功
到目前為止,GPT-4o 三戰全勝。讓我們看看它在最後一項測試中的表現。
4. 撰寫腳本
在這項測試中,GPT-4o 實際上提供了超出我要求的內容。這項測試涉及使用鮮為人知的 Mac 腳本工具 Keyboard Maestro、Apple 的 AppleScript 和 Chrome 腳本行為。順便一提,Keyboard Maestro 對我來說是個改變遊戲規則的工具,它能重新編程作業系統和應用程式,使 Mac 成為我的首選生產力工具。
要通過測試,AI 需要正確概述一個結合 Keyboard Maestro 程式碼、AppleScript 和 Chrome API 功能的解決方案。
令人驚訝的是,GPT-4o 給了我兩個不同版本:
兩個版本都正確與 Keyboard Maestro 互動,但它們在處理大小寫敏感性上有所不同。左邊的版本不正確,因為 AppleScript 不支援「as lowercase」。右邊的版本使用「contains」且不區分大小寫,運作正常。
我給 GPT-4o 通過,但持保留態度,因為它確實提供了可用的程式碼。然而,返回兩個選項,其中一個不正確,讓我需要額外工作來評估和選擇正確的選項。這可能和我自己編寫程式碼一樣耗時。
以下是此次及先前測試的總體結果:
- ChatGPT GPT-4o:成功,但有保留
- Microsoft Copilot:失敗
- Meta AI:失敗
- Meta Code Llama:失敗
- Google Gemini Advanced:成功
- ChatGPT 4:成功
- ChatGPT 3.5:失敗
總體結果
以下是所有模型在四項測試中的表現:
- ChatGPT GPT-4o:4 項全數成功,但有一次奇怪的雙選答案
- Microsoft Copilot:0 項成功
- Meta AI:1 項成功
- Meta Code Llama:1 項成功
- Google Gemini Advanced:1 項成功
- ChatGPT 4:4 項全數成功
- ChatGPT 3.5:3 項成功
到目前為止,ChatGPT 一直是我的編碼助手首選。它總是能交付(除了偶爾失誤)。其他 AI 在我的測試中大多表現不佳。但 GPT-4o 在最後的雙答案回應中讓我有些意外,這讓我好奇這個模型內部發生了什麼導致這樣的問題。
儘管如此,GPT-4o 仍是我的編碼測試中的最佳表現者,所以我可能會繼續使用它並熟悉它的特性。或者,我可能會回到 ChatGPT Plus 的 GPT-3.5 或 GPT-4。請繼續關注,下次 ChatGPT 更新模型時,我一定會重新運行這些測試,看看它能否在所有四項測試中始終選擇正確答案。
你有沒有用這些 AI 模型進行編碼?你的經驗如何?請在下方留言分享。
相關文章
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制
根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
相關專題推薦
評論 (22)
0/500
GPT-4o klingt beeindruckend, aber diese 'eine seltsame Ausnahme' macht mich neugierig. Was war das für ein seltsames Ergebnis? Vielleicht ein Hinweis darauf, dass KI bei bestimmten Logikaufgaben immer noch überraschend 'menschlich' scheitern kann? 🤔 Die Omni-Fähigkeiten sind cool, aber ich frage mich, wie stabil die Performance in allen Modi wirklich ist.
Bon article ! Les tests de programmation sont toujours révélateurs. Je me demande s’il y a des biais selon les langages utilisés pour l'entraînement… Ou peut-être que c’est lié à la façon dont la requête est formulée ? 🤔
GPT-4o é impressionante, passando na maioria dos meus testes de codificação! Mas aquele resultado estranho me deixou confuso. Ainda assim, é versátil em texto, gráficos e voz. Se ao menos pudesse explicar aquele resultado estranho, seria perfeito! 🤔
GPT-4o thật ấn tượng, vượt qua hầu hết các bài kiểm tra mã hóa của tôi! Nhưng kết quả lạ đó làm tôi bối rối. Tuy nhiên, nó rất linh hoạt trong văn bản, đồ họa và giọng nói. Giá mà nó có thể giải thích kết quả lạ đó, thì sẽ hoàn hảo! 🤔
GPT-4oは私のコードテストのほとんどを完璧にこなすので感動しました!しかし、その一つの奇妙な結果が気になりました。それでも、テキスト、グラフィック、音声での多様性は素晴らしいです。あの奇妙な結果を説明できれば完璧だったのに!🤔

如果你有在關注科技圈,你可能已經知道 OpenAI 剛剛推出了最新的大型語言模型 GPT-4o,其中「o」代表「omni」。這個新模型承諾在文字、圖形和語音方面具有多功能性,我迫不及待地想用我的標準編碼測試來檢驗它的表現。這些測試已經針對眾多 AI 模型進行過,結果相當引人入勝。請跟著我看到最後,因為有個你不想錯過的轉折。
如果你有興趣進行自己的實驗,請參閱此指南:如何測試 AI 聊天機器人的編碼能力 - 你也可以。它詳細列出了我使用的所有測試,並解釋它們的運作方式以及結果中需要注意的事項。
現在,讓我們來看看每個測試的結果,並比較 GPT-4o 與之前的競爭者如 Microsoft Copilot、Meta AI、Meta Code Llama、Google Gemini Advanced 以及早期版本的 ChatGPT 的表現。
1. 撰寫 WordPress 插件
以下是 GPT-4o 的用戶界面一瞥:
有趣的是,GPT-4o 主動加入了一個 JavaScript 文件,動態更新兩個欄位的行數。雖然提示中未明確排除 JavaScript,但這種創意方法出乎意料且有效。JavaScript 還增強了隨機化按鈕的功能,允許在不重新整理頁面的情況下產生多組結果。
行數排列正確,根據規格適當分隔了重複項。這段程式碼很穩固,只有一個小問題:隨機化按鈕未獨立成行,但因為提示中未明確要求,所以不扣分。
以下是此次及先前測試的總體結果:
- ChatGPT GPT-4o:界面:良好,功能:良好
- Microsoft Copilot:界面:適當,功能:失敗
- Meta AI:界面:適當,功能:失敗
- Meta Code Llama:完全失敗
- Google Gemini Advanced:界面:良好,功能:失敗
- ChatGPT 4:界面:良好,功能:良好
- ChatGPT 3.5:界面:良好,功能:良好
2. 重寫字串函數
此測試評估模型處理美元和分幣轉換的能力。GPT-4o 成功重寫了程式碼,拒絕可能導致後續行出問題的輸入,確保僅處理有效的美元和分幣值。
我有點失望它未自動將 .75 這類值加上前導零轉為 0.75。然而,由於我未明確要求此功能,這不是 AI 的錯。這提醒我們,即使 AI 提供了功能性程式碼,你可能仍需精煉提示以獲得完全符合需求的結果。
以下是此次及先前測試的總體結果:
- ChatGPT GPT-4o:成功
- Microsoft Copilot:失敗
- Meta AI:失敗
- Meta Code Llama:成功
- Google Gemini Advanced:失敗
- ChatGPT 4:成功
- ChatGPT 3.5:成功
3. 找出惱人錯誤
這個測試很有趣,因為解決方案並不顯而易見。我自己在編碼時最初被這個錯誤難倒,於是向第一個 ChatGPT 模型求助,它立即找出了錯誤,當時真是令人震驚。
相比之下,我測試的其他三個 LLM 都錯過了這個問題的誤導。錯誤訊息指向程式碼的某一部分,但實際問題在其他地方,需要對 WordPress 框架有深入了解才能辨識。
幸運的是,GPT-4o 正確辨識了問題並準確描述了修復方法。
以下是此次及先前測試的總體結果:
- ChatGPT GPT-4o:成功
- Microsoft Copilot:失敗。極其慘烈。熱情洋溢。表情符號滿天飛。
- Meta AI:成功
- Meta Code Llama:失敗
- Google Gemini Advanced:失敗
- ChatGPT 4:成功
- ChatGPT 3.5:成功
到目前為止,GPT-4o 三戰全勝。讓我們看看它在最後一項測試中的表現。
4. 撰寫腳本
在這項測試中,GPT-4o 實際上提供了超出我要求的內容。這項測試涉及使用鮮為人知的 Mac 腳本工具 Keyboard Maestro、Apple 的 AppleScript 和 Chrome 腳本行為。順便一提,Keyboard Maestro 對我來說是個改變遊戲規則的工具,它能重新編程作業系統和應用程式,使 Mac 成為我的首選生產力工具。
要通過測試,AI 需要正確概述一個結合 Keyboard Maestro 程式碼、AppleScript 和 Chrome API 功能的解決方案。
令人驚訝的是,GPT-4o 給了我兩個不同版本:
兩個版本都正確與 Keyboard Maestro 互動,但它們在處理大小寫敏感性上有所不同。左邊的版本不正確,因為 AppleScript 不支援「as lowercase」。右邊的版本使用「contains」且不區分大小寫,運作正常。
我給 GPT-4o 通過,但持保留態度,因為它確實提供了可用的程式碼。然而,返回兩個選項,其中一個不正確,讓我需要額外工作來評估和選擇正確的選項。這可能和我自己編寫程式碼一樣耗時。
以下是此次及先前測試的總體結果:
- ChatGPT GPT-4o:成功,但有保留
- Microsoft Copilot:失敗
- Meta AI:失敗
- Meta Code Llama:失敗
- Google Gemini Advanced:成功
- ChatGPT 4:成功
- ChatGPT 3.5:失敗
總體結果
以下是所有模型在四項測試中的表現:
- ChatGPT GPT-4o:4 項全數成功,但有一次奇怪的雙選答案
- Microsoft Copilot:0 項成功
- Meta AI:1 項成功
- Meta Code Llama:1 項成功
- Google Gemini Advanced:1 項成功
- ChatGPT 4:4 項全數成功
- ChatGPT 3.5:3 項成功
到目前為止,ChatGPT 一直是我的編碼助手首選。它總是能交付(除了偶爾失誤)。其他 AI 在我的測試中大多表現不佳。但 GPT-4o 在最後的雙答案回應中讓我有些意外,這讓我好奇這個模型內部發生了什麼導致這樣的問題。
儘管如此,GPT-4o 仍是我的編碼測試中的最佳表現者,所以我可能會繼續使用它並熟悉它的特性。或者,我可能會回到 ChatGPT Plus 的 GPT-3.5 或 GPT-4。請繼續關注,下次 ChatGPT 更新模型時,我一定會重新運行這些測試,看看它能否在所有四項測試中始終選擇正確答案。
你有沒有用這些 AI 模型進行編碼?你的經驗如何?請在下方留言分享。
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
GPT-4o klingt beeindruckend, aber diese 'eine seltsame Ausnahme' macht mich neugierig. Was war das für ein seltsames Ergebnis? Vielleicht ein Hinweis darauf, dass KI bei bestimmten Logikaufgaben immer noch überraschend 'menschlich' scheitern kann? 🤔 Die Omni-Fähigkeiten sind cool, aber ich frage mich, wie stabil die Performance in allen Modi wirklich ist.
Bon article ! Les tests de programmation sont toujours révélateurs. Je me demande s’il y a des biais selon les langages utilisés pour l'entraînement… Ou peut-être que c’est lié à la façon dont la requête est formulée ? 🤔
GPT-4o é impressionante, passando na maioria dos meus testes de codificação! Mas aquele resultado estranho me deixou confuso. Ainda assim, é versátil em texto, gráficos e voz. Se ao menos pudesse explicar aquele resultado estranho, seria perfeito! 🤔
GPT-4o thật ấn tượng, vượt qua hầu hết các bài kiểm tra mã hóa của tôi! Nhưng kết quả lạ đó làm tôi bối rối. Tuy nhiên, nó rất linh hoạt trong văn bản, đồ họa và giọng nói. Giá mà nó có thể giải thích kết quả lạ đó, thì sẽ hoàn hảo! 🤔
GPT-4oは私のコードテストのほとんどを完璧にこなすので感動しました!しかし、その一つの奇妙な結果が気になりました。それでも、テキスト、グラフィック、音声での多様性は素晴らしいです。あの奇妙な結果を説明できれば完璧だったのに!🤔





首頁






