選項
首頁
新聞
Claude 3.5十四行詩在以Chatgpt為主的AI編碼測試中創造性地掙扎

Claude 3.5十四行詩在以Chatgpt為主的AI編碼測試中創造性地掙扎

2025-05-04
204

測試Anthropic新款Claude 3.5 Sonnet的能力

上週,我收到Anthropic的電子郵件,宣布推出Claude 3.5 Sonnet。他們誇耀其「提升了業界智能標準,在多項評估中超越競爭對手模型及Claude 3 Opus」。他們還宣稱其非常適合複雜任務,如程式碼生成。我自然得測試這些說法。

我對多個AI進行了一系列程式碼測試,你也可以試試。只要前往如何測試AI聊天機器人的程式碼能力 - 你也可以查看所有細節。讓我們來看看Claude 3.5 Sonnet在我的標準測試中表現如何,並與其他AI如Microsoft Copilot、Meta AI、Meta Code Llama、Google Gemini Advanced及ChatGPT比較。

1. 撰寫WordPress外掛

最初,Claude 3.5 Sonnet展現了很大潛力。其生成的使用者介面令人印象深刻,佈局乾淨,首次在測試的AI中將資料欄位並排放置。

Claude 3.5 Sonnet創建的WordPress外掛介面截圖由David Gewirtz/ZDNET提供截圖

引起我注意的是Claude的程式碼生成方式。它未使用常見的獨立PHP、JavaScript及CSS檔案,而是提供單一PHP檔案,自動生成JavaScript及CSS檔案到外掛目錄。雖然這是創新方法,但風險在於其依賴作業系統設定允許外掛寫入自身資料夾,這在生產環境中是重大安全漏洞。

不幸的是,儘管解決方案具創意,外掛無法運作。「隨機化」按鈕毫無反應,令人失望。

以下是與先前測試的總結結果:

  • Claude 3.5 Sonnet:介面:良好,功能:失敗
  • ChatGPT GPT-4o:介面:良好,功能:良好
  • Microsoft Copilot:介面:尚可,功能:失敗
  • Meta AI:介面:尚可,功能:失敗
  • Meta Code Llama:完全失敗
  • Google Gemini Advanced:介面:良好,功能:失敗
  • ChatGPT 4:介面:良好,功能:良好
  • ChatGPT 3.5:介面:良好,功能:良好

2. 重寫字串函數

此測試評估AI如何依特定需求重寫程式碼,此處為美元與美分轉換。Claude 3.5 Sonnet在移除前導零、正確處理整數與小數及防止負值方面表現良好。它還巧妙地對意外輸入返回「0」,有助於避免錯誤。

然而,它未能允許如「.50」代表50美分的輸入,這是需求之一。因此,修改後的程式碼在現實場景中無法運作,我必須標記為失敗。

以下是總結結果:

  • Claude 3.5 Sonnet:失敗
  • ChatGPT GPT-4o:成功
  • Microsoft Copilot:失敗
  • Meta AI:失敗
  • Meta Code Llama:成功
  • Google Gemini Advanced:失敗
  • ChatGPT 4:成功
  • ChatGPT 3.5:成功

3. 尋找惱人錯誤

此測試很棘手,因其要求AI找出需要特定WordPress知識的細微錯誤。這是我最初忽略的錯誤,需借助ChatGPT解決。

Claude 3.5 Sonnet不僅找到並修復了錯誤,還注意到發布過程中引入的錯誤,我隨後修正。這是我發布完整測試集以來,AI中的首次表現。

以下是總結結果:

  • Claude 3.5 Sonnet:成功
  • ChatGPT GPT-4o:成功
  • Microsoft Copilot:失敗。極其、熱情地、表情符號地失敗。
  • Meta AI:成功
  • Meta Code Llama:失敗
  • Google Gemini Advanced:失敗
  • ChatGPT 4:成功
  • ChatGPT 3.5:成功

目前,Claude 3.5 Sonnet在三項測試中失敗了兩項。讓我們看看它在最後一項的表現。

4. 撰寫腳本

此測試檢查AI對專業程式工具如AppleScript及Keyboard Maestro的知識。雖然ChatGPT在兩者上表現熟練,但Claude 3.5 Sonnet表現不佳。它撰寫的AppleScript試圖與Chrome互動,但完全忽略Keyboard Maestro部分。

此外,AppleScript包含語法錯誤。在試圖使匹配不區分大小寫時,Claude生成一行導致運行時錯誤的程式碼:

if theTab's title contains input ignoring case then

「contains」語句已不區分大小寫,「ignoring case」短語放錯位置,導致錯誤。

以下是總結結果:

  • Claude 3.5 Sonnet:失敗
  • ChatGPT GPT-4o:成功但有保留意見
  • Microsoft Copilot:失敗
  • Meta AI:失敗
  • Meta Code Llama:失敗
  • Google Gemini Advanced:成功
  • ChatGPT 4:成功
  • ChatGPT 3.5:失敗

總體結果

以下是Claude 3.5 Sonnet與其他AI的整體表現比較:

  • Claude 3.5 Sonnet:4項中1項成功
  • ChatGPT GPT-4o:4項中4項成功,但有一個奇怪的雙選答案
  • Microsoft Copilot:4項中0項成功
  • Meta AI:4項中1項成功
  • Meta Code Llama:4項中1項成功
  • Google Gemini Advanced:4項中1項成功
  • ChatGPT 4:4項中4項成功
  • ChatGPT 3.5:4項中3項成功

我對Claude 3.5 Sonnet感到相當失望。Anthropic承諾其適合程式設計,但未達預期。它不是不能程式設計,只是無法正確程式設計。我一直希望找到能超越ChatGPT的AI,特別是這些模型融入程式環境時。但目前,我仍選擇ChatGPT作為程式設計輔助,建議你也如此。

你有沒有用AI進行程式設計?用了哪個,效果如何?請在下方評論分享你的經驗。

在社交媒體上關注我的項目更新,訂閱我的每週新聞信,並在Twitter/X上以@DavidGewirtz與我聯繫,在Facebook上以Facebook.com/DavidGewirtz,在Instagram上以Instagram.com/DavidGewirtz,以及在YouTube上以YouTube.com/DavidGewirtzTV

相關文章
佛羅里達州就暴力事件起訴 OpenAI 和薩姆·阿爾特曼 佛羅里達州就暴力事件起訴 OpenAI 和薩姆·阿爾特曼 佛羅里達州總檢察長於週一提起了一項史無前例的州級訴訟,起訴 OpenAI 及其執行長山姆·奧特曼(Sam Altman),指控該公司的 ChatGPT 與多起暴力事件有關。訴訟稱,OpenAI 優先考慮贏得“人工智慧軍備競賽並積累鉅額財富”,而忽視了安全問題。“今天我們宣佈了對 OpenAI 及其執行長山姆·奧特曼提起的首個全州性訴訟,”佛羅里達州總檢察長詹姆斯·烏特邁爾(James Uthmeier)表示。“OpenAI 和奧特曼無視內部和外部的安全警告,使兒童面臨巨大風險,並允許
OpenAI 推出先進的語音模型,以實現更自然的即時對話 OpenAI 推出先進的語音模型,以實現更自然的即時對話 OpenAI 已推出兩款新的對話模型——GPT-Live-1 與 GPT-Live-1 mini,旨在讓對話聽起來更自然,並更有效地管理對話輪次。這些全雙工模型能夠同時說話和聆聽,讓使用者能自然地打斷對話,並支援即時翻譯等功能。該公司同時將 GPT-Live-1 mini 作為預設選項,取代 ChatGPT 當前的高階語音模式。付費級別的使用者則可使用規模更大的 GPT-Live-1 模型。 此前
OpenAI 推出 GPT-5.6,這是其模型系列中的最新成員 OpenAI 推出 GPT-5.6,這是其模型系列中的最新成員 OpenAI 於週四推出其最新模型系列,為日益競爭激烈的 AI 領域帶來了強大且嶄新的選擇。GPT-5.6 共有三種變體:Sol(設計為主力機型)、Terra(中階選項)以及 Luna(經濟實惠的選擇)。這些模型擴展了跨領域的能力,該公司承諾在企業任務、程式設計及科學研究方面都能展現強勁表現。執行長山姆·奧特曼(Sam Altman)表示,新模型相較於早期版本在效率與成本效益方面都有顯著提升;他近
相關專題推薦
數據分析 適用於 SaaS 和電商團隊的 KPI 監控最佳 AI 異常檢測工具
適用於 SaaS 和電商團隊的 KPI 監控最佳 AI 異常檢測工具

2026 年最新最佳頂級評分 AI 異常檢測工具,助力 SaaS 和電商團隊的 KPI 監控!XIX.AI 基於嚴格的真實世界測試和每週更新的排名,精心策劃了一套強大且顛覆性的工具合集。您將找到詳細的免費與付費對比洞察,幫助您識別必須嘗試的解決方案,從而提升生產力並釋放您的 AI 優勢。立即探索!

10 個工具
xix.ai
寫作 最適合撰寫長篇 SEO 文章的 AI 大綱生成工具
最適合撰寫長篇 SEO 文章的 AI 大綱生成工具

2026 年最新最佳、評價最高的 AI 大綱生成器,專為長篇 SEO 文章打造,由 XIX.AI 精心精選。這些強大的工具能為快速創作高品質內容提供革命性的協助,大幅提升寫作效率。 透過免費版與付費版的比較、實際測試結果及詳細排名,協助您找出最符合需求且不容錯過的選項。立即探索,釋放您的 AI 優勢。

8 個工具
xix.ai
教育與學習 適用於作業與考試準備的人工智慧學習工具
適用於作業與考試準備的人工智慧學習工具

2026 年最新最佳 AI 學習工具,助您完成作業與備考!XIX.AI 精心整理了一份備受好評的清單,收錄了這些強大且具革命性、經實測驗證的工具,能幫助學生提升效率、簡化作業流程,並在考試中取得優異成績。 獲取免費版與付費版的比較、詳細排名,以及必試選項,以釋放您的 AI 優勢。立即探索!

10 個工具
xix.ai
音樂創作 面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具
面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具

2026 年最新最佳 AI 人聲演示工具,專為詞曲創作者、旋律創作者和多語言內容團隊打造!XIX.AI 精心整理了一份經過嚴格真實世界測試的高評分、變革性工具列表。您將找到詳細的免費與付費對比資料、全面排名以及必試選項,幫助您提升創作效率並釋放創意潛力。立即探索,發現滿足您所有內容需求的完美工具!

9 個工具
xix.ai
商業 最適合小型企業的頂尖 AI 競爭情勢分析工具
最適合小型企業的頂尖 AI 競爭情勢分析工具

2026 年最新、最佳且評價最高的中小企業 AI 競爭研究工具!XIX.AI 精心精選了一系列極具威力且能改變遊戲規則的工具,並透過嚴謹的實測與詳細排名,每週更新內容。您可在此找到詳盡的免費版與付費版比較,協助您找出必試的工具,以提升工作效率並獲得競爭優勢。 立即探索,找出最適合您的工具!

9 個工具
xix.ai
圖像編輯 用於電商服裝、皮膚清潔和色彩一致性的 Photoshop AI 修圖工具
用於電商服裝、皮膚清潔和色彩一致性的 Photoshop AI 修圖工具

2026 年最新最佳 Photoshop AI 修圖工具,適用於電商服裝、皮膚清潔和色彩一致性!這份頂級精選列表包含強大的變革性解決方案,可幫助您提升寫作效率、簡化內容創作並輕鬆實現完美的視覺效果。每個工具都經過實際測試,並透過每週更新的排名進行驗證,同時提供免費與付費版本的詳細對比。由 XIX.AI 支援,這是任何希望發揮 AI 優勢的人必試指南。立即探索!

10 個工具
xix.ai
評論 (11)
0/500
CharlesYoung
CharlesYoung 2025-10-06 22:30:46

Intéressant de voir Claude 3.5 Sonnet avoir du mal avec le codage créatif. Est-ce qu'on attend trop des IA actuellement ? Après tout, l'intelligence humaine reste unique 🤷‍♂️

ScottMitchell
ScottMitchell 2025-05-05 21:17:31

Claude 3.5 Sonnet is pretty good, but it's no match for ChatGPT in coding tests. It's like bringing a knife to a gunfight! 😂 Still, it's an improvement over the last version, so kudos to Anthropic for trying to keep up. Maybe next time, they'll surprise us!

JamesMiller
JamesMiller 2025-05-05 16:59:50

Claude 3.5 Sonnet é bom, mas não chega aos pés do ChatGPT em testes de codificação. É como levar uma faca para uma batalha de armas! 😂 Ainda assim, é uma melhoria em relação à versão anterior, então parabéns à Anthropic por tentar acompanhar. Talvez da próxima vez eles nos surpreendam!

StevenNelson
StevenNelson 2025-05-05 15:23:24

クロード3.5ソネットはコードテストではChatGPTにかなわないですね。まるでナイフを持って銃撃戦に挑むようなものです!😂 でも、前バージョンよりは改善されているので、アントロピックの努力には敬意を表します。次回は驚かせてくれるかも?

JoseDavis
JoseDavis 2025-05-05 14:46:04

Claude 3.5 Sonnet qui galère en codage, c’est un peu décevant vu les promesses d’Anthropic. 😐 ChatGPT garde l’avantage, mais la course à l’IA est fascinante !

HaroldLopez
HaroldLopez 2025-05-05 12:06:54

클로드 3.5 소넷은 코드 테스트에서 ChatGPT에 비해 많이 부족해요. 마치 칼을 들고 총격전에 나서는 느낌이죠! 😂 그래도 이전 버전보다는 나아졌으니, 앤트로픽의 노력에 박수를 보냅니다. 다음에는 놀라게 해줄지 모르겠네요!

OR