オプション
ニュース
Claude 3.5 Sonnetは、chatgptが支配するAIコーディングテストで創造的に苦労しています

Claude 3.5 Sonnetは、chatgptが支配するAIコーディングテストで創造的に苦労しています

2025年5月4日
204

Anthropicの新しいClaude 3.5 Sonnetの能力をテストする

先週、AnthropicからClaude 3.5 Sonnetのリリースを発表するメールを受け取りました。彼らはそれが「業界の知能の基準を引き上げ、幅広い評価で競合モデルやClaude 3 Opusを上回る」と自慢していました。また、コード生成のような複雑なタスクに最適だと主張していました。当然、私はその主張を試してみる必要がありました。

私はさまざまなAIで一連のコーディングテストを行ってきましたし、あなたもできます。詳細は、AIチャットボットのコーディング能力をテストする方法 - あなたもできるにアクセスしてください。Claude 3.5 Sonnetが私の標準テストでどのようにパフォーマンスを発揮したか、そしてMicrosoft Copilot、Meta AI、Meta Code Llama、Google Gemini Advanced、ChatGPTといった他のAIとどう比較されるかを見てみましょう。

1. WordPressプラグインの作成

最初、Claude 3.5 Sonnetは非常に有望に見えました。それが生成したユーザーインターフェースは印象的で、私がテストしたAIの中で初めてデータフィールドを横に配置したクリーンなレイアウトでした。

Claude 3.5 Sonnetが作成したWordPressプラグインのインターフェースのスクリーンショットDavid Gewirtz/ZDNETによるスクリーンショット

私の注意を引いたのは、Claudeがコード生成にどのように取り組んだかです。通常のPHP、JavaScript、CSSの個別ファイルではなく、JavaScriptとCSSファイルをプラグインのディレクトリに自動生成する単一のPHPファイルを提供しました。これは革新的なアプローチでしたが、プラグインが自身のフォルダに書き込むことをOS設定が許可する必要があるため、本番環境では重大なセキュリティの欠陥となるリスクがあります。

残念ながら、創造的な解決策にもかかわらず、プラグインは機能しませんでした。「ランダム化」ボタンは何もせず、初期の有望さにもかかわらず失望させられました。

これまでのテストとの総合結果は以下の通りです:

  • Claude 3.5 Sonnet:インターフェース:良好、機能:失敗
  • ChatGPT GPT-4o:インターフェース:良好、機能:良好
  • Microsoft Copilot:インターフェース:十分、機能:失敗
  • Meta AI:インターフェース:十分、機能:失敗
  • Meta Code Llama:完全な失敗
  • Google Gemini Advanced:インターフェース:良好、機能:失敗
  • ChatGPT 4:インターフェース:良好、機能:良好
  • ChatGPT 3.5:インターフェース:良好、機能:良好

2. 文字列関数の書き換え

このテストは、AIが特定のニーズ、今回はドルとセントの変換に合わせてコードを書き換える能力を評価します。Claude 3.5 Sonnetは、先頭のゼロを削除し、整数と小数を正しく処理し、負の値を防ぐ点で良い仕事をしてくれました。また、予期しない入力に対して「0」を返す賢い対応で、エラーを回避できました。

しかし、50セントを表す「.50」のような入力を許可するという要件を満たせませんでした。これは、改訂されたコードが実際のシナリオで機能しないことを意味し、失敗と評価せざるを得ません。

総合結果は以下の通りです:

  • Claude 3.5 Sonnet:失敗
  • ChatGPT GPT-4o:成功
  • Microsoft Copilot:失敗
  • Meta AI:失敗
  • Meta Code Llama:成功
  • Google Gemini Advanced:失敗
  • ChatGPT 4:成功
  • ChatGPT 3.5:成功

3. 厄介なバグを見つける

このテストは、特定のWordPressの知識が必要な微妙なバグを見つける必要があるため、難易度が高いです。これは私自身が見逃したバグで、最初はChatGPTに頼って解決しました。

Claude 3.5 Sonnetはバグを見つけて修正しただけでなく、公開プロセス中に導入されたエラーにも気づき、それを私が修正しました。これは、すべてのテストを公開して以来、テストしたAIの中で初めてのことでした。

総合結果は以下の通りです:

  • Claude 3.5 Sonnet:成功
  • ChatGPT GPT-4o:成功
  • Microsoft Copilot:失敗。見事に。熱狂的に。絵文字的に。
  • Meta AI:成功
  • Meta Code Llama:失敗
  • Google Gemini Advanced:失敗
  • ChatGPT 4:成功
  • ChatGPT 3.5:成功

これまで、Claude 3.5 Sonnetは3つのテストのうち2つで失敗しています。最後のテストでどうなるか見てみましょう。

4. スクリプトの作成

このテストは、AppleScriptやKeyboard Maestroのような専門的なプログラミングツールに関するAIの知識をチェックします。ChatGPTは両方で熟練を示しましたが、Claude 3.5 Sonnetはそれほど上手く行きませんでした。Chromeと対話しようとするAppleScriptを作成しましたが、Keyboard Maestroのコンポーネントは完全に無視されました。

さらに、AppleScriptには構文エラーが含まれていました。大文字小文字を無視するマッチを行おうとして、Claudeはランタイムエラーを引き起こす行を生成しました:

if theTab's title contains input ignoring case then

「contains」ステートメントはすでに大文字小文字を区別しないため、「ignoring case」のフレーズが誤って配置され、エラーが発生しました。

総合結果は以下の通りです:

  • Claude 3.5 Sonnet:失敗
  • ChatGPT GPT-4o:成功したが留保付き
  • Microsoft Copilot:失敗
  • Meta AI:失敗
  • Meta Code Llama:失敗
  • Google Gemini Advanced:成功
  • ChatGPT 4:成功
  • ChatGPT 3.5:失敗

全体の結果

Claude 3.5 Sonnetの全体的なパフォーマンスを他のAIと比較すると以下の通りです:

  • Claude 3.5 Sonnet:4つのうち1つ成功
  • ChatGPT GPT-4o:4つのうち4つ成功、ただし1つは奇妙な二択回答
  • Microsoft Copilot:4つのうち0つ成功
  • Meta AI:4つのうち1つ成功
  • Meta Code Llama:4つのうち1つ成功
  • Google Gemini Advanced:4つのうち1つ成功
  • ChatGPT 4:4つのうち4つ成功
  • ChatGPT 3.5:4つのうち3つ成功

Claude 3.5 Sonnetにはかなり失望しました。Anthropicはプログラミングに適していると約束しましたが、その期待に応えられませんでした。プログラミングができないわけではありませんが、正しくプログラミングできないのです。ChatGPTを上回るAI、特にこれらのモデルがプログラミング環境に統合される中で、を見つけることを期待し続けています。しかし、今のところ、プログラミングの助けにはChatGPTを使い続けるつもりで、あなたにも同じことをお勧めします。

あなたはプログラミングにAIを使ったことがありますか?どのAIで、どんな結果でしたか?以下のコメントであなたの経験を共有してください。

ソーシャルメディアで私のプロジェクトの更新をフォローし、毎週のニュースレターを購読し、Twitter/Xの@DavidGewirtz、FacebookのFacebook.com/DavidGewirtz、InstagramのInstagram.com/DavidGewirtz、YouTubeのYouTube.com/DavidGewirtzTVで私とつながってください。

関連記事
フロリダ州が OpenAI およびサム・アルトマン氏を提訴、暴力的な事件を巡り フロリダ州が OpenAI およびサム・アルトマン氏を提訴、暴力的な事件を巡り フロリダ州司法長官は月曜日、OpenAIおよびCEOのサム・アルトマンに対して、同州で初めてとなる民事訴訟を提起し、同社のChatGPTが複数の暴力事件と関連しているとの主張を行った。訴訟状は、OpenAIが安全上の懸念を無視して「AI軍拡競争」での勝利と巨額の富の蓄積を優先したと主張している。「本日、OpenAIおよびそのCEO、サム・アルトマンに対して、州が主導する全国初の訴訟を提起したことを発表します。」とフロリダ州司法長官のジェームズ・ウスマイアーは述べた。「OpenAIとアルトマン
OpenAI、より自然なリアルタイム会話を実現する高度な音声モデルを発表 OpenAI、より自然なリアルタイム会話を実現する高度な音声モデルを発表 OpenAIは、より自然な話し口を実現し、会話のやり取りをより効果的に管理できるように設計された、新しい対話型モデル「GPT-Live-1」および「GPT-Live-1 mini」をリリースしました。これらの全二重通信モデルは、話すことと聞くことを同時に行うことができるため、ユーザーが自然に会話を割り込むことが可能になり、リアルタイム翻訳などの機能も利用できるようになります。また同社は、ChatG
OpenAI、モデルファミリーの最新版「GPT-5.6」を発表 OpenAI、モデルファミリーの最新版「GPT-5.6」を発表 OpenAIは木曜日、最新のモデルファミリーを発表し、競争が激化するAI業界に強力な新選択肢をもたらした。GPT-5.6には、「Sol」(主力モデルとして設計されたもの)、「Terra」(ミドルレンジのオプション)、「Luna」(コストパフォーマンスに優れた選択肢)の3つのバリエーションが用意されている。これらのモデルは多岐にわたる分野で機能を拡張しており、同社は企業向けタスク、コーディング、科学
関連特集おすすめ
書き込み 長文SEO記事に最適なAIアウトライン生成ツール
長文SEO記事に最適なAIアウトライン生成ツール

XIX.AIが厳選した、2026年最新のロングフォームSEO記事向け高評価AIアウトライン生成ツール。これらの強力なツールは、高品質なコンテンツを迅速に作成するための画期的な支援を提供し、執筆効率を大幅に向上させます。 無料版と有料版の比較、実地テスト、詳細なランキングを参考に、ご自身のニーズに合った「ぜひ試すべき」ツールを見つけてください。今すぐチェックして、AIの力を最大限に活用しましょう。

8 ツール
xix.ai
教育と学習 宿題や試験対策に役立つAI学習ツール
宿題や試験対策に役立つAI学習ツール

2026年版 宿題や試験対策に最適な最新AI学習ツール!XIX.AIは、学生の生産性を高め、宿題の完了を効率化し、実際の試験で好成績を収めるのに役立つ、画期的な高評価ツールを厳選して紹介しています。 無料版と有料版の比較、詳細なランキング、そしてAIの力を最大限に引き出すためにぜひ試すべきツールをご紹介します。今すぐチェックしましょう!

10 ツール
xix.ai
作曲 ソングライター向けAIボーカルデモツール:フック、トップライン、多言語のドラフトセッション
ソングライター向けAIボーカルデモツール:フック、トップライン、多言語のドラフトセッション

2026年版 ソングライター、フッククリエイター、多言語コンテンツ制作チームのための最新・最高のAIボーカルデモツール!XIX.AIは、厳格な実地テストを経て、業界に革新をもたらす強力なツールを厳選し、高評価のランキングリストを作成しました。 無料版と有料版の詳細な比較データ、包括的なランキング、そして創作効率を高め、創造力を最大限に引き出すためにぜひ試すべきツールが満載です。今すぐチェックして、あらゆるコンテンツ制作ニーズに最適なツールを見つけましょう!

9 ツール
xix.ai
仕事 中小企業に最適なAI競合分析ツール
中小企業に最適なAI競合分析ツール

2026年版 中小企業向け最新・最高評価のAI競合分析ツール!XIX.AIは、実環境での厳格なテストと詳細なランキングに基づき、毎週更新される、極めて強力で業界に革命をもたらすツールを厳選しました。無料版と有料版の包括的な比較も掲載されており、生産性を向上させ、競争優位性をもたらす「ぜひ試すべき」ツールを見つけるのに役立ちます。 今すぐチェックして、あなたにぴったりのツールを見つけましょう!

9 ツール
xix.ai
画像編集 EC用アパレル向けPhotoshop AIレタッチツール、肌のクレンジング、色の統一
EC用アパレル向けPhotoshop AIレタッチツール、肌のクレンジング、色の統一

2026年最新版、eコマース用アパレル向けPhotoshop AIリタッチツール、肌補正、色調統一に最適!この高評価の厳選リストは、文章作成の効率化、コンテンツ制作の簡素化、完璧な視覚結果の達成を支援する革新的なソリューションを提供しています。各ツールは週次更新ランキングを通じて実世界でテストされ、無料版と有料版の比較詳細も記載されています。XIX.AIが後援するこのガイドは、AIの優位性を最大限に引き出したい方に必見です。今すぐチェック!

10 ツール
xix.ai
プロンプト ChatGPTワークフローに最適なAIプロンプトライブラリ
ChatGPTワークフローに最適なAIプロンプトライブラリ

2026年版:あらゆる種類のChatGPTワークフローを最適化するための、最新かつ最高評価のAIプロンプトライブラリ。XIX.AIは、最高のパフォーマンスを保証するために厳格な実環境テストを経た、強力で画期的なコレクションを厳選しました。 無料版と有料版の詳細な比較や専門家によるランキングを参考に、生産性を高め、AIの真の力を引き出す「必試」ツールを選んでください。今すぐチェックしましょう!

11 ツール
xix.ai
コメント (11)
0/500
CharlesYoung
CharlesYoung 2025年10月6日 23:30:46 JST

Intéressant de voir Claude 3.5 Sonnet avoir du mal avec le codage créatif. Est-ce qu'on attend trop des IA actuellement ? Après tout, l'intelligence humaine reste unique 🤷‍♂️

ScottMitchell
ScottMitchell 2025年5月5日 22:17:31 JST

Claude 3.5 Sonnet is pretty good, but it's no match for ChatGPT in coding tests. It's like bringing a knife to a gunfight! 😂 Still, it's an improvement over the last version, so kudos to Anthropic for trying to keep up. Maybe next time, they'll surprise us!

JamesMiller
JamesMiller 2025年5月5日 17:59:50 JST

Claude 3.5 Sonnet é bom, mas não chega aos pés do ChatGPT em testes de codificação. É como levar uma faca para uma batalha de armas! 😂 Ainda assim, é uma melhoria em relação à versão anterior, então parabéns à Anthropic por tentar acompanhar. Talvez da próxima vez eles nos surpreendam!

StevenNelson
StevenNelson 2025年5月5日 16:23:24 JST

クロード3.5ソネットはコードテストではChatGPTにかなわないですね。まるでナイフを持って銃撃戦に挑むようなものです!😂 でも、前バージョンよりは改善されているので、アントロピックの努力には敬意を表します。次回は驚かせてくれるかも?

JoseDavis
JoseDavis 2025年5月5日 15:46:04 JST

Claude 3.5 Sonnet qui galère en codage, c’est un peu décevant vu les promesses d’Anthropic. 😐 ChatGPT garde l’avantage, mais la course à l’IA est fascinante !

HaroldLopez
HaroldLopez 2025年5月5日 13:06:54 JST

클로드 3.5 소넷은 코드 테스트에서 ChatGPT에 비해 많이 부족해요. 마치 칼을 들고 총격전에 나서는 느낌이죠! 😂 그래도 이전 버전보다는 나아졌으니, 앤트로픽의 노력에 박수를 보냅니다. 다음에는 놀라게 해줄지 모르겠네요!

OR