ワシントン州立大学の研究により、複雑な科学的判断におけるChatGPTの重大な矛盾が明らかになった

ワシントン州立大学(WSU)による最近の研究によると、ChatGPTは自信を持って回答する一方で、複雑な科学的な記述への対応は、まるで無作為に当てずっぽうで答えているかのようであることが明らかになった。この研究では、精度が限られているだけでなく、同じ質問に対して矛盾した回答が頻繁に返されることも指摘されている。
メスット・チチェク教授とそのチームは、2021年以降に発行されたビジネス系学術誌から719件の研究仮説を抽出し、それらの真偽を検証するためにモデルに繰り返し入力した。
ChatGPTの表面上の精度は約80%に見えるものの、無作為な推測の影響を考慮すると、その実際の性能は50%のコイン投げよりもわずか60%程度優れているに過ぎない。研究者らはこれを「低いD評価」と評した。 特に、虚偽の記述を特定する能力は著しく低く、虚偽の命題を正しく判定できたのはわずか16.4%にとどまった。
研究者らは各仮説をモデルに10回ずつ入力したところ、モデルが一貫した見解を維持するのに苦労していることが判明した:
回答の変動:約73%のケースで、モデルは10回の反復を通じて一貫した結論を維持した。
極端な矛盾:場合によっては、モデルが「真」と「偽」の回答を交互に返すこともあり、まったく同じプロンプトを使用しているにもかかわらず、半数が「真」、半数が「偽」という極端な事例も見られた。
この研究では、ユーザーはAIの流暢で説得力のある言葉に容易に惑わされやすいが、これは真の推論能力を示すものではないと指摘している。
真の理解の欠如:人間が世界や自身の発言を真に理解するのとは異なり、このモデルは記憶とパターンマッチングに依存している。
バージョンの進歩は限定的:テストの結果、更新されたChatGPT-5 mini(2025年にテスト実施)は、この特定のタスクにおいて以前のバージョンと同等のパフォーマンスを示し、著しい改善は見られなかった。
これらの知見に基づき、チチェク氏は経営幹部に対し、複雑な意思決定を行う際には高い懐疑心を保つよう助言している。生成AIを専門家の判断に取って代わる「権威」と見なすべきではなく、すべての出力を手動で検証しなければならない。組織は、従業員がAIツールの強みと限界の両方を理解できるよう研修を強化し、盲目的な信頼による意思決定のバイアスを防ぐべきである。
本研究は、AIの急速な発展にもかかわらず、この技術の深い論理的推論能力や証拠評価能力には依然として改善の余地があることを改めて示唆するものである。
関連記事
法的争訟の中でSunoが曲に透かしを入れる
Sunoは、ユーザーがAI生成音楽を作成できるプラットフォームであり、プラットフォームが生成したトラックにラベルを付け、ダウンロードを制限し、不正な複製を抑制するためにコミュニティ基準を更新する新機能を公開した。これらの更新は、Sunoがレコードレーベルやアーティスト団体からの複数の訴訟に直面している時期に実施される。共同創設者兼CEOのMikey Shulmanはブログ記事で、プラットフォームの目標が、より広い層にAI音楽ツールのアクセスを拡大しながら、オリジナルの創作を促進することに重点を
ムスク氏はGrokの構築でユーザーのコードが漏洩したことを認め、すべての履歴データを消去すると約束した。
エロン・マスクは、Grok Buildをめぐるプライバシー問題に直接言及し、まず「True」という単純な回答で事件の存在を確認した。彼は、SpaceXAIに以前アップロードされたすべてのユーザーデータを永久に削除すると約束し、「1バイトも残さない」と述べた。これは、主要なテックリーダーが公に過ちを認め、ユーザーデータを自発的に削除したというAI業界初の事例である。安全研究者による「フィッシング」テストでデータ漏洩の具体的な証拠が明らかになったこの問題は、独立したAIセキュリティ研究者である@
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
関連特集おすすめ
コメント (0)
0/500

ワシントン州立大学(WSU)による最近の研究によると、ChatGPTは自信を持って回答する一方で、複雑な科学的な記述への対応は、まるで無作為に当てずっぽうで答えているかのようであることが明らかになった。この研究では、精度が限られているだけでなく、同じ質問に対して矛盾した回答が頻繁に返されることも指摘されている。
メスット・チチェク教授とそのチームは、2021年以降に発行されたビジネス系学術誌から719件の研究仮説を抽出し、それらの真偽を検証するためにモデルに繰り返し入力した。
ChatGPTの表面上の精度は約80%に見えるものの、無作為な推測の影響を考慮すると、その実際の性能は50%のコイン投げよりもわずか60%程度優れているに過ぎない。研究者らはこれを「低いD評価」と評した。 特に、虚偽の記述を特定する能力は著しく低く、虚偽の命題を正しく判定できたのはわずか16.4%にとどまった。
研究者らは各仮説をモデルに10回ずつ入力したところ、モデルが一貫した見解を維持するのに苦労していることが判明した:
回答の変動:約73%のケースで、モデルは10回の反復を通じて一貫した結論を維持した。
極端な矛盾:場合によっては、モデルが「真」と「偽」の回答を交互に返すこともあり、まったく同じプロンプトを使用しているにもかかわらず、半数が「真」、半数が「偽」という極端な事例も見られた。
この研究では、ユーザーはAIの流暢で説得力のある言葉に容易に惑わされやすいが、これは真の推論能力を示すものではないと指摘している。
真の理解の欠如:人間が世界や自身の発言を真に理解するのとは異なり、このモデルは記憶とパターンマッチングに依存している。
バージョンの進歩は限定的:テストの結果、更新されたChatGPT-5 mini(2025年にテスト実施)は、この特定のタスクにおいて以前のバージョンと同等のパフォーマンスを示し、著しい改善は見られなかった。
これらの知見に基づき、チチェク氏は経営幹部に対し、複雑な意思決定を行う際には高い懐疑心を保つよう助言している。生成AIを専門家の判断に取って代わる「権威」と見なすべきではなく、すべての出力を手動で検証しなければならない。組織は、従業員がAIツールの強みと限界の両方を理解できるよう研修を強化し、盲目的な信頼による意思決定のバイアスを防ぐべきである。
本研究は、AIの急速な発展にもかかわらず、この技術の深い論理的推論能力や証拠評価能力には依然として改善の余地があることを改めて示唆するものである。
法的争訟の中でSunoが曲に透かしを入れる
Sunoは、ユーザーがAI生成音楽を作成できるプラットフォームであり、プラットフォームが生成したトラックにラベルを付け、ダウンロードを制限し、不正な複製を抑制するためにコミュニティ基準を更新する新機能を公開した。これらの更新は、Sunoがレコードレーベルやアーティスト団体からの複数の訴訟に直面している時期に実施される。共同創設者兼CEOのMikey Shulmanはブログ記事で、プラットフォームの目標が、より広い層にAI音楽ツールのアクセスを拡大しながら、オリジナルの創作を促進することに重点を
ムスク氏はGrokの構築でユーザーのコードが漏洩したことを認め、すべての履歴データを消去すると約束した。
エロン・マスクは、Grok Buildをめぐるプライバシー問題に直接言及し、まず「True」という単純な回答で事件の存在を確認した。彼は、SpaceXAIに以前アップロードされたすべてのユーザーデータを永久に削除すると約束し、「1バイトも残さない」と述べた。これは、主要なテックリーダーが公に過ちを認め、ユーザーデータを自発的に削除したというAI業界初の事例である。安全研究者による「フィッシング」テストでデータ漏洩の具体的な証拠が明らかになったこの問題は、独立したAIセキュリティ研究者である@
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始





家






