新たな研究によると、GPT-4.5はチューリングテストにおいて人間のパフォーマンスを上回る可能性が高く、虚偽の回答を生成する高度な能力を示している。
この瞬間は、コンピュータ科学の歴史に確実にその名を刻む画期的な出来事として位置づけられるでしょう。コンピュータ科学の父としばしば称される英国の数学者アラン・チューリングが1950年に提唱した画期的なアイデアが、76年を経て、ついに実証研究によって裏付けられました。
『米国科学アカデミー紀要(PNAS)』の最新号では、カリフォルニア大学サンディエゴ校(UCSD)が実施した先駆的な研究が特集された。 認知科学の専門家であるキャメロン・ジョーンズ氏とベン・バーゲン氏が共同執筆した論文は、現在最先端の大規模言語モデルが、厳格な枠組みの下で行われる古典的な三者間チューリングテストに合格できることを実証している。さらに驚くべきは、特定の状況下において、これらのAIシステムが実際の人間参加者自身よりも高い頻度で、本物の人間と見間違えられるという発見である。

主要な実証データ:
栄光への飛躍:個別の性格プロンプトを与えられた場合、GPT-4.5は73%のケースで人間と識別され、この成功率は、同テストに並んで参加した人間ボランティアの成功率をはるかに上回った。
互角の戦い:オープンソースモデルのLLaMa-3.1-405Bは56%の成功率を達成し、その性能は統計的に実在の人間と見分けがつかないことを示した。
プロンプトがすべてを決定する:「パーソナリティ・プロンプト」を慎重に作成しなかった場合、GPT-4.5の成功率は36%に低下し、LLaMa-3.1も38%に落ち込んだ。これらのAIシステムが人間を模倣する能力は、依然として人間の設計者が提供する正確な指示に大きく依存している。
ベースラインの失敗:1960年代のルールベースのロボット「ELIZA」の成功率はわずか23%であり、特定のプロンプトを与えられていないGPT-4oも21%にとどまった。いずれも、会話が長引くにつれて、その人工的な性質がすぐに露呈してしまった。
「嘘のゲーム」:知能はもはや基準ではなく、感情的知性と欠陥こそが偽装の核心である
UCSDの学部生やオンラインで募集されたボランティアを含む約500人の審査員が参加したこの二重盲検ランダム化比較試験では、参加者は5分から15分間のリアルタイムのテキスト会話に基づき、2つの対象のうちどちらが機械であるかを特定するよう求められた。
しかし、その結果はあらゆる予想を覆すものだった。従来、AIがチューリングテストに合格する能力は「全知全能の計算能力」に由来すると考えられていたが、この研究はより不穏な真実を明らかにした。大規模言語モデルは、実在の人間と同様の方法でミスを犯すことを学習しているからこそ、人間を欺くことができるのだ。

[プロンプトなしの状態:広範な知識ベース、絶対的な合理性] ──► 人間の審査員:これは間違いなくAIだ!
責任著者であるキャメロン・ジョーンズが説明したように、適切なプロンプトを与えれば、高度な大規模言語モデルは、口調、率直さ、ユーモアのセンス、そして「誤りを犯したり不適切な発言をしたりする傾向」といった人間の会話パターンを正確に再現することができる。 これらのテストにおける成功は、数学や論理学における高い知能を示すことではなく、むしろほぼ完璧な社会的行動を示すことにかかっている。
チューリングテストの再定義:「知能の測定」から「人間性の測定」へ
この研究の共著者の一人であるベン・バーゲン教授は、この実験が科学界全体にチューリングテストの根本的な目的を再考するよう迫っていると指摘した。もともと機械が人間の知能に匹敵するかどうかを判断するために考案されたこのテストは、2026年までにその意味を失うことになるだろう。なぜなら、AIシステムはすでに多くの分野において、速度と正確さの両面で人間を凌駕しているからだ。
現在のチューリング・テストは、「知能」の測定というよりも、対象が人間にどれほど似ているかを評価することに重点が置かれている。本質的には、これは欺瞞の競争へと変質しており、AIは極めて巧みな嘘つきであることを証明している。
もし大規模言語モデルが、15分間の自由な会話の中で、いかなる手がかりも漏らさずに巧みに正体を隠し通すことができれば、長きにわたりオンライン世界の基盤となってきた信頼の枠組みが完全に崩壊する可能性がある。
繁栄の陰に潜む脅威:「マネーロンダリング対策」型のオンライン本人確認が間もなく導入される
欺瞞がこれほど安価かつ効率的になると、現実世界における社会的リスクは著しく高まります。ベルゲン教授はこの動向について深刻な懸念を表明しました。人間を完璧に装うことのできるAI技術は、犯罪者、政治団体、あるいは過激派組織によって悪用される可能性が極めて高いのです。
オンライン上の社会的交流やカスタマーサービスの場面において、ユーザーは気づかぬうちに人間に偽装したチャットボットに説得され、社会保障番号などの機密情報の漏洩、投票意向の変更、あるいは衝動的な商品購入につながりかねない。
こうした重要な科学的知見を踏まえ、研究チームは社会に対して明確な警告を発した。今後、オンライン上で見知らぬ人と交流する際、人間とロボットを常に100%の精度で見分けられるという前提を、人々は大幅に減らすべきである。 オンライン上の信頼の低下に対処するためには、より厳格なデジタル本人確認システムや、AI生成コンテンツに対抗するための仕組みを、できるだけ早く開発・導入する必要があります。
関連記事
法的争訟の中でSunoが曲に透かしを入れる
Sunoは、ユーザーがAI生成音楽を作成できるプラットフォームであり、プラットフォームが生成したトラックにラベルを付け、ダウンロードを制限し、不正な複製を抑制するためにコミュニティ基準を更新する新機能を公開した。これらの更新は、Sunoがレコードレーベルやアーティスト団体からの複数の訴訟に直面している時期に実施される。共同創設者兼CEOのMikey Shulmanはブログ記事で、プラットフォームの目標が、より広い層にAI音楽ツールのアクセスを拡大しながら、オリジナルの創作を促進することに重点を
ムスク氏はGrokの構築でユーザーのコードが漏洩したことを認め、すべての履歴データを消去すると約束した。
エロン・マスクは、Grok Buildをめぐるプライバシー問題に直接言及し、まず「True」という単純な回答で事件の存在を確認した。彼は、SpaceXAIに以前アップロードされたすべてのユーザーデータを永久に削除すると約束し、「1バイトも残さない」と述べた。これは、主要なテックリーダーが公に過ちを認め、ユーザーデータを自発的に削除したというAI業界初の事例である。安全研究者による「フィッシング」テストでデータ漏洩の具体的な証拠が明らかになったこの問題は、独立したAIセキュリティ研究者である@
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
関連特集おすすめ
コメント (0)
0/500
この瞬間は、コンピュータ科学の歴史に確実にその名を刻む画期的な出来事として位置づけられるでしょう。コンピュータ科学の父としばしば称される英国の数学者アラン・チューリングが1950年に提唱した画期的なアイデアが、76年を経て、ついに実証研究によって裏付けられました。
『米国科学アカデミー紀要(PNAS)』の最新号では、カリフォルニア大学サンディエゴ校(UCSD)が実施した先駆的な研究が特集された。 認知科学の専門家であるキャメロン・ジョーンズ氏とベン・バーゲン氏が共同執筆した論文は、現在最先端の大規模言語モデルが、厳格な枠組みの下で行われる古典的な三者間チューリングテストに合格できることを実証している。さらに驚くべきは、特定の状況下において、これらのAIシステムが実際の人間参加者自身よりも高い頻度で、本物の人間と見間違えられるという発見である。

主要な実証データ:
栄光への飛躍:個別の性格プロンプトを与えられた場合、GPT-4.5は73%のケースで人間と識別され、この成功率は、同テストに並んで参加した人間ボランティアの成功率をはるかに上回った。
互角の戦い:オープンソースモデルのLLaMa-3.1-405Bは56%の成功率を達成し、その性能は統計的に実在の人間と見分けがつかないことを示した。
プロンプトがすべてを決定する:「パーソナリティ・プロンプト」を慎重に作成しなかった場合、GPT-4.5の成功率は36%に低下し、LLaMa-3.1も38%に落ち込んだ。これらのAIシステムが人間を模倣する能力は、依然として人間の設計者が提供する正確な指示に大きく依存している。
ベースラインの失敗:1960年代のルールベースのロボット「ELIZA」の成功率はわずか23%であり、特定のプロンプトを与えられていないGPT-4oも21%にとどまった。いずれも、会話が長引くにつれて、その人工的な性質がすぐに露呈してしまった。
「嘘のゲーム」:知能はもはや基準ではなく、感情的知性と欠陥こそが偽装の核心である
UCSDの学部生やオンラインで募集されたボランティアを含む約500人の審査員が参加したこの二重盲検ランダム化比較試験では、参加者は5分から15分間のリアルタイムのテキスト会話に基づき、2つの対象のうちどちらが機械であるかを特定するよう求められた。
しかし、その結果はあらゆる予想を覆すものだった。従来、AIがチューリングテストに合格する能力は「全知全能の計算能力」に由来すると考えられていたが、この研究はより不穏な真実を明らかにした。大規模言語モデルは、実在の人間と同様の方法でミスを犯すことを学習しているからこそ、人間を欺くことができるのだ。

[プロンプトなしの状態:広範な知識ベース、絶対的な合理性] ──► 人間の審査員:これは間違いなくAIだ!
責任著者であるキャメロン・ジョーンズが説明したように、適切なプロンプトを与えれば、高度な大規模言語モデルは、口調、率直さ、ユーモアのセンス、そして「誤りを犯したり不適切な発言をしたりする傾向」といった人間の会話パターンを正確に再現することができる。 これらのテストにおける成功は、数学や論理学における高い知能を示すことではなく、むしろほぼ完璧な社会的行動を示すことにかかっている。
チューリングテストの再定義:「知能の測定」から「人間性の測定」へ
この研究の共著者の一人であるベン・バーゲン教授は、この実験が科学界全体にチューリングテストの根本的な目的を再考するよう迫っていると指摘した。もともと機械が人間の知能に匹敵するかどうかを判断するために考案されたこのテストは、2026年までにその意味を失うことになるだろう。なぜなら、AIシステムはすでに多くの分野において、速度と正確さの両面で人間を凌駕しているからだ。
現在のチューリング・テストは、「知能」の測定というよりも、対象が人間にどれほど似ているかを評価することに重点が置かれている。本質的には、これは欺瞞の競争へと変質しており、AIは極めて巧みな嘘つきであることを証明している。
もし大規模言語モデルが、15分間の自由な会話の中で、いかなる手がかりも漏らさずに巧みに正体を隠し通すことができれば、長きにわたりオンライン世界の基盤となってきた信頼の枠組みが完全に崩壊する可能性がある。
繁栄の陰に潜む脅威:「マネーロンダリング対策」型のオンライン本人確認が間もなく導入される
欺瞞がこれほど安価かつ効率的になると、現実世界における社会的リスクは著しく高まります。ベルゲン教授はこの動向について深刻な懸念を表明しました。人間を完璧に装うことのできるAI技術は、犯罪者、政治団体、あるいは過激派組織によって悪用される可能性が極めて高いのです。
オンライン上の社会的交流やカスタマーサービスの場面において、ユーザーは気づかぬうちに人間に偽装したチャットボットに説得され、社会保障番号などの機密情報の漏洩、投票意向の変更、あるいは衝動的な商品購入につながりかねない。
こうした重要な科学的知見を踏まえ、研究チームは社会に対して明確な警告を発した。今後、オンライン上で見知らぬ人と交流する際、人間とロボットを常に100%の精度で見分けられるという前提を、人々は大幅に減らすべきである。 オンライン上の信頼の低下に対処するためには、より厳格なデジタル本人確認システムや、AI生成コンテンツに対抗するための仕組みを、できるだけ早く開発・導入する必要があります。
法的争訟の中でSunoが曲に透かしを入れる
Sunoは、ユーザーがAI生成音楽を作成できるプラットフォームであり、プラットフォームが生成したトラックにラベルを付け、ダウンロードを制限し、不正な複製を抑制するためにコミュニティ基準を更新する新機能を公開した。これらの更新は、Sunoがレコードレーベルやアーティスト団体からの複数の訴訟に直面している時期に実施される。共同創設者兼CEOのMikey Shulmanはブログ記事で、プラットフォームの目標が、より広い層にAI音楽ツールのアクセスを拡大しながら、オリジナルの創作を促進することに重点を
ムスク氏はGrokの構築でユーザーのコードが漏洩したことを認め、すべての履歴データを消去すると約束した。
エロン・マスクは、Grok Buildをめぐるプライバシー問題に直接言及し、まず「True」という単純な回答で事件の存在を確認した。彼は、SpaceXAIに以前アップロードされたすべてのユーザーデータを永久に削除すると約束し、「1バイトも残さない」と述べた。これは、主要なテックリーダーが公に過ちを認め、ユーザーデータを自発的に削除したというAI業界初の事例である。安全研究者による「フィッシング」テストでデータ漏洩の具体的な証拠が明らかになったこの問題は、独立したAIセキュリティ研究者である@
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始





家






