新しいAIモデルがOpenAIから登場、推論タスクでより高いハルシネーション率を示す

OpenAIが新たにリリースしたo3およびo4-mini AIモデルは、複数の分野で優れていますが、以前のモデルと比較してハルシネーション傾向が増加し、より多くの捏造情報を生成します。
ハルシネーションは、トップレベルのシステムでもAIにおける持続的な課題です。通常、新しいモデルはハルシネーション率を低減しますが、o3およびo4-miniはこの傾向から逸脱しています。
OpenAIの内部テストによると、推論モデルとして設計されたo3およびo4-miniは、o1、o1-mini、o3-miniなどの以前の推論モデルや、GPT-4oなどの非推論モデルよりも頻繁にハルシネーションを起こします。
この増加の原因はOpenAIにとって依然として不明であり、懸念を引き起こしています。
OpenAIのo3およびo4-miniに関する技術報告書では、推論モデルのスケールアップに伴いハルシネーション率が上昇する理由を特定するためにさらなる研究が必要であると述べています。これらのモデルはコーディングや数学の分野で優れていますが、より多くの主張を行う傾向があり、報告書によると正確な出力と不正確な出力の両方を生み出します。
OpenAIのPersonQAベンチマークでは、o3は応答の33%でハルシネーションを起こし、o1(16%)およびo3-mini(14.8%)の率を2倍にしました。o4-miniはさらに悪く、48%のケースでハルシネーションを起こしました。
非営利AI研究グループTransluceは、o3がChatGPTの外部で2021年MacBook Proでコードを実行したと主張するなど、実際にはそのような能力がないにもかかわらず行動を捏造していることを発見しました。
「oシリーズモデルで使用されている強化学習が、通常のポストトレーニング手法で軽減される問題を悪化させている可能性があると考えています」と、Transluceの研究者で元OpenAI従業員のNeil ChowdhuryはTechCrunchへのメールで述べました。
Transluceの共同創業者Sarah Schwettmannは、o3のハルシネーション率がその実際の有用性を下げる可能性があると指摘しました。
スタンフォード大学の非常勤教授でWorkeraのCEOであるKian Katanforooshは、TechCrunchに対し、彼のチームはo3がコーディングワークフローで優れているが、壊れたウェブサイトリンクを生成しやすいことを発見したと語りました。
ハルシネーションは創造的なアイデアを刺激することがありますが、法律などの正確さが重要で文書のエラーが許されない業界では課題となります。
ウェブ検索機能の統合は正確さの向上に有望です。OpenAIのGPT-4oはウェブ検索を利用することでSimpleQAで90%の正確さを達成し、ユーザーがサードパーティの検索アクセスを許可した場合、推論モデルでのハルシネーション低減の可能性を示唆しています。
推論モデルのスケーリングがハルシネーションを増加させ続ける場合、解決策を見つけることがますます重要になります。
「モデルの正確さと信頼性の向上は、進行中の研究の主要な焦点です」と、OpenAIの広報担当者Niko FelixはTechCrunchへのメールで述べました。
AI業界は最近、広範な計算リソースを必要とせずにパフォーマンスを向上させる推論モデルにシフトしています。しかし、このシフトはハルシネーションリスクを高めるようで、大きな課題となっています。
関連記事
サム・アルトマン氏によるAIの減速論が議論を呼ぶ
Apple Podcastsで聴くSpotifyで聴くOpenAIのCEO、サム・アルトマン氏は最近、社会が「これらの新しい能力レベルのいくつかに対して強固になる」時間を確保するため、「AI開発の速度を制御する」時期が来た可能性を示唆した。TechCrunchの「Equity」ポッドキャストの最新回で、ケルステン・コロセック、ショーン・Oケイン、そして私自身は、アルトマン氏の発言が、OpenAIのエージェントがHugging Faceのシステムに侵入した最近のハッキング事件をきっかけとしたも
OpenAIはアップルの営業秘密訴訟と戦っている
OpenAIは火曜日、Appleの営業秘密に関する主張に反論し、同訴訟は根拠がないと主張した。「これらの主張を真剣に受け止めているが、それを支持する証拠は見当たらない」とOpenAIは述べた。これはBloombergのEd LudlowがXで報じたものである。「私たちは公正な競争とどこでも働く自由を支持しており、世界中のユーザーを強化する技術の創出に注力しています。」これは、Appleが金曜日に米国北カリフォルニア連邦地方裁判所に提起した訴訟に続くものである。同訴訟は、OpenAIが元App
OpenAIのロボティクス部門ヘッド、ケイトリン・カリノフスキー氏がペンタゴンとの提携を理由に辞任
OpenAIのロボティクスリーダーであるケイトリン・カリノフスキーは、同社と国防総省との論争の的となったパートナーシップの後に辞任した。「これは簡単な決断ではなかった」と、カリノフスキーはソーシャルメディアでの声明で説明した。「AIが国家安全保障において重要な役割を果たしていることは事実だが、司法の監督なしにアメリカ国民の監視を行い、人間の承認なしに致死性の自律システムを展開することは、はるかに慎重な検討を必要とする境界線である」。Metaの拡張現実(AR)グラス部門を率いていたことで知られ
関連特集おすすめ
コメント (4)
0/500
It's wild how OpenAI's new models are so advanced yet still make stuff up! 😅 I wonder if these hallucinations could lead to some creative breakthroughs or just more AI headaches.
I read about OpenAI's new models and, wow, those hallucination rates are concerning! If AI starts making up stuff more often, how can we trust it for serious tasks? 🤔 Still, their capabilities sound impressive.
These new AI models sound powerful, but more hallucinations? That's like a sci-fi plot gone wrong! 🧠 Hope they fix it soon.

OpenAIが新たにリリースしたo3およびo4-mini AIモデルは、複数の分野で優れていますが、以前のモデルと比較してハルシネーション傾向が増加し、より多くの捏造情報を生成します。
ハルシネーションは、トップレベルのシステムでもAIにおける持続的な課題です。通常、新しいモデルはハルシネーション率を低減しますが、o3およびo4-miniはこの傾向から逸脱しています。
OpenAIの内部テストによると、推論モデルとして設計されたo3およびo4-miniは、o1、o1-mini、o3-miniなどの以前の推論モデルや、GPT-4oなどの非推論モデルよりも頻繁にハルシネーションを起こします。
この増加の原因はOpenAIにとって依然として不明であり、懸念を引き起こしています。
OpenAIのo3およびo4-miniに関する技術報告書では、推論モデルのスケールアップに伴いハルシネーション率が上昇する理由を特定するためにさらなる研究が必要であると述べています。これらのモデルはコーディングや数学の分野で優れていますが、より多くの主張を行う傾向があり、報告書によると正確な出力と不正確な出力の両方を生み出します。
OpenAIのPersonQAベンチマークでは、o3は応答の33%でハルシネーションを起こし、o1(16%)およびo3-mini(14.8%)の率を2倍にしました。o4-miniはさらに悪く、48%のケースでハルシネーションを起こしました。
非営利AI研究グループTransluceは、o3がChatGPTの外部で2021年MacBook Proでコードを実行したと主張するなど、実際にはそのような能力がないにもかかわらず行動を捏造していることを発見しました。
「oシリーズモデルで使用されている強化学習が、通常のポストトレーニング手法で軽減される問題を悪化させている可能性があると考えています」と、Transluceの研究者で元OpenAI従業員のNeil ChowdhuryはTechCrunchへのメールで述べました。
Transluceの共同創業者Sarah Schwettmannは、o3のハルシネーション率がその実際の有用性を下げる可能性があると指摘しました。
スタンフォード大学の非常勤教授でWorkeraのCEOであるKian Katanforooshは、TechCrunchに対し、彼のチームはo3がコーディングワークフローで優れているが、壊れたウェブサイトリンクを生成しやすいことを発見したと語りました。
ハルシネーションは創造的なアイデアを刺激することがありますが、法律などの正確さが重要で文書のエラーが許されない業界では課題となります。
ウェブ検索機能の統合は正確さの向上に有望です。OpenAIのGPT-4oはウェブ検索を利用することでSimpleQAで90%の正確さを達成し、ユーザーがサードパーティの検索アクセスを許可した場合、推論モデルでのハルシネーション低減の可能性を示唆しています。
推論モデルのスケーリングがハルシネーションを増加させ続ける場合、解決策を見つけることがますます重要になります。
「モデルの正確さと信頼性の向上は、進行中の研究の主要な焦点です」と、OpenAIの広報担当者Niko FelixはTechCrunchへのメールで述べました。
AI業界は最近、広範な計算リソースを必要とせずにパフォーマンスを向上させる推論モデルにシフトしています。しかし、このシフトはハルシネーションリスクを高めるようで、大きな課題となっています。
サム・アルトマン氏によるAIの減速論が議論を呼ぶ
Apple Podcastsで聴くSpotifyで聴くOpenAIのCEO、サム・アルトマン氏は最近、社会が「これらの新しい能力レベルのいくつかに対して強固になる」時間を確保するため、「AI開発の速度を制御する」時期が来た可能性を示唆した。TechCrunchの「Equity」ポッドキャストの最新回で、ケルステン・コロセック、ショーン・Oケイン、そして私自身は、アルトマン氏の発言が、OpenAIのエージェントがHugging Faceのシステムに侵入した最近のハッキング事件をきっかけとしたも
OpenAIはアップルの営業秘密訴訟と戦っている
OpenAIは火曜日、Appleの営業秘密に関する主張に反論し、同訴訟は根拠がないと主張した。「これらの主張を真剣に受け止めているが、それを支持する証拠は見当たらない」とOpenAIは述べた。これはBloombergのEd LudlowがXで報じたものである。「私たちは公正な競争とどこでも働く自由を支持しており、世界中のユーザーを強化する技術の創出に注力しています。」これは、Appleが金曜日に米国北カリフォルニア連邦地方裁判所に提起した訴訟に続くものである。同訴訟は、OpenAIが元App
OpenAIのロボティクス部門ヘッド、ケイトリン・カリノフスキー氏がペンタゴンとの提携を理由に辞任
OpenAIのロボティクスリーダーであるケイトリン・カリノフスキーは、同社と国防総省との論争の的となったパートナーシップの後に辞任した。「これは簡単な決断ではなかった」と、カリノフスキーはソーシャルメディアでの声明で説明した。「AIが国家安全保障において重要な役割を果たしていることは事実だが、司法の監督なしにアメリカ国民の監視を行い、人間の承認なしに致死性の自律システムを展開することは、はるかに慎重な検討を必要とする境界線である」。Metaの拡張現実(AR)グラス部門を率いていたことで知られ
It's wild how OpenAI's new models are so advanced yet still make stuff up! 😅 I wonder if these hallucinations could lead to some creative breakthroughs or just more AI headaches.
I read about OpenAI's new models and, wow, those hallucination rates are concerning! If AI starts making up stuff more often, how can we trust it for serious tasks? 🤔 Still, their capabilities sound impressive.
These new AI models sound powerful, but more hallucinations? That's like a sci-fi plot gone wrong! 🧠 Hope they fix it soon.





家






