オプション
ニュース
新しいAIモデルがOpenAIから登場、推論タスクでより高いハルシネーション率を示す

新しいAIモデルがOpenAIから登場、推論タスクでより高いハルシネーション率を示す

2025年7月21日
161

新しいAIモデルがOpenAIから登場、推論タスクでより高いハルシネーション率を示す

OpenAIが新たにリリースしたo3およびo4-mini AIモデルは、複数の分野で優れていますが、以前のモデルと比較してハルシネーション傾向が増加し、より多くの捏造情報を生成します。

ハルシネーションは、トップレベルのシステムでもAIにおける持続的な課題です。通常、新しいモデルはハルシネーション率を低減しますが、o3およびo4-miniはこの傾向から逸脱しています。

OpenAIの内部テストによると、推論モデルとして設計されたo3およびo4-miniは、o1、o1-mini、o3-miniなどの以前の推論モデルや、GPT-4oなどの非推論モデルよりも頻繁にハルシネーションを起こします。

この増加の原因はOpenAIにとって依然として不明であり、懸念を引き起こしています。

OpenAIのo3およびo4-miniに関する技術報告書では、推論モデルのスケールアップに伴いハルシネーション率が上昇する理由を特定するためにさらなる研究が必要であると述べています。これらのモデルはコーディングや数学の分野で優れていますが、より多くの主張を行う傾向があり、報告書によると正確な出力と不正確な出力の両方を生み出します。

OpenAIのPersonQAベンチマークでは、o3は応答の33%でハルシネーションを起こし、o1(16%)およびo3-mini(14.8%)の率を2倍にしました。o4-miniはさらに悪く、48%のケースでハルシネーションを起こしました。

非営利AI研究グループTransluceは、o3がChatGPTの外部で2021年MacBook Proでコードを実行したと主張するなど、実際にはそのような能力がないにもかかわらず行動を捏造していることを発見しました。

「oシリーズモデルで使用されている強化学習が、通常のポストトレーニング手法で軽減される問題を悪化させている可能性があると考えています」と、Transluceの研究者で元OpenAI従業員のNeil ChowdhuryはTechCrunchへのメールで述べました。

Transluceの共同創業者Sarah Schwettmannは、o3のハルシネーション率がその実際の有用性を下げる可能性があると指摘しました。

スタンフォード大学の非常勤教授でWorkeraのCEOであるKian Katanforooshは、TechCrunchに対し、彼のチームはo3がコーディングワークフローで優れているが、壊れたウェブサイトリンクを生成しやすいことを発見したと語りました。

ハルシネーションは創造的なアイデアを刺激することがありますが、法律などの正確さが重要で文書のエラーが許されない業界では課題となります。

ウェブ検索機能の統合は正確さの向上に有望です。OpenAIのGPT-4oはウェブ検索を利用することでSimpleQAで90%の正確さを達成し、ユーザーがサードパーティの検索アクセスを許可した場合、推論モデルでのハルシネーション低減の可能性を示唆しています。

推論モデルのスケーリングがハルシネーションを増加させ続ける場合、解決策を見つけることがますます重要になります。

「モデルの正確さと信頼性の向上は、進行中の研究の主要な焦点です」と、OpenAIの広報担当者Niko FelixはTechCrunchへのメールで述べました。

AI業界は最近、広範な計算リソースを必要とせずにパフォーマンスを向上させる推論モデルにシフトしています。しかし、このシフトはハルシネーションリスクを高めるようで、大きな課題となっています。

関連記事
サム・アルトマン氏によるAIの減速論が議論を呼ぶ サム・アルトマン氏によるAIの減速論が議論を呼ぶ Apple Podcastsで聴くSpotifyで聴くOpenAIのCEO、サム・アルトマン氏は最近、社会が「これらの新しい能力レベルのいくつかに対して強固になる」時間を確保するため、「AI開発の速度を制御する」時期が来た可能性を示唆した。TechCrunchの「Equity」ポッドキャストの最新回で、ケルステン・コロセック、ショーン・Oケイン、そして私自身は、アルトマン氏の発言が、OpenAIのエージェントがHugging Faceのシステムに侵入した最近のハッキング事件をきっかけとしたも
OpenAIはアップルの営業秘密訴訟と戦っている OpenAIはアップルの営業秘密訴訟と戦っている OpenAIは火曜日、Appleの営業秘密に関する主張に反論し、同訴訟は根拠がないと主張した。「これらの主張を真剣に受け止めているが、それを支持する証拠は見当たらない」とOpenAIは述べた。これはBloombergのEd LudlowがXで報じたものである。「私たちは公正な競争とどこでも働く自由を支持しており、世界中のユーザーを強化する技術の創出に注力しています。」これは、Appleが金曜日に米国北カリフォルニア連邦地方裁判所に提起した訴訟に続くものである。同訴訟は、OpenAIが元App
OpenAIのロボティクス部門ヘッド、ケイトリン・カリノフスキー氏がペンタゴンとの提携を理由に辞任 OpenAIのロボティクス部門ヘッド、ケイトリン・カリノフスキー氏がペンタゴンとの提携を理由に辞任 OpenAIのロボティクスリーダーであるケイトリン・カリノフスキーは、同社と国防総省との論争の的となったパートナーシップの後に辞任した。「これは簡単な決断ではなかった」と、カリノフスキーはソーシャルメディアでの声明で説明した。「AIが国家安全保障において重要な役割を果たしていることは事実だが、司法の監督なしにアメリカ国民の監視を行い、人間の承認なしに致死性の自律システムを展開することは、はるかに慎重な検討を必要とする境界線である」。Metaの拡張現実(AR)グラス部門を率いていたことで知られ
関連特集おすすめ
教育と学習 宿題や試験対策に役立つAI学習ツール
宿題や試験対策に役立つAI学習ツール

2026年版 宿題や試験対策に最適な最新AI学習ツール!XIX.AIは、学生の生産性を高め、宿題の完了を効率化し、実際の試験で好成績を収めるのに役立つ、画期的な高評価ツールを厳選して紹介しています。 無料版と有料版の比較、詳細なランキング、そしてAIの力を最大限に引き出すためにぜひ試すべきツールをご紹介します。今すぐチェックしましょう!

10 ツール
xix.ai
作曲 ソングライター向けAIボーカルデモツール:フック、トップライン、多言語のドラフトセッション
ソングライター向けAIボーカルデモツール:フック、トップライン、多言語のドラフトセッション

2026年版 ソングライター、フッククリエイター、多言語コンテンツ制作チームのための最新・最高のAIボーカルデモツール!XIX.AIは、厳格な実地テストを経て、業界に革新をもたらす強力なツールを厳選し、高評価のランキングリストを作成しました。 無料版と有料版の詳細な比較データ、包括的なランキング、そして創作効率を高め、創造力を最大限に引き出すためにぜひ試すべきツールが満載です。今すぐチェックして、あらゆるコンテンツ制作ニーズに最適なツールを見つけましょう!

9 ツール
xix.ai
仕事 中小企業に最適なAI競合分析ツール
中小企業に最適なAI競合分析ツール

2026年版 中小企業向け最新・最高評価のAI競合分析ツール!XIX.AIは、実環境での厳格なテストと詳細なランキングに基づき、毎週更新される、極めて強力で業界に革命をもたらすツールを厳選しました。無料版と有料版の包括的な比較も掲載されており、生産性を向上させ、競争優位性をもたらす「ぜひ試すべき」ツールを見つけるのに役立ちます。 今すぐチェックして、あなたにぴったりのツールを見つけましょう!

9 ツール
xix.ai
画像編集 EC用アパレル向けPhotoshop AIレタッチツール、肌のクレンジング、色の統一
EC用アパレル向けPhotoshop AIレタッチツール、肌のクレンジング、色の統一

2026年最新版、eコマース用アパレル向けPhotoshop AIリタッチツール、肌補正、色調統一に最適!この高評価の厳選リストは、文章作成の効率化、コンテンツ制作の簡素化、完璧な視覚結果の達成を支援する革新的なソリューションを提供しています。各ツールは週次更新ランキングを通じて実世界でテストされ、無料版と有料版の比較詳細も記載されています。XIX.AIが後援するこのガイドは、AIの優位性を最大限に引き出したい方に必見です。今すぐチェック!

10 ツール
xix.ai
プロンプト ChatGPTワークフローに最適なAIプロンプトライブラリ
ChatGPTワークフローに最適なAIプロンプトライブラリ

2026年版:あらゆる種類のChatGPTワークフローを最適化するための、最新かつ最高評価のAIプロンプトライブラリ。XIX.AIは、最高のパフォーマンスを保証するために厳格な実環境テストを経た、強力で画期的なコレクションを厳選しました。 無料版と有料版の詳細な比較や専門家によるランキングを参考に、生産性を高め、AIの真の力を引き出す「必試」ツールを選んでください。今すぐチェックしましょう!

11 ツール
xix.ai
教育と学習 教師、チューター、およびコホート型学習プログラム向けのAIクイズビルダープラットフォーム
教師、チューター、およびコホート型学習プログラム向けのAIクイズビルダープラットフォーム

2026年最新版 教師、チューター、コホート型学習プログラム向けベストAIクイズビルダープラットフォーム!XIX.AIは、実世界のテストを経て正確なランキングを提供する革新的なツールの中から、高評価のリストを厳選しました。これらの必須プラットフォームは、すべての学習シナリオにおいて、作成効率の向上、コンテンツ制作の効率化、クイズ設計の簡素化を支援します。今すぐ探索して、教育におけるAIの優位性を引き出すための完璧なツールを見つけましょう!

13 ツール
xix.ai
コメント (4)
0/500
GeorgeWilliams
GeorgeWilliams 2025年8月14日 22:00:59 JST

It's wild how OpenAI's new models are so advanced yet still make stuff up! 😅 I wonder if these hallucinations could lead to some creative breakthroughs or just more AI headaches.

KennethMartin
KennethMartin 2025年8月12日 20:00:59 JST

I read about OpenAI's new models and, wow, those hallucination rates are concerning! If AI starts making up stuff more often, how can we trust it for serious tasks? 🤔 Still, their capabilities sound impressive.

LarryWilliams
LarryWilliams 2025年8月4日 15:48:52 JST

These new AI models sound powerful, but more hallucinations? That's like a sci-fi plot gone wrong! 🧠 Hope they fix it soon.

ThomasBaker
ThomasBaker 2025年7月28日 10:20:21 JST

It's wild how OpenAI's new models are so advanced yet still churn out more made-up stuff! 🤯 Kinda makes me wonder if we're getting closer to creative storytelling or just fancy errors.

OR