OpenAI、バイブグラフィ技術で反発に直面

木曜日に行われたGPT-5のライブストリームで、OpenAIはGPT-5の素晴らしい能力を示すかのようなグラフをいくつか提示した。
皮肉なことに、GPT-5の "モデル間の欺瞞検証 "のパフォーマンスを示すあるチャートでは、スケールがずれているように見える。例えば、ステージ上のグラフィックでは、「思考」を持つGPT-5が50.0%の欺瞞率を達成したと主張されている。しかし、OpenAIの小型モデル「o3」は47.4パーセントと報告されており、より大きなバーとして表示されている。しかし、OpenAIのGPT-5公式ブログポストで公開されているデータでは、GPT-5の実際の欺瞞率は16.5パーセントとなっている。
この視覚的なミスマッチにより、ステージ上では、GPT-5のスコアが低く報告されているにもかかわらず、GPT-5のバーがo3よりも高く表示されていた。同じチャートの別の場所では、o3とGPT-4oのスコアは異なっていたが、同じ大きさのバーで表示されていた。この誤りは、サム・アルトマン最高経営責任者(CEO)が公に認めるほど重大なもので、「チャートの大失敗」とレッテルを貼り、ブログには正しいバージョンが掲載されていることを明らかにした。
OpenAIのマーケティングスタッフも謝罪し、「ブログでチャートを修正しました。
金曜日、アルトマンはRedditユーザーからのグラフに関する問い合わせに答え、「ここの数字は正確だったが、ライブストリーム中に棒グラフを間違えてしまった」と説明した。別のスライドでは数字を間違えていた」と説明した。彼は、ブログ記事とシステムカードのデータが正確であることを確認し、「チームメンバーは遅くまで働き、疲労困憊していたため、ヒューマンエラーにつながった」と付け加えた。ライブストリームのために、すべてが直前になってしまったのです」。
それでも、このような重要な発売日にこのようなミスがあったことは、同社にとって残念なことである。特に、新モデルの "幻覚症状の軽減における大きな進歩 "をアピールするものであるだけに。
8月8日更新:アルトマンのRedditコメントを追加。
関連記事
Google、Geminiへの焦点がユーザー制御へシフトする中で、Remy AIエージェントをテスト
『Business Insider』によると、GoogleはGemini向けの新しいAIパーソナルエージェント「Remy」をテスト中である。このツールはユーザーに代わってタスクを実行することを目的としており、業務フローと日常のルーチンの両方を効率化する。現在、RemyはGeminiアプリケーションの社内限定版においてテストが行われている。この報道は社内文書と、プロジェクトに精通した2人の人物へのインタビューを引用している。社内資料では、Remyを「24時間365日のパーソナルエージェント」と位
サム・アルトマン氏によるAIの減速論が議論を呼ぶ
Apple Podcastsで聴くSpotifyで聴くOpenAIのCEO、サム・アルトマン氏は最近、社会が「これらの新しい能力レベルのいくつかに対して強固になる」時間を確保するため、「AI開発の速度を制御する」時期が来た可能性を示唆した。TechCrunchの「Equity」ポッドキャストの最新回で、ケルステン・コロセック、ショーン・Oケイン、そして私自身は、アルトマン氏の発言が、OpenAIのエージェントがHugging Faceのシステムに侵入した最近のハッキング事件をきっかけとしたも
OpenAIはアップルの営業秘密訴訟と戦っている
OpenAIは火曜日、Appleの営業秘密に関する主張に反論し、同訴訟は根拠がないと主張した。「これらの主張を真剣に受け止めているが、それを支持する証拠は見当たらない」とOpenAIは述べた。これはBloombergのEd LudlowがXで報じたものである。「私たちは公正な競争とどこでも働く自由を支持しており、世界中のユーザーを強化する技術の創出に注力しています。」これは、Appleが金曜日に米国北カリフォルニア連邦地方裁判所に提起した訴訟に続くものである。同訴訟は、OpenAIが元App
関連特集おすすめ
コメント (0)
0/500

木曜日に行われたGPT-5のライブストリームで、OpenAIはGPT-5の素晴らしい能力を示すかのようなグラフをいくつか提示した。
皮肉なことに、GPT-5の "モデル間の欺瞞検証 "のパフォーマンスを示すあるチャートでは、スケールがずれているように見える。例えば、ステージ上のグラフィックでは、「思考」を持つGPT-5が50.0%の欺瞞率を達成したと主張されている。しかし、OpenAIの小型モデル「o3」は47.4パーセントと報告されており、より大きなバーとして表示されている。しかし、OpenAIのGPT-5公式ブログポストで公開されているデータでは、GPT-5の実際の欺瞞率は16.5パーセントとなっている。
この視覚的なミスマッチにより、ステージ上では、GPT-5のスコアが低く報告されているにもかかわらず、GPT-5のバーがo3よりも高く表示されていた。同じチャートの別の場所では、o3とGPT-4oのスコアは異なっていたが、同じ大きさのバーで表示されていた。この誤りは、サム・アルトマン最高経営責任者(CEO)が公に認めるほど重大なもので、「チャートの大失敗」とレッテルを貼り、ブログには正しいバージョンが掲載されていることを明らかにした。
OpenAIのマーケティングスタッフも謝罪し、「ブログでチャートを修正しました。
金曜日、アルトマンはRedditユーザーからのグラフに関する問い合わせに答え、「ここの数字は正確だったが、ライブストリーム中に棒グラフを間違えてしまった」と説明した。別のスライドでは数字を間違えていた」と説明した。彼は、ブログ記事とシステムカードのデータが正確であることを確認し、「チームメンバーは遅くまで働き、疲労困憊していたため、ヒューマンエラーにつながった」と付け加えた。ライブストリームのために、すべてが直前になってしまったのです」。
それでも、このような重要な発売日にこのようなミスがあったことは、同社にとって残念なことである。特に、新モデルの "幻覚症状の軽減における大きな進歩 "をアピールするものであるだけに。
8月8日更新:アルトマンのRedditコメントを追加。
サム・アルトマン氏によるAIの減速論が議論を呼ぶ
Apple Podcastsで聴くSpotifyで聴くOpenAIのCEO、サム・アルトマン氏は最近、社会が「これらの新しい能力レベルのいくつかに対して強固になる」時間を確保するため、「AI開発の速度を制御する」時期が来た可能性を示唆した。TechCrunchの「Equity」ポッドキャストの最新回で、ケルステン・コロセック、ショーン・Oケイン、そして私自身は、アルトマン氏の発言が、OpenAIのエージェントがHugging Faceのシステムに侵入した最近のハッキング事件をきっかけとしたも
OpenAIはアップルの営業秘密訴訟と戦っている
OpenAIは火曜日、Appleの営業秘密に関する主張に反論し、同訴訟は根拠がないと主張した。「これらの主張を真剣に受け止めているが、それを支持する証拠は見当たらない」とOpenAIは述べた。これはBloombergのEd LudlowがXで報じたものである。「私たちは公正な競争とどこでも働く自由を支持しており、世界中のユーザーを強化する技術の創出に注力しています。」これは、Appleが金曜日に米国北カリフォルニア連邦地方裁判所に提起した訴訟に続くものである。同訴訟は、OpenAIが元App





家






