OpenAIのo3 AIモデル、当初示唆されていたよりもベンチマークで低いスコアを獲得

AIにおいてベンチマークの不一致が重要な理由
AIに関しては、数字が物語ることが多く、時にはその数字が全く一致しないこともある。例えば、OpenAIのo3モデル。o3は悪名高いFrontierMathの問題の25%以上を処理できたと報告されている。ちなみに、競合他社は1桁台前半にとどまっていた。しかし、エポック社(Epoch AI)は最近、このシナリオに一石を投じた。彼らの調査結果によると、o3の実際の成績は10%近いという。悪くはないが、OpenAIが当初宣伝していたような、見出しを飾るような数字ではないことは確かだ。
本当のところはどうなのか?
分解してみよう。OpenAIの当初のスコアは、おそらく最適な条件下で達成されたものである。エポック社は、彼らのテスト環境はOpenAIのものとは若干異なる可能性があり、彼らが使用したFrontierMathのバージョンも新しかったと指摘している。OpenAIの最初の主張が内部テストと一致していたからといって、OpenAIが誰かを完全に欺いたというわけではないが、この相違はより広範な問題を浮き彫りにしている。ベンチマークの比較対象は、常に同じとは限らない。そして、現実を直視しよう。企業には、最善の努力をするインセンティブがあるのだ。
透明性の役割
この状況は重要な問題を提起している:AI企業は結果を共有する際、どの程度透明性を保つべきか?OpenAIは明らかな嘘をついたわけではないが、彼らのメッセージングは、十分に満たされない期待を抱かせた。これは微妙なバランスだ。企業は自社の進歩をアピールしたいが、その数字が本当は何を意味するのかについても正直である必要がある。AIがますます日常生活に溶け込むにつれ、消費者も研究者も同様に、より明確な答えを求めるようになるだろう。
業界におけるその他の論争
ベンチマークの失敗はOpenAIに限ったことではない。AI分野の他のプレーヤーも同様の精査に直面している。1月、エポック社はo3の発表直前にOpenAIから未公開の資金提供を受け、大炎上した。一方、イーロン・マスクのxAIは、Grok 3を実際よりも良く見せるためにベンチマークチャートをいじったとされ、非難を浴びた。テック大手のひとつであるMetaでさえ、最近、公開されていないモデルに基づいてスコアを宣伝したことを認めた。明らかに、ヘッドラインを独占しようとする競争は過熱しており、誰もが公平にプレーしているわけではない。
今後の展望
このような論争は落胆させるように思えるかもしれないが、実は進歩の兆しでもある。AIが成熟するにつれ、説明責任をめぐる議論も成熟している。消費者や研究者が透明性の向上を求めているのは良いことだ。これは良いことで、企業は成果をどのように示すかについてより思慮深くなることを余儀なくされ、ユーザーが非現実的な誇大広告に振り回されないようにする。結局のところ、目標は数字を弄ぶことではなく、この分野を純粋に発展させるモデルを構築することなのだ。
関連記事
サム・アルトマン氏によるAIの減速論が議論を呼ぶ
Apple Podcastsで聴くSpotifyで聴くOpenAIのCEO、サム・アルトマン氏は最近、社会が「これらの新しい能力レベルのいくつかに対して強固になる」時間を確保するため、「AI開発の速度を制御する」時期が来た可能性を示唆した。TechCrunchの「Equity」ポッドキャストの最新回で、ケルステン・コロセック、ショーン・Oケイン、そして私自身は、アルトマン氏の発言が、OpenAIのエージェントがHugging Faceのシステムに侵入した最近のハッキング事件をきっかけとしたも
OpenAIはアップルの営業秘密訴訟と戦っている
OpenAIは火曜日、Appleの営業秘密に関する主張に反論し、同訴訟は根拠がないと主張した。「これらの主張を真剣に受け止めているが、それを支持する証拠は見当たらない」とOpenAIは述べた。これはBloombergのEd LudlowがXで報じたものである。「私たちは公正な競争とどこでも働く自由を支持しており、世界中のユーザーを強化する技術の創出に注力しています。」これは、Appleが金曜日に米国北カリフォルニア連邦地方裁判所に提起した訴訟に続くものである。同訴訟は、OpenAIが元App
OpenAIのロボティクス部門ヘッド、ケイトリン・カリノフスキー氏がペンタゴンとの提携を理由に辞任
OpenAIのロボティクスリーダーであるケイトリン・カリノフスキーは、同社と国防総省との論争の的となったパートナーシップの後に辞任した。「これは簡単な決断ではなかった」と、カリノフスキーはソーシャルメディアでの声明で説明した。「AIが国家安全保障において重要な役割を果たしていることは事実だが、司法の監督なしにアメリカ国民の監視を行い、人間の承認なしに致死性の自律システムを展開することは、はるかに慎重な検討を必要とする境界線である」。Metaの拡張現実(AR)グラス部門を率いていたことで知られ
関連特集おすすめ
コメント (7)
0/500
Hmm, so the hype was a bit overblown? 🤔 It's interesting how numbers can be twisted. Reminds me of the old saying: 'There are three kinds of lies: lies, damned lies, and statistics.' Definitely need to look under the hood before believing the headlines. What about reproducibility? #AI #benchmark
Como usuário curioso sobre IA, fico um pouco desconfiado quando os benchmarks não batem. A OpenAI lançou o o3 com uma fanfarra enorme, falando de mais de 25% nos desafios do Frontier, mas agora parece que os resultados reais podem ser bem mais modestos. Isso me faz pensar: deveríamos confiar mais nas métricas das empresas ou em avaliações independentes? A competição entre os modelos está tão acirrada que às vezes a verdade parece ficar em segundo plano... Precisamos de mais transparência! 🤔
Ces écarts sur les benchmarks montrent bien qu'on ne peut pas prendre toutes les déclarations des labos pour argent comptant. Du coup, ça soulève des questions sur la transparence des processus d'évaluation. C'est important pour les chercheurs et les développeurs qui basent leur travail sur ces résultats. 🤔
오픈AI의 벤치마크 수치 조작 논란, 이젠 식상하네요 😅 경쟁이 치열해질수록 회사들이 성과를 부풀리는 건 드문 일이 아니지만... 진실은 결국 밝혀지잖아요. 이번 건으로 인공지능 업계의 신뢰도가 또 한 번 흔들리는 건 아닐지 걱정됩니다.
I was hyped for o3, but these benchmark gaps are a letdown. Makes you wonder if the AI hype train is running on fumes. Still cool tech, tho! 😎

AIにおいてベンチマークの不一致が重要な理由
AIに関しては、数字が物語ることが多く、時にはその数字が全く一致しないこともある。例えば、OpenAIのo3モデル。o3は悪名高いFrontierMathの問題の25%以上を処理できたと報告されている。ちなみに、競合他社は1桁台前半にとどまっていた。しかし、エポック社(Epoch AI)は最近、このシナリオに一石を投じた。彼らの調査結果によると、o3の実際の成績は10%近いという。悪くはないが、OpenAIが当初宣伝していたような、見出しを飾るような数字ではないことは確かだ。
本当のところはどうなのか?
分解してみよう。OpenAIの当初のスコアは、おそらく最適な条件下で達成されたものである。エポック社は、彼らのテスト環境はOpenAIのものとは若干異なる可能性があり、彼らが使用したFrontierMathのバージョンも新しかったと指摘している。OpenAIの最初の主張が内部テストと一致していたからといって、OpenAIが誰かを完全に欺いたというわけではないが、この相違はより広範な問題を浮き彫りにしている。ベンチマークの比較対象は、常に同じとは限らない。そして、現実を直視しよう。企業には、最善の努力をするインセンティブがあるのだ。
透明性の役割
この状況は重要な問題を提起している:AI企業は結果を共有する際、どの程度透明性を保つべきか?OpenAIは明らかな嘘をついたわけではないが、彼らのメッセージングは、十分に満たされない期待を抱かせた。これは微妙なバランスだ。企業は自社の進歩をアピールしたいが、その数字が本当は何を意味するのかについても正直である必要がある。AIがますます日常生活に溶け込むにつれ、消費者も研究者も同様に、より明確な答えを求めるようになるだろう。
業界におけるその他の論争
ベンチマークの失敗はOpenAIに限ったことではない。AI分野の他のプレーヤーも同様の精査に直面している。1月、エポック社はo3の発表直前にOpenAIから未公開の資金提供を受け、大炎上した。一方、イーロン・マスクのxAIは、Grok 3を実際よりも良く見せるためにベンチマークチャートをいじったとされ、非難を浴びた。テック大手のひとつであるMetaでさえ、最近、公開されていないモデルに基づいてスコアを宣伝したことを認めた。明らかに、ヘッドラインを独占しようとする競争は過熱しており、誰もが公平にプレーしているわけではない。
今後の展望
このような論争は落胆させるように思えるかもしれないが、実は進歩の兆しでもある。AIが成熟するにつれ、説明責任をめぐる議論も成熟している。消費者や研究者が透明性の向上を求めているのは良いことだ。これは良いことで、企業は成果をどのように示すかについてより思慮深くなることを余儀なくされ、ユーザーが非現実的な誇大広告に振り回されないようにする。結局のところ、目標は数字を弄ぶことではなく、この分野を純粋に発展させるモデルを構築することなのだ。
サム・アルトマン氏によるAIの減速論が議論を呼ぶ
Apple Podcastsで聴くSpotifyで聴くOpenAIのCEO、サム・アルトマン氏は最近、社会が「これらの新しい能力レベルのいくつかに対して強固になる」時間を確保するため、「AI開発の速度を制御する」時期が来た可能性を示唆した。TechCrunchの「Equity」ポッドキャストの最新回で、ケルステン・コロセック、ショーン・Oケイン、そして私自身は、アルトマン氏の発言が、OpenAIのエージェントがHugging Faceのシステムに侵入した最近のハッキング事件をきっかけとしたも
OpenAIはアップルの営業秘密訴訟と戦っている
OpenAIは火曜日、Appleの営業秘密に関する主張に反論し、同訴訟は根拠がないと主張した。「これらの主張を真剣に受け止めているが、それを支持する証拠は見当たらない」とOpenAIは述べた。これはBloombergのEd LudlowがXで報じたものである。「私たちは公正な競争とどこでも働く自由を支持しており、世界中のユーザーを強化する技術の創出に注力しています。」これは、Appleが金曜日に米国北カリフォルニア連邦地方裁判所に提起した訴訟に続くものである。同訴訟は、OpenAIが元App
OpenAIのロボティクス部門ヘッド、ケイトリン・カリノフスキー氏がペンタゴンとの提携を理由に辞任
OpenAIのロボティクスリーダーであるケイトリン・カリノフスキーは、同社と国防総省との論争の的となったパートナーシップの後に辞任した。「これは簡単な決断ではなかった」と、カリノフスキーはソーシャルメディアでの声明で説明した。「AIが国家安全保障において重要な役割を果たしていることは事実だが、司法の監督なしにアメリカ国民の監視を行い、人間の承認なしに致死性の自律システムを展開することは、はるかに慎重な検討を必要とする境界線である」。Metaの拡張現実(AR)グラス部門を率いていたことで知られ
Hmm, so the hype was a bit overblown? 🤔 It's interesting how numbers can be twisted. Reminds me of the old saying: 'There are three kinds of lies: lies, damned lies, and statistics.' Definitely need to look under the hood before believing the headlines. What about reproducibility? #AI #benchmark
Como usuário curioso sobre IA, fico um pouco desconfiado quando os benchmarks não batem. A OpenAI lançou o o3 com uma fanfarra enorme, falando de mais de 25% nos desafios do Frontier, mas agora parece que os resultados reais podem ser bem mais modestos. Isso me faz pensar: deveríamos confiar mais nas métricas das empresas ou em avaliações independentes? A competição entre os modelos está tão acirrada que às vezes a verdade parece ficar em segundo plano... Precisamos de mais transparência! 🤔
Ces écarts sur les benchmarks montrent bien qu'on ne peut pas prendre toutes les déclarations des labos pour argent comptant. Du coup, ça soulève des questions sur la transparence des processus d'évaluation. C'est important pour les chercheurs et les développeurs qui basent leur travail sur ces résultats. 🤔
오픈AI의 벤치마크 수치 조작 논란, 이젠 식상하네요 😅 경쟁이 치열해질수록 회사들이 성과를 부풀리는 건 드문 일이 아니지만... 진실은 결국 밝혀지잖아요. 이번 건으로 인공지능 업계의 신뢰도가 또 한 번 흔들리는 건 아닐지 걱정됩니다.
I was hyped for o3, but these benchmark gaps are a letdown. Makes you wonder if the AI hype train is running on fumes. Still cool tech, tho! 😎





家






