opción
Hogar
Noticias
El modelo o3 de IA de OpenAI obtiene una puntuación más baja en la prueba de referencia de lo que se sugirió inicialmente

El modelo o3 de IA de OpenAI obtiene una puntuación más baja en la prueba de referencia de lo que se sugirió inicialmente

7 de junio de 2025
160

El modelo o3 de IA de OpenAI obtiene una puntuación más baja en la prueba de referencia de lo que se sugirió inicialmente

Por qué las discrepancias en los puntos de referencia son importantes en la IA

En lo que respecta a la IA, los números suelen contar la historia y, a veces, esos números no cuadran del todo. Tomemos como ejemplo el modelo o3 de OpenAI. Las afirmaciones iniciales eran asombrosas: o3 podía resolver más del 25% de los problemas FrontierMath. Para contextualizar, la competencia se quedaba en unos pocos dígitos. Sin embargo, en los últimos tiempos, Epoch AI -un respetado instituto de investigación- ha dado un vuelco a la historia. Sus hallazgos sugieren que el rendimiento real de o3 se acerca al 10%. No está mal, pero desde luego no es la cifra que tanto llamó la atención a OpenAI en un principio.

¿Qué está pasando realmente?

Desglosémoslo. Es probable que la puntuación original de OpenAI se obtuviera en condiciones óptimas, condiciones que podrían no ser exactamente reproducibles en el mundo real. Epoch señaló que su entorno de pruebas podría diferir ligeramente del de OpenAI, e incluso la versión de FrontierMath que utilizaron era más reciente. Esto no quiere decir que OpenAI haya engañado a nadie; sus afirmaciones iniciales coincidían con las pruebas internas, pero la disparidad pone de manifiesto un problema más amplio. Los puntos de referencia no siempre son comparables. Y, admitámoslo, las empresas tienen incentivos para dar lo mejor de sí mismas.

El papel de la transparencia

Esta situación plantea una cuestión importante: ¿Hasta qué punto deben ser transparentes las empresas de IA a la hora de compartir resultados? Aunque OpenAI no mintió abiertamente, sus mensajes crearon expectativas que no se cumplieron del todo. Es un equilibrio delicado. Las empresas quieren mostrar sus avances, pero también tienen que ser honestas sobre lo que significan realmente esas cifras. A medida que la IA se integre cada vez más en la vida cotidiana, tanto los consumidores como los investigadores exigirán respuestas más claras.

Otras polémicas del sector

Los errores de evaluación comparativa no son exclusivos de OpenAI. Otros actores del sector de la IA se han enfrentado a escrutinios similares. En enero, Epoch se metió en un buen lío tras aceptar financiación no revelada de OpenAI justo antes del anuncio de o3. Por su parte, xAI, de Elon Musk, fue objeto de críticas por modificar supuestamente sus gráficos de referencia para que Grok 3 pareciera mejor de lo que era en realidad. Incluso Meta, uno de los gigantes tecnológicos, admitió recientemente que promocionaba puntuaciones basadas en un modelo que no estaba disponible públicamente. Está claro que la carrera por dominar los titulares se recrudece, y no todos juegan limpio.

De cara al futuro

Aunque estas polémicas puedan parecer desalentadoras, en realidad son un signo de progreso. A medida que el panorama de la IA madura, también lo hace el discurso en torno a la responsabilidad. Los consumidores y los investigadores exigen una mayor transparencia, y eso es bueno. Obliga a las empresas a ser más reflexivas a la hora de presentar sus logros y garantiza que los usuarios no se dejen llevar por exageraciones poco realistas. Al fin y al cabo, el objetivo no debería ser jugar con las cifras, sino crear modelos que realmente hagan avanzar el sector.

Artículo relacionado
Sam Altman desata un debate sobre la desaceleración de la IA Sam Altman desata un debate sobre la desaceleración de la IA Escuchar enApple PodcastsEscuchar enSpotifyEl director ejecutivo de OpenAI, Sam Altman, sugirió recientemente que podría ser el momento de “regular el ritmo del desarrollo de la IA” para permitir que la sociedad “se fortalezca en torno a algunos de
OpenAI enfrenta una demanda por secreto comercial de Apple OpenAI enfrenta una demanda por secreto comercial de Apple OpenAI rebatió las alegaciones de Apple sobre secretos comerciales el martes, argumentando que la demanda es infundada.“Tomamos estas afirmaciones en serio, pero no vemos ninguna evidencia que las respalde”, declaró OpenAI, según informó Ed Ludlow d
La jefa de robótica de OpenAI, Caitlin Kalinowski, renuncia por la asociación con el Pentágono La jefa de robótica de OpenAI, Caitlin Kalinowski, renuncia por la asociación con el Pentágono El líder de robótica de OpenAI, Caitlin Kalinowski, ha dimitido tras la controvertida asociación de la empresa con el Departamento de Defensa.“Esta no fue una decisión fácil”, explicó Kalinowski en un comunicado en redes sociales. “Aunque la IA dese
Recomendaciones de temas especiales relacionados
SEO Las mejores herramientas de análisis de SERP basadas en IA para la estrategia de búsqueda
Las mejores herramientas de análisis de SERP basadas en IA para la estrategia de búsqueda

Las mejores herramientas de análisis de SERP con IA mejor valoradas de 2026 para la estrategia de búsqueda han sido seleccionadas por XIX.AI tras rigurosas pruebas en condiciones reales y clasificaciones que se actualizan semanalmente. Estas potentes herramientas te ayudan a descubrir oportunidades de optimización ocultas, a mejorar el rendimiento de tu contenido y a obtener una ventaja competitiva en los motores de búsqueda. Descubre hoy mismo la herramienta perfecta para mejorar tu estrategia de búsqueda. ¡Explora ahora!

13 herramientas
xix.ai
Análisis de datos Mejores herramientas de IA para la detección de anomalías en el monitoreo de KPIs para equipos de SaaS y comercio electrónico
Mejores herramientas de IA para la detección de anomalías en el monitoreo de KPIs para equipos de SaaS y comercio electrónico

¡Las mejores herramientas de detección de anomalías con IA de 2026, más valoradas y destacadas para el monitoreo de KPI en equipos de SaaS y comercio electrónico! XIX.AI ha recopilado una poderosa colección transformadora basada en rigurosas pruebas del mundo real y clasificaciones actualizadas semanalmente. Encontrarás comparaciones detalladas entre versiones gratuitas y de pago que te ayudarán a identificar la solución imprescindible para aumentar la productividad y desbloquear tu ventaja con IA. ¡Explora ahora!

10 herramientas
xix.ai
escribiendo Los mejores generadores de esquemas basados en IA para artículos largos optimizados para SEO
Los mejores generadores de esquemas basados en IA para artículos largos optimizados para SEO

Los mejores generadores de esquemas con IA mejor valorados de 2026 para artículos largos optimizados para SEO, seleccionados minuciosamente por XIX.AI. Estas potentes herramientas ofrecen una ayuda revolucionaria a la hora de crear contenido de alta calidad rápidamente, lo que aumenta considerablemente la eficiencia a la hora de escribir. Consigue una comparación entre las versiones gratuitas y de pago, junto con pruebas en condiciones reales y clasificaciones detalladas, que te ayudarán a encontrar la opción imprescindible que mejor se adapte a tus necesidades. Explora ahora para descubrir las ventajas que te ofrece la IA.

8 herramientas
xix.ai
Educación y aprendizaje Herramientas de estudio basadas en IA para los deberes y la preparación de exámenes
Herramientas de estudio basadas en IA para los deberes y la preparación de exámenes

¡Las mejores herramientas de IA de 2026 para hacer los deberes y prepararse para los exámenes! XIX.AI ha elaborado una lista con las herramientas mejor valoradas, potentes y revolucionarias que ayudan a los estudiantes a aumentar su productividad, agilizar la realización de los deberes y sacar sobresaliente en los exámenes gracias a pruebas reales. Consigue una comparación entre versiones gratuitas y de pago, clasificaciones detalladas y opciones imprescindibles para sacar el máximo partido a la IA. ¡Explora ahora!

10 herramientas
xix.ai
composicion musical Herramientas de demostración vocal con IA para compositores, ganchos, melodías principales y sesiones de borrador multilingüe
Herramientas de demostración vocal con IA para compositores, ganchos, melodías principales y sesiones de borrador multilingüe

¡Las mejores herramientas de demostración vocal con IA de 2026 para compositores, creadores de ganchos y equipos de contenido multilingüe! XIX.AI ha recopilado una lista de herramientas poderosas y transformadoras, rigurosamente probadas en el mundo real. Encontrarás datos detallados de comparación entre versiones gratuitas y de pago, clasificaciones completas y opciones imprescindibles para ayudarte a aumentar tu eficiencia de escritura y desbloquear todo tu potencial creativo. ¡Explora ahora para descubrir la herramienta perfecta para todas tus necesidades de contenido!

9 herramientas
xix.ai
Negocio Las mejores herramientas de investigación competitiva basadas en IA para pequeñas empresas
Las mejores herramientas de investigación competitiva basadas en IA para pequeñas empresas

¡Las mejores herramientas de investigación competitiva basadas en IA mejor valoradas de 2026 para pequeñas empresas! XIX.AI ha seleccionado una colección revolucionaria y muy potente, que se actualiza semanalmente con rigurosas pruebas en el mundo real y clasificaciones detalladas. Encontrarás una comparación exhaustiva entre las opciones gratuitas y las de pago que te ayudará a identificar las herramientas imprescindibles que impulsarán tu productividad y te proporcionarán una ventaja competitiva. ¡Explora ahora mismo y descubre la herramienta perfecta para ti!

9 herramientas
xix.ai
comentario (7)
0/500
LarryMitchell
LarryMitchell 4 de agosto de 2026 00:00:20 GMT+02:00

Hmm, so the hype was a bit overblown? 🤔 It's interesting how numbers can be twisted. Reminds me of the old saying: 'There are three kinds of lies: lies, damned lies, and statistics.' Definitely need to look under the hood before believing the headlines. What about reproducibility? #AI #benchmark

JackPerez
JackPerez 2 de febrero de 2026 23:00:45 GMT+01:00

Como usuário curioso sobre IA, fico um pouco desconfiado quando os benchmarks não batem. A OpenAI lançou o o3 com uma fanfarra enorme, falando de mais de 25% nos desafios do Frontier, mas agora parece que os resultados reais podem ser bem mais modestos. Isso me faz pensar: deveríamos confiar mais nas métricas das empresas ou em avaliações independentes? A competição entre os modelos está tão acirrada que às vezes a verdade parece ficar em segundo plano... Precisamos de mais transparência! 🤔

BruceRoberts
BruceRoberts 16 de diciembre de 2025 11:30:42 GMT+01:00

Ces écarts sur les benchmarks montrent bien qu'on ne peut pas prendre toutes les déclarations des labos pour argent comptant. Du coup, ça soulève des questions sur la transparence des processus d'évaluation. C'est important pour les chercheurs et les développeurs qui basent leur travail sur ces résultats. 🤔

FrankSmith
FrankSmith 10 de septiembre de 2025 08:30:33 GMT+02:00

오픈AI의 벤치마크 수치 조작 논란, 이젠 식상하네요 😅 경쟁이 치열해질수록 회사들이 성과를 부풀리는 건 드문 일이 아니지만... 진실은 결국 밝혀지잖아요. 이번 건으로 인공지능 업계의 신뢰도가 또 한 번 흔들리는 건 아닐지 걱정됩니다.

LiamWalker
LiamWalker 12 de agosto de 2025 08:50:10 GMT+02:00

I was hyped for o3, but these benchmark gaps are a letdown. Makes you wonder if the AI hype train is running on fumes. Still cool tech, tho! 😎

FrankLewis
FrankLewis 7 de agosto de 2025 04:41:14 GMT+02:00

The o3 model's benchmark slip-up is a bit of a letdown. 😕 I was hyped for OpenAI's big claims, but now I’m wondering if they’re overselling. Numbers don’t lie, but they can sure be misleading!

OR