Hogar
OpenAI critica duramente una prueba de referencia de IA: casi un tercio de las preguntas eran erróneas y la tasa de aprobados se disparó hasta el 80 % en ocho meses
OpenAI ha cuestionado públicamente el principal banco de pruebas del sector, SWE-Bench Pro, en una entrada de blog, alegando que aproximadamente el 30 % de sus 731 tareas de prueba públicas contienen fallos de evaluación. Desarrollado por Scale AI, SWE-Bench Pro está diseñado para evaluar las capacidades de programación de los grandes modelos de lenguaje y los agentes de IA. Dado que refleja fielmente el desarrollo empresarial del mundo real y aplica estrictas medidas contra las trampas, se ha convertido en un punto de referencia ampliamente reconocido en la ingeniería de software de IA.

OpenAI destaca un indicio clave en la entrada del blog: la tasa de aprobados de los modelos de primer nivel en este banco de pruebas se disparó del 23,3 % al 80,3 % en tan solo ocho meses. Un progreso tan rápido resulta sospechoso, y OpenAI sostiene que el banco de pruebas ya no puede medir con precisión las habilidades de desarrollo de software en el mundo real de un modelo. Es probable que el problema se deba a fallos en la propia evaluación, y no a un auténtico salto en la capacidad de los modelos.
Dos procesos de revisión, sometidos a validación cruzada, revelan que casi el 30 % de las tareas se consideran «no aptas».
Para verificarlo, OpenAI puso en marcha dos procesos de revisión paralelos. El análisis de los puntos de datos reveló 200 tareas fallidas, lo que supone el 27,4 % de las 731 tareas públicas. Por su parte, la anotación manual señaló 249 tareas fallidas, es decir, el 34,1 %. Al cruzar los resultados de ambos métodos, OpenAI estima que aproximadamente el 30 % de las tareas de SWE-Bench Pro contienen defectos, que se clasifican en cuatro categorías: pruebas excesivamente estrictas, indicaciones inadecuadas, cobertura de prueba limitada e indicaciones engañosas.
OpenAI también compartió un ejemplo típico: una tarea pedía un solo espacio al principio de una línea al convertir contenido a Markdown, pero la prueba oculta esperaba dos espacios. Como resultado, aunque el modelo cumpliera el requisito indicado, se marcaría como incorrecto. Esta discrepancia entre las instrucciones explícitas y los requisitos ocultos sesga directamente la evaluación de la verdadera capacidad de un modelo y explica el aumento irrazonable de las tasas de superación.
Retirada de la recomendación de adopción y llamamiento a la reconstrucción del sistema de evaluación de la IA
Basándose en este análisis, OpenAI ha retirado oficialmente su recomendación anterior de utilizar SWE-Bench Pro. La empresa considera que los futuros bancos de pruebas deberían ser creados por desarrolladores de software con experiencia específicamente para la evaluación de la IA, en lugar de reutilizar la lógica de prueba diseñada para desarrolladores humanos. Si un banco de pruebas del sector presenta un defecto en casi el 30 % de sus tareas, la credibilidad de todo el sistema de evaluación de la IA queda en entredicho. Cambiar el enfoque de las competiciones centradas en la búsqueda de puntuaciones a evaluaciones genuinas de la capacidad de ingeniería puede ser el siguiente paso fundamental en la evaluación de la ingeniería de software de IA.
Artículo relacionado
El lanzamiento global de la campaña de campus de Seed de ByteDance ofrece acciones virtuales para captar a los mejores talentos en modelos grandes
En el competitivo panorama de los modelos de lenguaje grandes, asegurar el talento de primer nivel sigue siendo el activo estratégico más crítico.El 1 de abril, ByteDance anunció el lanzamiento de su iniciativa global de reclutamiento de campus Seed
Suno añade marcas de agua a las canciones en medio de batallas legales
Suno, la plataforma que permite a los usuarios generar música creada por inteligencia artificial, ha presentado nuevas funciones para etiquetar las pistas producidas en la plataforma, restringir las descargas y actualizar las normas de la comunidad c
Musk admite que Grok filtró código de usuarios, promete borrar todos los datos históricos
Elon Musk abordó directamente la controversia por privacidad relacionada con Grok Build, comenzando con un simple "Verdadero" para confirmar la validez del incidente. Se comprometió a que todos los datos de usuario cargados previamente en SpaceXAI se
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
OpenAI ha cuestionado públicamente el principal banco de pruebas del sector, SWE-Bench Pro, en una entrada de blog, alegando que aproximadamente el 30 % de sus 731 tareas de prueba públicas contienen fallos de evaluación. Desarrollado por Scale AI, SWE-Bench Pro está diseñado para evaluar las capacidades de programación de los grandes modelos de lenguaje y los agentes de IA. Dado que refleja fielmente el desarrollo empresarial del mundo real y aplica estrictas medidas contra las trampas, se ha convertido en un punto de referencia ampliamente reconocido en la ingeniería de software de IA.

OpenAI destaca un indicio clave en la entrada del blog: la tasa de aprobados de los modelos de primer nivel en este banco de pruebas se disparó del 23,3 % al 80,3 % en tan solo ocho meses. Un progreso tan rápido resulta sospechoso, y OpenAI sostiene que el banco de pruebas ya no puede medir con precisión las habilidades de desarrollo de software en el mundo real de un modelo. Es probable que el problema se deba a fallos en la propia evaluación, y no a un auténtico salto en la capacidad de los modelos.
Dos procesos de revisión, sometidos a validación cruzada, revelan que casi el 30 % de las tareas se consideran «no aptas».
Para verificarlo, OpenAI puso en marcha dos procesos de revisión paralelos. El análisis de los puntos de datos reveló 200 tareas fallidas, lo que supone el 27,4 % de las 731 tareas públicas. Por su parte, la anotación manual señaló 249 tareas fallidas, es decir, el 34,1 %. Al cruzar los resultados de ambos métodos, OpenAI estima que aproximadamente el 30 % de las tareas de SWE-Bench Pro contienen defectos, que se clasifican en cuatro categorías: pruebas excesivamente estrictas, indicaciones inadecuadas, cobertura de prueba limitada e indicaciones engañosas.
OpenAI también compartió un ejemplo típico: una tarea pedía un solo espacio al principio de una línea al convertir contenido a Markdown, pero la prueba oculta esperaba dos espacios. Como resultado, aunque el modelo cumpliera el requisito indicado, se marcaría como incorrecto. Esta discrepancia entre las instrucciones explícitas y los requisitos ocultos sesga directamente la evaluación de la verdadera capacidad de un modelo y explica el aumento irrazonable de las tasas de superación.
Retirada de la recomendación de adopción y llamamiento a la reconstrucción del sistema de evaluación de la IA
Basándose en este análisis, OpenAI ha retirado oficialmente su recomendación anterior de utilizar SWE-Bench Pro. La empresa considera que los futuros bancos de pruebas deberían ser creados por desarrolladores de software con experiencia específicamente para la evaluación de la IA, en lugar de reutilizar la lógica de prueba diseñada para desarrolladores humanos. Si un banco de pruebas del sector presenta un defecto en casi el 30 % de sus tareas, la credibilidad de todo el sistema de evaluación de la IA queda en entredicho. Cambiar el enfoque de las competiciones centradas en la búsqueda de puntuaciones a evaluaciones genuinas de la capacidad de ingeniería puede ser el siguiente paso fundamental en la evaluación de la ingeniería de software de IA.
El lanzamiento global de la campaña de campus de Seed de ByteDance ofrece acciones virtuales para captar a los mejores talentos en modelos grandes
En el competitivo panorama de los modelos de lenguaje grandes, asegurar el talento de primer nivel sigue siendo el activo estratégico más crítico.El 1 de abril, ByteDance anunció el lanzamiento de su iniciativa global de reclutamiento de campus Seed
Suno añade marcas de agua a las canciones en medio de batallas legales
Suno, la plataforma que permite a los usuarios generar música creada por inteligencia artificial, ha presentado nuevas funciones para etiquetar las pistas producidas en la plataforma, restringir las descargas y actualizar las normas de la comunidad c
Musk admite que Grok filtró código de usuarios, promete borrar todos los datos históricos
Elon Musk abordó directamente la controversia por privacidad relacionada con Grok Build, comenzando con un simple "Verdadero" para confirmar la validez del incidente. Se comprometió a que todos los datos de usuario cargados previamente en SpaceXAI se











