Hogar
Un estudio de la Universidad Estatal de Washington revela las principales contradicciones de ChatGPT en valoraciones científicas complejas

Un estudio reciente de la Universidad Estatal de Washington (WSU) revela que, aunque ChatGPT responde con seguridad, su tratamiento de afirmaciones científicas complejas se asemeja a una conjetura aleatoria. La investigación pone de relieve no solo una precisión limitada, sino también respuestas contradictorias frecuentes a la misma pregunta.
El profesor Mesut Cicek y su equipo extrajeron 719 hipótesis de investigación de revistas especializadas en negocios publicadas desde 2021 y las sometieron repetidamente al modelo para verificar su veracidad.
Aunque la precisión aparente de ChatGPT ronda el 80 %, una vez tenidas en cuenta las conjeturas aleatorias, su rendimiento real solo es un 60 % superior al de lanzar una moneda al aire (50 %). Los investigadores calificaron este resultado como una «nota baja de grado D». El modelo obtuvo resultados especialmente deficientes a la hora de identificar afirmaciones falsas, ya que solo juzgó correctamente el 16,4 % de las proposiciones falsas.
Los investigadores sometieron cada hipótesis al modelo diez veces y observaron que este tenía dificultades para mantener posiciones coherentes:
Fluctuación en las respuestas: en aproximadamente el 73 % de los casos, el modelo mantuvo conclusiones coherentes a lo largo de las diez repeticiones.
Contradicciones extremas: en algunos casos, el modelo alternaba entre respuestas «verdaderas» y «falsas», con casos extremos en los que la mitad eran verdaderas y la otra mitad falsas, a pesar de utilizar exactamente la misma pregunta.
El estudio señala que los usuarios se dejan engañar fácilmente por el lenguaje fluido y persuasivo de la IA, pero esto no indica una capacidad de razonamiento genuina.
Falta de comprensión real: el modelo se basa en la memoria y la identificación de patrones, a diferencia de los seres humanos, que comprenden realmente el mundo y lo que dicen.
Progreso limitado de la versión: Las pruebas demostraron que la versión actualizada de ChatGPT-5 mini (probada en 2025) obtuvo resultados similares a los de versiones anteriores en esta tarea específica, sin mejoras significativas.
A la luz de estos hallazgos, Cicek aconseja a los directivos empresariales que mantengan un alto grado de escepticismo a la hora de tomar decisiones complejas. No deben considerar la IA generativa como una «autoridad» capaz de sustituir el criterio profesional y deben verificar manualmente todos los resultados. Las organizaciones deben mejorar la formación para ayudar a los empleados a comprender tanto los puntos fuertes como las limitaciones de las herramientas de IA, evitando así sesgos en la toma de decisiones derivados de una confianza ciega.
Este estudio sirve como un nuevo recordatorio de que, a pesar del rápido desarrollo de la IA, las capacidades de razonamiento lógico profundo y de evaluación de pruebas de esta tecnología aún deben mejorarse.
Artículo relacionado
Suno añade marcas de agua a las canciones en medio de batallas legales
Suno, la plataforma que permite a los usuarios generar música creada por inteligencia artificial, ha presentado nuevas funciones para etiquetar las pistas producidas en la plataforma, restringir las descargas y actualizar las normas de la comunidad c
Musk admite que Grok filtró código de usuarios, promete borrar todos los datos históricos
Elon Musk abordó directamente la controversia por privacidad relacionada con Grok Build, comenzando con un simple "Verdadero" para confirmar la validez del incidente. Se comprometió a que todos los datos de usuario cargados previamente en SpaceXAI se
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
Recomendaciones de temas especiales relacionados
comentario (0)
0/500

Un estudio reciente de la Universidad Estatal de Washington (WSU) revela que, aunque ChatGPT responde con seguridad, su tratamiento de afirmaciones científicas complejas se asemeja a una conjetura aleatoria. La investigación pone de relieve no solo una precisión limitada, sino también respuestas contradictorias frecuentes a la misma pregunta.
El profesor Mesut Cicek y su equipo extrajeron 719 hipótesis de investigación de revistas especializadas en negocios publicadas desde 2021 y las sometieron repetidamente al modelo para verificar su veracidad.
Aunque la precisión aparente de ChatGPT ronda el 80 %, una vez tenidas en cuenta las conjeturas aleatorias, su rendimiento real solo es un 60 % superior al de lanzar una moneda al aire (50 %). Los investigadores calificaron este resultado como una «nota baja de grado D». El modelo obtuvo resultados especialmente deficientes a la hora de identificar afirmaciones falsas, ya que solo juzgó correctamente el 16,4 % de las proposiciones falsas.
Los investigadores sometieron cada hipótesis al modelo diez veces y observaron que este tenía dificultades para mantener posiciones coherentes:
Fluctuación en las respuestas: en aproximadamente el 73 % de los casos, el modelo mantuvo conclusiones coherentes a lo largo de las diez repeticiones.
Contradicciones extremas: en algunos casos, el modelo alternaba entre respuestas «verdaderas» y «falsas», con casos extremos en los que la mitad eran verdaderas y la otra mitad falsas, a pesar de utilizar exactamente la misma pregunta.
El estudio señala que los usuarios se dejan engañar fácilmente por el lenguaje fluido y persuasivo de la IA, pero esto no indica una capacidad de razonamiento genuina.
Falta de comprensión real: el modelo se basa en la memoria y la identificación de patrones, a diferencia de los seres humanos, que comprenden realmente el mundo y lo que dicen.
Progreso limitado de la versión: Las pruebas demostraron que la versión actualizada de ChatGPT-5 mini (probada en 2025) obtuvo resultados similares a los de versiones anteriores en esta tarea específica, sin mejoras significativas.
A la luz de estos hallazgos, Cicek aconseja a los directivos empresariales que mantengan un alto grado de escepticismo a la hora de tomar decisiones complejas. No deben considerar la IA generativa como una «autoridad» capaz de sustituir el criterio profesional y deben verificar manualmente todos los resultados. Las organizaciones deben mejorar la formación para ayudar a los empleados a comprender tanto los puntos fuertes como las limitaciones de las herramientas de IA, evitando así sesgos en la toma de decisiones derivados de una confianza ciega.
Este estudio sirve como un nuevo recordatorio de que, a pesar del rápido desarrollo de la IA, las capacidades de razonamiento lógico profundo y de evaluación de pruebas de esta tecnología aún deben mejorarse.
Suno añade marcas de agua a las canciones en medio de batallas legales
Suno, la plataforma que permite a los usuarios generar música creada por inteligencia artificial, ha presentado nuevas funciones para etiquetar las pistas producidas en la plataforma, restringir las descargas y actualizar las normas de la comunidad c
Musk admite que Grok filtró código de usuarios, promete borrar todos los datos históricos
Elon Musk abordó directamente la controversia por privacidad relacionada con Grok Build, comenzando con un simple "Verdadero" para confirmar la validez del incidente. Se comprometió a que todos los datos de usuario cargados previamente en SpaceXAI se
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de











