Maison
Une étude de l'Université de l'État de Washington révèle les contradictions majeures de ChatGPT dans ses jugements scientifiques complexes

Une étude récente de l'université de l'État de Washington (WSU) révèle que, bien que ChatGPT réponde avec assurance, son traitement des énoncés scientifiques complexes s'apparente à des suppositions aléatoires. Cette étude met en évidence non seulement une précision limitée, mais aussi des réponses souvent contradictoires à une même question.
Le professeur Mesut Cicek et son équipe ont extrait 719 hypothèses de recherche de revues spécialisées en gestion publiées depuis 2021 et les ont soumises à plusieurs reprises au modèle afin d’en vérifier la véracité.
Bien que la précision apparente de ChatGPT semble avoisiner les 80 %, une fois les devinettes aléatoires prises en compte, ses performances réelles ne sont que d’environ 60 % supérieures à celles d’un tirage au sort à 50 %. Les chercheurs ont attribué à ce résultat la note « D », correspondant à un niveau faible. Le modèle s’est montré particulièrement peu performant pour identifier les fausses affirmations, ne jugeant correctement que 16,4 % des propositions fausses.
Les chercheurs ont soumis chaque hypothèse au modèle à dix reprises et ont constaté qu’il avait du mal à maintenir des positions cohérentes :
Fluctuation des réponses: dans environ 73 % des cas, le modèle a maintenu des conclusions cohérentes sur les dix répétitions.
Contradictions extrêmes: dans certains cas, le modèle alternait entre des réponses « vraies » et « fausses », avec des cas extrêmes où la moitié des réponses était vraie et l’autre moitié fausse, alors que la consigne était exactement la même.
L’étude souligne que les utilisateurs se laissent facilement induire en erreur par le langage fluide et persuasif de l’IA, mais que cela ne témoigne pas d’une véritable capacité de raisonnement.
Absence de véritable compréhension: le modèle s’appuie sur la mémoire et la reconnaissance de schémas, contrairement aux humains qui comprennent véritablement le monde et ce qu’ils disent.
Progrès limités de la version: les tests ont montré que la version mise à jour de ChatGPT-5 mini (testée en 2025) présentait des performances similaires à celles des versions antérieures sur cette tâche spécifique, sans amélioration significative.
Sur la base de ces résultats, Cicek conseille aux dirigeants d’entreprise de faire preuve d’un scepticisme marqué lorsqu’ils prennent des décisions complexes. Ils ne doivent pas considérer l’IA générative comme une « autorité » capable de se substituer au jugement professionnel et doivent vérifier manuellement tous les résultats. Les organisations devraient renforcer la formation afin d’aider les employés à comprendre à la fois les atouts et les limites des outils d’IA, évitant ainsi les biais décisionnels liés à une confiance aveugle.
Cette étude rappelle une fois de plus que, malgré le développement rapide de l’IA, les capacités de cette technologie en matière de raisonnement logique approfondi et d’évaluation des preuves doivent encore être améliorées.
Article connexe
Suno appose des filigranes aux chansons dans le cadre de batailles juridiques
Suno, la plateforme permettant aux utilisateurs de générer de la musique créée par l’intelligence artificielle, a dévoilé de nouvelles fonctionnalités pour étiqueter les titres produits sur la plateforme, restreindre les téléchargements et mettre à j
Musk admet que la construction de Grok a divulgué le code utilisateur, promet d’effacer toutes les données historiques
Elon Musk a abordé directement la controverse sur la vie privée concernant Grok Build, en commençant par un simple « Vrai » pour confirmer la validité de l’incident. Il s’est engagé à ce que toutes les données utilisateur précédemment téléchargées su
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
Recommandations de sujets spéciaux liés
commentaires (0)

Une étude récente de l'université de l'État de Washington (WSU) révèle que, bien que ChatGPT réponde avec assurance, son traitement des énoncés scientifiques complexes s'apparente à des suppositions aléatoires. Cette étude met en évidence non seulement une précision limitée, mais aussi des réponses souvent contradictoires à une même question.
Le professeur Mesut Cicek et son équipe ont extrait 719 hypothèses de recherche de revues spécialisées en gestion publiées depuis 2021 et les ont soumises à plusieurs reprises au modèle afin d’en vérifier la véracité.
Bien que la précision apparente de ChatGPT semble avoisiner les 80 %, une fois les devinettes aléatoires prises en compte, ses performances réelles ne sont que d’environ 60 % supérieures à celles d’un tirage au sort à 50 %. Les chercheurs ont attribué à ce résultat la note « D », correspondant à un niveau faible. Le modèle s’est montré particulièrement peu performant pour identifier les fausses affirmations, ne jugeant correctement que 16,4 % des propositions fausses.
Les chercheurs ont soumis chaque hypothèse au modèle à dix reprises et ont constaté qu’il avait du mal à maintenir des positions cohérentes :
Fluctuation des réponses: dans environ 73 % des cas, le modèle a maintenu des conclusions cohérentes sur les dix répétitions.
Contradictions extrêmes: dans certains cas, le modèle alternait entre des réponses « vraies » et « fausses », avec des cas extrêmes où la moitié des réponses était vraie et l’autre moitié fausse, alors que la consigne était exactement la même.
L’étude souligne que les utilisateurs se laissent facilement induire en erreur par le langage fluide et persuasif de l’IA, mais que cela ne témoigne pas d’une véritable capacité de raisonnement.
Absence de véritable compréhension: le modèle s’appuie sur la mémoire et la reconnaissance de schémas, contrairement aux humains qui comprennent véritablement le monde et ce qu’ils disent.
Progrès limités de la version: les tests ont montré que la version mise à jour de ChatGPT-5 mini (testée en 2025) présentait des performances similaires à celles des versions antérieures sur cette tâche spécifique, sans amélioration significative.
Sur la base de ces résultats, Cicek conseille aux dirigeants d’entreprise de faire preuve d’un scepticisme marqué lorsqu’ils prennent des décisions complexes. Ils ne doivent pas considérer l’IA générative comme une « autorité » capable de se substituer au jugement professionnel et doivent vérifier manuellement tous les résultats. Les organisations devraient renforcer la formation afin d’aider les employés à comprendre à la fois les atouts et les limites des outils d’IA, évitant ainsi les biais décisionnels liés à une confiance aveugle.
Cette étude rappelle une fois de plus que, malgré le développement rapide de l’IA, les capacités de cette technologie en matière de raisonnement logique approfondi et d’évaluation des preuves doivent encore être améliorées.
Suno appose des filigranes aux chansons dans le cadre de batailles juridiques
Suno, la plateforme permettant aux utilisateurs de générer de la musique créée par l’intelligence artificielle, a dévoilé de nouvelles fonctionnalités pour étiqueter les titres produits sur la plateforme, restreindre les téléchargements et mettre à j
Musk admet que la construction de Grok a divulgué le code utilisateur, promet d’effacer toutes les données historiques
Elon Musk a abordé directement la controverse sur la vie privée concernant Grok Build, en commençant par un simple « Vrai » pour confirmer la validité de l’incident. Il s’est engagé à ce que toutes les données utilisateur précédemment téléchargées su
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent











