Maison
Le CVPR 2026 annonce un changement de paradigme dans le domaine de l'intelligence visuelle, à mesure que les gains marginaux s'estompent
Au cours de la dernière décennie, la vision par ordinateur a évolué, passant de la classification ImageNet aux modèles de diffusion, dans le but de permettre aux machines de « voir le monde ». Cependant, à mesure que les capacités perceptives se rapprochent de celles de l’être humain, les gains en termes de précision pure perdent de leur intérêt. Lors de la conférence CVPR 2026, la recherche en intelligence visuelle a pris un nouveau tournant : la vision n’est plus un objectif en soi, mais un tremplin vers le raisonnement, la prise de décision et l’interaction.
Au-delà du « raisonnement aveugle » : approches adaptatives et implicites
Les modèles multimodaux s’appuient depuis longtemps sur la « chaîne de pensée » (CoT) pour le raisonnement logique. Cependant, des découvertes récentes suggèrent que ce raisonnement constant est souvent inefficace. Le cadre VideoAuto-R1 introduit le « raisonnement à la demande » : il répond directement aux requêtes perceptives simples et ne déclenche le raisonnement que pour la logique complexe. Cette méthode maintient des performances optimales tout en réduisant de 3,3 fois la longueur moyenne des sorties.

Le support du raisonnement évolue également. Auparavant, les modèles s’appuyaient sur le langage pour décrire les relations spatiales, ce qui s’avérait inefficace face à des casse-têtes ou des structures géométriques. La nouvelle tendance consiste en un raisonnement visuel implicite au sein de l’« espace latent », contournant la conversion linéaire en texte afin de mieux saisir les structures visuelles complexes.
Repenser l’évaluation : briser l’illusion des questions à choix multiples
Les évaluations actuelles des modèles visuels-linguistiques s’appuient fortement sur les questions à choix multiples (MCQA), ce qui peut conduire à une surestimation des capacités. Des recherches indiquent que les modèles « trichent » souvent par élimination ou par biais de réponse, gonflant ainsi les scores d’environ 20 points. Pour remédier à cela, le secteur adopte des « questions-réponses ouvertes vérifiables », obligeant les modèles à véritablement comprendre le contenu visuel plutôt que d’exploiter des indices présents dans les options.
Parallèlement, les scénarios d’évaluation évoluent, passant d’images statiques à agent unique vers des environnements multi-agents. Des benchmarks tels que VS-Bench exigent des modèles qu’ils ne se contentent pas de comprendre l’environnement, mais qu’ils fassent également preuve de raisonnement stratégique et de prise de décision dans le cadre d’interactions complexes, telles que la collaboration et la compétition. Cela marque la transition de l’intelligence visuelle d’un « compreneur » passif vers un « décideur » actif.

Améliorations de l’infrastructure : modèles open source et données du monde réel
La communauté open source renforce la transparence. Des modèles comme Molmo2 publient non seulement les poids, mais aussi l’intégralité des données et des processus d’entraînement. Ces modèles étendent leurs capacités des images individuelles aux vidéos, en ajoutant des fonctionnalités de localisation précises et en franchissant un cap décisif, passant de la « compréhension » à la « localisation d’emplacements ».
Ces progrès s’appuient sur une infrastructure de données complète. Pour l’édition d’images pilotée par le texte, des ensembles de données à grande échelle issues du monde réel, tels que Pico-Banana-400K, comblent le fossé causé par une dépendance excessive aux données synthétiques. Prenant en charge l’édition en plusieurs étapes et l’alignement des préférences, cet ensemble de données offre une base solide pour l’entraînement de modèles d’édition dotés d’un sens commun et d’une logique améliorés.
En résumé, l’intelligence visuelle évolue d’une simple perception vers une intelligence intégrée combinant perception, cognition et action. Cette évolution représente bien plus qu’une simple amélioration des performances ; il s’agit d’une reconstruction systématique des mécanismes de raisonnement, des paradigmes d’évaluation et des chaînes d’approvisionnement en données.
Article connexe
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur
Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Recommandations de sujets spéciaux liés
commentaires (0)
Au cours de la dernière décennie, la vision par ordinateur a évolué, passant de la classification ImageNet aux modèles de diffusion, dans le but de permettre aux machines de « voir le monde ». Cependant, à mesure que les capacités perceptives se rapprochent de celles de l’être humain, les gains en termes de précision pure perdent de leur intérêt. Lors de la conférence CVPR 2026, la recherche en intelligence visuelle a pris un nouveau tournant : la vision n’est plus un objectif en soi, mais un tremplin vers le raisonnement, la prise de décision et l’interaction.
Au-delà du « raisonnement aveugle » : approches adaptatives et implicites
Les modèles multimodaux s’appuient depuis longtemps sur la « chaîne de pensée » (CoT) pour le raisonnement logique. Cependant, des découvertes récentes suggèrent que ce raisonnement constant est souvent inefficace. Le cadre VideoAuto-R1 introduit le « raisonnement à la demande » : il répond directement aux requêtes perceptives simples et ne déclenche le raisonnement que pour la logique complexe. Cette méthode maintient des performances optimales tout en réduisant de 3,3 fois la longueur moyenne des sorties.

Le support du raisonnement évolue également. Auparavant, les modèles s’appuyaient sur le langage pour décrire les relations spatiales, ce qui s’avérait inefficace face à des casse-têtes ou des structures géométriques. La nouvelle tendance consiste en un raisonnement visuel implicite au sein de l’« espace latent », contournant la conversion linéaire en texte afin de mieux saisir les structures visuelles complexes.
Repenser l’évaluation : briser l’illusion des questions à choix multiples
Les évaluations actuelles des modèles visuels-linguistiques s’appuient fortement sur les questions à choix multiples (MCQA), ce qui peut conduire à une surestimation des capacités. Des recherches indiquent que les modèles « trichent » souvent par élimination ou par biais de réponse, gonflant ainsi les scores d’environ 20 points. Pour remédier à cela, le secteur adopte des « questions-réponses ouvertes vérifiables », obligeant les modèles à véritablement comprendre le contenu visuel plutôt que d’exploiter des indices présents dans les options.
Parallèlement, les scénarios d’évaluation évoluent, passant d’images statiques à agent unique vers des environnements multi-agents. Des benchmarks tels que VS-Bench exigent des modèles qu’ils ne se contentent pas de comprendre l’environnement, mais qu’ils fassent également preuve de raisonnement stratégique et de prise de décision dans le cadre d’interactions complexes, telles que la collaboration et la compétition. Cela marque la transition de l’intelligence visuelle d’un « compreneur » passif vers un « décideur » actif.

Améliorations de l’infrastructure : modèles open source et données du monde réel
La communauté open source renforce la transparence. Des modèles comme Molmo2 publient non seulement les poids, mais aussi l’intégralité des données et des processus d’entraînement. Ces modèles étendent leurs capacités des images individuelles aux vidéos, en ajoutant des fonctionnalités de localisation précises et en franchissant un cap décisif, passant de la « compréhension » à la « localisation d’emplacements ».
Ces progrès s’appuient sur une infrastructure de données complète. Pour l’édition d’images pilotée par le texte, des ensembles de données à grande échelle issues du monde réel, tels que Pico-Banana-400K, comblent le fossé causé par une dépendance excessive aux données synthétiques. Prenant en charge l’édition en plusieurs étapes et l’alignement des préférences, cet ensemble de données offre une base solide pour l’entraînement de modèles d’édition dotés d’un sens commun et d’une logique améliorés.
En résumé, l’intelligence visuelle évolue d’une simple perception vers une intelligence intégrée combinant perception, cognition et action. Cette évolution représente bien plus qu’une simple amélioration des performances ; il s’agit d’une reconstruction systématique des mécanismes de raisonnement, des paradigmes d’évaluation et des chaînes d’approvisionnement en données.
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter











