Les outils de codage IA s'orientent vers le développement dans le terminal

Depuis des années, les éditeurs de code améliorés par l'IA tels que Cursor, Windsurf et GitHub Copilot ont établi la norme en matière de développement logiciel. Cependant, à mesure que l'IA agentielle devient plus performante et qu'une approche plus intuitive du « vibe-coding » gagne du terrain, une évolution discrète est en train de remodeler le fonctionnement de ces systèmes. Plutôt que de se contenter de manipuler le code, ils interagissent de plus en plus directement avec le shell de la ligne de commande du système. Cela marque un changement fondamental dans le développement assisté par l'IA, une évolution subtile mais potentiellement transformatrice pour l'orientation future du secteur.
Le terminal, qui rappelle souvent les écrans noir et blanc austères des films sur les hackers des années 90, est une interface classique pour l'exécution de programmes et la gestion de données. Bien que moins sophistiqué visuellement que les éditeurs de code modernes, il reste un outil extrêmement puissant entre des mains expertes. Bien que les agents centrés sur le code puissent écrire et déboguer des programmes, les utilitaires basés sur le terminal sont souvent essentiels pour transformer le code écrit en une application fonctionnelle et déployable.
La transition vers le terminal est particulièrement évidente dans les principaux laboratoires d'IA. Depuis février, Anthropic, DeepMind et OpenAI ont chacun lancé des outils de codage en ligne de commande (respectivement Claude Code, Gemini CLI et CLI Codex), qui sont rapidement devenus parmi leurs offres les plus populaires. Cette transition est facile à négliger, car ces outils partagent souvent la même image de marque que leurs prédécesseurs. Pourtant, fondamentalement, la manière dont les agents IA interagissent avec les ordinateurs, en ligne et hors ligne, a changé. Beaucoup pensent que ce n'est qu'un début.
« Notre hypothèse principale est qu'à l'avenir, environ 95 % des interactions entre les LLM et les ordinateurs se feront via une interface de type terminal », explique Alex Shaw, co-créateur du célèbre benchmark TerminalBench, axé sur les terminaux.
Les outils basés sur des terminaux gagnent en importance alors que certaines plateformes établies axées sur le code sont confrontées à une certaine instabilité. L'éditeur de code IA Windsurf, par exemple, a été fragmenté par des acquisitions concurrentes, ses dirigeants ayant été recrutés par Google et le reste de l'entreprise racheté par Cognition, ce qui jette le doute sur la viabilité à long terme du produit grand public.
Parallèlement, de nouvelles recherches suggèrent que les développeurs pourraient surestimer les avantages des outils traditionnels en termes de productivité. Une étude METR évaluant Cursor Pro, le principal concurrent de Windsurf, a révélé que, alors que les développeurs prévoyaient une augmentation de 20 à 30 % de la vitesse, le processus observé était en réalité près de 20 % plus lent. En substance, l'assistant de code faisait, dans certains cas, perdre du temps aux programmeurs.
Cela a créé une opportunité pour des entreprises comme Warp, qui est actuellement en tête du classement TerminalBench. Warp se décrit comme un « environnement de développement agentique », comblant le fossé entre les IDE complets et les outils en ligne de commande comme Claude Code. Le fondateur Zach Lloyd reste optimiste quant au potentiel du terminal, qu'il considère comme un moyen de résoudre des problèmes dépassant le cadre d'un éditeur de code traditionnel comme Cursor.
Événement Techcrunch EN DIRECT ! TechCrunch All Stage
Construisez plus intelligemment. Évoluez plus rapidement. Connectez-vous plus profondément. Rejoignez les visionnaires de Precursor Ventures, NEA, Index Ventures, Underscore VC et bien d'autres pour une journée riche en stratégies, ateliers et rencontres enrichissantes.
Économisez 450 $ sur votre pass TechCrunch All Stage
Construisez plus intelligemment. Développez-vous plus rapidement. Créez des liens plus solides. Rejoignez les visionnaires de Precursor Ventures, NEA, Index Ventures, Underscore VC et bien d'autres pour une journée riche en stratégies, ateliers et rencontres enrichissantes.
Boston, MA | 15 juillet INSCRIVEZ-VOUS MAINTENANT « Le terminal occupe une place fondamentale dans la pile des développeurs, ce qui en fait l'endroit le plus polyvalent pour exécuter des agents IA », explique Lloyd.
Pour comprendre en quoi cette nouvelle approche est différente, examinez les critères utilisés pour l'évaluer. La génération précédente d'outils basés sur le code était évaluée sur la résolution de problèmes GitHub, qui constituent la base du test SWE-Bench. Chaque problème SWE-Bench est un problème GitHub ouvert, c'est-à-dire un morceau de code défectueux. Les modèles affinent le code de manière itérative jusqu'à ce qu'il fonctionne. Bien que des produits intégrés tels que Cursor aient développé des méthodes plus sophistiquées, le modèle GitHub/SWE-Bench reste le même : commencer par un code défectueux et le corriger.
Les outils basés sur Terminal adoptent une perspective plus large, en tenant compte de l'ensemble de l'environnement dans lequel un programme s'exécute, et pas seulement du code. Cela englobe le codage ainsi que les tâches orientées DevOps telles que la configuration d'un serveur Git ou le diagnostic des raisons pour lesquelles un script échoue. Un défi TerminalBench fournit un programme de décompression et un fichier texte cible, chargeant l'agent de procéder à une ingénierie inverse d'un algorithme de compression correspondant. Un autre demande à l'agent de construire le noyau Linux à partir du code source, sans mentionner qu'il doit d'abord obtenir le code source. La résolution de ces défis nécessite une approche persistante et créative, intrinsèque à la programmation.
« Ce qui rend TerminalBench difficile, ce ne sont pas seulement les questions que nous posons aux agents, explique M. Shaw, mais aussi les environnements complexes dans lesquels nous les plaçons. »
Cette nouvelle méthode implique essentiellement de résoudre des problèmes par étapes séquentielles et raisonnées, la même capacité qui rend l'IA agentielle si puissante. Pourtant, même les modèles agentiels de pointe ont du mal dans certains de ces environnements. Warp a obtenu son meilleur score TerminalBench en résolvant un peu plus de la moitié des problèmes, ce qui souligne à la fois la difficulté du benchmark et le travail qui reste à faire pour exploiter pleinement le potentiel du terminal.
Néanmoins, Lloyd soutient que nous avons atteint un stade où les outils basés sur le terminal peuvent gérer de manière fiable une partie importante de la charge de travail non liée au codage d'un développeur, une offre difficile à refuser.
« Prenons l'exemple du travail quotidien consistant à mettre en place un nouveau projet, à déterminer les dépendances et à le rendre exécutable : Warp peut en grande partie s'en charger de manière autonome », explique Lloyd. « Et s'il ne peut pas le faire, il vous dira exactement pourquoi. »
Article connexe
La Corée du Sud pose la première pierre du centre national de calcul en intelligence artificielle, investissant 2,5 billions de wons avec un objectif pour 2028
Le journal sud-coréen EtNews rapporte que la cérémonie de pose de la première pierre du Centre de calcul IA de Corée (KOACC) s’est tenue le 3 août au parc de centres de données Solar City à Sunan, dans la province du Jeollanam-do. Doté d’un investiss
Six géants de la technologie soutiennent la Linux Foundation avec 12,5 millions de dollars pour faire face au bruit des vulnérabilités de l'IA
Pour faire face à l'afflux de rapports de sécurité de faible qualité produits par des outils d'automatisation basés sur l'intelligence artificielle, six grandes entreprises technologiques — Anthropic, Amazon (AWS), GitHub, Google, Microsoft et OpenAI
Musk envisageait de laisser OpenAI à ses enfants alors qu'Altman témoigne
Ce matin, le PDG d’OpenAI, Sam Altman, a pris la parole pour répondre au procès intenté par l’ancien cofondateur Elon Musk, qui conteste la structure corporative de l’entreprise.Interrogé sur l’allégation de Musk selon laquelle d’autres fondateurs «
Recommandations de sujets spéciaux liés
commentaires (3)
Interessant, dass sich die KI-Coding-Tools jetzt auf das Terminal konzentrieren. Ich habe Cursor und Copilot im Editor benutzt, aber die Idee, direkt in der Kommandozeile zu arbeiten, klingt nach einem logischen nächsten Schritt für mehr Effizienz. Hoffentlich bleibt die Bedienung trotzdem intuitiv – sonst wird das nichts mit dem 'Vibe-Coding' 😅. Mal sehen, wie sich das gegen die etablierten Editoren durchsetzt.

Depuis des années, les éditeurs de code améliorés par l'IA tels que Cursor, Windsurf et GitHub Copilot ont établi la norme en matière de développement logiciel. Cependant, à mesure que l'IA agentielle devient plus performante et qu'une approche plus intuitive du « vibe-coding » gagne du terrain, une évolution discrète est en train de remodeler le fonctionnement de ces systèmes. Plutôt que de se contenter de manipuler le code, ils interagissent de plus en plus directement avec le shell de la ligne de commande du système. Cela marque un changement fondamental dans le développement assisté par l'IA, une évolution subtile mais potentiellement transformatrice pour l'orientation future du secteur.
Le terminal, qui rappelle souvent les écrans noir et blanc austères des films sur les hackers des années 90, est une interface classique pour l'exécution de programmes et la gestion de données. Bien que moins sophistiqué visuellement que les éditeurs de code modernes, il reste un outil extrêmement puissant entre des mains expertes. Bien que les agents centrés sur le code puissent écrire et déboguer des programmes, les utilitaires basés sur le terminal sont souvent essentiels pour transformer le code écrit en une application fonctionnelle et déployable.
La transition vers le terminal est particulièrement évidente dans les principaux laboratoires d'IA. Depuis février, Anthropic, DeepMind et OpenAI ont chacun lancé des outils de codage en ligne de commande (respectivement Claude Code, Gemini CLI et CLI Codex), qui sont rapidement devenus parmi leurs offres les plus populaires. Cette transition est facile à négliger, car ces outils partagent souvent la même image de marque que leurs prédécesseurs. Pourtant, fondamentalement, la manière dont les agents IA interagissent avec les ordinateurs, en ligne et hors ligne, a changé. Beaucoup pensent que ce n'est qu'un début.
« Notre hypothèse principale est qu'à l'avenir, environ 95 % des interactions entre les LLM et les ordinateurs se feront via une interface de type terminal », explique Alex Shaw, co-créateur du célèbre benchmark TerminalBench, axé sur les terminaux.
Les outils basés sur des terminaux gagnent en importance alors que certaines plateformes établies axées sur le code sont confrontées à une certaine instabilité. L'éditeur de code IA Windsurf, par exemple, a été fragmenté par des acquisitions concurrentes, ses dirigeants ayant été recrutés par Google et le reste de l'entreprise racheté par Cognition, ce qui jette le doute sur la viabilité à long terme du produit grand public.
Parallèlement, de nouvelles recherches suggèrent que les développeurs pourraient surestimer les avantages des outils traditionnels en termes de productivité. Une étude METR évaluant Cursor Pro, le principal concurrent de Windsurf, a révélé que, alors que les développeurs prévoyaient une augmentation de 20 à 30 % de la vitesse, le processus observé était en réalité près de 20 % plus lent. En substance, l'assistant de code faisait, dans certains cas, perdre du temps aux programmeurs.
Cela a créé une opportunité pour des entreprises comme Warp, qui est actuellement en tête du classement TerminalBench. Warp se décrit comme un « environnement de développement agentique », comblant le fossé entre les IDE complets et les outils en ligne de commande comme Claude Code. Le fondateur Zach Lloyd reste optimiste quant au potentiel du terminal, qu'il considère comme un moyen de résoudre des problèmes dépassant le cadre d'un éditeur de code traditionnel comme Cursor.
Événement TechcrunchEN DIRECT ! TechCrunch All Stage
Construisez plus intelligemment. Évoluez plus rapidement. Connectez-vous plus profondément. Rejoignez les visionnaires de Precursor Ventures, NEA, Index Ventures, Underscore VC et bien d'autres pour une journée riche en stratégies, ateliers et rencontres enrichissantes.
Économisez 450 $ sur votre pass TechCrunch All Stage
Construisez plus intelligemment. Développez-vous plus rapidement. Créez des liens plus solides. Rejoignez les visionnaires de Precursor Ventures, NEA, Index Ventures, Underscore VC et bien d'autres pour une journée riche en stratégies, ateliers et rencontres enrichissantes.
Boston, MA | 15 juillet INSCRIVEZ-VOUS MAINTENANT« Le terminal occupe une place fondamentale dans la pile des développeurs, ce qui en fait l'endroit le plus polyvalent pour exécuter des agents IA », explique Lloyd.
Pour comprendre en quoi cette nouvelle approche est différente, examinez les critères utilisés pour l'évaluer. La génération précédente d'outils basés sur le code était évaluée sur la résolution de problèmes GitHub, qui constituent la base du test SWE-Bench. Chaque problème SWE-Bench est un problème GitHub ouvert, c'est-à-dire un morceau de code défectueux. Les modèles affinent le code de manière itérative jusqu'à ce qu'il fonctionne. Bien que des produits intégrés tels que Cursor aient développé des méthodes plus sophistiquées, le modèle GitHub/SWE-Bench reste le même : commencer par un code défectueux et le corriger.
Les outils basés sur Terminal adoptent une perspective plus large, en tenant compte de l'ensemble de l'environnement dans lequel un programme s'exécute, et pas seulement du code. Cela englobe le codage ainsi que les tâches orientées DevOps telles que la configuration d'un serveur Git ou le diagnostic des raisons pour lesquelles un script échoue. Un défi TerminalBench fournit un programme de décompression et un fichier texte cible, chargeant l'agent de procéder à une ingénierie inverse d'un algorithme de compression correspondant. Un autre demande à l'agent de construire le noyau Linux à partir du code source, sans mentionner qu'il doit d'abord obtenir le code source. La résolution de ces défis nécessite une approche persistante et créative, intrinsèque à la programmation.
« Ce qui rend TerminalBench difficile, ce ne sont pas seulement les questions que nous posons aux agents, explique M. Shaw, mais aussi les environnements complexes dans lesquels nous les plaçons. »
Cette nouvelle méthode implique essentiellement de résoudre des problèmes par étapes séquentielles et raisonnées, la même capacité qui rend l'IA agentielle si puissante. Pourtant, même les modèles agentiels de pointe ont du mal dans certains de ces environnements. Warp a obtenu son meilleur score TerminalBench en résolvant un peu plus de la moitié des problèmes, ce qui souligne à la fois la difficulté du benchmark et le travail qui reste à faire pour exploiter pleinement le potentiel du terminal.
Néanmoins, Lloyd soutient que nous avons atteint un stade où les outils basés sur le terminal peuvent gérer de manière fiable une partie importante de la charge de travail non liée au codage d'un développeur, une offre difficile à refuser.
« Prenons l'exemple du travail quotidien consistant à mettre en place un nouveau projet, à déterminer les dépendances et à le rendre exécutable : Warp peut en grande partie s'en charger de manière autonome », explique Lloyd. « Et s'il ne peut pas le faire, il vous dira exactement pourquoi. »
La Corée du Sud pose la première pierre du centre national de calcul en intelligence artificielle, investissant 2,5 billions de wons avec un objectif pour 2028
Le journal sud-coréen EtNews rapporte que la cérémonie de pose de la première pierre du Centre de calcul IA de Corée (KOACC) s’est tenue le 3 août au parc de centres de données Solar City à Sunan, dans la province du Jeollanam-do. Doté d’un investiss
Six géants de la technologie soutiennent la Linux Foundation avec 12,5 millions de dollars pour faire face au bruit des vulnérabilités de l'IA
Pour faire face à l'afflux de rapports de sécurité de faible qualité produits par des outils d'automatisation basés sur l'intelligence artificielle, six grandes entreprises technologiques — Anthropic, Amazon (AWS), GitHub, Google, Microsoft et OpenAI
Musk envisageait de laisser OpenAI à ses enfants alors qu'Altman témoigne
Ce matin, le PDG d’OpenAI, Sam Altman, a pris la parole pour répondre au procès intenté par l’ancien cofondateur Elon Musk, qui conteste la structure corporative de l’entreprise.Interrogé sur l’allégation de Musk selon laquelle d’autres fondateurs «
Interessant, dass sich die KI-Coding-Tools jetzt auf das Terminal konzentrieren. Ich habe Cursor und Copilot im Editor benutzt, aber die Idee, direkt in der Kommandozeile zu arbeiten, klingt nach einem logischen nächsten Schritt für mehr Effizienz. Hoffentlich bleibt die Bedienung trotzdem intuitiv – sonst wird das nichts mit dem 'Vibe-Coding' 😅. Mal sehen, wie sich das gegen die etablierten Editoren durchsetzt.





Maison






