Ferramentas de codificação de IA se voltam para o desenvolvimento no terminal

Durante anos, editores de código aprimorados por IA, como Cursor, Windsurf e GitHub Copilot, estabeleceram o padrão para o desenvolvimento de software. No entanto, à medida que a IA agênica se torna mais capaz e uma abordagem mais intuitiva de “codificação por vibração” ganha força, uma evolução silenciosa está remodelando a forma como esses sistemas operam. Em vez de apenas manipular o código, eles estão cada vez mais se envolvendo diretamente com o shell da linha de comando do sistema. Isso marca uma mudança fundamental no desenvolvimento assistido por IA — um movimento sutil, mas potencialmente transformador para o futuro da indústria.
O terminal, que muitas vezes lembra as telas em preto e branco dos filmes de hackers dos anos 90, é uma interface clássica para executar programas e gerenciar dados. Embora menos sofisticado visualmente do que os editores de código modernos, ele continua sendo uma ferramenta imensamente poderosa nas mãos de profissionais qualificados. Embora os agentes centrados em código possam escrever e depurar programas, os utilitários baseados em terminal são frequentemente essenciais para transformar o código escrito em um aplicativo funcional e implantável.
A mudança em direção ao terminal é mais evidente nos principais laboratórios de IA. Desde fevereiro, a Anthropic, a DeepMind e a OpenAI lançaram ferramentas de codificação de linha de comando (Claude Code, Gemini CLI e CLI Codex, respectivamente), que rapidamente se tornaram algumas de suas ofertas mais populares. Essa transição é fácil de ignorar, pois essas ferramentas geralmente compartilham a marca com suas antecessoras. No entanto, fundamentalmente, a forma como os agentes de IA interagem com os computadores — tanto online quanto offline — mudou. Muitos acreditam que isso é apenas o começo.
“Nossa hipótese central é que, no futuro, cerca de 95% da interação entre LLM e computadores ocorrerá por meio de uma interface semelhante a um terminal”, afirma Alex Shaw, co-criador do proeminente benchmark focado em terminais, TerminalBench.
As ferramentas baseadas em terminais estão ganhando destaque, enquanto algumas plataformas estabelecidas focadas em código enfrentam instabilidade. O editor de código de IA Windsurf, por exemplo, foi fragmentado por aquisições concorrentes, com líderes seniores recrutados pelo Google e o restante da empresa comprado pela Cognition — lançando dúvidas sobre a viabilidade a longo prazo do produto de consumo.
Simultaneamente, novas pesquisas sugerem que os desenvolvedores podem estar superestimando os benefícios de produtividade das ferramentas tradicionais. Um estudo da METR que avaliou o Cursor Pro, principal rival do Windsurf, descobriu que, embora os desenvolvedores previsse um aumento de 20 a 30% na velocidade, o processo observado foi quase 20% mais lento. Em essência, o assistente de código estava, em alguns casos, custando tempo aos programadores.
Isso criou uma oportunidade para empresas como a Warp, que atualmente lidera o ranking da TerminalBench. A Warp se descreve como um “ambiente de desenvolvimento agente”, preenchendo a lacuna entre IDEs completas e ferramentas de linha de comando como o Claude Code. O fundador Zach Lloyd continua otimista sobre o potencial do terminal, vendo-o como uma forma de resolver problemas além do escopo de um editor de código tradicional como o Cursor.
Evento Techcrunch AO VIVO AGORA! TechCrunch All Stage
Construa de forma mais inteligente. Escale mais rapidamente. Conecte-se mais profundamente. Junte-se a visionários da Precursor Ventures, NEA, Index Ventures, Underscore VC e outras empresas para um dia repleto de estratégias, workshops e conexões significativas.
Economize US$ 450 em seu passe para o TechCrunch All Stage
Construa de forma mais inteligente. Expanda mais rapidamente. Conecte-se mais profundamente. Junte-se a visionários da Precursor Ventures, NEA, Index Ventures, Underscore VC e outras empresas para um dia repleto de estratégias, workshops e conexões significativas.
Boston, MA | 15 de julho INSCRIVA-SE AGORA “O terminal fica em uma camada muito fundamental na pilha de desenvolvedores, tornando-o o local mais versátil para executar agentes de IA”, explica Lloyd.
Para entender como essa nova abordagem difere, considere os benchmarks usados para avaliá-la. A geração anterior de ferramentas baseadas em código era avaliada pela resolução de problemas do GitHub, a base do teste SWE-Bench. Cada problema do SWE-Bench é um problema aberto do GitHub — um trecho de código com defeito. Os modelos refinam o código iterativamente até que ele funcione. Embora produtos integrados como o Cursor tenham desenvolvido métodos mais sofisticados, o modelo central do GitHub/SWE-Bench permanece: comece com um código defeituoso e conserte-o.
As ferramentas baseadas em terminal adotam uma perspectiva mais ampla, considerando todo o ambiente em que um programa é executado, não apenas o código. Isso abrange a codificação, bem como tarefas orientadas para DevOps, como configurar um servidor Git ou diagnosticar por que um script falha. Um desafio do TerminalBench fornece um programa de descompressão e um arquivo de texto de destino, encarregando o agente de fazer a engenharia reversa de um algoritmo de compressão correspondente. Outro desafio pede ao agente que construa o kernel Linux a partir do código-fonte, sem mencionar que ele deve primeiro obter o código-fonte. Resolver esses desafios requer a persistência e a criatividade na resolução de problemas, características intrínsecas à programação.
“O que torna o TerminalBench difícil não são apenas as perguntas que fazemos aos agentes”, diz Shaw, “mas os ambientes complexos em que os colocamos”.
Fundamentalmente, esse novo método envolve lidar com problemas por meio de etapas sequenciais e racionais — a mesma capacidade que torna a IA agênica tão poderosa. No entanto, mesmo os modelos agênicos de ponta enfrentam dificuldades em alguns desses ambientes. O Warp alcançou sua pontuação máxima no TerminalBench resolvendo pouco mais da metade dos problemas, destacando tanto a dificuldade do benchmark quanto o trabalho ainda necessário para realizar todo o potencial do terminal.
No entanto, Lloyd afirma que chegamos a um ponto em que as ferramentas baseadas em terminal podem gerenciar com confiabilidade uma parte significativa da carga de trabalho não relacionada à codificação de um desenvolvedor — uma oferta difícil de recusar.
“Considere o trabalho diário de configurar um novo projeto, descobrir dependências e torná-lo executável — o Warp pode lidar com isso de forma amplamente autônoma”, diz Lloyd. “E se não puder, ele dirá exatamente o motivo.”
Artigo relacionado
A ByteDance Aumenta os Incentivos de IA Principal com o Doubao Aumentando 14,6%
A ByteDance convocou recentemente uma reunião de divulgação sobre a participação acionária do DouBao para revelar novas políticas de incentivos para os funcionários envolvidos na divisão do DouBao. O preço de exercício das ações do DouBao foi elevado
MiniMax Lança Programa de Equipes 10x para Incentivar Especialistas Globais em IA
A MiniMax (Xiyu Technology), o Laboratório de Inteligência Artificial Geral, lançou oficialmente o "Equipe 10x", uma iniciativa global de colaboração de talentos. Este programa visa recrutar os melhores especialistas de diversos setores para explorar
A Coreia do Sul inicia a construção do Centro Nacional de Computação em IA, investindo 2,5 trilhões de won com meta para 2028
O outlet sul-coreano EtNews relata que a cerimônia de lançamento da pedra fundamental do Centro de Computação em IA da Coreia (KOACC) ocorreu em 3 de agosto no parque de data centers Solar City, em Sunan, Jeollanam-do. Com um investimento total de 2,
Recomendações de tópicos especiais relacionados
Comentários (3)
Interessant, dass sich die KI-Coding-Tools jetzt auf das Terminal konzentrieren. Ich habe Cursor und Copilot im Editor benutzt, aber die Idee, direkt in der Kommandozeile zu arbeiten, klingt nach einem logischen nächsten Schritt für mehr Effizienz. Hoffentlich bleibt die Bedienung trotzdem intuitiv – sonst wird das nichts mit dem 'Vibe-Coding' 😅. Mal sehen, wie sich das gegen die etablierten Editoren durchsetzt.

Durante anos, editores de código aprimorados por IA, como Cursor, Windsurf e GitHub Copilot, estabeleceram o padrão para o desenvolvimento de software. No entanto, à medida que a IA agênica se torna mais capaz e uma abordagem mais intuitiva de “codificação por vibração” ganha força, uma evolução silenciosa está remodelando a forma como esses sistemas operam. Em vez de apenas manipular o código, eles estão cada vez mais se envolvendo diretamente com o shell da linha de comando do sistema. Isso marca uma mudança fundamental no desenvolvimento assistido por IA — um movimento sutil, mas potencialmente transformador para o futuro da indústria.
O terminal, que muitas vezes lembra as telas em preto e branco dos filmes de hackers dos anos 90, é uma interface clássica para executar programas e gerenciar dados. Embora menos sofisticado visualmente do que os editores de código modernos, ele continua sendo uma ferramenta imensamente poderosa nas mãos de profissionais qualificados. Embora os agentes centrados em código possam escrever e depurar programas, os utilitários baseados em terminal são frequentemente essenciais para transformar o código escrito em um aplicativo funcional e implantável.
A mudança em direção ao terminal é mais evidente nos principais laboratórios de IA. Desde fevereiro, a Anthropic, a DeepMind e a OpenAI lançaram ferramentas de codificação de linha de comando (Claude Code, Gemini CLI e CLI Codex, respectivamente), que rapidamente se tornaram algumas de suas ofertas mais populares. Essa transição é fácil de ignorar, pois essas ferramentas geralmente compartilham a marca com suas antecessoras. No entanto, fundamentalmente, a forma como os agentes de IA interagem com os computadores — tanto online quanto offline — mudou. Muitos acreditam que isso é apenas o começo.
“Nossa hipótese central é que, no futuro, cerca de 95% da interação entre LLM e computadores ocorrerá por meio de uma interface semelhante a um terminal”, afirma Alex Shaw, co-criador do proeminente benchmark focado em terminais, TerminalBench.
As ferramentas baseadas em terminais estão ganhando destaque, enquanto algumas plataformas estabelecidas focadas em código enfrentam instabilidade. O editor de código de IA Windsurf, por exemplo, foi fragmentado por aquisições concorrentes, com líderes seniores recrutados pelo Google e o restante da empresa comprado pela Cognition — lançando dúvidas sobre a viabilidade a longo prazo do produto de consumo.
Simultaneamente, novas pesquisas sugerem que os desenvolvedores podem estar superestimando os benefícios de produtividade das ferramentas tradicionais. Um estudo da METR que avaliou o Cursor Pro, principal rival do Windsurf, descobriu que, embora os desenvolvedores previsse um aumento de 20 a 30% na velocidade, o processo observado foi quase 20% mais lento. Em essência, o assistente de código estava, em alguns casos, custando tempo aos programadores.
Isso criou uma oportunidade para empresas como a Warp, que atualmente lidera o ranking da TerminalBench. A Warp se descreve como um “ambiente de desenvolvimento agente”, preenchendo a lacuna entre IDEs completas e ferramentas de linha de comando como o Claude Code. O fundador Zach Lloyd continua otimista sobre o potencial do terminal, vendo-o como uma forma de resolver problemas além do escopo de um editor de código tradicional como o Cursor.
Evento TechcrunchAO VIVO AGORA! TechCrunch All Stage
Construa de forma mais inteligente. Escale mais rapidamente. Conecte-se mais profundamente. Junte-se a visionários da Precursor Ventures, NEA, Index Ventures, Underscore VC e outras empresas para um dia repleto de estratégias, workshops e conexões significativas.
Economize US$ 450 em seu passe para o TechCrunch All Stage
Construa de forma mais inteligente. Expanda mais rapidamente. Conecte-se mais profundamente. Junte-se a visionários da Precursor Ventures, NEA, Index Ventures, Underscore VC e outras empresas para um dia repleto de estratégias, workshops e conexões significativas.
Boston, MA | 15 de julho INSCRIVA-SE AGORA“O terminal fica em uma camada muito fundamental na pilha de desenvolvedores, tornando-o o local mais versátil para executar agentes de IA”, explica Lloyd.
Para entender como essa nova abordagem difere, considere os benchmarks usados para avaliá-la. A geração anterior de ferramentas baseadas em código era avaliada pela resolução de problemas do GitHub, a base do teste SWE-Bench. Cada problema do SWE-Bench é um problema aberto do GitHub — um trecho de código com defeito. Os modelos refinam o código iterativamente até que ele funcione. Embora produtos integrados como o Cursor tenham desenvolvido métodos mais sofisticados, o modelo central do GitHub/SWE-Bench permanece: comece com um código defeituoso e conserte-o.
As ferramentas baseadas em terminal adotam uma perspectiva mais ampla, considerando todo o ambiente em que um programa é executado, não apenas o código. Isso abrange a codificação, bem como tarefas orientadas para DevOps, como configurar um servidor Git ou diagnosticar por que um script falha. Um desafio do TerminalBench fornece um programa de descompressão e um arquivo de texto de destino, encarregando o agente de fazer a engenharia reversa de um algoritmo de compressão correspondente. Outro desafio pede ao agente que construa o kernel Linux a partir do código-fonte, sem mencionar que ele deve primeiro obter o código-fonte. Resolver esses desafios requer a persistência e a criatividade na resolução de problemas, características intrínsecas à programação.
“O que torna o TerminalBench difícil não são apenas as perguntas que fazemos aos agentes”, diz Shaw, “mas os ambientes complexos em que os colocamos”.
Fundamentalmente, esse novo método envolve lidar com problemas por meio de etapas sequenciais e racionais — a mesma capacidade que torna a IA agênica tão poderosa. No entanto, mesmo os modelos agênicos de ponta enfrentam dificuldades em alguns desses ambientes. O Warp alcançou sua pontuação máxima no TerminalBench resolvendo pouco mais da metade dos problemas, destacando tanto a dificuldade do benchmark quanto o trabalho ainda necessário para realizar todo o potencial do terminal.
No entanto, Lloyd afirma que chegamos a um ponto em que as ferramentas baseadas em terminal podem gerenciar com confiabilidade uma parte significativa da carga de trabalho não relacionada à codificação de um desenvolvedor — uma oferta difícil de recusar.
“Considere o trabalho diário de configurar um novo projeto, descobrir dependências e torná-lo executável — o Warp pode lidar com isso de forma amplamente autônoma”, diz Lloyd. “E se não puder, ele dirá exatamente o motivo.”
A ByteDance Aumenta os Incentivos de IA Principal com o Doubao Aumentando 14,6%
A ByteDance convocou recentemente uma reunião de divulgação sobre a participação acionária do DouBao para revelar novas políticas de incentivos para os funcionários envolvidos na divisão do DouBao. O preço de exercício das ações do DouBao foi elevado
MiniMax Lança Programa de Equipes 10x para Incentivar Especialistas Globais em IA
A MiniMax (Xiyu Technology), o Laboratório de Inteligência Artificial Geral, lançou oficialmente o "Equipe 10x", uma iniciativa global de colaboração de talentos. Este programa visa recrutar os melhores especialistas de diversos setores para explorar
A Coreia do Sul inicia a construção do Centro Nacional de Computação em IA, investindo 2,5 trilhões de won com meta para 2028
O outlet sul-coreano EtNews relata que a cerimônia de lançamento da pedra fundamental do Centro de Computação em IA da Coreia (KOACC) ocorreu em 3 de agosto no parque de data centers Solar City, em Sunan, Jeollanam-do. Com um investimento total de 2,
Interessant, dass sich die KI-Coding-Tools jetzt auf das Terminal konzentrieren. Ich habe Cursor und Copilot im Editor benutzt, aber die Idee, direkt in der Kommandozeile zu arbeiten, klingt nach einem logischen nächsten Schritt für mehr Effizienz. Hoffentlich bleibt die Bedienung trotzdem intuitiv – sonst wird das nichts mit dem 'Vibe-Coding' 😅. Mal sehen, wie sich das gegen die etablierten Editoren durchsetzt.





Lar






