Lar
Claude 3,5 sonetos luta criativamente em testes de codificação de IA dominados por chatgpt
Testando as Capacidades do Novo Claude 3.5 Sonnet da Anthropic
Na última semana, recebi um e-mail da Anthropic anunciando o lançamento do Claude 3.5 Sonnet. Eles afirmaram que ele "eleva o padrão da indústria em inteligência, superando modelos concorrentes e o Claude 3 Opus em uma ampla gama de avaliações." Eles também disseram que era perfeito para tarefas complexas como geração de código. Naturalmente, precisei testar essas afirmações.
Eu executei uma série de testes de codificação em várias IAs, e você também pode. Basta acessar Como eu testo a capacidade de codificação de um chatbot de IA - e você também pode para encontrar todos os detalhes. Vamos mergulhar em como o Claude 3.5 Sonnet se saiu nos meus testes padrão e ver como ele se compara a outras IAs como Microsoft Copilot, Meta AI, Meta Code Llama, Google Gemini Advanced e ChatGPT.
1. Escrevendo um Plugin para WordPress
Inicialmente, o Claude 3.5 Sonnet mostrou muito potencial. A interface de usuário que ele gerou foi impressionante, com um layout limpo que posicionou os campos de dados lado a lado pela primeira vez entre as IAs que testei.
Captura de tela por David Gewirtz/ZDNET
O que chamou minha atenção foi como o Claude abordou a geração de código. Em vez dos arquivos separados habituais para PHP, JavaScript e CSS, ele forneceu um único arquivo PHP que gerava automaticamente os arquivos JavaScript e CSS no diretório do plugin. Embora essa seja uma abordagem inovadora, é arriscada porque depende das configurações do sistema operacional permitirem que um plugin escreva em sua própria pasta — uma grande falha de segurança em um ambiente de produção.
Infelizmente, apesar da solução criativa, o plugin não funcionou. O botão "Randomize" não fazia nada, o que foi decepcionante, dado o potencial inicial.
Aqui estão os resultados agregados em comparação com testes anteriores:
- Claude 3.5 Sonnet: Interface: boa, funcionalidade: falhou
- ChatGPT GPT-4o: Interface: boa, funcionalidade: boa
- Microsoft Copilot: Interface: adequada, funcionalidade: falhou
- Meta AI: Interface: adequada, funcionalidade: falhou
- Meta Code Llama: Falha completa
- Google Gemini Advanced: Interface: boa, funcionalidade: falhou
- ChatGPT 4: Interface: boa, funcionalidade: boa
- ChatGPT 3.5: Interface: boa, funcionalidade: boa
2. Reescrevendo uma Função de String
Este teste avalia o quão bem uma IA pode reescrever código para atender a necessidades específicas, neste caso, para conversões de dólar e centavos. O Claude 3.5 Sonnet fez um bom trabalho ao remover zeros à esquerda, lidar corretamente com inteiros e decimais e prevenir valores negativos. Ele também retornou inteligentemente "0" para entradas inesperadas, o que ajuda a evitar erros.
No entanto, ele não conseguiu permitir entradas como ".50" para 50 centavos, que era um requisito. Isso significa que o código revisado não funcionaria em um cenário do mundo real, então tenho que marcar como falha.
Aqui estão os resultados agregados:
- Claude 3.5 Sonnet: Falhou
- ChatGPT GPT-4o: Sucesso
- Microsoft Copilot: Falhou
- Meta AI: Falhou
- Meta Code Llama: Sucesso
- Google Gemini Advanced: Falhou
- ChatGPT 4: Sucesso
- ChatGPT 3.5: Sucesso
3. Encontrando um Bug Irritante
Este teste é complicado porque exige que a IA encontre um bug sutil que requer conhecimento específico do WordPress. É um bug que eu mesmo perdi e precisei recorrer ao ChatGPT para resolver inicialmente.
O Claude 3.5 Sonnet não apenas encontrou e corrigiu o bug, mas também notou um erro introduzido durante o processo de publicação, que eu então corrigi. Isso foi uma novidade entre as IAs que testei desde a publicação do conjunto completo de testes.
Aqui estão os resultados agregados:
- Claude 3.5 Sonnet: Sucesso
- ChatGPT GPT-4o: Sucesso
- Microsoft Copilot: Falhou. Espetacularmente. Entusiasticamente. Com emojis.
- Meta AI: Sucesso
- Meta Code Llama: Falhou
- Google Gemini Advanced: Falhou
- ChatGPT 4: Sucesso
- ChatGPT 3.5: Sucesso
Até agora, o Claude 3.5 Sonnet falhou em dois dos três testes. Vamos ver como ele se sai no último.
4. Escrevendo um Script
Este teste verifica o conhecimento da IA sobre ferramentas de programação especializadas como AppleScript e Keyboard Maestro. Enquanto o ChatGPT demonstrou proficiência em ambos, o Claude 3.5 Sonnet não se saiu tão bem. Ele escreveu um AppleScript que tentou interagir com o Chrome, mas ignorou completamente o componente Keyboard Maestro.
Além disso, o AppleScript continha um erro de sintaxe. Ao tentar tornar a correspondência insensível a maiúsculas e minúsculas, o Claude gerou uma linha que causaria um erro de execução:
if theTab's title contains input ignoring case then
A declaração "contains" já é insensível a maiúsculas e minúsculas, e a frase "ignoring case" foi colocada incorretamente, resultando em um erro.
Aqui estão os resultados agregados:
- Claude 3.5 Sonnet: Falhou
- ChatGPT GPT-4o: Sucesso, mas com ressalvas
- Microsoft Copilot: Falhou
- Meta AI: Falhou
- Meta Code Llama: Falhou
- Google Gemini Advanced: Sucesso
- ChatGPT 4: Sucesso
- ChatGPT 3.5: Falhou
Resultados Gerais
Aqui está como o Claude 3.5 Sonnet se saiu no geral em comparação com outras IAs:
- Claude 3.5 Sonnet: 1 de 4 com sucesso
- ChatGPT GPT-4o: 4 de 4 com sucesso, mas com uma resposta de escolha dupla estranha
- Microsoft Copilot: 0 de 4 com sucesso
- Meta AI: 1 de 4 com sucesso
- Meta Code Llama: 1 de 4 com sucesso
- Google Gemini Advanced: 1 de 4 com sucesso
- ChatGPT 4: 4 de 4 com sucesso
- ChatGPT 3.5: 3 de 4 com sucesso
Fiquei bastante decepcionado com o Claude 3.5 Sonnet. A Anthropic prometeu que ele era adequado para programação, mas não atendeu às expectativas. Não é que ele não consiga programar; ele simplesmente não consegue programar corretamente. Continuo esperando encontrar uma IA que supere o ChatGPT, especialmente à medida que esses modelos são integrados em ambientes de programação. Mas, por enquanto, vou continuar com o ChatGPT para ajuda com programação, e recomendo que você faça o mesmo.
Você já usou uma IA para programar? Qual, e como foi? Compartilhe suas experiências nos comentários abaixo.
Acompanhe as atualizações do meu projeto nas redes sociais, assine meu boletim semanal e conecte-se comigo no Twitter/X em @DavidGewirtz, no Facebook em Facebook.com/DavidGewirtz, no Instagram em Instagram.com/DavidGewirtz e no YouTube em YouTube.com/DavidGewirtzTV.
Artigo relacionado
A Flórida processa a OpenAI e Sam Altman por incidentes violentos
O Procurador-Geral da Flórida entrou na segunda-feira com uma ação judicial estadual inédita contra a OpenAI e o seu CEO, Sam Altman, alegando que o ChatGPT da empresa está ligado a múltiplos incidentes violentos.A queixa argumenta que a OpenAI prio
A OpenAI apresenta modelos de voz avançados para conversas em tempo real mais naturais
A OpenAI lançou novos modelos conversacionais, o GPT-Live-1 e o GPT-Live-1 mini, projetados para soarem mais naturais e gerenciarem a alternância de turnos de forma mais eficaz. Esses modelos full-dup
A OpenAI apresenta o GPT-5.6, a mais recente adição à sua família de modelos
A OpenAI lançou sua mais recente família de modelos na quinta-feira, introduzindo novas e poderosas opções em um cenário de IA cada vez mais competitivo.O GPT-5.6 está disponível em três variantes: So
Recomendações de tópicos especiais relacionados
Comentários (11)
Intéressant de voir Claude 3.5 Sonnet avoir du mal avec le codage créatif. Est-ce qu'on attend trop des IA actuellement ? Après tout, l'intelligence humaine reste unique 🤷♂️
Claude 3.5 Sonnet is pretty good, but it's no match for ChatGPT in coding tests. It's like bringing a knife to a gunfight! 😂 Still, it's an improvement over the last version, so kudos to Anthropic for trying to keep up. Maybe next time, they'll surprise us!
Claude 3.5 Sonnet é bom, mas não chega aos pés do ChatGPT em testes de codificação. É como levar uma faca para uma batalha de armas! 😂 Ainda assim, é uma melhoria em relação à versão anterior, então parabéns à Anthropic por tentar acompanhar. Talvez da próxima vez eles nos surpreendam!
クロード3.5ソネットはコードテストではChatGPTにかなわないですね。まるでナイフを持って銃撃戦に挑むようなものです!😂 でも、前バージョンよりは改善されているので、アントロピックの努力には敬意を表します。次回は驚かせてくれるかも?
Claude 3.5 Sonnet qui galère en codage, c’est un peu décevant vu les promesses d’Anthropic. 😐 ChatGPT garde l’avantage, mais la course à l’IA est fascinante !
Testando as Capacidades do Novo Claude 3.5 Sonnet da Anthropic
Na última semana, recebi um e-mail da Anthropic anunciando o lançamento do Claude 3.5 Sonnet. Eles afirmaram que ele "eleva o padrão da indústria em inteligência, superando modelos concorrentes e o Claude 3 Opus em uma ampla gama de avaliações." Eles também disseram que era perfeito para tarefas complexas como geração de código. Naturalmente, precisei testar essas afirmações.
Eu executei uma série de testes de codificação em várias IAs, e você também pode. Basta acessar Como eu testo a capacidade de codificação de um chatbot de IA - e você também pode para encontrar todos os detalhes. Vamos mergulhar em como o Claude 3.5 Sonnet se saiu nos meus testes padrão e ver como ele se compara a outras IAs como Microsoft Copilot, Meta AI, Meta Code Llama, Google Gemini Advanced e ChatGPT.
1. Escrevendo um Plugin para WordPress
Inicialmente, o Claude 3.5 Sonnet mostrou muito potencial. A interface de usuário que ele gerou foi impressionante, com um layout limpo que posicionou os campos de dados lado a lado pela primeira vez entre as IAs que testei.
Captura de tela por David Gewirtz/ZDNET
O que chamou minha atenção foi como o Claude abordou a geração de código. Em vez dos arquivos separados habituais para PHP, JavaScript e CSS, ele forneceu um único arquivo PHP que gerava automaticamente os arquivos JavaScript e CSS no diretório do plugin. Embora essa seja uma abordagem inovadora, é arriscada porque depende das configurações do sistema operacional permitirem que um plugin escreva em sua própria pasta — uma grande falha de segurança em um ambiente de produção.
Infelizmente, apesar da solução criativa, o plugin não funcionou. O botão "Randomize" não fazia nada, o que foi decepcionante, dado o potencial inicial.
Aqui estão os resultados agregados em comparação com testes anteriores:
- Claude 3.5 Sonnet: Interface: boa, funcionalidade: falhou
- ChatGPT GPT-4o: Interface: boa, funcionalidade: boa
- Microsoft Copilot: Interface: adequada, funcionalidade: falhou
- Meta AI: Interface: adequada, funcionalidade: falhou
- Meta Code Llama: Falha completa
- Google Gemini Advanced: Interface: boa, funcionalidade: falhou
- ChatGPT 4: Interface: boa, funcionalidade: boa
- ChatGPT 3.5: Interface: boa, funcionalidade: boa
2. Reescrevendo uma Função de String
Este teste avalia o quão bem uma IA pode reescrever código para atender a necessidades específicas, neste caso, para conversões de dólar e centavos. O Claude 3.5 Sonnet fez um bom trabalho ao remover zeros à esquerda, lidar corretamente com inteiros e decimais e prevenir valores negativos. Ele também retornou inteligentemente "0" para entradas inesperadas, o que ajuda a evitar erros.
No entanto, ele não conseguiu permitir entradas como ".50" para 50 centavos, que era um requisito. Isso significa que o código revisado não funcionaria em um cenário do mundo real, então tenho que marcar como falha.
Aqui estão os resultados agregados:
- Claude 3.5 Sonnet: Falhou
- ChatGPT GPT-4o: Sucesso
- Microsoft Copilot: Falhou
- Meta AI: Falhou
- Meta Code Llama: Sucesso
- Google Gemini Advanced: Falhou
- ChatGPT 4: Sucesso
- ChatGPT 3.5: Sucesso
3. Encontrando um Bug Irritante
Este teste é complicado porque exige que a IA encontre um bug sutil que requer conhecimento específico do WordPress. É um bug que eu mesmo perdi e precisei recorrer ao ChatGPT para resolver inicialmente.
O Claude 3.5 Sonnet não apenas encontrou e corrigiu o bug, mas também notou um erro introduzido durante o processo de publicação, que eu então corrigi. Isso foi uma novidade entre as IAs que testei desde a publicação do conjunto completo de testes.
Aqui estão os resultados agregados:
- Claude 3.5 Sonnet: Sucesso
- ChatGPT GPT-4o: Sucesso
- Microsoft Copilot: Falhou. Espetacularmente. Entusiasticamente. Com emojis.
- Meta AI: Sucesso
- Meta Code Llama: Falhou
- Google Gemini Advanced: Falhou
- ChatGPT 4: Sucesso
- ChatGPT 3.5: Sucesso
Até agora, o Claude 3.5 Sonnet falhou em dois dos três testes. Vamos ver como ele se sai no último.
4. Escrevendo um Script
Este teste verifica o conhecimento da IA sobre ferramentas de programação especializadas como AppleScript e Keyboard Maestro. Enquanto o ChatGPT demonstrou proficiência em ambos, o Claude 3.5 Sonnet não se saiu tão bem. Ele escreveu um AppleScript que tentou interagir com o Chrome, mas ignorou completamente o componente Keyboard Maestro.
Além disso, o AppleScript continha um erro de sintaxe. Ao tentar tornar a correspondência insensível a maiúsculas e minúsculas, o Claude gerou uma linha que causaria um erro de execução:
A declaração "contains" já é insensível a maiúsculas e minúsculas, e a frase "ignoring case" foi colocada incorretamente, resultando em um erro.
Aqui estão os resultados agregados:
- Claude 3.5 Sonnet: Falhou
- ChatGPT GPT-4o: Sucesso, mas com ressalvas
- Microsoft Copilot: Falhou
- Meta AI: Falhou
- Meta Code Llama: Falhou
- Google Gemini Advanced: Sucesso
- ChatGPT 4: Sucesso
- ChatGPT 3.5: Falhou
Resultados Gerais
Aqui está como o Claude 3.5 Sonnet se saiu no geral em comparação com outras IAs:
- Claude 3.5 Sonnet: 1 de 4 com sucesso
- ChatGPT GPT-4o: 4 de 4 com sucesso, mas com uma resposta de escolha dupla estranha
- Microsoft Copilot: 0 de 4 com sucesso
- Meta AI: 1 de 4 com sucesso
- Meta Code Llama: 1 de 4 com sucesso
- Google Gemini Advanced: 1 de 4 com sucesso
- ChatGPT 4: 4 de 4 com sucesso
- ChatGPT 3.5: 3 de 4 com sucesso
Fiquei bastante decepcionado com o Claude 3.5 Sonnet. A Anthropic prometeu que ele era adequado para programação, mas não atendeu às expectativas. Não é que ele não consiga programar; ele simplesmente não consegue programar corretamente. Continuo esperando encontrar uma IA que supere o ChatGPT, especialmente à medida que esses modelos são integrados em ambientes de programação. Mas, por enquanto, vou continuar com o ChatGPT para ajuda com programação, e recomendo que você faça o mesmo.
Você já usou uma IA para programar? Qual, e como foi? Compartilhe suas experiências nos comentários abaixo.
Acompanhe as atualizações do meu projeto nas redes sociais, assine meu boletim semanal e conecte-se comigo no Twitter/X em @DavidGewirtz, no Facebook em Facebook.com/DavidGewirtz, no Instagram em Instagram.com/DavidGewirtz e no YouTube em YouTube.com/DavidGewirtzTV.
A Flórida processa a OpenAI e Sam Altman por incidentes violentos
O Procurador-Geral da Flórida entrou na segunda-feira com uma ação judicial estadual inédita contra a OpenAI e o seu CEO, Sam Altman, alegando que o ChatGPT da empresa está ligado a múltiplos incidentes violentos.A queixa argumenta que a OpenAI prio
A OpenAI apresenta modelos de voz avançados para conversas em tempo real mais naturais
A OpenAI lançou novos modelos conversacionais, o GPT-Live-1 e o GPT-Live-1 mini, projetados para soarem mais naturais e gerenciarem a alternância de turnos de forma mais eficaz. Esses modelos full-dup
A OpenAI apresenta o GPT-5.6, a mais recente adição à sua família de modelos
A OpenAI lançou sua mais recente família de modelos na quinta-feira, introduzindo novas e poderosas opções em um cenário de IA cada vez mais competitivo.O GPT-5.6 está disponível em três variantes: So
Intéressant de voir Claude 3.5 Sonnet avoir du mal avec le codage créatif. Est-ce qu'on attend trop des IA actuellement ? Après tout, l'intelligence humaine reste unique 🤷♂️
Claude 3.5 Sonnet is pretty good, but it's no match for ChatGPT in coding tests. It's like bringing a knife to a gunfight! 😂 Still, it's an improvement over the last version, so kudos to Anthropic for trying to keep up. Maybe next time, they'll surprise us!
Claude 3.5 Sonnet é bom, mas não chega aos pés do ChatGPT em testes de codificação. É como levar uma faca para uma batalha de armas! 😂 Ainda assim, é uma melhoria em relação à versão anterior, então parabéns à Anthropic por tentar acompanhar. Talvez da próxima vez eles nos surpreendam!
クロード3.5ソネットはコードテストではChatGPTにかなわないですね。まるでナイフを持って銃撃戦に挑むようなものです!😂 でも、前バージョンよりは改善されているので、アントロピックの努力には敬意を表します。次回は驚かせてくれるかも?
Claude 3.5 Sonnet qui galère en codage, c’est un peu décevant vu les promesses d’Anthropic. 😐 ChatGPT garde l’avantage, mais la course à l’IA est fascinante !











