Option
Heim
Nachricht
Ich habe GPT -4O durch meine Codierungstests gestellt und sie hat sie geschnitten - bis auf ein seltsames Ergebnis

Ich habe GPT -4O durch meine Codierungstests gestellt und sie hat sie geschnitten - bis auf ein seltsames Ergebnis

17. April 2025
173

Ich habe GPT -4O durch meine Codierungstests gestellt und sie hat sie geschnitten - bis auf ein seltsames Ergebnis

Wenn du die Tech-Welt verfolgst, ist dir wahrscheinlich bewusst, dass OpenAI gerade sein neuestes großes Sprachmodell, GPT-4o, veröffentlicht hat, wobei das „o“ für „omni“ steht. Dieses neue Modell verspricht Vielseitigkeit bei Text, Grafiken und Sprache, und ich konnte es kaum erwarten, es mit meinem Standardset an Codierungstests auf die Probe zu stellen. Diese Tests wurden gegen eine Vielzahl von KI-Modellen durchgeführt und haben einige ziemlich faszinierende Ergebnisse geliefert. Bleib bis zum Ende dabei, denn es gibt eine Wendung, die du nicht verpassen willst.

Wenn du daran interessiert bist, deine eigenen Experimente durchzuführen, schau dir diese Anleitung an: Wie ich die Codierungsfähigkeit eines KI-Chatbots teste – und du kannst es auch. Sie beschreibt alle Tests, die ich verwende, zusammen mit detaillierten Erklärungen, wie sie funktionieren und worauf man bei den Ergebnissen achten sollte.

Jetzt lass uns in die Ergebnisse der einzelnen Tests eintauchen und sehen, wie GPT-4o im Vergleich zu früheren Konkurrenten wie Microsoft Copilot, Meta AI, Meta Code Llama, Google Gemini Advanced und den früheren Versionen von ChatGPT abschneidet.

1. Erstellen eines WordPress-Plugins

Hier ist ein Einblick in die Benutzeroberfläche von GPT-4o:

Interessanterweise hat GPT-4o sich die Freiheit genommen, eine JavaScript-Datei einzufügen, die die Zeilenanzahl in beiden Feldern dynamisch aktualisiert. Obwohl die Eingabeaufforderung JavaScript nicht ausdrücklich ausgeschlossen hat, war dieser kreative Ansatz unerwartet und effektiv. Das JavaScript verbessert auch die Funktionalität des Randomize-Buttons, indem es mehrere Ergebnissätze ohne vollständiges Neuladen der Seite ermöglicht.

Die Zeilen wurden korrekt angeordnet, und Duplikate wurden gemäß den Spezifikationen angemessen getrennt. Es ist ein solides Stück Code, mit nur einem kleinen Kritikpunkt: Der Randomize-Button wurde nicht auf eine eigene Zeile gesetzt, obwohl ich das in der Eingabeaufforderung nicht spezifiziert hatte, also keine Punktabzüge dafür.

Hier sind die Gesamtergebnisse für diesen und frühere Tests:

  • ChatGPT GPT-4o: Benutzeroberfläche: gut, Funktionalität: gut
  • Microsoft Copilot: Benutzeroberfläche: ausreichend, Funktionalität: fehlgeschlagen
  • Meta AI: Benutzeroberfläche: ausreichend, Funktionalität: fehlgeschlagen
  • Meta Code Llama: Komplettes Versagen
  • Google Gemini Advanced: Benutzeroberfläche: gut, Funktionalität: fehlgeschlagen
  • ChatGPT 4: Benutzeroberfläche: gut, Funktionalität: gut
  • ChatGPT 3.5: Benutzeroberfläche: gut, Funktionalität: gut

2. Umschreiben einer Zeichenfolgenfunktion

Dieser Test bewertet die Fähigkeit des Modells, mit Umrechnungen von Dollar und Cent umzugehen. GPT-4o hat den Code erfolgreich umgeschrieben, um Eingaben abzulehnen, die Probleme mit nachfolgenden Zeilen verursachen könnten, und sichergestellt, dass nur gültige Dollar- und Cent-Werte verarbeitet werden.

Ich war ein wenig enttäuscht, dass es nicht automatisch eine führende Null zu Werten wie .75 hinzufügte, um sie in 0.75 umzuwandeln. Da ich diese Funktion jedoch nicht ausdrücklich angefordert habe, ist es kein Fehler der KI. Es ist eine Erinnerung daran, dass man selbst bei funktionsfähigem Code die Eingabeaufforderung verfeinern muss, um genau das zu bekommen, was man braucht.

Hier sind die Gesamtergebnisse für diesen und frühere Tests:

  • ChatGPT GPT-4o: Erfolgreich
  • Microsoft Copilot: Fehlgeschlagen
  • Meta AI: Fehlgeschlagen
  • Meta Code Llama: Erfolgreich
  • Google Gemini Advanced: Fehlgeschlagen
  • ChatGPT 4: Erfolgreich
  • ChatGPT 3.5: Erfolgreich

3. Finden eines lästigen Fehlers

Dieser Test ist faszinierend, weil die Lösung nicht sofort offensichtlich ist. Ich war zunächst selbst bei diesem Fehler während meines eigenen Codierens ratlos, also wandte ich mich an das erste ChatGPT-Modell um Hilfe. Es fand den Fehler sofort, was damals überwältigend war.

Im Gegensatz dazu übersahen drei der anderen getesteten LLMs die Irreführung in diesem Problem. Die Fehlermeldung deutet auf einen Teil des Codes hin, aber das eigentliche Problem liegt woanders und erfordert tiefes Wissen über das WordPress-Framework, um es zu identifizieren.

Glücklicherweise hat GPT-4o das Problem korrekt identifiziert und die Lösung genau beschrieben.

Hier sind die Gesamtergebnisse für diesen und frühere Tests:

  • ChatGPT GPT-4o: Erfolgreich
  • Microsoft Copilot: Fehlgeschlagen. Spektakulär. Enthusiastisch. Emojimäßig.
  • Meta AI: Erfolgreich
  • Meta Code Llama: Fehlgeschlagen
  • Google Gemini Advanced: Fehlgeschlagen
  • ChatGPT 4: Erfolgreich
  • ChatGPT 3.5: Erfolgreich

Bis jetzt hat GPT-4o in allen drei Tests bestanden. Mal sehen, wie es im letzten Test abschneidet.

4. Schreiben eines Skripts

Als Antwort auf diesen Test hat GPT-4o tatsächlich mehr geliefert, als ich verlangt habe. Der Test beinhaltet die Verwendung des obskuren Mac-Scripting-Tools Keyboard Maestro, Apples AppleScript und Chrome-Scripting-Verhalten. Keyboard Maestro ist übrigens für mich ein echter Gamechanger, da es Macs aufgrund seiner Fähigkeit, das Betriebssystem und Anwendungen umzuprogrammieren, zu meiner bevorzugten Wahl für Produktivität macht.

Um zu bestehen, muss die KI eine Lösung korrekt skizzieren, die eine Kombination aus Keyboard Maestro-Code, AppleScript und Chrome-API-Funktionalität verwendet.

Überraschenderweise hat GPT-4o mir zwei verschiedene Versionen geliefert:

Beide Versionen interagierten korrekt mit Keyboard Maestro, unterschieden sich jedoch in der Handhabung der Groß-/Kleinschreibung. Die linke Version war falsch, da AppleScript „as lowercase“ nicht unterstützt. Die rechte Version, die „contains“ verwendete und groß-/kleinschreibungsunabhängig war, funktionierte einwandfrei.

Ich gebe GPT-4o einen vorsichtigen Pass, da es funktionsfähigen Code geliefert hat. Allerdings hat das Zurückgeben von zwei Optionen, von denen eine falsch war, zusätzliche Arbeit verursacht, um die richtige auszuwählen. Das hätte genauso zeitaufwändig sein können, wie den Code selbst zu schreiben.

Hier sind die Gesamtergebnisse für diesen und frühere Tests:

  • ChatGPT GPT-4o: Erfolgreich, aber mit Vorbehalten
  • Microsoft Copilot: Fehlgeschlagen
  • Meta AI: Fehlgeschlagen
  • Meta Code Llama: Fehlgeschlagen
  • Google Gemini Advanced: Erfolgreich
  • ChatGPT 4: Erfolgreich
  • ChatGPT 3.5: Fehlgeschlagen

Gesamtergebnisse

So haben alle Modelle in den vier Tests abgeschnitten:

  • ChatGPT GPT-4o: 4 von 4 erfolgreich, aber mit dieser seltsamen Doppelantwort
  • Microsoft Copilot: 0 von 4 erfolgreich
  • Meta AI: 1 von 4 erfolgreich
  • Meta Code Llama: 1 von 4 erfolgreich
  • Google Gemini Advanced: 1 von 4 erfolgreich
  • ChatGPT 4: 4 von 4 erfolgreich
  • ChatGPT 3.5: 3 von 4 erfolgreich

Bis jetzt war ChatGPT meine erste Wahl für Programmierhilfe. Es hat immer geliefert (außer wenn es das nicht tat). Die anderen KIs blieben in meinen Tests meist hinter den Erwartungen zurück. Aber GPT-4o hat mich mit dieser letzten Doppelantwort überrascht. Es ließ mich fragen, was in diesem Modell vor sich geht, dass es zu einem solchen Stolperer kommen konnte.

Trotzdem bleibt GPT-4o in meinen Codierungstests der Spitzenreiter, also werde ich es wahrscheinlich weiter nutzen und mich mit seinen Eigenheiten vertrauter machen. Alternativ könnte ich zu GPT-3.5 oder GPT-4 in ChatGPT Plus zurückkehren. Bleibt dran; wenn ChatGPT das nächste Mal sein Modell aktualisiert, werde ich diese Tests definitiv erneut durchführen, um zu sehen, ob es durchgehend die richtige Antwort bei allen vier Tests liefern kann.

Hast du schon einmal mit einem dieser KI-Modelle programmiert? Was sind deine Erfahrungen? Lass es uns in den Kommentaren unten wissen.

Verwandter Artikel
Südkorea beginnt mit dem Bau des nationalen KI-Rechenzentrums und investiert 2,5 Billionen Won mit einem Zieljahr von 2028 Südkorea beginnt mit dem Bau des nationalen KI-Rechenzentrums und investiert 2,5 Billionen Won mit einem Zieljahr von 2028 Der südkoreanische Ableger von EtNews berichtet, dass am 3. August im Solar City-Datenzentrumspark in Sunan, Provinz Jeollanam-do, der Grundstein für das Korea AI Computing Center (KOACC) gelegt wurde. Mit einer Gesamtinvestition von 2,5 Billionen KR
Sechs Tech-Giganten unterstützen die Linux Foundation mit 12,5 Millionen US-Dollar, um das Rauschen bei KI-Schwachstellen zu bekämpfen Sechs Tech-Giganten unterstützen die Linux Foundation mit 12,5 Millionen US-Dollar, um das Rauschen bei KI-Schwachstellen zu bekämpfen Um der Flut von Sicherheitsberichten niedriger Qualität, die durch KI-Automatisierungstools erzeugt werden, zu begegnen, haben sechs große Technologieunternehmen – Anthropic, Amazon (AWS), GitHub, Google, Microsoft und OpenAI – gemeinsam 12,5 Million
Musk erwog, OpenAI an seine Kinder zu übergeben, während Altman aussagte Musk erwog, OpenAI an seine Kinder zu übergeben, während Altman aussagte Diesen Morgen trat OpenAI-CEO Sam Altman vor Gericht, um sich zur Klage von Ex-Mitbegründer Elon Musk zu äußern, die die Unternehmensstruktur der Firma anfechtet.Auf die Frage nach Musks Behauptung, andere Mitbegründer hätten „eine Wohltätigkeitsorg
Empfehlungen zu verwandten Spezialthemen
Musikkomposition KI-Stimm-Demo-Tools für Songwriter, Hooks, Toplines und mehrsprachige Entwurfs-Sessions
KI-Stimm-Demo-Tools für Songwriter, Hooks, Toplines und mehrsprachige Entwurfs-Sessions

2026 Neueste und beste KI-Stimm-Demo-Tools für Songwriter, Hook-Ersteller und mehrsprachige Content-Teams! XIX.AI hat eine hochbewertete Liste leistungsstarker, bahnbrechender Tools zusammengestellt, die strengen Praxistests unterzogen wurden. Sie finden detaillierte Vergleichsdaten zu kostenlosen und kostenpflichtigen Optionen, umfassende Rankings und empfehlenswerte Auswahlmöglichkeiten, die Ihnen helfen, Ihre Schreibeffizienz zu steigern und Ihr kreatives Potenzial zu entfalten. Entdecken Sie jetzt das perfekte Tool für all Ihre Content-Bedürfnisse!

9 Tools
xix.ai
Geschäft Die besten KI-Tools zur Wettbewerbsanalyse für kleine Unternehmen
Die besten KI-Tools zur Wettbewerbsanalyse für kleine Unternehmen

Die besten und am besten bewerteten KI-Tools für die Wettbewerbsanalyse für kleine Unternehmen im Jahr 2026! XIX.AI hat eine äußerst leistungsstarke, bahnbrechende Auswahl zusammengestellt, die wöchentlich anhand strenger Praxistests und detaillierter Rankings aktualisiert wird. Hier finden Sie einen umfassenden Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten, der Ihnen dabei hilft, die unverzichtbaren Tools zu identifizieren, die Ihre Produktivität steigern und Ihnen einen Wettbewerbsvorteil verschaffen. Entdecken Sie jetzt das perfekte Tool für sich!

9 Tools
xix.ai
Bildbearbeitung Photoshop-KI-Retuschierungstools für E-Commerce-Bekleidung, Hautbereinigung und Farbkonstanz
Photoshop-KI-Retuschierungstools für E-Commerce-Bekleidung, Hautbereinigung und Farbkonstanz

2026 Neueste beste Photoshop-KI-Retuschierungstools für E-Commerce-Bekleidung, Hautbereinigung und Farbkonsistenz! Diese hoch bewertete kuratierte Liste bietet leistungsstarke, bahnbrechende Lösungen, die Ihnen helfen, die Schreibeffizienz zu steigern, die Content-Erstellung zu optimieren und mühelos perfekte visuelle Ergebnisse zu erzielen. Jedes Tool wurde durch wöchentlich aktualisierte Rankings mit echten Tests geprüft, einschließlich detaillierter Vergleiche zwischen kostenlosen und kostenpflichtigen Versionen. Unterstützt von XIX.AI ist es der unverzichtbare Leitfaden für alle, die ihre KI-Vorteile nutzen möchten. Jetzt entdecken!

10 Tools
xix.ai
Prompt Die besten KI-Prompt-Bibliotheken für ChatGPT-Workflows
Die besten KI-Prompt-Bibliotheken für ChatGPT-Workflows

Die besten und am besten bewerteten KI-Prompt-Bibliotheken des Jahres 2026 zur Optimierung aller Arten von ChatGPT-Workflows. XIX.AI hat eine leistungsstarke, bahnbrechende Sammlung zusammengestellt, die strengen Praxistests unterzogen wird, um Spitzenleistung zu gewährleisten. Hier finden Sie detaillierte Vergleiche zwischen kostenlosen und kostenpflichtigen Angeboten sowie Experten-Rankings, die Ihnen dabei helfen, die unverzichtbaren Tools auszuwählen, mit denen Sie Ihre Produktivität steigern und Ihren KI-Vorteil ausschöpfen können. Entdecken Sie sie jetzt!

11 Tools
xix.ai
Bildung und Lernen AI Quiz Builder Plattformen für Lehrer, Nachhilfelehrer und kohortenbasierte Lernprogramme
AI Quiz Builder Plattformen für Lehrer, Nachhilfelehrer und kohortenbasierte Lernprogramme

2026 Neueste und beste KI-Quiz-Erstellungstools für Lehrer, Nachhilfelehrer und kohortenbasierte Lernprogramme! XIX.AI hat eine hochbewertete Liste leistungsstarker, bahnbrechender Tools zusammengestellt, die realen Tests unterzogen wurden, um genaue Rankings zu liefern. Diese unbedingt auszuprobierenden Plattformen helfen dabei, die Schreibeffizienz zu steigern, die Inhaltserstellung zu optimieren und das Quiz-Design in allen Lernszenarien zu vereinfachen. Entdecken Sie jetzt Ihr perfektes Tool, um Ihren KI-Vorteil im Unterricht voll auszuschöpfen!

13 Tools
xix.ai
Code KI-Tools zur Überprüfung von Pull-Requests für GitHub-Teams, die sich mit Refactorings, Fehlern und Sicherheitslücken befassen
KI-Tools zur Überprüfung von Pull-Requests für GitHub-Teams, die sich mit Refactorings, Fehlern und Sicherheitslücken befassen

Die besten neuen KI-Tools zur Pull-Request-Prüfung für GitHub-Teams im Jahr 2026 finden Sie hier auf XIX.AI! Diese sorgfältig zusammengestellte Liste mit den besten Bewertungen präsentiert leistungsstarke, bahnbrechende Lösungen, die Refactoring, Fehlerbehebung und die Erkennung von Sicherheitslücken in allen Team-Workflows optimieren. Profitieren Sie von einem Vergleich zwischen kostenlosen und kostenpflichtigen Tools sowie von Praxistests und detaillierten Rankings, die Ihnen helfen, das perfekte Tool zu finden, mit dem Sie Ihre Produktivität deutlich steigern können. Entdecken Sie die Tools jetzt und sichern Sie sich Ihren KI-Vorteil!

12 Tools
xix.ai
Kommentare (22)
0/500
RoyMartínez
RoyMartínez 1. Mai 2026 04:01:09 MESZ

GPT-4o klingt beeindruckend, aber diese 'eine seltsame Ausnahme' macht mich neugierig. Was war das für ein seltsames Ergebnis? Vielleicht ein Hinweis darauf, dass KI bei bestimmten Logikaufgaben immer noch überraschend 'menschlich' scheitern kann? 🤔 Die Omni-Fähigkeiten sind cool, aber ich frage mich, wie stabil die Performance in allen Modi wirklich ist.

PaulYoung
PaulYoung 15. März 2026 01:00:58 MEZ

Bon article ! Les tests de programmation sont toujours révélateurs. Je me demande s’il y a des biais selon les langages utilisés pour l'entraînement… Ou peut-être que c’est lié à la façon dont la requête est formulée ? 🤔

JonathanAllen
JonathanAllen 26. April 2025 13:46:22 MESZ

GPT-4o é impressionante, passando na maioria dos meus testes de codificação! Mas aquele resultado estranho me deixou confuso. Ainda assim, é versátil em texto, gráficos e voz. Se ao menos pudesse explicar aquele resultado estranho, seria perfeito! 🤔

WillHarris
WillHarris 25. April 2025 20:21:39 MESZ

GPT-4o thật ấn tượng, vượt qua hầu hết các bài kiểm tra mã hóa của tôi! Nhưng kết quả lạ đó làm tôi bối rối. Tuy nhiên, nó rất linh hoạt trong văn bản, đồ họa và giọng nói. Giá mà nó có thể giải thích kết quả lạ đó, thì sẽ hoàn hảo! 🤔

DonaldGonzález
DonaldGonzález 24. April 2025 13:41:59 MESZ

GPT-4oは私のコードテストのほとんどを完璧にこなすので感動しました!しかし、その一つの奇妙な結果が気になりました。それでも、テキスト、グラフィック、音声での多様性は素晴らしいです。あの奇妙な結果を説明できれば完璧だったのに!🤔

JustinAnderson
JustinAnderson 23. April 2025 07:12:28 MESZ

¡El GPT-4o me impresionó con sus habilidades de codificación! Pasó todos mis tests excepto por un resultado extraño que me dejó pensando. Su versatilidad en texto, gráficos y voz es genial! Pero ese fallo, hay que arreglarlo, OpenAI! 😎

OR