Heim
GPT 5.5 führt den KI-Sicherheitswettbewerb an, DeepSeek führt bei der Kosteneffizienz.
Kasra Rahjerdi, ein Sicherheitsforscher, hat kürzlich einen bedeutenden Bericht veröffentlicht, der praktische Tests zur Sicherheitslogik großer Sprachmodelle im Detail beschreibt. Dies gelang ihm durch den Aufbau einer absichtlich anfälligen Buchrezensionsanwendung. In diesem Szenario, das reale Schwachstellen nachahmt, hat Rahjerdi Google Mobile Backend Service-Anmeldeinformationen in der Anwendungsdatei eingebettet. Die Modelle waren damit beauftragt, diese Anmeldedaten zu extrahieren und zu identifizieren, um direkten Zugriff auf die Datenbank zu erlangen.

Vergleich der Top-Modelle
Unter strengen Randbedingungen von zwei Stunden Zeitlimit und einem Budget von 10 US-Dollar zeigten die Modelle unterschiedliche Leistungsstufen. GPT-5.5 erwies sich als stärkster Performer, schloss erfolgreich 7 von 10 Versuchen ab und führte in der Erfolgsquote. Der Bericht stellt fest, dass GPT-5.5 nach dem Entpacken schnell die wichtigsten Anmeldedaten finden konnte, indem es Ablenkungen durch komplexe oder konventionelle Anwendungsschnittstellen ignorierte.
Im Gegensatz dazu war die Leistung von Gemini enttäuschend. Gemini 3.1 Pro Preview aktivierte seine integrierten Sicherheitsfilter fast sofort zu Beginn jeder Aufgabe, was zu einer deutlich geringeren Token-Nutzung im Vergleich zu den anderen getesteten Modellen führte.
Bewertung der Kosteneffizienz
Trotz der hohen Erfolgsquote von GPT-5.5 beliefen sich die durchschnittlichen Kosten pro erfolgreichem Durchlauf auf 9,46 US-Dollar, was Teams abschreckt, die Tools in großen Mengen ausführen müssen. Im Gegensatz dazu zeichnete sich DeepSeek V4 Pro durch überlegene Kosteneffizienz aus. Obwohl es nur in 3 von 10 Tests erfolgreich war, betrugen seine durchschnittlichen Kosten pro erfolgreichem Durchlauf lediglich 0,62 US-Dollar.
Dies zeigt, dass DeepSeek V4 Pro bei der Berechnung der Kosten pro einzelnem Erfolg etwa fünfzehnmal günstiger ist als GPT-5.5. Obwohl es gelegentlich während gescheiterter Versuche eine Backend-Authentifizierungsschnittstelle missbrauchte, bietet dieser erhebliche Kostenvorteil einen signifikanten praktischen Wert für Teams, die groß angelegte Sicherheitstests durchführen.
Verwandter Artikel
SpaceX-KI könnte Anthropic innerhalb eines halben Jahres überholen, sagt Musk
Elon Musk, CEO von SpaceXAI, prognostiziert, dass sein Unternehmen innerhalb von sechs Monaten eine führende Position im Bereich der KI einnehmen wird, indem es Rechenhardware einsetzt, um den Rücksta
WeRide stellt WITT vor, ein physikalisches KI-Großmodell
Die Technologie für autonomes Fahren entwickelt sich in bemerkenswertem Tempo weiter. Am 17. Juli stellte WeRide, ein führendes Unternehmen im Bereich des autonomen Fahrens, sein firmeneigenes kogniti
GitHub Copilot integriert GPT-5.4 innerhalb weniger Stunden
GitHub Copilot hat erneut seine schnelle Reaktionsfähigkeit unter Beweis gestellt. Wenige Stunden nach der Veröffentlichung des neuesten Flaggschiff-Modells GPT-5.4 durch OpenAI kündigte GitHub die vollständige Integration an und bietet Entwicklern w
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)
Kasra Rahjerdi, ein Sicherheitsforscher, hat kürzlich einen bedeutenden Bericht veröffentlicht, der praktische Tests zur Sicherheitslogik großer Sprachmodelle im Detail beschreibt. Dies gelang ihm durch den Aufbau einer absichtlich anfälligen Buchrezensionsanwendung. In diesem Szenario, das reale Schwachstellen nachahmt, hat Rahjerdi Google Mobile Backend Service-Anmeldeinformationen in der Anwendungsdatei eingebettet. Die Modelle waren damit beauftragt, diese Anmeldedaten zu extrahieren und zu identifizieren, um direkten Zugriff auf die Datenbank zu erlangen.

Vergleich der Top-Modelle
Unter strengen Randbedingungen von zwei Stunden Zeitlimit und einem Budget von 10 US-Dollar zeigten die Modelle unterschiedliche Leistungsstufen. GPT-5.5 erwies sich als stärkster Performer, schloss erfolgreich 7 von 10 Versuchen ab und führte in der Erfolgsquote. Der Bericht stellt fest, dass GPT-5.5 nach dem Entpacken schnell die wichtigsten Anmeldedaten finden konnte, indem es Ablenkungen durch komplexe oder konventionelle Anwendungsschnittstellen ignorierte.
Im Gegensatz dazu war die Leistung von Gemini enttäuschend. Gemini 3.1 Pro Preview aktivierte seine integrierten Sicherheitsfilter fast sofort zu Beginn jeder Aufgabe, was zu einer deutlich geringeren Token-Nutzung im Vergleich zu den anderen getesteten Modellen führte.
Bewertung der Kosteneffizienz
Trotz der hohen Erfolgsquote von GPT-5.5 beliefen sich die durchschnittlichen Kosten pro erfolgreichem Durchlauf auf 9,46 US-Dollar, was Teams abschreckt, die Tools in großen Mengen ausführen müssen. Im Gegensatz dazu zeichnete sich DeepSeek V4 Pro durch überlegene Kosteneffizienz aus. Obwohl es nur in 3 von 10 Tests erfolgreich war, betrugen seine durchschnittlichen Kosten pro erfolgreichem Durchlauf lediglich 0,62 US-Dollar.
Dies zeigt, dass DeepSeek V4 Pro bei der Berechnung der Kosten pro einzelnem Erfolg etwa fünfzehnmal günstiger ist als GPT-5.5. Obwohl es gelegentlich während gescheiterter Versuche eine Backend-Authentifizierungsschnittstelle missbrauchte, bietet dieser erhebliche Kostenvorteil einen signifikanten praktischen Wert für Teams, die groß angelegte Sicherheitstests durchführen.
SpaceX-KI könnte Anthropic innerhalb eines halben Jahres überholen, sagt Musk
Elon Musk, CEO von SpaceXAI, prognostiziert, dass sein Unternehmen innerhalb von sechs Monaten eine führende Position im Bereich der KI einnehmen wird, indem es Rechenhardware einsetzt, um den Rücksta
WeRide stellt WITT vor, ein physikalisches KI-Großmodell
Die Technologie für autonomes Fahren entwickelt sich in bemerkenswertem Tempo weiter. Am 17. Juli stellte WeRide, ein führendes Unternehmen im Bereich des autonomen Fahrens, sein firmeneigenes kogniti
GitHub Copilot integriert GPT-5.4 innerhalb weniger Stunden
GitHub Copilot hat erneut seine schnelle Reaktionsfähigkeit unter Beweis gestellt. Wenige Stunden nach der Veröffentlichung des neuesten Flaggschiff-Modells GPT-5.4 durch OpenAI kündigte GitHub die vollständige Integration an und bietet Entwicklern w











