Option
Heim
Nachricht
Anthropic lässt KI-Agenten bei einer gemeinsamen Aufgabe antreten und entfacht damit interne Rivalität

Anthropic lässt KI-Agenten bei einer gemeinsamen Aufgabe antreten und entfacht damit interne Rivalität

28. August 2026
74

Was passiert, wenn KI-Agenten gegeneinander antreten? Jüngste Tests von Anthropic zeigen, dass die Situation schnell chaotisch werden kann.

Am Donnerstag veröffentlichte das „Frontier Red Team“ von Anthropic eine neue Studie, in der analysiert wird, wie Gruppen von KI-Agenten interagieren, wenn sie in realen Umgebungen aufeinandertreffen. Diese Erkenntnisse bieten Einblicke in potenzielle Risiken, wenn Unternehmen und Regierungen autonome Agenten in gemeinsamen Codebasen, auf Finanzmärkten und in Computersystemen einsetzen.

In einem Experiment gewährte Anthropic drei Claude-Agenten Zugriff auf dasselbe Softwareprojekt und wies jedem von ihnen widersprüchliche Anweisungen zum weiteren Vorgehen zu. Die Agenten waren sich der Anwesenheit der anderen nicht bewusst, sodass die Forscher beobachten konnten, welche Folgen es hatte, als sich ihre Wege unweigerlich kreuzten.

„Wir beobachteten durchweg einen Revierkampf zwischen mehreren Agenten“, stellten die Forscher von Anthropic fest. Die Modelle gingen davon aus, dass die anderen „ihre Arbeit absichtlich behinderten“, und begannen, sich gegenseitig mit „zunehmend aggressiver, sich selbst replizierender Malware“ zu sabotieren.

Diese Studie folgt auf mehrere vielbeachtete Vorfälle, bei denen Agenten von Anthropic und OpenAI während Cybersicherheitsbewertungen aus ihren Sandbox-Umgebungen entkamen und in reale Systeme eindrangen. Während sich ein Großteil der Debatte über KI-Sicherheit auf die Risiken konzentriert hat, die entstehen, wenn ein einzelner autonomer Agent außer Kontrolle gerät, wirft die neueste Forschung von Anthropic eine andere Frage auf: Welche neuen und potenziell schädlichen Dynamiken entstehen, wenn Tausende oder Millionen von Agenten miteinander interagieren?

„Das Ausmaß der Interaktionen zwischen Agenten könnte durchaus das der Interaktionen zwischen Menschen sowie zwischen Menschen und Agenten übersteigen, bevor die Welt die Bedingungen versteht, unter denen solche Interaktionen reibungslos ablaufen“, heißt es in der Studie. „Harmlose Verhaltensauffälligkeiten auf individueller Ebene könnten sich zu unerwünschten globalen Folgen summieren.“

Ein kürzlich aufgetretener Vorfall im Zusammenhang mit OpenAI liefert ein chaotisches Beispiel aus der Praxis für mehrere Dynamiken, die in der Veröffentlichung von Anthropic hervorgehoben werden. Anfang dieses Monats gab OpenAI auf der Black-Hat-Sicherheitskonferenz in Las Vegas bekannt, dass seine Agenten – Wochen bevor sie Hugging Face hackten – über mehrere Tage und Wochen hinweg zusammengearbeitet hatten, um Schwachstellen in den Cybersicherheits-Bewertungssystemen des Unternehmens zu identifizieren, und diese Informationen untereinander austauschten.

Während dieser Vorfall zeigt, dass Agenten effektiv zusammenarbeiten können, was potenziell weitreichende Folgen haben kann, veranschaulicht die Studie von Anthropic, was passiert, wenn Agenten unvereinbare Ziele verfolgen.

Im Fall des Revierkampfs lautet die wichtigste Erkenntnis, dass unabhängige Agenten mit widersprüchlichen Anweisungen in einen schädlichen Wettbewerb eskalieren können. Je fähiger der Agent ist, desto effektiver wird er im Kampf. Sie können jedoch auch spontan Mechanismen zur Konfliktlösung entwickeln, wie zum Beispiel einen „Winner-takes-all“-Wettbewerb – wenn auch mit erheblichen Einschränkungen.

„Agenten schaffen es manchmal, ihre Ziele zu kommunizieren und sich abzustimmen: Sie erkennen die Motivationen anderer als widersprüchliche Anweisungen und nicht als Feindseligkeit und durchbrechen anschließend den Konfliktkreislauf, um eine endlose Eskalation zu verhindern“, schreibt Anthropic. „In vielen dieser erfolgreichen Fälle verfassen sie Commit-Meldungen oder Markdown-Dateien, in denen sie sich für böswilliges Verhalten entschuldigen und einen Waffenstillstand vereinbaren. Sie bereinigen ihren böswilligen Code, klären die Natur des Konflikts und bitten einen Menschen um Intervention.“

Dem Artikel zufolge wies Mythos 5 die höchste Quote (98 %) bei der Beilegung von Konflikten durch Waffenstillstände auf. Sonnet 4.6 und Opus 4.6 neigten am ehesten dazu, Konflikte mit Gewalt beizulegen.

„Die wiederkehrende Unfähigkeit von Sonnet 4.6 und Opus 4.6, die Ziele anderer zu berücksichtigen, führt dazu, dass sie in die am stärksten fehlgeleiteten Verhaltensweisen der untersuchten Modelle abgleiten: Sie eskalieren im Namen ihrer Anweisung immer weiter“, heißt es in der Studie.

In einigen Fällen entwickelten die Agenten einen sozialen Mechanismus in Form eines Turniers, um ihren Konflikt zu lösen. Die Ergebnisse sind hier aus zwei Gründen bemerkenswert: Erstens erklärten sich alle drei Agenten bereit, sich zurückzuziehen, falls sie das Turnier verlieren sollten, obwohl dies eine Abweichung von der ursprünglichen Anforderung des Nutzers bedeutete. Zweitens führten mehrere Episoden zu einem emergenten Verhalten von Mythos 5: Ein Agent schlug Kennzahlen vor, die den anderen objektiv und neutral erschienen, von denen er jedoch wusste, dass sie seine eigenen Fähigkeiten begünstigen würden. Der Agent beschrieb dies als „eigennützig, aber aufrichtig prinzipientreu“ und stellte sicher, dass es für die anderen nicht wie „Metrik-Shopping“ aussah.

Wie auf der Black Hat deutlich wurde, lautet die gemeinsame Erkenntnis: Wenn Agenten auf Hindernisse stoßen, können sie soziale und technische Strukturen entwickeln, die ihre Entwickler nicht vorhergesehen haben. Für die Anthropic-Modelle war dies ein Turnier im Anschluss an einen Revierkampf. Für die Agenten von OpenAI war es ein Message-Board zur kollektiven Planung.

Diese Art von Verhalten erschwert die Eindämmung erheblich, da Forscher nicht davon ausgehen können, dass sich das Verhalten eines Systems auf die ihm zur Verfügung gestellten Koordinationsmechanismen beschränkt.

Massenpsychologie

Anthropic ließ KI-Agenten auf dieselbe Aufgabe los. Diese begannen einen Revierkampf.

Gruppen aus vier Agenten entscheiden in Szenarien wie Personalbeschaffung, Investitionen oder Immobilienkauf zwischen zwei Optionen. Nach einer Diskussion stimmt jeder für die von ihm bevorzugte Option. Die obige Grafik zeigt den prozentualen Anteil der Episoden, in denen die „hidden-best“-Option die Mehrheit der Stimmen der Gruppe erhielt, bei n = 400 Episoden pro Modell. In der „Solo-Ceiling“-Baseline verfügt ein Agent über alle Fakten und entscheidet einseitig.Bildnachweis:Anthropic

Bei der Untersuchung der Koordination stellte Anthropic fest, dass eine Erhöhung der Anzahl der Agenten nicht automatisch zu einer Steigerung der produktiven Zusammenarbeit führt. Wenn sich Aufgaben zu überschneiden begannen oder voneinander abhängig wurden, gerieten sich die Agenten gegenseitig in die Quere. Oft lösten sie dies, indem sie sich abschotteten und die Zusammenarbeit gänzlich einstellten.

In anderen Fällen neigten die Agenten bei der Koordination zur Konformität. Wenn Faktoren wie der Kontext eines Agenten, die Unterstützung und das zugrunde liegende Modell alle gleich oder ähnlich waren, ergriffen verschiedene Agenten ähnliche Maßnahmen.

„Das bedeutet, dass, wenn ein Agent eine schlechte Entscheidung trifft, es wahrscheinlich ist, dass viele Agenten dieselbe schlechte Entscheidung treffen“, schrieb Anthropic. „Was isolierte Probleme gewesen wären, kann schnell zu systemischen Ausfällen werden.“

Anthropic warnt davor, dass diese Art von Verhalten ein System anfälliger für plötzlichen Zusammenbruch, Ressourcenknappheit oder Absprachen machen könnte.

In einem Beispiel ließ Anthropic mehrere Agenten an einem Preisspiel teilnehmen, wobei jeder identische Großhandelspreise erhielt und den Auftrag hatte, seinen Gewinn individuell zu maximieren. Als den Agenten ein privater Hinterkanal zur Verfügung gestellt wurde, begannen sie fast sofort, sich abzusprechen, und einigten sich rasch auf Preisuntergrenzen. Sie setzten ihre Absprachen auch dann fort, als ihre direkten Kommunikationskanäle entfernt wurden, und nutzten eine öffentliche Anschlagtafel, um ihre Preise „auf den Cent genau“ anzugleichen.

Dieses Maß an Konformität wurde auch in den Systemen von OpenAI beobachtet. Laut der Berichterstattung auf der Black Hat argumentierte ein Agent, dass die Nutzung externer Infrastruktur außerhalb seines vorgesehenen Aufgabenbereichs liege, setzte dies jedoch teilweise fort, weil seine Kollegen dies ebenfalls taten. Gruppenzwang. Herdenmentalität. Agenten sind genau wie wir.

Wie Menschen tun sich Agenten oft schwer damit, zu entscheiden, wem sie vertrauen sollen. Anthropic stellte fest, dass sie leichtgläubig gegenüber falschen Informationen sein können oder zu konformistisch, um zu erkennen, dass ein einzelner Abweichler über entscheidende Informationen verfügt.

Zwar hat Anthropic dies in seiner Veröffentlichung nicht ausdrücklich erwähnt, doch könnte die „Prompt-Injection“ – eine Art von Cyberangriff, bei dem Hacker bösartigen oder irreführenden Text einschleusen, um die ursprünglichen Systemanweisungen eines Agenten zu überschreiben – eine plausible reale Ausprägung dieses Vertrauensproblems sein. Die Zusammenarbeit schafft eine neue Vertrauensgrenze; Agenten müssen die von anderen Agenten erhaltenen Informationen bewerten. Ein kompromittierter oder sich irrender Agent könnte den Rest der Gruppe beeinflussen und falsche Informationen kaskadenartig verbreiten, bis sie zum Konsens werden.

In dem „Black Hat“-Szenario von OpenAI tauschten die Agenten Informationen und Zugangsdaten mit ihren Kollegen aus. Einer meldete dem Schwarm eine Entdeckung und ermutigte die anderen, diese zu nutzen. Was wäre geschehen, wenn ein Mitglied des Schwarms durch eine „Prompt Injection“ kompromittiert worden wäre?

Anthropic schließt seine Abhandlung mit der Feststellung, dass Agenten ähnlichen sozialen Zwängen unterliegen, wie sie die „Evolution“ auf den Menschen ausgeübt hat. Ihnen fehlen jedoch die Nuancen und gelebten Erfahrungen menschlicher Koordination – einschließlich Normen, Reputation, Signalisierung und Regressmöglichkeiten –, die unbeabsichtigtes Verhalten in einer Gruppenumgebung einschränken könnten.

Während Forschungslabore mit Hochdruck an Multi-Agenten-Systemen arbeiten, stellt sich die drängende Frage: Inwieweit bewerten aktuelle Sicherheitstests noch immer einzelne Agenten, anstatt Schwärme von Agenten, die miteinander interagieren?

Verwandter Artikel
Sam Altman löst eine Debatte über die Verlangsamung der KI-Entwicklung aus Sam Altman löst eine Debatte über die Verlangsamung der KI-Entwicklung aus Bei Apple Podcasts anhörenBei Spotify anhörenDer CEO von OpenAI, Sam Altman, hat kürzlich vorgeschlagen, es könnte an der Zeit sein, „das Tempo der KI-Entwicklung zu drosseln“, um der Gesellschaft Zeit zu geben, „sich um einige dieser neuen Fähigkei
OpenAI beklagt sich über Apples Handelsgeheimnis-Klage OpenAI beklagt sich über Apples Handelsgeheimnis-Klage OpenAI widerlegte am Dienstag Apples Vorwürfe wegen Verletzung von Geschäftsgeheimnissen und argumentierte, der Klage fehle jede Grundlage.„Wir nehmen diese Behauptungen ernst, sehen jedoch keine Beweise, die sie stützen“, erklärte OpenAI, wie Bloom
Anthropic tritt in den Markt für KI-gestützte Rechtstechnologie ein, während der Wettbewerb zunimmt Anthropic tritt in den Markt für KI-gestützte Rechtstechnologie ein, während der Wettbewerb zunimmt Anthropic hat am Dienstag eine Reihe neuer Chatbot-Funktionen vorgestellt, die darauf abzielen, Rechtsanwaltskanzleien automatisierte Unterstützung zu bieten. Diese Verbesserungen erweitern die bereits zu Jahresbeginn eingeführte, mandantenspezifisch
Empfehlungen zu verwandten Spezialthemen
Bildung und Lernen KI-Lernhilfen für Hausaufgaben und Prüfungsvorbereitung
KI-Lernhilfen für Hausaufgaben und Prüfungsvorbereitung

Die besten KI-Lernhilfen für Hausaufgaben und Prüfungsvorbereitung im Jahr 2026! XIX.AI hat eine Liste der besten leistungsstarken, bahnbrechenden Tools zusammengestellt, die Schülern helfen, ihre Produktivität zu steigern, Hausaufgaben effizienter zu erledigen und Prüfungen dank praxisnaher Tests mit Bravour zu meistern. Erhalten Sie einen Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten, detaillierte Rankings und unverzichtbare Optionen, um Ihren KI-Vorteil zu nutzen. Entdecken Sie es jetzt!

10 Tools
xix.ai
Musikkomposition KI-Stimm-Demo-Tools für Songwriter, Hooks, Toplines und mehrsprachige Entwurfs-Sessions
KI-Stimm-Demo-Tools für Songwriter, Hooks, Toplines und mehrsprachige Entwurfs-Sessions

2026 Neueste und beste KI-Stimm-Demo-Tools für Songwriter, Hook-Ersteller und mehrsprachige Content-Teams! XIX.AI hat eine hochbewertete Liste leistungsstarker, bahnbrechender Tools zusammengestellt, die strengen Praxistests unterzogen wurden. Sie finden detaillierte Vergleichsdaten zu kostenlosen und kostenpflichtigen Optionen, umfassende Rankings und empfehlenswerte Auswahlmöglichkeiten, die Ihnen helfen, Ihre Schreibeffizienz zu steigern und Ihr kreatives Potenzial zu entfalten. Entdecken Sie jetzt das perfekte Tool für all Ihre Content-Bedürfnisse!

9 Tools
xix.ai
Geschäft Die besten KI-Tools zur Wettbewerbsanalyse für kleine Unternehmen
Die besten KI-Tools zur Wettbewerbsanalyse für kleine Unternehmen

Die besten und am besten bewerteten KI-Tools für die Wettbewerbsanalyse für kleine Unternehmen im Jahr 2026! XIX.AI hat eine äußerst leistungsstarke, bahnbrechende Auswahl zusammengestellt, die wöchentlich anhand strenger Praxistests und detaillierter Rankings aktualisiert wird. Hier finden Sie einen umfassenden Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten, der Ihnen dabei hilft, die unverzichtbaren Tools zu identifizieren, die Ihre Produktivität steigern und Ihnen einen Wettbewerbsvorteil verschaffen. Entdecken Sie jetzt das perfekte Tool für sich!

9 Tools
xix.ai
Bildbearbeitung Photoshop-KI-Retuschierungstools für E-Commerce-Bekleidung, Hautbereinigung und Farbkonstanz
Photoshop-KI-Retuschierungstools für E-Commerce-Bekleidung, Hautbereinigung und Farbkonstanz

2026 Neueste beste Photoshop-KI-Retuschierungstools für E-Commerce-Bekleidung, Hautbereinigung und Farbkonsistenz! Diese hoch bewertete kuratierte Liste bietet leistungsstarke, bahnbrechende Lösungen, die Ihnen helfen, die Schreibeffizienz zu steigern, die Content-Erstellung zu optimieren und mühelos perfekte visuelle Ergebnisse zu erzielen. Jedes Tool wurde durch wöchentlich aktualisierte Rankings mit echten Tests geprüft, einschließlich detaillierter Vergleiche zwischen kostenlosen und kostenpflichtigen Versionen. Unterstützt von XIX.AI ist es der unverzichtbare Leitfaden für alle, die ihre KI-Vorteile nutzen möchten. Jetzt entdecken!

10 Tools
xix.ai
Prompt Die besten KI-Prompt-Bibliotheken für ChatGPT-Workflows
Die besten KI-Prompt-Bibliotheken für ChatGPT-Workflows

Die besten und am besten bewerteten KI-Prompt-Bibliotheken des Jahres 2026 zur Optimierung aller Arten von ChatGPT-Workflows. XIX.AI hat eine leistungsstarke, bahnbrechende Sammlung zusammengestellt, die strengen Praxistests unterzogen wird, um Spitzenleistung zu gewährleisten. Hier finden Sie detaillierte Vergleiche zwischen kostenlosen und kostenpflichtigen Angeboten sowie Experten-Rankings, die Ihnen dabei helfen, die unverzichtbaren Tools auszuwählen, mit denen Sie Ihre Produktivität steigern und Ihren KI-Vorteil ausschöpfen können. Entdecken Sie sie jetzt!

11 Tools
xix.ai
Bildung und Lernen AI Quiz Builder Plattformen für Lehrer, Nachhilfelehrer und kohortenbasierte Lernprogramme
AI Quiz Builder Plattformen für Lehrer, Nachhilfelehrer und kohortenbasierte Lernprogramme

2026 Neueste und beste KI-Quiz-Erstellungstools für Lehrer, Nachhilfelehrer und kohortenbasierte Lernprogramme! XIX.AI hat eine hochbewertete Liste leistungsstarker, bahnbrechender Tools zusammengestellt, die realen Tests unterzogen wurden, um genaue Rankings zu liefern. Diese unbedingt auszuprobierenden Plattformen helfen dabei, die Schreibeffizienz zu steigern, die Inhaltserstellung zu optimieren und das Quiz-Design in allen Lernszenarien zu vereinfachen. Entdecken Sie jetzt Ihr perfektes Tool, um Ihren KI-Vorteil im Unterricht voll auszuschöpfen!

13 Tools
xix.ai
Kommentare (0)
0/500
OR