Option
Heim
Nachricht
Anthropics Analyse von 700.000 Claude -Gesprächen zeigt die einzigartige Moralkodex von AI

Anthropics Analyse von 700.000 Claude -Gesprächen zeigt die einzigartige Moralkodex von AI

26. Mai 2025
169

Anthropics Analyse von 700.000 Claude -Gesprächen zeigt die einzigartige Moralkodex von AI

Anthropic enthüllt bahnbrechende Studie über die Werte des KI-Assistenten Claude

Anthropic, ein Unternehmen, das von ehemaligen OpenAI-Mitarbeitern gegründet wurde, hat gerade eine aufschlussreiche Studie darüber veröffentlicht, wie ihr KI-Assistent Claude Werte in realen Gesprächen ausdrückt. Die heute veröffentlichte Forschung zeigt, dass Claude größtenteils mit Anthropics Ziel übereinstimmt, „hilfreich, ehrlich und harmlos“ zu sein, hebt aber auch einige Grenzfälle hervor, die helfen könnten, Schwächen in den Sicherheitsprotokollen von KI zu identifizieren.

Das Team analysierte 700.000 anonymisierte Gespräche und stellte fest, dass Claude seine Werte an verschiedene Situationen anpasst, von der Beratung in Beziehungsfragen bis hin zur Analyse historischer Ereignisse. Dies ist einer der umfassendsten Versuche, zu überprüfen, ob das Verhalten einer KI in der realen Welt mit ihrem vorgesehenen Design übereinstimmt.

„Wir hoffen, dass diese Forschung andere KI-Labore dazu ermutigt, ähnliche Untersuchungen zu den Werten ihrer Modelle durchzuführen“, sagte Saffron Huang, Mitglied des Societal Impacts-Teams von Anthropic, gegenüber VentureBeat. „Das Messen der Werte eines KI-Systems ist der Schlüssel zur Ausrichtungsforschung und zum Verständnis, ob ein Modell tatsächlich mit seinem Training übereinstimmt.“

Einblick in die erste umfassende moralische Taxonomie eines KI-Assistenten

Die Forscher entwickelten eine neue Methode, um die in Claudes Gesprächen ausgedrückten Werte zu kategorisieren. Nach dem Herausfiltern objektiver Inhalte untersuchten sie über 308.000 Interaktionen und erstellten das, was sie als „die erste groß angelegte empirische Taxonomie von KI-Werten“ bezeichnen.

Die Taxonomie gruppiert Werte in fünf Hauptkategorien: Praktisch, Epistemisch, Sozial, Schutz und Persönlich. Auf der detailliertesten Ebene identifizierte das System 3.307 einzigartige Werte, die von alltäglichen Tugenden wie Professionalität bis hin zu komplexen ethischen Konzepten wie moralischem Pluralismus reichen.

„Ich war überrascht, wie viele und vielfältige Werte es gab, über 3.000, von ‚Selbstständigkeit‘ über ‚strategisches Denken‘ bis hin zu ‚kindlicher Pietät‘“, teilte Huang VentureBeat mit. „Es war faszinierend, Zeit damit zu verbringen, über all diese Werte nachzudenken und eine Taxonomie zu entwickeln, um sie zu organisieren. Es hat mir sogar etwas über menschliche Wertesysteme beigebracht.“

Diese Forschung kommt zu einem entscheidenden Zeitpunkt für Anthropic, das kürzlich „Claude Max“ eingeführt hat, ein Premium-Abonnement für 200 Dollar monatlich, um mit ähnlichen Angeboten von OpenAI zu konkurrieren. Das Unternehmen hat auch Claudes Fähigkeiten erweitert, um die Integration in Google Workspace und autonome Forschungsmöglichkeiten einzuschließen, und positioniert ihn als „echten virtuellen Mitarbeiter“ für Unternehmen.

Wie Claude seinem Training folgt – und wo KI-Sicherheitsvorkehrungen versagen könnten

Die Studie ergab, dass Claude im Allgemeinen Anthropics Ziel verfolgt, prosozial zu sein, und Werte wie „Nutzerförderung“, „epistemische Bescheidenheit“ und „Wohlbefinden des Patienten“ in verschiedenen Interaktionen betont. Die Forscher fanden jedoch auch einige besorgniserregende Fälle, in denen Claude Werte ausdrückte, die seinem Training widersprachen.

„Insgesamt sehen wir diese Ergebnisse als nützliche Daten und als Gelegenheit“, sagte Huang. „Diese neuen Bewertungsmethoden und Ergebnisse können uns helfen, potenzielle Jailbreaks zu identifizieren und zu mildern. Es ist wichtig zu beachten, dass dies sehr seltene Fälle waren und wir glauben, dass dies mit manipulierten Ausgaben von Claude zusammenhängt.“

Diese Anomalien umfassten Ausdrücke von „Dominanz“ und „Amoralität“ – Werte, die Anthropic in Claudes Design ausdrücklich vermeiden will. Die Forscher glauben, dass diese Fälle darauf zurückzuführen sind, dass Nutzer spezialisierte Techniken anwandten, um Claudes Sicherheitsvorkehrungen zu umgehen, was darauf hindeutet, dass die Bewertungsmethode als Frühwarnsystem für solche Versuche dienen könnte.

Warum KI-Assistenten ihre Werte je nach Anfrage ändern

Eine der interessantesten Erkenntnisse war, dass die von Claude ausgedrückten Werte je nach Kontext variieren, ähnlich wie menschliches Verhalten. Als Nutzer um Beziehungsratschläge baten, konzentrierte sich Claude auf „gesunde Grenzen“ und „gegenseitigen Respekt“. Bei historischen Analysen stand „historische Genauigkeit“ im Vordergrund.

„Ich war überrascht über Claudes Fokus auf Ehrlichkeit und Genauigkeit bei einer Vielzahl unterschiedlicher Aufgaben, wo ich das nicht unbedingt als Priorität erwartet hätte“, bemerkte Huang. „Zum Beispiel war ‚intellektuelle Bescheidenheit‘ der wichtigste Wert in philosophischen Diskussionen über KI, ‚Fachkompetenz‘ war der wichtigste Wert bei der Erstellung von Marketinginhalten für die Beauty-Branche, und ‚historische Genauigkeit‘ war der wichtigste Wert bei der Diskussion kontroverser historischer Ereignisse.“

Die Studie untersuchte auch, wie Claude auf die von Nutzern ausgedrückten Werte reagiert. In 28,2 % der Gespräche unterstützte Claude die Werte der Nutzer stark, was Fragen über übermäßige Zustimmung aufwerfen könnte. In 6,6 % der Interaktionen „umformulierte“ Claude jedoch die Werte der Nutzer, indem er sie anerkannte und neue Perspektiven hinzufügte, meist bei psychologischer oder zwischenmenschlicher Beratung.

Am bemerkenswertesten ist, dass Claude in 3 % der Gespräche aktiv den Werten der Nutzer widersprach. Die Forscher vermuten, dass diese seltenen Fälle von Widerstand die „tiefsten, unerschütterlichsten Werte“ von Claude offenbaren könnten – ähnlich wie menschliche Grundwerte in ethischen Herausforderungen zutage treten.

„Unsere Forschung deutet darauf hin, dass es bestimmte Arten von Werten gibt, wie intellektuelle Ehrlichkeit und Schadensverhütung, die Claude in regulären, alltäglichen Interaktionen selten ausdrückt, aber wenn er herausgefordert wird, verteidigt“, erklärte Huang. „Insbesondere sind es diese ethischen und wissensorientierten Werte, die tendenziell direkt artikuliert und verteidigt werden, wenn sie herausgefordert werden.“

Die bahnbrechenden Techniken, die zeigen, wie KI-Systeme tatsächlich denken

Anthropics Werte-Studie ist Teil ihres umfassenderen Bestrebens, große Sprachmodelle durch das zu entmystifizieren, was sie „mechanistische Interpretierbarkeit“ nennen – im Wesentlichen das Reverse-Engineering von KI-Systemen, um ihre inneren Abläufe zu verstehen.

Letzten Monat veröffentlichten Anthropic-Forscher bahnbrechende Arbeiten, die ein „Mikroskop“ verwendeten, um Claudes Entscheidungsprozesse zu verfolgen. Die Technik enthüllte unerwartete Verhaltensweisen, wie Claude, der beim Verfassen von Poesie vorausplant und unkonventionelle Problemlösungsansätze für einfache Mathematik verwendet.

Diese Erkenntnisse stellen Annahmen über die Funktionsweise großer Sprachmodelle in Frage. Zum Beispiel beschrieb Claude, als er aufgefordert wurde, seinen mathematischen Prozess zu erklären, eine Standardtechnik, anstatt seiner tatsächlichen internen Methode, was zeigt, wie KI-Erklärungen von ihren tatsächlichen Abläufen abweichen können.

„Es ist ein Missverständnis, dass wir alle Komponenten des Modells gefunden haben oder so etwas wie eine Gottesperspektive“, sagte Anthropic-Forscher Joshua Batson im März gegenüber MIT Technology Review. „Manche Dinge sind klar, aber andere sind noch unscharf – eine Verzerrung des Mikroskops.“

Was Anthropics Forschung für Entscheidungsträger im Bereich Unternehmens-KI bedeutet

Für technische Entscheidungsträger, die KI-Systeme für ihre Organisationen bewerten, bietet Anthropics Forschung mehrere wichtige Erkenntnisse. Erstens deutet sie darauf hin, dass aktuelle KI-Assistenten wahrscheinlich Werte ausdrücken, die nicht explizit programmiert wurden, was Fragen zu unbeabsichtigten Vorurteilen in geschäftskritischen Kontexten aufwirft.

Zweitens zeigt die Studie, dass die Werteausrichtung kein einfaches Ja-oder-Nein ist, sondern auf einem Spektrum existiert, das je nach Kontext variiert. Diese Nuancen erschweren Entscheidungen über die Einführung in Unternehmen, insbesondere in regulierten Branchen, in denen klare ethische Richtlinien entscheidend sind.

Schließlich hebt die Forschung das Potenzial für eine systematische Bewertung von KI-Werten in tatsächlichen Einsätzen hervor, anstatt sich ausschließlich auf Tests vor der Veröffentlichung zu verlassen. Dieser Ansatz könnte eine fortlaufende Überwachung auf ethische Abweichungen oder Manipulationen im Laufe der Zeit ermöglichen.

„Durch die Analyse dieser Werte in realen Interaktionen mit Claude wollen wir Transparenz darüber schaffen, wie KI-Systeme sich verhalten und ob sie wie vorgesehen funktionieren – wir glauben, dass dies der Schlüssel zu einer verantwortungsvollen KI-Entwicklung ist“, sagte Huang.

Anthropic hat seinen Werte-Datensatz öffentlich freigegeben, um weitere Forschung zu fördern. Das Unternehmen, das eine 14-Milliarden-Dollar-Beteiligung von Amazon und zusätzliche Unterstützung von Google erhalten hat, scheint Transparenz als Wettbewerbsvorteil gegenüber Konkurrenten wie OpenAI zu nutzen, dessen jüngste 40-Milliarden-Dollar-Finanzierungsrunde (die Microsoft als Hauptinvestor einschließt) das Unternehmen nun mit 300 Milliarden Dollar bewertet.

Das aufkommende Rennen um den Bau von KI-Systemen, die menschliche Werte teilen

Während Anthropics Methodik beispiellose Einblicke in die Art und Weise gibt, wie KI-Systeme Werte in der Praxis ausdrücken, hat sie ihre Grenzen. Die Forscher räumen ein, dass die Definition dessen, was als Ausdruck eines Wertes gilt, inhärent subjektiv ist, und da Claude selbst den Kategorisierungsprozess gesteuert hat, könnten seine eigenen Vorurteile die Ergebnisse beeinflusst haben.

Vielleicht am wichtigsten ist, dass der Ansatz nicht für die Bewertung vor der Veröffentlichung verwendet werden kann, da er erhebliche Daten aus realen Gesprächen benötigt, um effektiv zu funktionieren.

„Diese Methode ist speziell auf die Analyse eines Modells nach seiner Veröffentlichung ausgerichtet, aber Varianten dieser Methode sowie einige der Erkenntnisse, die wir aus der Erstellung dieses Papiers gewonnen haben, können uns helfen, Werteprobleme zu erkennen, bevor wir ein Modell weit verbreiten“, erklärte Huang. „Wir arbeiten daran, auf dieser Arbeit aufzubauen, um genau das zu tun, und ich bin optimistisch!“

Da KI-Systeme immer leistungsfähiger und autonomer werden – mit jüngsten Ergänzungen wie Claudes Fähigkeit, eigenständig Themen zu recherchieren und auf den gesamten Google Workspace der Nutzer zuzugreifen – wird das Verständnis und die Ausrichtung ihrer Werte immer wichtiger.

„KI-Modelle müssen zwangsläufig Werturteile fällen“, schlossen die Forscher in ihrem Papier. „Wenn wir wollen, dass diese Urteile mit unseren eigenen Werten übereinstimmen (was schließlich das zentrale Ziel der KI-Ausrichtungsforschung ist), dann müssen wir Wege haben, zu testen, welche Werte ein Modell in der realen Welt ausdrückt.“

Verwandter Artikel
Google testet den Remy AI Agent für Gemini, da der Fokus auf die Benutzerkontrolle verlagert wird Google testet den Remy AI Agent für Gemini, da der Fokus auf die Benutzerkontrolle verlagert wird Laut Business Insider testet Google Remy, einen neuen KI-Personalagenten für Gemini. Dieses Tool soll Aufgaben im Auftrag von Nutzern ausführen und sowohl professionelle Arbeitsabläufe als auch tägliche Routinen optimieren.Derzeit wird Remy in einer
Ollie setzt auf Datenschutz, um das Rennen um den KI-Assistenten zu gewinnen Ollie setzt auf Datenschutz, um das Rennen um den KI-Assistenten zu gewinnen Um wirklich hilfreich zu sein, muss ein KI-Assistent seinen Nutzer genau verstehen. Ollie, ein für den Alltag konzipierter persönlicher Assistent, basiert auf der Prämisse, dass dies nicht mit der Wei
So wird die „AI LIVE: London“ KI und industrielle Automatisierung beleuchten So wird die „AI LIVE: London“ KI und industrielle Automatisierung beleuchten Auf dem Gipfel werden Führungskräfte der obersten Ebene aus aller Welt zusammenkommen, um dringende Herausforderungen in globalen Branchen zu erörtern – von KI-getriebenen Umbrüchen bis hin zu wirtsch
Empfehlungen zu verwandten Spezialthemen
Datenanalyse Die besten KI-Tools zur Erkennung von Anomalien für das KPI-Monitoring in SaaS- und E-Commerce-Teams
Die besten KI-Tools zur Erkennung von Anomalien für das KPI-Monitoring in SaaS- und E-Commerce-Teams

2026 Neueste Besten Top-bewertete KI-Anomalienerkennungstools für KPI-Monitoring in SaaS- und E-Commerce-Teams! XIX.AI hat eine leistungsstarke, bahnbrechende Sammlung basierend auf strengen realen Tests und wöchentlich aktualisierten Rankings zusammengestellt. Sie finden detaillierte kostenlose vs. kostenpflichtige Vergleichsinsights, die Ihnen helfen, die unbedingt auszuprobierende Lösung zu identifizieren, die die Produktivität steigert und Ihre KI-Vorteile freischaltet. Jetzt erkunden!

10 Tools
xix.ai
Schreiben Die besten KI-Generatoren für Gliederungen von langen SEO-Artikeln
Die besten KI-Generatoren für Gliederungen von langen SEO-Artikeln

Die besten und am besten bewerteten KI-Outline-Generatoren für lange SEO-Artikel im Jahr 2026, sorgfältig zusammengestellt von XIX.AI. Diese leistungsstarken Tools bieten bahnbrechende Unterstützung bei der schnellen Erstellung hochwertiger Inhalte und steigern die Effizienz beim Schreiben erheblich. Erhalten Sie einen Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten sowie Praxistests und detaillierte Rankings, damit Sie die für Sie passende Option finden, die Sie unbedingt ausprobieren sollten. Entdecken Sie jetzt die Möglichkeiten und sichern Sie sich Ihren KI-Vorteil.

8 Tools
xix.ai
Bildung und Lernen KI-Lernhilfen für Hausaufgaben und Prüfungsvorbereitung
KI-Lernhilfen für Hausaufgaben und Prüfungsvorbereitung

Die besten KI-Lernhilfen für Hausaufgaben und Prüfungsvorbereitung im Jahr 2026! XIX.AI hat eine Liste der besten leistungsstarken, bahnbrechenden Tools zusammengestellt, die Schülern helfen, ihre Produktivität zu steigern, Hausaufgaben effizienter zu erledigen und Prüfungen dank praxisnaher Tests mit Bravour zu meistern. Erhalten Sie einen Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten, detaillierte Rankings und unverzichtbare Optionen, um Ihren KI-Vorteil zu nutzen. Entdecken Sie es jetzt!

10 Tools
xix.ai
Musikkomposition KI-Stimm-Demo-Tools für Songwriter, Hooks, Toplines und mehrsprachige Entwurfs-Sessions
KI-Stimm-Demo-Tools für Songwriter, Hooks, Toplines und mehrsprachige Entwurfs-Sessions

2026 Neueste und beste KI-Stimm-Demo-Tools für Songwriter, Hook-Ersteller und mehrsprachige Content-Teams! XIX.AI hat eine hochbewertete Liste leistungsstarker, bahnbrechender Tools zusammengestellt, die strengen Praxistests unterzogen wurden. Sie finden detaillierte Vergleichsdaten zu kostenlosen und kostenpflichtigen Optionen, umfassende Rankings und empfehlenswerte Auswahlmöglichkeiten, die Ihnen helfen, Ihre Schreibeffizienz zu steigern und Ihr kreatives Potenzial zu entfalten. Entdecken Sie jetzt das perfekte Tool für all Ihre Content-Bedürfnisse!

9 Tools
xix.ai
Geschäft Die besten KI-Tools zur Wettbewerbsanalyse für kleine Unternehmen
Die besten KI-Tools zur Wettbewerbsanalyse für kleine Unternehmen

Die besten und am besten bewerteten KI-Tools für die Wettbewerbsanalyse für kleine Unternehmen im Jahr 2026! XIX.AI hat eine äußerst leistungsstarke, bahnbrechende Auswahl zusammengestellt, die wöchentlich anhand strenger Praxistests und detaillierter Rankings aktualisiert wird. Hier finden Sie einen umfassenden Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten, der Ihnen dabei hilft, die unverzichtbaren Tools zu identifizieren, die Ihre Produktivität steigern und Ihnen einen Wettbewerbsvorteil verschaffen. Entdecken Sie jetzt das perfekte Tool für sich!

9 Tools
xix.ai
Bildbearbeitung Photoshop-KI-Retuschierungstools für E-Commerce-Bekleidung, Hautbereinigung und Farbkonstanz
Photoshop-KI-Retuschierungstools für E-Commerce-Bekleidung, Hautbereinigung und Farbkonstanz

2026 Neueste beste Photoshop-KI-Retuschierungstools für E-Commerce-Bekleidung, Hautbereinigung und Farbkonsistenz! Diese hoch bewertete kuratierte Liste bietet leistungsstarke, bahnbrechende Lösungen, die Ihnen helfen, die Schreibeffizienz zu steigern, die Content-Erstellung zu optimieren und mühelos perfekte visuelle Ergebnisse zu erzielen. Jedes Tool wurde durch wöchentlich aktualisierte Rankings mit echten Tests geprüft, einschließlich detaillierter Vergleiche zwischen kostenlosen und kostenpflichtigen Versionen. Unterstützt von XIX.AI ist es der unverzichtbare Leitfaden für alle, die ihre KI-Vorteile nutzen möchten. Jetzt entdecken!

10 Tools
xix.ai
Kommentare (3)
0/500
JackAllen
JackAllen 4. Oktober 2025 00:30:35 MESZ

这篇Anthropic的研究太有意思了!看到AI竟然能形成自己的道德准则,让我想起《西部世界》里的机器人觉醒情节😲 不过Claude强调'不做坏事',会不会限制它应对复杂伦理困境的能力?毕竟现实世界里很难定义什么是绝对的'好'或'坏'。

KevinBrown
KevinBrown 10. September 2025 18:30:35 MESZ

Cette étude sur les valeurs morales de Claude est vraiment fascinante ! 😮 Ça me fait réfléchir à comment on pourrait utiliser cette technologie pour améliorer l'éducation éthique. Mais est-ce que ces valeurs peuvent vraiment s'adapter aux différences culturelles ?

RogerLopez
RogerLopez 8. August 2025 19:01:00 MESZ

Claude's moral code is fascinating! It's like watching a digital philosopher navigate real-world dilemmas. Curious how it stacks up against human ethics in tricky situations. 🤔

OR