Heim
Die große Herausforderung für die KI-Medizin: Generativen Modellen fehlt es noch an eigenständigem klinischem Urteilsvermögen

Eine aktuelle Studie des MESH-Incubator-Teams am Massachusetts General Hospital untersuchte die Fähigkeiten generativer KI im Bereich des klinischen Denkens. Während KI zunehmend Einzug in die Medizin hält, deckt die Untersuchung anhaltende Lücken in der logischen Kette der simulierten klinischen Diagnose in der Praxis auf. Die in der renommierten Fachzeitschrift „JAMA Network Open“ veröffentlichten Ergebnisse zeigen deutlich, dass die derzeitigen Mainstream-Modelle noch nicht in der Lage sind, eigenständige klinische Diagnoseaufgaben zu übernehmen.
Die Studie testete 21 große Sprachmodelle, darunter ChatGPT, DeepSeek, Claude, Gemini und Grok, anhand von 29 etablierten klinischen Fällen. Das Experiment ahmte den dynamischen Diagnoseprozess eines Arztes nach, indem es schrittweise Patientensymptome, Labordaten und Bildgebungsergebnisse offenlegte. Die Daten zeigten, dass alle Modelle bei vollständiger Information eine Genauigkeit von über 90 % bei der Erstellung der richtigen Enddiagnose erreichten. Im Kernbereich des klinischen Denkens – der Differentialdiagnose – schnitten jedoch über 80 % der Modelle schlecht ab und versagten bei der systematischen Analyse und Priorisierung mehrerer potenzieller Erkrankungen.
Um diese Lücke zu quantifizieren, führten die Forscher den umfassenden Bewertungsindex PrIME-LLM ein, der den gesamten Prozess von der Erstbeurteilung über die Testauswahl bis hin zur Behandlungsplanung abdeckt. Die Bewertungsergebnisse lagen bei den Modellen zwischen 64 % und 78 %, was verdeutlicht, dass KI besser darin ist, bei vollständigen Informationen „Antworten zu liefern“, als bei unvollständigen Daten offenes logisches Denken zu betreiben.
Zwar zeigen neuere Modelle im Vergleich zu ihren Vorgängern deutliche Verbesserungen im Umgang mit komplexen Daten, doch betonte das Team, dass große Sprachmodelle derzeit als Hilfswerkzeuge betrachtet werden sollten. Ihr Einsatz in der klinischen Praxis ohne fachliche Aufsicht birgt nach wie vor Risiken. Diese Studie liefert einen rationalen Maßstab für die Zukunft der KI im Gesundheitswesen: Der Übergang vom einfachen „Antwortabgleich“ zum komplexen „logischen Schlussfolgern“ wird die entscheidende Schwelle sein, damit medizinische Großmodelle eine Anwendung auf professionellem Niveau erreichen.
Verwandter Artikel
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13
Google testet den Remy AI Agent für Gemini, da der Fokus auf die Benutzerkontrolle verlagert wird
Laut Business Insider testet Google Remy, einen neuen KI-Personalagenten für Gemini. Dieses Tool soll Aufgaben im Auftrag von Nutzern ausführen und sowohl professionelle Arbeitsabläufe als auch tägliche Routinen optimieren.Derzeit wird Remy in einer
So beheben Sie Core Web Vitals für bessere SEO-Rankings
Berichtskartenkommentare mit KI-Tools optimierenEinführungKI-Tools zur Generierung von BerichtskartenkommentarenMagic SchoolAlmanac AIChat GPTNutzung von Magic School zur Generierung von BerichtskartenkommentarenAnmeldung bei Magic SchoolAuswahl des
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)

Eine aktuelle Studie des MESH-Incubator-Teams am Massachusetts General Hospital untersuchte die Fähigkeiten generativer KI im Bereich des klinischen Denkens. Während KI zunehmend Einzug in die Medizin hält, deckt die Untersuchung anhaltende Lücken in der logischen Kette der simulierten klinischen Diagnose in der Praxis auf. Die in der renommierten Fachzeitschrift „JAMA Network Open“ veröffentlichten Ergebnisse zeigen deutlich, dass die derzeitigen Mainstream-Modelle noch nicht in der Lage sind, eigenständige klinische Diagnoseaufgaben zu übernehmen.
Die Studie testete 21 große Sprachmodelle, darunter ChatGPT, DeepSeek, Claude, Gemini und Grok, anhand von 29 etablierten klinischen Fällen. Das Experiment ahmte den dynamischen Diagnoseprozess eines Arztes nach, indem es schrittweise Patientensymptome, Labordaten und Bildgebungsergebnisse offenlegte. Die Daten zeigten, dass alle Modelle bei vollständiger Information eine Genauigkeit von über 90 % bei der Erstellung der richtigen Enddiagnose erreichten. Im Kernbereich des klinischen Denkens – der Differentialdiagnose – schnitten jedoch über 80 % der Modelle schlecht ab und versagten bei der systematischen Analyse und Priorisierung mehrerer potenzieller Erkrankungen.
Um diese Lücke zu quantifizieren, führten die Forscher den umfassenden Bewertungsindex PrIME-LLM ein, der den gesamten Prozess von der Erstbeurteilung über die Testauswahl bis hin zur Behandlungsplanung abdeckt. Die Bewertungsergebnisse lagen bei den Modellen zwischen 64 % und 78 %, was verdeutlicht, dass KI besser darin ist, bei vollständigen Informationen „Antworten zu liefern“, als bei unvollständigen Daten offenes logisches Denken zu betreiben.
Zwar zeigen neuere Modelle im Vergleich zu ihren Vorgängern deutliche Verbesserungen im Umgang mit komplexen Daten, doch betonte das Team, dass große Sprachmodelle derzeit als Hilfswerkzeuge betrachtet werden sollten. Ihr Einsatz in der klinischen Praxis ohne fachliche Aufsicht birgt nach wie vor Risiken. Diese Studie liefert einen rationalen Maßstab für die Zukunft der KI im Gesundheitswesen: Der Übergang vom einfachen „Antwortabgleich“ zum komplexen „logischen Schlussfolgern“ wird die entscheidende Schwelle sein, damit medizinische Großmodelle eine Anwendung auf professionellem Niveau erreichen.
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13
So beheben Sie Core Web Vitals für bessere SEO-Rankings
Berichtskartenkommentare mit KI-Tools optimierenEinführungKI-Tools zur Generierung von BerichtskartenkommentarenMagic SchoolAlmanac AIChat GPTNutzung von Magic School zur Generierung von BerichtskartenkommentarenAnmeldung bei Magic SchoolAuswahl des











