Eilmeldung

Bitte denken Sie daran, dass uns je Praxis und Standort eine vollständig ausgefüllte TI-Eigenerklärung vorliegen muss, um Sanktionen wie Honorar- und Pauschalenkürzungen zu vermeiden. Weitere Informationen dazu finden Sie hier auf unseren Seiten.

Tests & Statistik

Wenn „Doktor KI“ die Diagnose stellt

Stiftung Warentest geht in der aktuellen August-Ausgabe der Frage nach, ob Chatbots Krankheitssymptome zutreffend einschätzen, geeignete Handlungsempfehlungen geben und Erkrankte notfalls rechtzeitig zum Arzt schicken können. Um das herauszufinden, wurden fünf der am meisten genutzten Bots mit verschiedenen Krankheitsbildern konfrontiert und die von der KI gelieferten Ergebnisse genau unter die Lupe genommen.
Von Susanne Krieger
Erstellt am 21.08.2026
Quelle: test.de | zm online | Technische Universität Dresden
Ein Roboter als Arzt mit Stethoskop in einem Klinikflur. © phonlamaiphoto – stock.adobe.com

Diagnose, Handlungsempfehlungen und Datenverhalten getestet

Die Tester schickten die KI-Modelle ChatGPT von OpenAI, Gemini von Google, Claude von Anthropic, Meta AI von Meta Platforms und das chinesische DeepSeek ins Rennen, um die Kompetenz und Vertrauenswürdigkeit von KI in medizinischen Fragen auf die Probe zu stellen. Neben den Testergebnissen erhalten KI-Nutzerinnen und Nutzer auch Tipps, wie sie bessere Ergebnisse erzielen und den Schutz ihrer Daten im Auge behalten.

Die Testaufgabe für die KI-Chatbots – alle in der kostenlosen Standardversion – bestand darin, die für einen Bandscheibenvorfall, Angina pectoris, Depression, Blasenentzündung und für das Restless-Legs-Syndrom einschlägigen Symptome zu erkennen und Verhaltensempfehlungen auszusprechen. Fachärzte und eine Psychotherapeutin überprüften die Ergebnisse der KI. Darüber hinaus wurde auch untersucht, wie und in welchem Umfang die künstliche Intelligenz Daten übermittelt.

ChatGPT bester „Doktor KI“ im Test

Bei der Diagnosestellung auf Basis der angegebenen Symptome war ChatGPT nicht zu schlagen. Der Testsieger schätzte alle Krankheitszeichen richtig ein, gab zudem passende Empfehlungen und in dringenden Fällen den Rat, umgehend eine Arztpraxis aufzusuchen. Platz zwei teilen sich Claude und DeepSeek. Erfreulich: Bei Suizidgedanken empfahlen alle getesteten Bots mit Nachdruck, entsprechende Hilfsangebote wahrzunehmen. Bei Claude gab es sogar die Möglichkeit, sich über eingeblendete Button-Links zum Beispiel direkt an die Telefonseelsorge zu wenden.

Vor zu viel Vertrauen in die KI wird gewarnt

Auch wenn drei der Chatbots im Test bei den Diagnosen in der Regel richtig lagen und durchaus hilfreiche Verhaltenstipps gaben, sollte man sich nach Ansicht von Stiftung Warentest niemals uneingeschränkt auf die KI als medizinischen Ratgeber verlassen. Die Ergebnisse von zwei KI-Bots stuften die Tester zum Beispiel als irritierend ein. Chatbots agieren auf der Basis von Sprachmodellen und Wahrscheinlichkeiten und zeichnen sich nicht wie menschliches Fachpersonal durch medizinisches Verständnis aus. Die KI-„Expertise“ kann daher auch teilweise oder ganz fehlerhaft sein. Die Qualität der Ergebnisse von Chatbots hängt außerdem von den Prompts der Nutzerinnen und Nutzer ab. Fehlende Details oder Ungenauigkeiten können zu falschen Antworten führen. Stiftung Warentest stellt daher einen Mustertext als Promptvorlage zur Verfügung. Das strikte Fazit der Tester für den Einsatz von Chatbots in Gesundheitsfragen lautet jedoch in jedem Fall, dass die KI niemals den Gang zum Arzt ersetzen kann.

Gefahr durch „Halluzinationen“ der KI 

Was bei der künstlichen Intelligenz bei einer Anwendung im medizinischen Bereich alles falschlaufen kann, hat ein interdisziplinäres und internationales Wissenschaftsteam unter Federführung des Else Kröner Fresenius Zentrums für Digitale Gesundheit an der Technischen Universität Dresden und des Dresdner Universitätsklinikums klar herausgearbeitet. Die in der Fachzeitschrift „Nature“ veröffentlichte Übersichtsstudie zu möglichen Gefahren durch KI in der Medizin warnt ausdrücklich vor fachsprachlich als „Halluzinationen“ bezeichneten Irrwegen der künstlichen Intelligenz. Diese kommen dadurch zustande, dass die der KI zugrunde liegenden Sprachmodelle schlüssig klingende, aber inhaltlich falsche Aussagen erzeugen können. Das Zitieren einer wissenschaftlichen Studie, die gar nicht existiert, oder falsche Handlungs- und Therapieempfehlungen können die Folgen sein. Sprachlich ausgefeilte und daher glaubwürdig erscheinende Angaben der KI, bei denen für den medizinischen Laien nicht zu erkennen ist, ob sie zutreffend oder schlicht erfunden sind, bergen erhebliche Risiken für die Patientensicherheit und können potenziell gefährlich sein. Passen sich die Sprachmodelle zu sehr den Erwartungen der Nutzerinnen und Nutzer an, verstärken sie bei diesen Annahmen, die von vorneherein fehlerhaft sind.

Datenschutz nicht gewährleistet

Auch in datenschutzrechtlicher Hinsicht sollte man bei der Anwendung von KI Vorsicht walten lassen. Immerhin war keinem Chatbot im Test eine unnötige Übermittlung von Daten nachzuweisen. Doch die von Nutzerinnen und Nutzern preisgegebenen Daten können auf Server gelangen, die sich außerhalb von Europa und damit oft in Ländern mit schwächerem Datenschutzrecht wie zum Beispiel den USA befinden, ganz zu schweigen von DeepSeek, dem chinesischen Chatbot, auf dessen Daten chinesische Behörden zugreifen könnten. Ein Tipp von Stiftung Warentest lautet deshalb, sich bei Chatbots prinzipiell nicht anzumelden, falls es nicht erforderlich ist, und die Speicherung von Daten einzuschränken.

   

Chatbots auf dem Prüfstand

Warum die KI den Arztbesuch nicht ersetzen kann

Weiterführende Informationen zum Chatbot-Test erhalten Sie auf der Website von Stiftung Warentest.
   
Mehr erfahren bei test.de
   

Die Technische Universität Dresden (TUD) berichtet ausführlich über die neue Übersichtsstudie eines internationalen Wissenschaftsteams zu Strategien und Risiken beim klinischen Einsatz von KI. Zum Studienreport auf den Seiten der TUD und zur Studie gelangen Sie unter den nachfolgenden Links.
   

Zum Studienreport der TUD
   

Zur Studie auf nature.com