E-HEALTH-COM ist das unabhängige Fachmagazin für Gesundheitstelematik, vernetzte Medizintechnik , Telemedizin und Health-IT für Deutschland, Österreich und die Schweiz.
Mehr

Für das ePaper anmelden

Geben Sie Ihren Benutzernamen und Ihr Passwort ein, um sich an der Website anzumelden

Anmelden

Passwort vergessen?

Health-IT |

» Es fehlt noch an Vertrauen in KI «

Die neu aufgelegte NOHARM-Studie hat 45 generalistische LLMs und vier Retrieval-Augmented Generation (RAG)-Systeme in einem medizinischen Setting verglichen. Einer der Sieger ist AMBOSS AI LiSA, eine Medizin-KI aus Deutschland. Ein Gespräch mit Dr. Patricia Hinske, ausgebildete Ärztin und seit Dezember 2024 Chief of Clinical Innovation bei AMBOSS.

Dr. Patricia Hinske, ausgebildete Ärztin und seit Dezember 2024 Chief of Clinical Innovation bei AMBOSS. Foto: © AMBOSS SE

Was unterscheidet ein RAG wie LiSA von generalistischen LLMs?
Wir sprechen meist von „klinischen KI-Systemen“. Sie werden eigens für medizinische Recherchen entwickelt. Das betrifft zum einen das Prompting: Man muss der KI nicht sagen, dass man Arzt oder Ärztin ist und dass die Antworten möglichst vollständig sein sollen. Das ist im System automatisch hinterlegt. Der zweite Unterschied ist der begrenzte Quellenraum. Wir nutzen nicht das freie Internet, sondern unsere eigenen kuratierten Inhalte, ergänzt um nationale Leitlinien, lokale SOPs, klinische Studien und ausgewählte andere externe Quellen mit hoher klinischer Relevanz.

In der NOHARM-Studie erreichte LiSA eine Rate schwerer Fehler von 2,9 Prozent. Generalistische LLMs landen eher bei 10 bis 20 Prozent. Von welcher Art Fehlern reden wir?

Wir sind stolz, dass wir damit die niedrigste Rate potenziell schwerer Fehler erzielt haben. Viele denken bei KI zuerst an Halluzinationen. Die gibt es auch, aber sie sind nicht das Hauptproblem. Tatsächlich handelte es sich insgesamt zu 80 Prozent um Fehler durch Unterlassung, also dass z. B. wichtige diagnostische Maßnahmen nicht erwähnt werden. Das hängt wahrscheinlich damit zusammen, dass generalisierte LLMs bei medizinischen Themen darauf trainiert sind, im Zweifel lieber etwas wegzulassen als etwas Falsches zu sagen.

Welche Ergebnisse der Studie fandet Ihr noch spannend?

Bei den Prompts zeigte sich erwartungsgemäß, dass generalisierte LLMs sehr genaue Anweisungen brauchen, um korrekte und vor allem vollständige Empfehlungen zu geben. Das entspricht aber nicht der Realität. Unsere eigenen Daten zeigen, dass Suchanfragen im Schnitt nur sieben Wörter lang sind. Damit muss ein klinisches KI-System umgehen können. Interessant ist auch der randomisierte Teil der Studie, in dem die klinische Performance mit und ohne KI-Unterstützung verglichen wurde. Es zeigte sich, dass auch KI-unterstützte Ärztinnen und Ärzte in einem Erstkontaktszenario schlechter performen als generalisierte LLMs alleine, weil Empfehlungen des LLMs nicht übernommen oder die KI-Tools erst gar nicht genutzt wurden.

Was sind Eure Schlussfolgerungen daraus?
Ich denke, es fehlt oft noch an Vertrauen in KI. Umso wichtiger ist es, dass Anbieter entsprechender Systeme in unabhängigen Benchmarks wie NOHARM überzeugend nachweisen, dass sich die Qualität der Versorgung verbessert. Wir selbst entwickeln aktuell Schulungsprogramme, mit denen wir die Einführung unseres klinischen KI-Systems begleiten. Das ist auch mit Blick auf die europäische KI-Gesetzgebung wichtig. 


Das Interview führte Philipp Grätzel von Grätz, Chefredakteur E-HEALTH-COM