Was unterscheidet ein RAG wie LiSA von generalistischen LLMs?
Wir sprechen meist von „klinischen KI-Systemen“. Sie werden eigens für medizinische Recherchen entwickelt. Das betrifft zum einen das Prompting: Man muss der KI nicht sagen, dass man Arzt oder Ärztin ist und dass die Antworten möglichst vollständig sein sollen. Das ist im System automatisch hinterlegt. Der zweite Unterschied ist der begrenzte Quellenraum. Wir nutzen nicht das freie Internet, sondern unsere eigenen kuratierten Inhalte, ergänzt um nationale Leitlinien, lokale SOPs, klinische Studien und ausgewählte andere externe Quellen mit hoher klinischer Relevanz.
In der NOHARM-Studie erreichte LiSA eine Rate schwerer Fehler von 2,9 Prozent. Generalistische LLMs landen eher bei 10 bis 20 Prozent. Von welcher Art Fehlern reden wir?
Wir sind stolz, dass wir damit die niedrigste Rate potenziell schwerer Fehler erzielt haben. Viele denken bei KI zuerst an Halluzinationen. Die gibt es auch, aber sie sind nicht das Hauptproblem. Tatsächlich handelte es sich insgesamt zu 80 Prozent um Fehler durch Unterlassung, also dass z. B. wichtige diagnostische Maßnahmen nicht erwähnt werden. Das hängt wahrscheinlich damit zusammen, dass generalisierte LLMs bei medizinischen Themen darauf trainiert sind, im Zweifel lieber etwas wegzulassen als etwas Falsches zu sagen.
Welche Ergebnisse der Studie fandet Ihr noch spannend?
Bei den Prompts zeigte sich erwartungsgemäß, dass generalisierte LLMs sehr genaue Anweisungen brauchen, um korrekte und vor allem vollständige Empfehlungen zu geben. Das entspricht aber nicht der Realität. Unsere eigenen Daten zeigen, dass Suchanfragen im Schnitt nur sieben Wörter lang sind. Damit muss ein klinisches KI-System umgehen können. Interessant ist auch der randomisierte Teil der Studie, in dem die klinische Performance mit und ohne KI-Unterstützung verglichen wurde. Es zeigte sich, dass auch KI-unterstützte Ärztinnen und Ärzte in einem Erstkontaktszenario schlechter performen als generalisierte LLMs alleine, weil Empfehlungen des LLMs nicht übernommen oder die KI-Tools erst gar nicht genutzt wurden.
Was sind Eure Schlussfolgerungen daraus?
Ich denke, es fehlt oft noch an Vertrauen in KI. Umso wichtiger ist es, dass Anbieter entsprechender Systeme in unabhängigen Benchmarks wie NOHARM überzeugend nachweisen, dass sich die Qualität der Versorgung verbessert. Wir selbst entwickeln aktuell Schulungsprogramme, mit denen wir die Einführung unseres klinischen KI-Systems begleiten. Das ist auch mit Blick auf die europäische KI-Gesetzgebung wichtig.
Das Interview führte Philipp Grätzel von Grätz, Chefredakteur E-HEALTH-COM
