Wer merkt es noch, wenn die KI danebenliegt?
Hallo,
in Wien stand ich vor knapp zwei Wochen auf einem Podium, vor Menschen, die die Regeln für KI in der Medizin machen. Ich hatte fünf Minuten für eine Frage: Wer merkt es noch, wenn die KI danebenliegt?
Diese Frage kenne ich nicht nur aus Studien. Ich habe sie mir irgendwann selbst stellen müssen, und davon erzähle ich weiter unten.
Erst einmal: Was hatte ich in Wien überhaupt verloren?
Warum ausgerechnet Wien
Eigentlich fahre ich schon länger zu keinem Kongress mehr. Im Mai habe ich sogar den Deutschen Röntgenkongress verpasst, und das, obwohl ich eine von drei Kongresspräsident:innen war.
Der Grund ist eine chronische Erkrankung. Meine Energie ist dadurch knapp, und ein Kongress kostet viel davon: der Weg dorthin, der Lärm, das Gedränge.
Bei Wien habe ich deshalb nicht sofort Ja gesagt. Zwei Wochen lang habe ich hin und her überlegt, ob ich das will und kann, ohne dass es sich hinterher „rächt“.
Am Ende hat mich das Publikum überzeugt. Wenn ich über KI in der Radiologie spreche, dann meistens vor Kolleg:innen, die die Probleme aus dem eigenen Befundungsraum kennen. In Wien dagegen saßen Leute, deren Entscheidungen später bestimmen, wie wir in Zukunft arbeiten.
Anlass war die Generalkonferenz der Internationalen Atomenergie-Organisation (IAEA). An ihrem Rand ging es in einer eigenen Veranstaltung um KI im medizinischen Strahlenschutz und um die Frage, wie man sie reguliert. Die Einladung kam vom Bundesumweltministerium.
Neben mir auf dem Podium saßen Leute aus der Physik und der Informatik. Ärztin war nur ich. Vor uns saßen Delegierte aus aller Welt, aus den USA, aus Tansania, aus Brasilien.
Eine internationale Bühne dieser Größe außerhalb der Medizin hatte ich vorher noch nie. Drei Folien hatte ich dabei, und einen Vorsatz: keine Warnung vor der Technik. Ich wollte über die Menschen reden, die mit ihr arbeiten.
Ich bin nicht gegen KI
Angefangen habe ich beim Patienten, weil ich als Ärztin immer dort anfange.
KI kann für den Strahlenschutz (um den es hier natürlich primär gehen sollte) heute schon viel tun. KI-basierte Rekonstruktionen machen aus sehr wenig Strahlung ein brauchbares Bild.
In einer Studie mit simulierter Dosis ließ sich eine CT der Lunge mit 8% der üblichen Dosis rekonstruieren. Das ist etwa ein halbes Millisievert, in der Größenordnung weniger Röntgenaufnahmen der Lunge.
KI macht die MRT schneller, dazu habe ich auch selbst geforscht. Und jede Untersuchung, die statt in der CT in der MRT laufen kann, kommt ganz ohne Strahlung aus. Manchmal ist „keine Strahlung“ eben der beste Strahlenschutz - und je besser verfügbar und schneller die MRT wird, desto weniger Strahlung müssen wir bei einigen Fragestellungen anwenden. Vor allem auch bei Kindern.
In der Forschung zur Strahlentherapie entstehen Pläne, die sich an den Körper anpassen, wie er heute aussieht. Nicht an den, wie er letzte Woche aussah.
Das ist gut, und ich meine das so. Ich habe selbst mit KI gearbeitet, und gut eingesetzt kann sie eine gute Unterstützung im radiologischen Alltag sein.
Der Haken: Sie funktioniert
KI wird manchmal danebenliegen. Das eigentliche Risiko ist ein anderes: dass sie so gut funktioniert, dass wir aufhören hinzuschauen. Bis irgendwann niemand mehr da ist, der es merken würde.
In meinem Vortrag war das eine Kette aus drei Gliedern.
Erstens: Die Maschine rechnet ins Bild, was sie nicht sieht. Bei genau diesen 8% Dosis hat einer von zwei Rekonstruktions-Algorithmen zahlreiche Strukturen ins Bild gerechnet, die es gar nicht gab. Man nennt das Halluzination. Das kennen wir sehr gut von den LLMs - ChatGPT und Co.
Und die Frage ist dann nicht nur, was dazugekommen ist, sondern auch, was fehlt. Zeigt das Bild noch, was im Menschen wirklich drin ist?
Dazu kommt: Fälschungen fallen uns schwer auf. 182 Radiolog:innen sollten echte von KI-erzeugten Bildern unterscheiden. Bei der CT lagen sie nur in 70% richtig, obwohl sie wussten, dass Fälschungen dabei waren. Berufserfahrung machte keinen Unterschied.
Zweitens: Der Mensch glaubt der Maschine. In unserer Studie aus Köln haben Radiolog:innen Mammografien mit einer KI befundet, die in einigen Fällen absichtlich falsch lag.
Lag die KI richtig, lagen alle bei etwa 80%. Lag sie falsch, fielen die sehr Erfahrenen auf 45%, die Berufsanfänger:innen auf 20%.
Drittens: Der Mensch verliert die Fähigkeit, sie zu prüfen. Bei Darmspiegelungen beispielsweise fanden Ärzt:innen drei Monate nach Einführung einer KI ohne sie nur noch bei 22 statt 28% der Patient:innen Adenome, also Vorstufen von Darmkrebs. Ein Fünftel weniger.
Das ist eine Beobachtungsstudie und keine endgültige Antwort. Aber eine Warnung.
Was mir selbst passiert ist
Hier ist die Geschichte, die ich oben angekündigt habe. Das dritte Glied habe ich an mir selbst erlebt.
In der Lungendiagnostik lief bei mir eine Software mit, die kleine Rundherde markiert. Sie war zuverlässig. Und irgendwann habe ich angefangen, weniger genau hinzuschauen.
Nicht bewusst, nicht als Entscheidung. Einfach so, weil sie ja mitlief.
Gemerkt habe ich es erst, als ich einen Fall ohne sie befunden musste, weil sie vorübergehend ausgefallen war. Plötzlich war ich nicht mehr so sicher.
Die Systematik, mit der ich früher jeden Millimeter Lunge abgesucht hatte, war irgendwo auf dem Weg verloren gegangen.
Das ist mir passiert. Und ich beschäftige mich seit Jahren mit genau diesem Risiko, ich spreche darüber und habe dazu publiziert.
Deshalb habe ich meinen Vortrag auf diese Frage zugespitzt: Die Frage ist nicht, ob KI Fehler macht. Die Frage ist, ob es dann noch jemanden gibt, der es merkt.
Nickende Gesichter
Während ich gesprochen habe, habe ich die ganze Zeit in nickende Gesichter geguckt. Die Hürden, über die ich gesprochen habe, sind offenbar doch mehr Menschen bewusst, zumindest in diesen regulatorischen Kreisen.
Das fand ich gut. Auch nach dem Podium gab es noch spannende Diskussionen.
Zum Schluss sollten alle auf dem Podium noch eine Botschaft zum Mitnehmen sagen. Meine war: Keep the human in the loop. Gemeint habe ich: Sorgt dafür, dass der Mensch in vollautomatisierten Abläufen nicht ausgeschaltet wird. Und vor allem, dass sein Können erhalten bleibt.
Der Satz hat zwei Hälften. Die erste ist in der Medizin weitgehend geregelt. Die zweite nicht.
Da sein ist geregelt
Dass ein Mensch entscheidet, steht im Gesetz. Nach den europäischen Strahlenschutz-Grundnormen muss jede Untersuchung mit ionisierender Strahlung vorher ärztlich gerechtfertigt werden. Ein Vorschlag aus einer Software ändert daran formal nichts, er bleibt ein Rat.
Die europäische KI-Verordnung geht noch weiter. Wer ein solches System beaufsichtigt, muss den Automation Bias kennen, also die menschliche Neigung, der Entscheidung einer Maschine zu folgen. Und er muss ihr Ergebnis übergehen können.
Für KI in Medizinprodukten gilt das allerdings erst ab August 2028. Ursprünglich sollte es ein Jahr früher gelten, im Sommer wurde es verschoben. Warum auch immer.
Es noch können ist nicht geregelt
Für meinen Vortrag habe ich nachgesehen, wer eigentlich verlangt, dass Ärzt:innen ihre Arbeit auch ohne KI beherrschen. Die KI-Verordnung, die Strahlenschutz-Grundnormen, die Sicherheitsanforderungen der Atomenergie-Organisation, das deutsche Recht.
Verpflichtend ist es in keiner dieser Regeln.
Es gibt Empfehlungen, und sie sind gut. Die Leitlinie der Atomenergie-Organisation zu KI in Bildgebung und Strahlentherapie empfiehlt, dass Teams auch ohne die Ausgabe der KI arbeiten können.
Und dass es einen Plan gibt für den Tag, an dem das System ausfällt.
In der Luftfahrt, aus der der Begriff Automation Bias stammt, empfiehlt die US-Luftfahrtbehörde den Fluggesellschaften seit 2013, das Fliegen von Hand in Betrieb und Training einzubauen. Auch dort ist es eine Empfehlung, keine Pflicht. Aber es wird wohl relativ flächendeckend umgesetzt.
Und die Pflicht zur KI-Kompetenz, die die KI-Verordnung kennt, ist im Sommer gleich mit abgeschwächt worden. Keine ihrer beiden Fassungen hat je verlangt, die Arbeit auch ohne das Werkzeug zu können.
Meine erste Forderung an die Regulierungsbehörden war deshalb: Wer mit KI arbeitet, muss es auch ohne können. Trainiert, geprüft, erhalten.
Die zweite: Die Entscheidung bleibt beim Menschen, und zwar bei einem, der sie treffen kann. Das heißt: erst selbst hinschauen, dann den Vorschlag ansehen.
Und Widersprechen ist ein normaler, dokumentierter Schritt, keine Ausnahme, für die man sich rechtfertigen muss. Eine Ärztin muss widersprechen können, und sie muss es dürfen.
Und das Gerät?
Die dritte Forderung betraf die Systeme selbst. Beim Vorbereiten bin ich dafür auf eine Zahl gestoßen, die mich überrascht hat.
Kurz vor meinem Vortrag hat eine Forschungsgruppe jedes KI-Medizinprodukt durchgesehen, das die US-Zulassungsbehörde FDA bis Anfang Dezember 2025 zugelassen hatte. Das waren 1.357, und 1.059 davon kommen aus der Radiologie. Ups.
Registrierte klinische Studien gab es zu 34 davon. Und nur in drei Fällen (3!) stand im Mittelpunkt einer solchen Studie, ob es den Patient:innen damit besser ging: ob sie länger lebten, seltener schwer krank wurden, seltener zurück ins Krankenhaus mussten.
Drei. Bei 1.357 Produkten.
Geprüft werden diese Produkte durchaus, sonst gäbe es keine Zulassung. Für die Zulassung in den USA genügt aber meist, dass ein neues Produkt einem bereits zugelassenen im Wesentlichen entspricht.
Ob Patient:innen damit besser behandelt werden, wird auf diesem Weg in der Regel nicht verlangt.
Und selbst ein gut belegtes Gerät trifft am Ende auf einen Menschen, der ihm vielleicht zu sehr glaubt. Das hatten wir oben, bei den Mammografien.
Mein Vortrag endete deshalb mit einem Satz, der alle drei Forderungen zusammenfasst: Regulate the decision, not just the device.
Wir regeln das Gerät, und selbst das oft nur daraufhin, ob es einem anderen gleicht. Kaum eine Regel fragt, ob der Mensch, der am Ende unterschreibt, die Entscheidung noch selbst treffen könnte.
Was ich selbst tue
Auf Regeln warte ich dabei nicht. Für mich ist eine Reihenfolge nicht mehr verhandelbar: erst selbst hinschauen, dann das System.
Das ist einer der Gründe, warum ich die LernRad gegründet habe. Kein Fall, kein Kurs, keine Didaktik kommt aus einer KI.
Wir bauen die Fälle und die Didaktik selbst.
Das ist unsere Antwort auf eine Weiterbildung, die schon vor der KI an vielen Orten kein systematisches Lernen am Fall kannte, und in der KI die Lücken jetzt größer macht statt kleiner.
Kompetenz entsteht am echten Fall: systematisch, mit Feedback, immer wieder. Bescheid wissen reicht dafür nicht.
Das betrifft nicht nur die Radiologie. Überall, wo ein System vorschlägt und ein Mensch unterschreibt, reicht es nicht, dass der Mensch da ist. Er muss es noch können.
Schreib mir
Wo in deiner Arbeit schlägt heute schon ein System vor, und was davon könntest du morgen noch ohne es?
Bis zum nächsten Mal,
Bettina