Klartext ·
Diagnose: Automation Bias – Die unsichtbare Gefahr, die jeden Befund beeinflusst
→ Reinhören (Spotify)
Ich stehe auf einem Podium. Deutscher Röntgenkongress. Eröffnungsveranstaltung. Große Bühne, voller Saal — genau die Sorte Veranstaltung, bei der man wahrscheinlich besser nur nickend dasitzen soll.
Ich sitze nicht nickend da.
Ich sage, was ich denke: Dass KI in der Radiologie große Risiken mit sich bringt. Dass wir anfangen müssen, über Automation Bias zu reden. Über Deskilling. Darüber, was es mit uns als Fach macht, wenn wir anfangen, dem Computer mehr zu vertrauen als uns selbst.
Die Reaktion? Ich werde niedergemacht. Auf offener Bühne. Vor allen.
Nicht mit Argumenten — sondern mit der Botschaft: Das will hier niemand hören.
Im Anschluss kamen viele Kolleg*innen aus dem Publikum zu mir, um sich solidarisch zu zeigen. Das hat mir dann wieder Mut gemacht.
Das war vor einigen Jahren. Und ich denke heute noch daran, weil sich seither so vieles bestätigt hat — in der Forschung, in der Klinik, in den Daten. Und weil die Bereitschaft, hinzuhören, immer noch erschreckend gering ist.
Deshalb kommt hier mein zweiter Versuch.
Lass uns heute über Automation Bias reden. Einen Begriff, den ich schon kurz in der letzten Episode erwähnt habe, als ich darüber gesprochen habe, ob ich heute noch guten Gewissens jemandem empfehlen kann, Radiologe zu werden. Aber vielleicht hast Du diesen Begriff auch noch nie gehört — und dennoch beeinflusst er schon jetzt Deinen klinischen Alltag. Egal ob Du gerade Dein erstes Weiterbildungsjahr hinter Dir hast oder seit zwanzig Jahren befundest.
Automation Bias ist nicht Deine Schuld. Es ist keine Schwäche. Es ist ein kognitives Phänomen, das die Forschung seit Jahrzehnten kennt — aus der Luftfahrt, aus der Prozesssteuerung, aus der Medizin. Und der Begriff beschreibt etwas Einfaches, aber Folgenreiches:
Wenn ein automatisiertes System eine Empfehlung gibt, neigen wir dazu, dieser Empfehlung zu folgen — auch dann, wenn der eigene Blick etwas anderes sagt.
Nicht weil wir faul sind. Nicht weil wir schlechte Ärztinnen und Ärzte sind. Sondern weil unser Gehirn unter Zeitdruck, bei hohem Volumen und gegenüber einem System, das wir als überlegen einschätzen, auf eine kognitive Abkürzung zurückgreift. Das ist pure Neurobiologie. Das ist Human Factors. Und das passiert Dir, während Du Mammographien befundest, Noduli zählst, oder ein Stroke-CT auswertest.
Ich bin nicht als Automation-Bias-Forscherin gestartet. Ich habe an Radiomics geforscht, an quantitativen Biomarkern, habe mich tief in die Statistik und Data Science reingefuchst — und irgendwann führte dieser Weg ganz selbstverständlich in Richtung KI. Weil KI das nächste logische Werkzeug war.
Und je tiefer ich in dieses Feld gekommen bin, desto mehr haben mich die Fragen beschäftigt, die sonst kaum jemand stellen wollte. Nicht "kann die KI das besser als ich?" — sondern:
Was macht es mit mir, wenn ich anfange, das so zu glauben?
Diese Frage hat Daniel Pinto dos Santos und mich über viele Jahre und viele Gespräche begleitet. Daniel ist Senior-Autor unserer Studie, Kollege und Freund — und einer der wenigen, mit denen ich damals offen darüber reden konnte, ohne das Gefühl zu haben, gegen den Strom zu schwimmen.
Aus diesen Gesprächen ist schließlich eine Studie geworden. Und diese Studie hat gezeigt, was wir geahnt hatten. Nur deutlicher, als wir es uns vorgestellt hatten.
Stell Dir folgendes Setting vor: 27 Radiologinnen und Radiologen. Unterschiedliche Erfahrungsstufen — von zwei bis fünfzehn Jahren Mammographie-Expertise. Jede und jeder befundet 50 Mammographien. Mit Unterstützung eines KI-Systems, das BI-RADS-Kategorien vorschlägt.
Was die Teilnehmenden nicht wissen: Das System ist eine Sham-AI. Eine Attrappe.
In einem Trainingsset von zehn Fällen ist die KI korrekt — sie baut Vertrauen auf. Im eigentlichen Testset sind 30 Prozent der Vorschläge bewusst falsch.
Die Ergebnisse sind eindeutig — und sie sind unbequem.
Bei korrekten KI-Vorschlägen: Trefferquote rund 80 Prozent, über alle Erfahrungsstufen. Gut. Erwartbar.
Bei falschen Vorschlägen: Die Trefferquote der unerfahrenen Gruppe fällt auf knapp 20 Prozent. Die moderat Erfahrenen auf 25 Prozent. Und die sehr Erfahrenen — im Schnitt 15 Jahre Mammographie — auf 45 Prozent.
Niemand ist immun. Erfahrung schützt — aber unvollständig. Und bei einer bestimmten Fehlerkategorie, den sogenannten Omission Errors — die KI stuft ein Karzinom fälschlich herab — gibt es zwischen den Erfahrungsgruppen keinen signifikanten Unterschied. Alle folgen dem Vorschlag gleichermaßen.
Das ist die gefährlichste Fehlerart. Das übersehene Karzinom. Und Erfahrung hilft dabei kaum. Ist das nicht erschreckend?
Bevor wir weitergehen: Warum passiert das eigentlich? Warum folgt ein Mensch mit 15 Jahren Erfahrung einem falschen Computervorschlag, obwohl das Bild vor ihm etwas anderes zeigt?
Die Antwort kommt nicht aus der Radiologie. Sie kommt aus der Kognitionspsychologie — und aus der Luftfahrt.
Der Begriff Automation Bias wurde in den 1990er Jahren von Kathleen Mosier und Linda Skitka geprägt. Ihr Forschungsfeld: keine Ärztinnen und Ärzte, sondern Piloten. Hochqualifizierte Menschen in Hochleistungs-Cockpits, die jahrelang trainiert hatten, unter extremem Druck richtig zu entscheiden. Und trotzdem: Sobald ein automatisiertes System eine Empfehlung gab, veränderte sich ihr Verhalten. In einer frühen Studie schalteten 75 Prozent der Piloten auf Basis einer elektronischen Checkliste den falschen Triebwerksmotor ab — obwohl die Instrumente etwas anderes anzeigten. Ohne elektronische Checkliste waren es 25 Prozent.
Derselbe Fehler. Dreimal so häufig. Nur weil ein System eine Empfehlung gegeben hatte.
Stell Dir das mal kurz vor — erfahrene Piloten, trainiert für genau diese Situationen, mit allen Informationen vor sich. Und trotzdem folgen drei von vier dem falschen Vorschlag der Maschine.
Drei Mechanismen
Mosier und Skitka beschreiben drei Mechanismen. Der erste: Das Gehirn ist ein Energiesparer. Unter Zeitdruck, bei hohem Volumen, bei Erschöpfung — wählt es den Weg des geringsten Widerstands. Und dem System zuzustimmen kostet weniger als ihm zu widersprechen. Das nennen sie den "Cognitive Miser"-Effekt — das Gehirn als kognitiver Geizkragen.
Der zweite Mechanismus ist Autorität. Wir nehmen automatisierte Systeme als analytisch überlegen wahr — besonders, wenn wir uns selbst unsicher fühlen. Erinnere Dich an unsere Studie: Die unerfahrenen Teilnehmenden bewerteten ihre eigene Mammographie-Kompetenz im Schnitt mit 2 von 10. Die der KI mit 9 von 10. Wenn Du Dir selbst eine 2 gibst und der Maschine eine 9 — wessen Urteil wirst Du im Zweifel folgen? Auch das ist pure Psychologie.
Und der dritte Mechanismus ist vielleicht der subtilste: Wenn ein System mitentscheidet, fühlt sich die eigene Verantwortung kleiner an. Die Entscheidung ist geteilt. Das gibt ein trügerisches Gefühl von Absicherung. Trügerisch, weil die Haftung eben nicht geteilt ist — dazu gleich mehr.
Alle drei Mechanismen treffen auf unseren radiologischen Alltag zu. Hoher Befundungsdruck. Tausende Bilder pro Tag. Ein KI-Produkt, das mit beeindruckenden Zahlen beworben wird. Und das Gefühl, dass man sich absichert, wenn man der Maschine folgt.
Das ist kein Versagen. Das ist Biologie. Aber es hat Konsequenzen.
Unsere Studie hat das Phänomen in der Mammographie gezeigt. Aber Automation Bias ist kein Mammographie-Problem. Er ist ein Radiologie-Problem — und darüber hinaus ein Medizin-Problem.
Lass mich Dir zwei Studien aus der Thorax-Radiologie zeigen, weil die für viele den direktesten Alltagsbezug haben.
Eine Forschergruppe um Chassagnon hat 2023 acht Assistenzärztinnen und -ärzte 500 Thorax-Röntgen befunden lassen — einmal mit, einmal ohne KI-Unterstützung. Mit KI wurde die Trefferquote signifikant besser. Das klingt erst mal gut.
Aber dann kam der entscheidende Test: Die KI wurde entfernt. Und die Performance kehrte exakt auf das Ausgangsniveau zurück. Kein Lerneffekt. Kein Transfer. Die KI hatte geholfen — aber kein Wissen, keine Sicherheit hinterlassen. Was das bedeutet: Diese Assistenzärztinnen und -ärzte haben während der KI-Phase nicht gelernt, besser zu befunden. Sie haben gelernt, der KI zu folgen. Das ist ein Unterschied. Ein wesentlicher Unterschied.
Eine andere Gruppe hat direkt untersucht, was passiert, wenn die KI falsch liegt. Die Ausgangssituation ohne KI: Eine Falsch-Negativ-Rate von knapp 3 Prozent — also von 100 Befunden wurden etwa 3 fälschlicherweise als unauffällig eingestuft. Mit einer fehlerhaften KI stieg diese Rate auf 33 Prozent. Aus 3 wurden 33.
Das ist keine Nuance — das ist eine Verzehnfachung des gefährlichsten Fehlers, den wir machen können: das Übersehen einer ernsthaften Pathologie.
Und dann gibt es noch einen Befund, der mich besonders beschäftigt — weil er eine der häufigsten Antworten auf Automation Bias direkt widerlegt. Die Antwort lautet: Wir brauchen nur bessere KI-Erklärungen. Explainable AI. Wenn die KI zeigt, warum sie zu einem Ergebnis kommt, werden wir kritischer.
Eine Studie mit über 90 Radiologinnen und Radiologen und fast 3.000 Befundungsentscheidungen hat genau das getestet. Das Ergebnis: nein. Weder Erklärbarkeit noch gezieltes Training haben den Effekt auf Automation Bias signifikant reduziert. Die Teilnehmenden haben durch fehlerhafte KI im Schnitt 16 Prozent der Karzinome übersehen — egal ob mit oder ohne Erklärung.
Das sollte uns vorsichtig machen gegenüber einfachen Lösungen. Und neugierig machen auf die Frage: Was funktioniert dann?
Jetzt kommt der Teil, über den am wenigsten gesprochen wird — obwohl er für jeden von uns, der KI im Alltag nutzt, direkt relevant ist.
Wer haftet, wenn eine KI-gestützte Befundung falsch ist?
Die Antwort ist klar: Du.
Solange KI als Entscheidungsunterstützung fungiert und nicht autonom befundet, liegt die Letztverantwortung bei der Person, die den Befund unterzeichnet. Das gilt in Deutschland, das gilt in Österreich, das gilt in der Schweiz. Die Bundesärztekammer hat das 2025 noch einmal ausdrücklich bekräftigt: die ärztliche Letztverantwortung bleibt bestehen — unabhängig davon, was das System vorgeschlagen hat.
Und Automation Bias ist vor Gericht keine Entlastung.
Aber es wird noch komplizierter. Forscher der Brown University haben 2025 Mock-Jury-Studien durchgeführt — sie haben Laiengruppen mit Haftungsszenarien konfrontiert. Das Ergebnis sollte dich beunruhigen: Wenn eine KI eine Auffälligkeit gefunden hat, die die Radiologin oder der Radiologe übersehen hat, urteilten fast 75 Prozent der Juroren zugunsten des Klägers. Ohne KI lag diese Rate bei 56 Prozent.
Mit anderen Worten: KI, die Du benutzt und der Du nicht widersprichst, erhöht Dein Haftungsrisiko — nicht nur dann, wenn Du ihr folgst und sie falsch liegt, sondern auch dann, wenn sie recht hat und Du es trotzdem übersiehst.
Das ist das neue Dilemma. Du kannst KI nicht mehr ignorieren, ohne rechtliches Risiko. Aber Du kannst ihr auch nicht unkritisch folgen, ohne rechtliches Risiko. Der einzige Weg durch dieses Dilemma führt über Kompetenz. Über Deinen eigenen Blick. Über die Fähigkeit, dem System zu widersprechen — begründet, souverän, dokumentiert.
Was bedeutet das konkret für Dich — heute, in Deinem Alltag?
Meine Haltung dazu ist klar, auch wenn ich weiß, dass die Praxis das nicht immer zulässt:
Erst selbst schauen. Dann die KI nutzen.
Ich mache das selbst so. Wenn ich zum Beispiel ein lung nodule detection-Tool benutze, schaue ich zuerst eigenständig — forme mir ein Urteil, entscheide mich für einen Befund — und nutze die KI danach als Second Read. Als Sicherheitsnetz, nicht als Erstmeinung.
Warum? Weil das der einzige Weg ist, wie Du weißt, ob Du noch eigene Skills hast. Ob Dein Blick noch scharf ist. Ob Dein Urteilsvermögen noch unabhängig funktioniert.
Wenn Du die KI-Ergebnisse zuerst anschaust — oder schlimmer, wenn Du nur noch die KI-Ausgabe bestätigst — wirst Du irgendwann nicht mehr wissen, was Du ohne sie siehst. Und das ist der Moment, in dem Automation Bias aufgehört hat, ein kognitives Phänomen zu sein, und zu einem echten klinischen Risiko geworden ist.
Ich sage nicht: Nutze keine KI. Das wäre weltfremd und auch falsch — die Evidenz zeigt, dass gut implementierte KI die Detektionsrate verbessert, Intervallkarzinome reduziert, Leben rettet. Das ist real und relevant.
Aber KI ist ein Werkzeug. Kein Urteil.
Und der Unterschied zwischen einem guten Werkzeug und einer Krücke liegt darin, wer zuerst denkt.
Ausblick: Weiter- und Fortbildung
Das führt mich direkt zu einem Punkt, der mir persönlich sehr am Herzen liegt — und der weit über den individuellen Alltag hinausgeht: Aus-, Weiter- und Fortbildung.
Ich glaube, dass strukturierte Bildung in der Radiologie gerade jetzt — in diesem Moment, in dem KI in unsere Workflows einzieht — wichtiger ist als je zuvor. Nicht trotz KI. Sondern wegen KI.
Denn wenn die Gefahr des Automation Bias real ist — und das ist sie, das haben wir heute anhand von Studien gezeigt — dann ist die einzige strukturelle Antwort darauf, dass wir Radiologinnen und Radiologen ausbilden, die ihren eigenen Blick kennen. Die wissen, was sie sehen, wenn kein System daneben steht. Die in der Lage sind, einem falschen Vorschlag aktiv zu widersprechen — und zwar aus Kompetenz.
Das klingt selbstverständlich. Ist es aber nicht. Denn die nächste Frage, die sich stellt, ist noch unbequemer: Was passiert mit dieser Kompetenz, wenn KI dauerhaft im Workflow ist? Was passiert mit Assistenzärztinnen und -ärzten, die von Anfang an mit KI-Unterstützung befunden — und nie lernen, was sie ohne sie sehen?
Das ist das Thema Deskilling. Und das ist eine eigene Episode — die nächste. Denn das verdient mehr als einen Absatz.
Ich bin ehrlich: Ich glaube nicht, dass wir diese Entwicklung aufhalten können. Die Richtung ist klar. KI wird eigenständiger befunden. Der Radiologe oder die Radiologin wird in manchen Settings nur noch freigeben. Das wird kommen — vor allem dort, wo Befunde als Massenware betrachtet werden und wo der ökonomische Druck groß ist.
Das beunruhigt mich. Nicht weil ich Technik ablehne, sondern weil ich die Konsequenzen kenne. Weil ich weiß, was passiert, wenn wir aufhören, unser Urteilsvermögen zu trainieren. Und weil die rechtliche Situation diese Entwicklung nicht bremst — sie treibt sie sogar voran.
Was Du tun kannst: Deine Kompetenz schützen. Aktiv. Bewusst. Nicht weil es komfortabel ist — sondern weil es das Einzige ist, das Dir langfristig gehört.
Vor einigen Jahren stand ich auf diesem Podium und wollte genau das sagen. Und wurde dafür niedergemacht.
Heute sage ich es trotzdem. Wieder. Lauter.
Wenn Du Fragen, Gedanken oder Widerspruch hast — schreib mir. Diskutier mit. Dieses Thema braucht mehr Stimmen, nicht weniger.
Also, bis zum nächsten Mal - bleib neugierig!
Quellen
Weitere erwähnte Publikationen:
- Mosier KL, Skitka LJ. Human decision makers and automated decision aids: Made for each other? In: Parasuraman R, Mouloua M (Eds.), Automation and Human Performance. Erlbaum, 1996: 201–220.
- Mosier KL, Skitka LJ, Heers S, Burdick M. Automation bias: Decision making and performance in high-tech cockpits. Int J Aviat Psychol 1998; 8(1): 47–63.
- Chassagnon G et al. Learning from the machine: AI assistance is not an effective learning tool for resident education in chest x-ray interpretation. European Radiology 2023; 33(11): 8241–8250
- Bernstein MH et al. Can incorrect artificial intelligence (AI) results impact radiologists, and if so, what can we do about it? A multi-reader pilot study of lung cancer detection with chest radiography. European Radiology 2023
- Rezazade Mehrizi MH et al. The impact of AI suggestions on radiologists' decisions: a pilot study of explainability and attitudinal priming interventions in mammography examination. Scientific Reports 2023
- Bernstein MH et al. Randomized Study of the Impact of AI on Perceived Legal Liability for Radiologists. NEJM AI 2024/2025
- Bundesärztekammer. Stellungnahme „Künstliche Intelligenz in der Medizin.“ 2025
Andersdenken, mein Newsletter.