66. Kongress der Deutschen Gesellschaft für Handchirurgie
66. Kongress der Deutschen Gesellschaft für Handchirurgie
Multi-Run-Evaluation multimodaler KI-Systeme bei Handfrakturen: Hohe Übereinstimmung, falsche Diagnose?
Text
Fragestellung: Multimodale Large Language Models (MLLMs) werden zunehmend zur radiologischen Bildinterpretation eingesetzt. Während bisherige Studien überwiegend die diagnostische Genauigkeit untersuchen, bleibt die Reproduzierbarkeit der Modelle bei identischen Eingaben weitgehend unklar. Ziel dieser Studie war die Analyse der diagnostischen Genauigkeit und der internen Konsistenz multimodaler KI-Systeme bei der Detektion von Handfrakturen.
Methodik: 65 frakturpositive Handröntgenaufnahmen (30 Phalanx-, 30 Mittelhand- und 5 Skaphoidfrakturen) wurden mit vier multimodalen KI-Systemen analysiert (GPT-5 Pro, Gemini 2.5 Pro, Claude Sonnet 4.5, Mistral Medium 3.1). Jeder Datensatz wurde pro Modell fünfmal mit identischem Zero-shot-Prompt und ohne Gesprächskontext evaluiert (1300 Inferenzläufe). Analysiert wurden die diagnostische Genauigkeit, die Inter-Run-Reliabilität mittels Fleiss-κ sowie die frakturspezifischen Leistungsprofile.
Ergebnisse: GPT-5 Pro zeigte die höchste diagnostische Genauigkeit (64,3%) bei gleichzeitig substantieller Konsistenz (κ = 0,71). Gemini 2.5 Pro erreichte moderate Werte hinsichtlich der Genauigkeit (56,9%) und Konsistenz (κ = 0,57). Mistral Medium 3.1 zeigte trotz niedriger diagnostischer Genauigkeit (38,5%) eine nahezu perfekte Übereinstimmung zwischen den Durchläufen (κ = 0,88), was auf systematische Fehlentscheidungen hinweist. Claude Sonnet 4.5 zeigte sowohl eine geringe Genauigkeit (33,8%) als auch eine geringe Stabilität (κ = 0,33). Phalanxfrakturen wurden insgesamt zuverlässiger erkannt als Skaphoidfrakturen, die für mehrere Modelle eine deutliche Schwachstelle darstellten.
Schlussfolgerung: Diagnostische Genauigkeit und Reproduzierbarkeit sind unterschiedliche Leistungsdimensionen multimodaler KI-Systeme. Eine hohe interne Konsistenz bedeutet nicht zwangsläufig eine korrekte diagnostische Leistung. Aktuelle MLLMs zeigen relevante Limitationen in der handchirurgischen Frakturdiagnostik und sollten derzeit nicht als verlässliche Stand-alone-Systeme eingesetzt werden. Die Bewertung zukünftiger KI-Systeme sollte neben der Genauigkeit auch die Stabilität und Reproduzierbarkeit der Modellantworten berücksichtigen.



