Logo

66. Kongress der Deutschen Gesellschaft für Handchirurgie

Deutsche Gesellschaft für Handchirurgie
08.-10.10.2026
Bremen

Meeting Abstract

Diagnostische Leistungsfähigkeit von Vision-Language-Modellen zur Detektion akuter Hand- und Handgelenksfrakturen im Röntgen

Johanna Thiele - Orthopädie und Unfallchirurgie, Universitätsklinikum Bonn, Bonn, Deutschland
Jonas Roos - Orthopädie und Unfallchirurgie, Universitätsklinikum Bonn, Bonn, Deutschland
Christian Prangenberg - Orthopädie und Unfallchirurgie, Universitätsklinikum Bonn, Bonn, Deutschland
Kristian Welle - Orthopädie und Unfallchirurgie, Universitätsklinikum Bonn, Bonn, Deutschland
Robert Kaczmarczyk - Klinik und Poliklinik für Dermatologie und Allergologie am Biederstein TU München, München, Deutschland
Stefan Weber - Klinik für Plastische und Handchirurgie, Brandverletztenzentrum, BG Klinikum Bergmannstrost Halle, Halle (Saale), Deutschland
Ron Martin - Klinik für Plastische und Handchirurgie, Brandverletztenzentrum, BG Klinikum Bergmannstrost Halle, Halle (Saale), Deutschland

Text

Fragestellung: Frakturen der Hand und des Handgelenks gehören zu den häufigsten traumatologischen Verletzungen in der klinischen Praxis. Ihre radiologische Diagnostik kann aufgrund subtiler Befunde und variabler Befunderfahrung anspruchsvoll sein. Aktuelle Vision–Language-Modelle (VLMs) stellen einen vielversprechenden Ansatz zur automatisierten Interpretation radiologischer Bildgebung dar. Durch standardisierte, radiologisch strukturierte Prompts könnten sie die Frakturdetektion unterstützen. Die diagnostische Leistungsfähigkeit dieser Modelle in der muskuloskelettalen Traumatologie ist bislang jedoch unzureichend untersucht.

Ziel dieser Studie war Evaluation der diagnostischen Leistungsfähigkeit moderner VLMs bei der Detektion akuter Frakturen an Hand- und Handgelenksröntgenaufnahmen unter Verwendung eines standardisierten, radiologisch strukturierten Prompts.

Methodik: In einer retrospektiven Analyse wurden 662 Röntgenaufnahmen von Hand und Handgelenk ausgewertet. Sechs VLMs (GPT-5, MedGemma-27B, Gemini 2.5 Pro, Qwen3-VL, Lingshu-32B und Claude Sonnet) wurden mittels eines identischen strukturierten Prompts untersucht. Dieser umfasste die Beurteilung von Frakturvorhandensein, Anzahl der Frakturen, Lokalisation sowie Frakturcharakteristika wie Dislokation, Mehrfragmentierung und Gelenkbeteiligung. Als Referenzstandard dienten radiologische Expertenbefunde. Die Auswertung erfolgte anhand Erhebung metrischer Daten wie des F1-Scores, der Accuracy, der Sensitivität und der Spezifität.

Ergebnisse: GPT-5 zeigte die beste Gesamtleistung in der Frakturdetektion (F1 = 0,66; Accuracy = 0,73; Sensitivität = 0,81; Spezifität = 0,85). MedGemma-27B und Gemini 2.5 Pro erreichten leicht geringere, aber robuste Ergebnisse (F1 = 0,64 bzw. 0,63), gefolgt von Qwen3-VL (F1 = 0,62). Die knochenbezogene Lokalisation war bei allen Modellen eingeschränkt (F1 ≈ 0,09–0,37). Lingshu-32B und Claude Sonnet lieferten kaum diagnostisch verwertbare Ergebnisse (F1 ≤ 0,02). Modelle mit hoher Sensitivität zeigten häufig eine reduzierte Spezifität, was auf eine Tendenz zur Überdiagnose hinweist.

Schlussfolgerung: Moderne Vision–Language-Modelle zeigen unter Verwendung eines standardisierten, radiologisch fundierten Prompts eine vielversprechende Leistungsfähigkeit in der Detektion akuter Frakturen an Hand und Handgelenk. Die ausgeprägte Variabilität zwischen den Modellen sowie die eingeschränkte anatomische Lokalisation verdeutlichen jedoch den Bedarf weiterer Validierungsstudien vor einer routinemäßigen klinischen Anwendung. Derzeit erscheint ein Einsatz als Triage- oder Entscheidungsunterstützungssystem sinnvoll.