Logo

Jahrestagung der Gesellschaft für Medizinische Ausbildung (GMA)


17.-19.09.2026
Dresden

Meeting Abstract

ChatGPT vs. AMBOSS AI im Progress Test Medizin: Vergleich der Leistungsfähigkeit generativer KI bei medizinischen Wissensfragen

Lennart Handke - Universität Bielefeld, Medizinische Fakultät OWL, Bielefeld, Deutschland
Hendrik Friederichs - Universität Bielefeld, Medizinische Fakultät OWL, Bielefeld, Deutschland

Text

Hintergrund/Fragestellung: Generative KI-Modelle wie ChatGPT sind längst im studentischen Alltag angekommen und ersetzen oder ergänzen klassische Lernressourcen wie AMBOSS [1], [2]. Letztere setzen ihrerseits auf die Entwicklung von KI-Funktionen; so hat z.B. AMBOSS ein GPT auf Basis von ChatGPT veröffentlicht (AMBOSS Medical Knowledge, nachfolgend AMBOSS AI), der die Antworten anhand der AMBOSS-Datenbank generiert. Bisherige Studien zeigen, dass generative KI medizinische Fragen auf sehr hohem Niveau beantworten kann, wobei zum Teil große Unterschiede zwischen den Modellen bestehen [3]. Vor diesem Hintergrund soll die Leistungsfähigkeit bei medizinischen Fragestellungen von AMBOSS AI mit der von ChatGPT verglichen werden.

Methoden: Als Maßstab für die Testung wurde der Progress Tests Medizin (PTM) verwendet, ein etabliertes Messinstrument für das medizinische Fachwissen von Studierenden. Der Test besteht aus 200 Multiple-Choice-Fragen im single-best answer-Format. Durchgeführt wurde die Erhebung mit der ChatGPT-App. Die Fragen wurden inkl. Antwortoptionen ohne weiteren Kontext in separaten Chats gestellt, um Lerneffekte auszuschließen. Lediglich Folgefragen wurden in einem Chat gestellt. Für die Erhebung wurde das Modell „ChatGPT 5.2 Instant“ verwendet. Die Version der AMBOSS AI wird in der App nicht spezifiziert. Die Fragen wurden einmal an beide Modelle gestellt. Bei falschen Antworten, voneinander abweichenden Antworten zwischen den Modellen und Antwortwechseln wurden die Fragen bis zu viermal gestellt (siehe Abbildung 1 [Abb. 1]).

Abbildung 1: Ablauf der Datenerhebung

Ergebnisse: Von den 200 Fragen wurden 195 analysiert (fünf Ausschlüsse wegen falscher/uneindeutiger Referenzlösungen). Beide Modelle beantworteten den größten Teil der Fragen richtig. Werden die initialen Antworten betrachtet, beantwortete ChatGPT 97,4% (190/195) und AMBOSS AI 94,9% (185/195) der Fragen korrekt. Der Unterschied war nicht signifikant (McNemar Test: p=.18). Die Konkordanzrate betrug 95,4%. Bei den wiederholt gestellten Fragen zeigten beide Modelle eine gewisse Antwortinstabilität. Diese betraf sowohl initial falsche als auch korrekte Antworten.

Bei einer Frage konnte AMBOSS AI nicht antworten, weil die angefragte Lösung nicht in der AMBOSS Datenbank verifiziert werden konnte. Neben den Antworten gab AMBOSS AI zudem Verlinkungen auf die zugehörigen Datenbankeinträge für weitere Informationen aus.

Diskussion: Die Ergebnisse zeigen deutlich das hohe Niveau, auf dem beide KI-Modelle antworten. Die Spezialisierung von AMBOSS AI auf eine kuratierte Wissensdatenbank führte entgegen der Erwartung nicht zu besseren Ergebnissen – möglicherweise, weil aktuelle allgemeine LLMs medizinisches Wissen bereits umfassend abbilden.

Take-Home-Messages:

  • Sowohl ChatGPT als auch AMBOSS AI antworteten auf medizinische Wissensfragen größtenteils korrekt.
  • Lehrende und Studierende sollten die Wahl der KI vom gewünschten Anschlussverhalten (weitere dialogische Interaktion vs. Weiterlesen in einer kuratierten Wissensdatenbank) abhängig machen.

Literatur

[1] Aster A, Laupichler MC, Rockwell-Kollmann T, Masala G, Bala E, Raupach T. ChatGPT and Other Large Language Models in Medical Education — Scoping Literature Review. Med Sci Educ. 2025;35(1):555-567. DOI: 10.1007/s40670-024-02206-6
[2] Younis HA, Eisa TA, Nasser M, Sahib TM, Noor AA, Alyasiri OM, Salisu S, Hayder IM, Younis HA. A Systematic Review and Meta-Analysis of Artificial Intelligence Tools in Medicine and Healthcare: Applications, Considerations, Limitations, Motivation and Challenges. Diagnostics. 2024;14(1):109. DOI: 10.3390/diagnostics14010109
[3] Hallquist E, Gupta I, Montalbano M, Loukas M. Applications of Artificial Intelligence in Medical Education: A Systematic Review. Cureus. 2025;17(3):e79878. DOI: 10.7759/cureus.79878