<?xml version="1.0" encoding="iso-8859-1" standalone="no"?>
<!DOCTYPE GmsArticle SYSTEM "http://www.egms.de/dtd/2.0.34/GmsArticle.dtd">
<GmsArticle xmlns:xlink="http://www.w3.org/1999/xlink">
  <MetaData>
    <Identifier>26gma031</Identifier>
    <IdentifierDoi>10.3205/26gma031</IdentifierDoi>
    <IdentifierUrn>urn:nbn:de:0183-26gma0315</IdentifierUrn>
    <ArticleType>Meeting Abstract</ArticleType>
    <TitleGroup>
      <Title language="de">ChatGPT vs. AMBOSS AI im Progress Test Medizin: Vergleich der Leistungsf&#228;higkeit generativer KI bei medizinischen Wissensfragen</Title>
    </TitleGroup>
    <CreatorList>
      <Creator>
        <PersonNames>
          <Lastname>Handke</Lastname>
          <LastnameHeading>Handke</LastnameHeading>
          <Firstname>Lennart</Firstname>
          <Initials>L</Initials>
        </PersonNames>
        <Address>
          <Affiliation>Universit&#228;t Bielefeld, Medizinische Fakult&#228;t OWL, Bielefeld, Deutschland</Affiliation>
        </Address>
        <Creatorrole corresponding="no" presenting="yes">author</Creatorrole>
      </Creator>
      <Creator>
        <PersonNames>
          <Lastname>Friederichs</Lastname>
          <LastnameHeading>Friederichs</LastnameHeading>
          <Firstname>Hendrik</Firstname>
          <Initials>H</Initials>
        </PersonNames>
        <Address>
          <Affiliation>Universit&#228;t Bielefeld, Medizinische Fakult&#228;t OWL, Bielefeld, Deutschland</Affiliation>
        </Address>
        <Creatorrole corresponding="no" presenting="no">author</Creatorrole>
      </Creator>
    </CreatorList>
    <PublisherList>
      <Publisher>
        <Corporation>
          <Corporatename>German Medical Science GMS Publishing House</Corporatename>
        </Corporation>
        <Address>D&#252;sseldorf</Address>
      </Publisher>
    </PublisherList>
    <SubjectGroup>
      <SubjectheadingDDB>610</SubjectheadingDDB>
    </SubjectGroup>
    <DatePublishedList>
      <DatePublished>20260904</DatePublished>
    </DatePublishedList>
    <Language>germ</Language>
    <License license-type="open-access" xlink:href="http://creativecommons.org/licenses/by/4.0/">
      <AltText language="en">This is an Open Access article distributed under the terms of the Creative Commons Attribution 4.0 License.</AltText>
      <AltText language="de">Dieser Artikel ist ein Open-Access-Artikel und steht unter den Lizenzbedingungen der Creative Commons Attribution 4.0 License (Namensnennung).</AltText>
    </License>
    <SourceGroup>
      <Meeting>
        <MeetingId>M0655</MeetingId>
        <MeetingSequence>031</MeetingSequence>
        <MeetingName>Jahrestagung der Gesellschaft f&#252;r Medizinische Ausbildung (GMA)</MeetingName>
        <MeetingTitle></MeetingTitle>
        <MeetingSession>V-06 KI &#8211; Assessment, Testing &#38; Feedback</MeetingSession>
        <MeetingCity>Dresden</MeetingCity>
        <MeetingDate>
          <DateFrom>20260917</DateFrom>
          <DateTo>20260919</DateTo>
        </MeetingDate>
      </Meeting>
    </SourceGroup>
    <ArticleNo>V-0601</ArticleNo>
  </MetaData>
  <OrigData>
    <TextBlock name="Text" linked="yes">
      <MainHeadline>Text</MainHeadline><Pgraph><Mark1>Hintergrund&#47;Fragestellung: </Mark1>Generative KI-Modelle wie ChatGPT sind l&#228;ngst im studentischen Alltag angekommen und ersetzen oder erg&#228;nzen klassische Lernressourcen wie AMBOSS <TextLink reference="1"></TextLink>, <TextLink reference="2"></TextLink>. Letztere setzen ihrerseits auf die Entwicklung von KI-Funktionen; so hat z.B. AMBOSS ein GPT auf Basis von ChatGPT ver&#246;ffentlicht (AMBOSS Medical Knowledge, nachfolgend AMBOSS AI), der die Antworten anhand der AMBOSS-Datenbank generiert. Bisherige Studien zeigen, dass generative KI medizinische Fragen auf sehr hohem Niveau beantworten kann, wobei zum Teil gro&#223;e Unterschiede zwischen den Modellen bestehen <TextLink reference="3"></TextLink>. Vor diesem Hintergrund soll die Leistungsf&#228;higkeit bei medizinischen Fragestellungen von AMBOSS AI mit der von ChatGPT verglichen werden.</Pgraph><Pgraph><Mark1>Methoden: </Mark1>Als Ma&#223;stab f&#252;r die Testung wurde der Progress Tests Medizin (PTM) verwendet, ein etabliertes Messinstrument f&#252;r das medizinische Fachwissen von Studierenden. Der Test besteht aus 200 Multiple-Choice-Fragen im <Mark2>single-best answer</Mark2>-Format. Durchgef&#252;hrt wurde die Erhebung mit der ChatGPT-App. Die Fragen wurden inkl. Antwortoptionen ohne weiteren Kontext in separaten Chats gestellt, um Lerneffekte auszuschlie&#223;en. Lediglich Folgefragen wurden in einem Chat gestellt. F&#252;r die Erhebung wurde das Modell &#8222;ChatGPT 5.2 Instant&#8220; verwendet. Die Version der AMBOSS AI wird in der App nicht spezifiziert. Die Fragen wurden einmal an beide Modelle gestellt. Bei falschen Antworten, voneinander abweichenden Antworten zwischen den Modellen und Antwortwechseln wurden die Fragen bis zu viermal gestellt (siehe Abbildung 1 <ImgLink imgNo="1" imgType="figure" />).</Pgraph><Pgraph><Mark1>Ergebnisse: </Mark1>Von den 200 Fragen wurden 195 analysiert (f&#252;nf Ausschl&#252;sse wegen falscher&#47;uneindeutiger Referenzl&#246;sungen). Beide Modelle beantworteten den gr&#246;&#223;ten Teil der Fragen richtig. Werden die initialen Antworten betrachtet, beantwortete ChatGPT 97,4&#37; (190&#47;195) und AMBOSS AI 94,9&#37; (185&#47;195) der Fragen korrekt. Der Unterschied war nicht signifikant (McNemar Test: <Mark2>p</Mark2>&#61;.18). Die Konkordanzrate betrug 95,4&#37;. Bei den wiederholt gestellten Fragen zeigten beide Modelle eine gewisse Antwortinstabilit&#228;t. Diese betraf sowohl initial falsche als auch korrekte Antworten.</Pgraph><Pgraph>Bei einer Frage konnte AMBOSS AI nicht antworten, weil die angefragte L&#246;sung nicht in der AMBOSS Datenbank verifiziert werden konnte. Neben den Antworten gab AMBOSS AI zudem Verlinkungen auf die zugeh&#246;rigen Datenbankeintr&#228;ge f&#252;r weitere Informationen aus.</Pgraph><Pgraph><Mark1>Diskussion: </Mark1>Die Ergebnisse zeigen deutlich das hohe Niveau, auf dem beide KI-Modelle antworten. Die Spezialisierung von AMBOSS AI auf eine kuratierte Wissensdatenbank f&#252;hrte entgegen der Erwartung nicht zu besseren Ergebnissen &#8211; m&#246;glicherweise, weil aktuelle allgemeine LLMs medizinisches Wissen bereits umfassend abbilden.</Pgraph><Pgraph><Mark1>Take-Home-Messages: </Mark1></Pgraph><Pgraph><UnorderedList><ListItem level="1">Sowohl ChatGPT als auch AMBOSS AI antworteten auf medizinische Wissensfragen gr&#246;&#223;tenteils korrekt.</ListItem><ListItem level="1">Lehrende und Studierende sollten die Wahl der KI vom gew&#252;nschten Anschlussverhalten (weitere dialogische Interaktion vs. Weiterlesen in einer kuratierten Wissensdatenbank) abh&#228;ngig machen.</ListItem></UnorderedList></Pgraph></TextBlock>
    <References linked="yes">
      <Reference refNo="1">
        <RefAuthor>Aster A</RefAuthor>
        <RefAuthor>Laupichler MC</RefAuthor>
        <RefAuthor>Rockwell-Kollmann T</RefAuthor>
        <RefAuthor>Masala G</RefAuthor>
        <RefAuthor>Bala E</RefAuthor>
        <RefAuthor>Raupach T</RefAuthor>
        <RefTitle>ChatGPT and Other Large Language Models in Medical Education &#8212; Scoping Literature Review</RefTitle>
        <RefYear>2025</RefYear>
        <RefJournal>Med Sci Educ</RefJournal>
        <RefPage>555-567</RefPage>
        <RefTotal>Aster A, Laupichler MC, Rockwell-Kollmann T, Masala G, Bala E, Raupach T. ChatGPT and Other Large Language Models in Medical Education &#8212; Scoping Literature Review. Med Sci Educ. 2025;35(1):555-567. DOI: 10.1007&#47;s40670-024-02206-6</RefTotal>
        <RefLink>http:&#47;&#47;dx.doi.org&#47;10.1007&#47;s40670-024-02206-6</RefLink>
      </Reference>
      <Reference refNo="2">
        <RefAuthor>Younis HA</RefAuthor>
        <RefAuthor>Eisa TA</RefAuthor>
        <RefAuthor>Nasser M</RefAuthor>
        <RefAuthor>Sahib TM</RefAuthor>
        <RefAuthor>Noor AA</RefAuthor>
        <RefAuthor>Alyasiri OM</RefAuthor>
        <RefAuthor>Salisu S</RefAuthor>
        <RefAuthor>Hayder IM</RefAuthor>
        <RefAuthor>Younis HA</RefAuthor>
        <RefTitle>A Systematic Review and Meta-Analysis of Artificial Intelligence Tools in Medicine and Healthcare: Applications, Considerations, Limitations, Motivation and Challenges</RefTitle>
        <RefYear>2024</RefYear>
        <RefJournal>Diagnostics</RefJournal>
        <RefPage>109</RefPage>
        <RefTotal>Younis HA, Eisa TA, Nasser M, Sahib TM, Noor AA, Alyasiri OM, Salisu S, Hayder IM, Younis HA. A Systematic Review and Meta-Analysis of Artificial Intelligence Tools in Medicine and Healthcare: Applications, Considerations, Limitations, Motivation and Challenges. Diagnostics. 2024;14(1):109. DOI: 10.3390&#47;diagnostics14010109</RefTotal>
        <RefLink>http:&#47;&#47;dx.doi.org&#47;10.3390&#47;diagnostics14010109</RefLink>
      </Reference>
      <Reference refNo="3">
        <RefAuthor>Hallquist E</RefAuthor>
        <RefAuthor>Gupta I</RefAuthor>
        <RefAuthor>Montalbano M</RefAuthor>
        <RefAuthor>Loukas M</RefAuthor>
        <RefTitle>Applications of Artificial Intelligence in Medical Education: A Systematic Review</RefTitle>
        <RefYear>2025</RefYear>
        <RefJournal>Cureus</RefJournal>
        <RefPage>e79878</RefPage>
        <RefTotal>Hallquist E, Gupta I, Montalbano M, Loukas M. Applications of Artificial Intelligence in Medical Education: A Systematic Review. Cureus. 2025;17(3):e79878. DOI: 10.7759&#47;cureus.79878</RefTotal>
        <RefLink>http:&#47;&#47;dx.doi.org&#47;10.7759&#47;cureus.79878</RefLink>
      </Reference>
    </References>
    <Media>
      <Tables>
        <NoOfTables>0</NoOfTables>
      </Tables>
      <Figures>
        <Figure width="617" height="287" format="png">
          <MediaNo>1</MediaNo>
          <MediaID>1</MediaID>
          <Caption><Pgraph><Mark1>Abbildung 1: Ablauf der Datenerhebung</Mark1></Pgraph></Caption>
        </Figure>
        <NoOfPictures>1</NoOfPictures>
      </Figures>
      <InlineFigures>
        <NoOfPictures>0</NoOfPictures>
      </InlineFigures>
      <Attachments>
        <NoOfAttachments>0</NoOfAttachments>
      </Attachments>
    </Media>
  </OrigData>
</GmsArticle>