<?xml version="1.0" encoding="iso-8859-1" standalone="no"?>
<!DOCTYPE GmsArticle SYSTEM "http://www.egms.de/dtd/2.0.34/GmsArticle.dtd">
<GmsArticle xmlns:xlink="http://www.w3.org/1999/xlink">
  <MetaData>
    <Identifier>26gma014</Identifier>
    <IdentifierDoi>10.3205/26gma014</IdentifierDoi>
    <IdentifierUrn>urn:nbn:de:0183-26gma0148</IdentifierUrn>
    <ArticleType>Meeting Abstract</ArticleType>
    <TitleGroup>
      <Title language="de">Bewertung von Pick-N-Aufgaben: Beurteilung von Scoring-Algorithmen mittels des Finite-State-Modells</Title>
    </TitleGroup>
    <CreatorList>
      <Creator>
        <PersonNames>
          <Lastname>M&#246;ltner</Lastname>
          <LastnameHeading>M&#246;ltner</LastnameHeading>
          <Firstname>Andreas</Firstname>
          <Initials>A</Initials>
        </PersonNames>
        <Address>
          <Affiliation>Universit&#228;t Heidelberg, Medizinische Fakult&#228;t, Qualit&#228;tssicherung Pr&#252;fungen, Heidelberg, Deutschland</Affiliation>
        </Address>
        <Creatorrole corresponding="no" presenting="yes">author</Creatorrole>
      </Creator>
    </CreatorList>
    <PublisherList>
      <Publisher>
        <Corporation>
          <Corporatename>German Medical Science GMS Publishing House</Corporatename>
        </Corporation>
        <Address>D&#252;sseldorf</Address>
      </Publisher>
    </PublisherList>
    <SubjectGroup>
      <SubjectheadingDDB>610</SubjectheadingDDB>
    </SubjectGroup>
    <DatePublishedList>
      <DatePublished>20260904</DatePublished>
    </DatePublishedList>
    <Language>germ</Language>
    <License license-type="open-access" xlink:href="http://creativecommons.org/licenses/by/4.0/">
      <AltText language="en">This is an Open Access article distributed under the terms of the Creative Commons Attribution 4.0 License.</AltText>
      <AltText language="de">Dieser Artikel ist ein Open-Access-Artikel und steht unter den Lizenzbedingungen der Creative Commons Attribution 4.0 License (Namensnennung).</AltText>
    </License>
    <SourceGroup>
      <Meeting>
        <MeetingId>M0655</MeetingId>
        <MeetingSequence>014</MeetingSequence>
        <MeetingName>Jahrestagung der Gesellschaft f&#252;r Medizinische Ausbildung (GMA)</MeetingName>
        <MeetingTitle></MeetingTitle>
        <MeetingSession>V-03 Gestaltung &#38; Pr&#252;fen &#8211; Assessments &#38; Fairness</MeetingSession>
        <MeetingCity>Dresden</MeetingCity>
        <MeetingDate>
          <DateFrom>20260917</DateFrom>
          <DateTo>20260919</DateTo>
        </MeetingDate>
      </Meeting>
    </SourceGroup>
    <ArticleNo>V-0302</ArticleNo>
  </MetaData>
  <OrigData>
    <TextBlock name="Text" linked="yes">
      <MainHeadline>Text</MainHeadline><Pgraph><Mark1>Hintergrund&#47;Fragestellung: </Mark1>Pick-N-Items sind Multiple-Response-Aufgaben, bei denen aus einer Reihe <Mark2>n</Mark2> zutreffender und unzutreffender Antworten eine <Mark2>vorgegebene und bekannte Zahl</Mark2> <Mark2>k</Mark2> korrekter Antworten zu w&#228;hlen sind. Wie bei Mehrfach-Richtig-Falsch-Items (MTF) stellt sich die Frage nach dem optimalen Scoring solcher Aufgaben, wie dort ist eine Teilbepunktung zur reliableren Erfassung der Kenntnisse sinnvoll. Bauer et al. <TextLink reference="1"></TextLink> untersuchten empirisch verschiedene Bewertungsverfahren, Schmidt et al. <TextLink reference="2"></TextLink> f&#252;hren in einem Review 24 verwendete Scoring-Algorithmen auf und vergleichen sie hinsichtlich ihrer Beantwortung bei reinem Raten.</Pgraph><Pgraph><Mark1>Methoden: </Mark1>Wie in <TextLink reference="3"></TextLink> f&#252;r MTF-Items erfolgt eine Analyse auf Basis des Finite-State-Modells, welches einen f&#252;r jedes Item und f&#252;r jeden Pr&#252;fungsteilnehmer spezifischen F&#228;higkeitsparameter &#955; annimmt, der die Wahrscheinlichkeit bezeichnet, die Richtigkeit einer Antwortoption bei diesem Item zu kennen. F&#252;r das Scoring &#8222;1&#47;n Punkt f&#252;r jede richtige Antwort&#8220; (P1&#47;n), &#8222;&#189; Punkt bei einem Fehler (PS-1)&#8220;, &#8222;&#189; Punkt bei mehr als 50 &#37; (PS50-)&#8220;, &#8222;&#189; Punkt ab 50 &#37; richtiger Antworten (PS50&#43;)&#8220; und &#8222;1 Punkt nur bei vollst&#228;ndiger Beantwortung (dichotomes Scoring DS)&#8220;, sonst 0 Punkte, werden die erwarteten Scores abh&#228;ngig von &#955; sowie die aus dem Modell abzuleitende Itemreliabilit&#228;t bestimmt.</Pgraph><Pgraph>Der empirische Vergleich unterschiedlicher Scoring-Algorithmen wurde anhand von 1484 Pick-N-Fragen aus den Pr&#252;fungen der med. Fakult&#228;t Heidelberg von WS 2020&#47;21 bis WS 2025&#47;26 durchgef&#252;hrt. Die statistische Pr&#252;fung auf Unterschiede in der Trennsch&#228;rfe als indirektes Ma&#223; der Reliabilit&#228;t erfolgte mittels paarweiser Wilcoxon-Vorzeichen-Rang-Tests, welche nach Bonferroni-Holm adjustiert wurden.</Pgraph><Pgraph><Mark1>Ergebnisse: </Mark1>Die theoretische Analyse zeigt eine Abh&#228;ngigkeit der Algorithmen vom Typ des Pick-N-Items &#8222;<Mark2>k</Mark2> aus <Mark2>n</Mark2>&#8220;. Generell sind die Unterschiede zwischen PS1&#47;n, PS50&#43;, PS50- und PS50- jedoch gering, PS50- liefert zwar eine etwas geringere Reliabilit&#228;t, hat im Unterschied zu PS1&#47;n und PS50&#43; aber keine f&#252;r die &#252;bliche 60&#37;-Bestehensgrenze zu hohe Ratewahrscheinlichkeit (siehe Abbildung 1 <ImgLink imgNo="1" imgType="figure" />). DS erweist sich bei allen Vergleichen als deutlich weniger reliabel.</Pgraph><Pgraph>Die empirischen Daten stimmen mit dem Modell &#252;berein. Signifikant schlechtere Trennsch&#228;rfen als indirektes Ma&#223; f&#252;r die Itemreliabilit&#228;t ergeben sich f&#252;r das dichotome Scoring DS gegen&#252;ber allen anderen Algorithmen. PS1&#47;n und PS-1 erweisen sich als optimale Verfahren, die Unterschiede zu PS50&#43; und PS50- sind jedoch gering (siehe Abbildung 2 <ImgLink imgNo="2" imgType="figure" />).</Pgraph><Pgraph><Mark1>Diskussion: </Mark1>Die theoretischen Resultate entsprechen im Wesentlichen den empirischen Ergebnissen. Sofern f&#252;r verschiedene Typen <Mark2>k</Mark2> aus <Mark2>n</Mark2> von Pick-N-Items die selben Algorithmen verwendet werden sollen, d&#252;rfte PS-1 oder PS50- zu empfehlen sein, da beide eine akzeptable Ratewahrscheinlichkeit sowie Reliabilit&#228;t aufweisen.</Pgraph><Pgraph><Mark1>Take-Home-Message: </Mark1>Pick-N-Items sollten mit 1 Punkt bei vollst&#228;ndiger und mit &#189; Punkt bei einem Fehler oder &#189; Punkt bei mehr als 50&#37; korrekt beantworteter Optionen bewertet werden.</Pgraph></TextBlock>
    <References linked="yes">
      <Reference refNo="1">
        <RefAuthor>Bauer D</RefAuthor>
        <RefAuthor>Holzer M</RefAuthor>
        <RefAuthor>Kopp V</RefAuthor>
        <RefAuthor>Fischer MR</RefAuthor>
        <RefTitle>Pick-N multiple choice-exams: a comparison of scoring algorithms</RefTitle>
        <RefYear>2011</RefYear>
        <RefJournal>Adv Health Sci Educ Theory Pract</RefJournal>
        <RefPage>211-221</RefPage>
        <RefTotal>Bauer D, Holzer M, Kopp V, Fischer MR. Pick-N multiple choice-exams: a comparison of scoring algorithms. Adv Health Sci Educ Theory Pract. 2011;16(2):211-221. DOI: 10.1007&#47;s10459-010-9256-1</RefTotal>
        <RefLink>http:&#47;&#47;dx.doi.org&#47;10.1007&#47;s10459-010-9256-1</RefLink>
      </Reference>
      <Reference refNo="3">
        <RefAuthor>M&#246;ltner A</RefAuthor>
        <RefTitle>Bewertung von Mehrfach-Richtig-Falsch-Aufgaben: Beurteilung von Scoring-Algorithmen mittels Finite-State-Modell</RefTitle>
        <RefYear>2025</RefYear>
        <RefBookTitle>Jahrestagung der Gesellschaft f&#252;r Medizinische Ausbildung (GMA). D&#252;sseldorf, 08.-10.09.2025</RefBookTitle>
        <RefPage>DocV-07-02</RefPage>
        <RefTotal>M&#246;ltner A. Bewertung von Mehrfach-Richtig-Falsch-Aufgaben: Beurteilung von Scoring-Algorithmen mittels Finite-State-Modell. In: Jahrestagung der Gesellschaft f&#252;r Medizinische Ausbildung (GMA). D&#252;sseldorf, 08.-10.09.2025. D&#252;sseldorf: German Medical Science GMS Publishing House; 2025. DocV-07-02. DOI: 10.3205&#47;25gma049</RefTotal>
        <RefLink>https:&#47;&#47;doi.org&#47;10.3205&#47;25gma049</RefLink>
      </Reference>
      <Reference refNo="2">
        <RefAuthor>Schmidt D</RefAuthor>
        <RefAuthor>Raupach T</RefAuthor>
        <RefAuthor>Wiegand A</RefAuthor>
        <RefAuthor>Herrmann M</RefAuthor>
        <RefAuthor>Kanzow P</RefAuthor>
        <RefTitle>Relation between examinees&#8217; true knowledge and examination scores: systematic review and exemplary calculations on Pick-N items</RefTitle>
        <RefYear>2022</RefYear>
        <RefJournal>Educ Res Rev</RefJournal>
        <RefPage>100483</RefPage>
        <RefTotal>Schmidt D, Raupach T, Wiegand A, Herrmann M, Kanzow P. Relation between examinees&#8217; true knowledge and examination scores: systematic review and exemplary calculations on Pick-N items. Educ Res Rev. 2022;37:100483. DOI: 10.1016&#47;j.edurev.2022.100483</RefTotal>
        <RefLink>http:&#47;&#47;dx.doi.org&#47;10.1016&#47;j.edurev.2022.100483</RefLink>
      </Reference>
    </References>
    <Media>
      <Tables>
        <NoOfTables>0</NoOfTables>
      </Tables>
      <Figures>
        <Figure width="459" height="421" format="png">
          <MediaNo>1</MediaNo>
          <MediaID>1</MediaID>
          <Caption><Pgraph><Mark1>Abbildung 1: Zusammenhang des F&#228;higkeitsparameters und des Erwartungswerts des Scores bei Pick-N (6 aus12): Erwartungswert des Scores in in Abh&#228;ngigkeit vom F&#228;higkeitsparameter des Finite-State-Modells f&#252;r verschiedene Scoring-Algorithmen bei Pick-N-Items mit 6 zu w&#228;hlenden Antworten aus 12 Optionen.</Mark1></Pgraph></Caption>
        </Figure>
        <Figure width="512" height="470" format="png">
          <MediaNo>2</MediaNo>
          <MediaID>2</MediaID>
          <Caption><Pgraph><Mark1>Abbildung 2: Trennsch&#228;rfen in Abh&#228;ngigkeit vom Scoring-Algorithmus. Mittlere Trennsch&#228;rfen und Standardfehler des Mittelwerts der 1484 in Pr&#252;fungen verwendeten Pick-N-Items des WS 2020&#47;21 bis WS 2025&#47;26 in der med. Fakult&#228;t Heidelberg.</Mark1></Pgraph></Caption>
        </Figure>
        <NoOfPictures>2</NoOfPictures>
      </Figures>
      <InlineFigures>
        <NoOfPictures>0</NoOfPictures>
      </InlineFigures>
      <Attachments>
        <NoOfAttachments>0</NoOfAttachments>
      </Attachments>
    </Media>
  </OrigData>
</GmsArticle>