Was funktioniert? Jackknife, Plausible Values, Personenfit
Stand vor dem Umbau (PP 0.6.4-1) · je Funktion und Modell
2PL PCM GPCM gemischt
Jackknife · JKpp()
Leave-one-out-Schätzer (WLE)
✓
✓
✓
✓
JK-Schätzer (WLE)
✓
✓
✓
✓
JK-Standardfehler (WLE)1
✗
Δ 1,40
✗
Δ 0,80
✗
Δ 1,23
✗
Δ 1,46
JK-Schätzer (EAP)
✓
✓
✓
Abbruch
2
Plausible Values · PV()
Ziehung aus dem Posterior3,4
✗
Δ 0,03
✗
Δ 0,02
✗
Δ 0,03
✗
Δ 0,03
Normal-Approximation (EAP-Objekt)
✓
✓
✓
✓
Personenfit · Pfit() an der WLE
lz
✓
–
–
Abbruch
5
lz*
✓
–
–
Abbruch
5
Infit/Outfit
✓
✓
✗
Δ 1,17
6
Abbruch
5
Simulation · sim_4pl(), sim_gpcm()
Häufigkeiten wie im Modell
✓
✓
✓
–
1 Falsche Jackknife-Formel: Der Standardfehler ist um den Faktor L − 1 zu klein.
2 Bricht für gemischte Tests mit EAP ab.
3 Eine Antwortfolge 2000-mal repliziert, 20 Draws je Person; verglichen werden Mittelwert und SD der Draws mit dem exakten Posterior.
4 Der Sampler streut breiter als der Posterior.
5 Für gemischte Tests gibt es keine Fit-Funktion.
6 Rechnet mit Slope 1 statt mit den Slopes der Items.
✓ alle Personen innerhalb der Toleranz · ⚠︎ einzelne Personen falsch (höchstens 20 %) · ✗ systematisch falsch · Abbruch mit Fehlermeldung · – nicht angeboten. Δ = größte Abweichung von der Referenz.
Toleranz: 0,01 auf der θ-Skala (Schätzer, Standardfehler, EAP), 0,02 beim Jackknife, 1e-4 bei den Fit-Indizes, 4 Monte-Carlo-Standardfehler bei Plausible Values.
Messung: blog/status_daten.R, PP 0.6.4-1.9000, Commit 416224c, 06.10.2026 · Referenzen: reines R mit numerischen Ableitungen, uniroot, Posterior auf 4001 Gitterpunkten, Lehrbuch-Jackknife (tests/testthat/helper-2-reference.R) · Daten: in R simuliert, 20–25 Personen je Modell.