| Was funktioniert? Jackknife, Plausible Values, Personenfit | ||||
| Stand vor dem Umbau (PP 0.6.4-1) · je Funktion und Modell | ||||
| 2PL | PCM | GPCM | gemischt | |
|---|---|---|---|---|
| Jackknife · JKpp() | ||||
| Leave-one-out-Schätzer (WLE) | ✓
|
✓
|
✓
|
✓
|
| JK-Schätzer (WLE) | ✓
|
✓
|
✓
|
✓
|
| JK-Standardfehler (WLE)1 | ✗
Δ 1,40 |
✗
Δ 0,80 |
✗
Δ 1,23 |
✗
Δ 1,46 |
| JK-Schätzer (EAP) | ✓
|
✓
|
✓
|
Abbruch
2 |
| Plausible Values · PV() | ||||
| Ziehung aus dem Posterior3,4 | ✗
Δ 0,03 |
✗
Δ 0,02 |
✗
Δ 0,03 |
✗
Δ 0,03 |
| Normal-Approximation (EAP-Objekt) | ✓
|
✓
|
✓
|
✓
|
| Personenfit · Pfit() an der WLE | ||||
| lz | ✓
|
–
|
–
|
Abbruch
5 |
| lz* | ✓
|
–
|
–
|
Abbruch
5 |
| Infit/Outfit | ✓
|
✓
|
✗
6Δ 1,17 |
Abbruch
5 |
| Simulation · sim_4pl(), sim_gpcm() | ||||
| Häufigkeiten wie im Modell | ✓
|
✓
|
✓
|
–
|
| 1 Falsche Jackknife-Formel: Der Standardfehler ist um den Faktor L − 1 zu klein. | ||||
| 2 Bricht für gemischte Tests mit EAP ab. | ||||
| 3 Eine Antwortfolge 2000-mal repliziert, 20 Draws je Person; verglichen werden Mittelwert und SD der Draws mit dem exakten Posterior. | ||||
| 4 Der Sampler streut breiter als der Posterior. | ||||
| 5 Für gemischte Tests gibt es keine Fit-Funktion. | ||||
| 6 Rechnet mit Slope 1 statt mit den Slopes der Items. | ||||
| ✓ alle Personen innerhalb der Toleranz · ⚠︎ einzelne Personen falsch (höchstens 20 %) · ✗ systematisch falsch · Abbruch mit Fehlermeldung · – nicht angeboten. Δ = größte Abweichung von der Referenz. | ||||
| Toleranz: 0,01 auf der θ-Skala (Schätzer, Standardfehler, EAP), 0,02 beim Jackknife, 1e-4 bei den Fit-Indizes, 4 Monte-Carlo-Standardfehler bei Plausible Values. | ||||
Messung: blog/status_daten.R, PP 0.6.4-1.9000, Commit 416224c, 06.10.2026 · Referenzen: reines R mit numerischen Ableitungen, uniroot, Posterior auf 4001 Gitterpunkten, Lehrbuch-Jackknife (tests/testthat/helper-2-reference.R) · Daten: in R simuliert, 20–25 Personen je Modell. |
||||