Was funktioniert? Personenschätzer
Stand vor dem Umbau (PP 0.6.4-1) · Schätzer θ̂ und Standardfehler je Modell und Methode
MLE
WLE
MAP
EAP
Robust1
θ̂ SE θ̂ SE θ̂ SE2 θ̂ SE θ̂ SE3
1PL
✓
✓
✓
✓
✓
✗
Δ 0,20
✓
✓
✓
✗
Δ 0,10
2PL
✓
✓
✓
✓
✓
✗
Δ 0,21
✓
✓
✓
✗
Δ 0,08
3PL
✓
✓
⚠︎
1 von 20
4
⚠︎
1 von 20
4
✓
✗
Δ 0,37
✓
✓
✓
✗
Δ 0,12
4PL
⚠︎
1 von 20 NaN
4
✓
⚠︎
2 von 20
4
⚠︎
2 von 20
4
✓
✗
Δ 0,41
✓
✓
✓
✗
Δ 0,08
PCM
✓
✓
✓
✓
✓
✗
Δ 0,15
✓
✓
✓
⚠︎
4 von 25
GPCM
✓
✓
✓
✓
✓
✗
Δ 0,17
✓
✓
✓
✗
Δ 0,03
gemischt
⚠︎
1 von 25 NaN
4
✓
✓
✓
✓
✗
Δ 0,20
✓
✓
⚠︎
1 von 25 NaN
4
✗
Δ 0,31
1 Robust konvergiert im alten Code nur linear: Mit dem Default exac = 0.001 liegt θ̂ bis 0,003 neben der Lösung, innerhalb der Toleranz von 0,01.
2 Die Formel lässt den Prior weg, der Standardfehler ist zu groß.
3 Die Formel lässt die Huber-Gewichte weg, der Standardfehler ist zu klein.
4 Bei einzelnen Personen mit extremem Score pendelt das Newton-Verfahren oder liefert NaN, ohne Warnung.
✓ alle Personen innerhalb der Toleranz · ⚠︎ einzelne Personen falsch (höchstens 20 %) · ✗ systematisch falsch · Abbruch mit Fehlermeldung · – nicht angeboten. Δ = größte Abweichung von der Referenz.
Toleranz: 0,01 auf der θ-Skala (Schätzer, Standardfehler, EAP), 0,02 beim Jackknife, 1e-4 bei den Fit-Indizes, 4 Monte-Carlo-Standardfehler bei Plausible Values.
Messung: blog/status_daten.R, PP 0.6.4-1.9000, Commit 416224c, 06.10.2026 · Referenzen: reines R mit numerischen Ableitungen, uniroot, Posterior auf 4001 Gitterpunkten, Lehrbuch-Jackknife (tests/testthat/helper-2-reference.R) · Daten: in R simuliert, 20–25 Personen je Modell.