- Zufriedenheitsbögen messen Reaktion, nicht Verhaltensänderung oder Business-Wirkung.
- Kirkpatrick Level 3 — Verhalten am Arbeitsplatz — wird durch Simulation endlich skalierbar messbar.
- Cohen's d macht Entwicklungswirkung vergleichbar: klein ≈0,2, mittel ≈0,5, groß ≈0,8 (Cohen, 1988).
- Der belastbare Loop lautet: Baseline, Intervention, Nachmessung, Effektstärke mit Konfidenzintervall.
Warum sind Zufriedenheitsumfragen kein ROI?
Zufriedenheitsumfragen zeigen, ob Lernende eine Session mochten; sie zeigen nicht, ob Verhalten sich verändert hat. Alliger et al. (1997) fanden nahezu null Zusammenhang zwischen Reaktionsratings und späterer Jobleistung. Zufriedenheit als ROI zu berichten ist ein Kategorienfehler.
Sie überlebt, weil Verhaltensmessung lange teuer war. Simulation senkt diese Hürde drastisch.
Was ist Kirkpatrick Level 3 und warum zählt es jetzt?
Kirkpatrick Level 3 misst Verhaltensänderung im Job — die Ebene, die immer am wertvollsten und am schwersten messbar war (Kirkpatrick & Kirkpatrick, 2006). Simulationsbasierte Diagnostik macht Level 3 wiederholbar, weil vor und nach dem Programm dieselbe kalibrierte Rubrik genutzt wird.
Damit verschiebt sich die Budgetdiskussion von Anekdoten zu Evidenz.
Welche Effektstärke gilt als meaningful L&D-Ergebnis?
Cohen's d ist die Standardmetrik für Vorher/Nachher-Veränderung: d≈0,2 klein, d≈0,5 mittel, d≈0,8 groß (Cohen, 1988). Als Effektstärke berichtet, kann L&D Wirkung mit anderen Kapitalallokationen in einer gemeinsamen statistischen Sprache vergleichen.
Das macht Entwicklungsbudget auch in Abschwüngen verteidigungsfähig.
Wie baut man den Vorher/Nachher-Messloop auf?
Messen Sie Zielkompetenzen vor dem Programm mit kalibrierten Simulationen, führen Sie die Intervention durch, messen Sie mit denselben oder äquivalent kalibrierten Szenarien nach und berichten Sie Cohen's d pro Kompetenz mit Konfidenzintervallen auf Kohorten- und Individualebene.
- Baseline vor Programmstart
- Intervention durchführen
- Nachmessung mit gleicher oder äquivalenter Form
- Effektstärke und Konfidenzintervalle berichten
Die Messarchitektur hinter diesem Guide.
Lesen Sie die Methodik für Kalibrierung, Scoring und Validierung — oder buchen Sie eine Demo, um die Zahlen an Ihren eigenen Szenarien zu sehen.
