Leadify — AI leadership simulation platform

Der vollständige Guide zu simulationsbasierter Diagnostik

Wie simulationsbasierte Diagnostik funktioniert, warum sie Selbstauskunft und Interviews übertrifft und worauf Enterprise-Teams bei Verhaltensmessung bestehen sollten.

14 Min. Lesezeit Aktualisiert Jan. 2026
Kernaussagen
  • Simulationsbasierte Diagnostik beobachtet Verhalten in realistischen Hochdrucksituationen; meta-analytisch liegt ihre Prognosevalidität deutlich über unstrukturierten Interviews (Schmidt & Hunter, 1998; Sackett et al., 2022).
  • Die drei tragenden Schichten sind Verhaltens-Elicitation, kalibrierte Rubriken und psychometrisches Scoring — fehlt eine, wird aus Messung Meinung.
  • Moderne sprachbasierte Simulationen erreichen assessment-center-nahe Strenge bei einem Bruchteil der Kosten pro Teilnehmer:in (SIOP Practice Reviews, 2023).
  • Ein belastbarer Anbieter veröffentlicht Prognosevalidität, Adverse-Impact-Monitoring, Rater-Reliabilität und Konfidenzintervalle — nicht nur Testimonials.

Was ist simulationsbasierte Diagnostik?

Simulationsbasierte Diagnostik versetzt eine Person in eine realistische Hochdrucksituation — Kundeneinwand, Feedbackgespräch, Board Challenge — und bewertet ihr tatsächliches Verhalten an einer kalibrierten Rubrik. Sie misst beobachtetes Verhalten statt Selbstauskunft und erzeugt eine Fähigkeitsschätzung mit Konfidenzintervall.

Die Kategorie umfasst klassische Assessment-Center, videobasierte Simulationen und seit 2023 sprachbasierte adaptive Simulationen mit KI-Gegenübern. Gemeinsam ist ihnen: Verhalten im Moment ist ein stärkeres Signal für spätere Leistung als behauptetes Verhalten.

Warum sagt Simulation mehr vorher als Interviews und Persönlichkeitstests?

Unstrukturierte Interviews korrelieren meta-analytisch nur etwa r=0,20 mit Jobleistung, Selbstauskunftsinventare r=0,15–0,30. Strukturierte Arbeitsproben und Simulationen erreichen dagegen häufig r=0,50–0,60 (Schmidt & Hunter, 1998; Sackett et al., 2022). Der Unterschied ist der zwischen Raten und Messen.

Drei Mechanismen erklären den Sprung: Simulationen sind schwerer zu fälschen, adaptive Gegenüber erzeugen kontrollierten Druck, und strukturierte Rubriken begrenzen Rater-Drift stärker als Interviewnotizen.

Welche drei Säulen braucht eine belastbare Simulation?

Eine belastbare Simulation braucht Verhaltens-Elicitation, kalibrierte Rubriken und psychometrisches Scoring. Das Szenario muss das Zielverhalten hervorrufen, die Rubrik muss gegen Referenzantworten geprüft sein, und das Scoring muss Schwierigkeit und Unsicherheit quantifizieren.

1. Verhaltens-Elicitation

Das Szenario muss die Zielkompetenz wirklich erzwingen. Ein Prompt, der Ausweichen erlaubt, misst Eloquenz statt Entscheidungskompetenz.

2. Kalibrierte Rubriken

Scorepunkte werden an Referenzantworten getestet, damit menschliche und modellbasierte Rater konsistent bewerten.

3. Psychometrisches Scoring

IRT und Bayes-Updates machen unterschiedliche Szenarien vergleichbar und zeigen, wie sicher der Score ist.

Was kostet simulationsbasierte Diagnostik?

Klassische Assessment-Center liegen oft bei 2.000–8.000 US-Dollar pro Person und dauern Tage. KI-gestützte Sprachsimulationen senken die Grenzkosten typischerweise auf 5–10 % davon und können kontinuierlich laufen. Dadurch wird Verhaltensmessung für mittlere Führungsebenen skalierbar.

Der strategische Unterschied ist nicht nur Preis, sondern Taktung: aus einem jährlichen Event wird ein laufendes Capability-Signal.

Wie bewertet man Anbieter für simulationsbasierte Diagnostik?

Fragen Sie nach Validierungsdaten, Rubrik-Kalibrierung, Adverse-Impact-Monitoring, Audit-Trails und Konfidenzintervallen. Ein Anbieter, der nur eine Demo und ein Dashboard zeigt, verkauft Erlebnis. Ein Anbieter mit Messarchitektur kann erklären, warum ein Score belastbar ist.

  • Veröffentlichte oder kundenspezifische Prognosevalidität
  • Kalibrierung gegen Expert:innen-Rater und Drift-Audits
  • Konfidenzintervalle statt einzelner Punktscores
  • Auditierbarkeit bis zur konkreten Gesprächsevidenz
So macht Leadify das messbar

Die Messarchitektur hinter diesem Guide.

Lesen Sie die Methodik für Kalibrierung, Scoring und Validierung — oder buchen Sie eine Demo, um die Zahlen an Ihren eigenen Szenarien zu sehen.