Leadify — AI leadership simulation platform
Leadify değerlendirme motoru

Davranışı ölçmenin bilimi.

Her Leadify skoru bir LLM yorumu değil, kalibre psikometrik motorun çıktısıdır. Bu sayfa nasıl olduğunu tam olarak anlatır.

Değerlendirme motoru · v3.2 kalibre
  • Canlı konuşmasinyal girişi
  • IRT kalibreli rubrikβ = 1,24
  • Bayesyen güncellemeθ = 0,72
  • Doğrulanmış kayıtSEM ±0,11
Yaklaşım

İnsanların ne yapacaklarını söylediklerini değil, ne yaptıklarını ölçüyoruz.

Davranış örneklemi · N = 1
θ posterior 0.7295% CI [0.61, 0.83]
Dört sütun

Motor, konuşmayı nasıl kanıta dönüştürüyor.

Sütun 01

Davranışı Tetikleme

Senaryoları belirli yetkinlikleri gerçekçi baskı altında ortaya çıkaracak biçimde tasarlarız. Her senaryoyu deneyimli uygulayıcılarla birlikte kurgular ve tanımlı bir yetkinlik modeline eşleriz; böylece konuşmanın her anının bir ölçüm amacı olur.

Yetkinliğe eşliUyum sağlayan baskıUygulayıcı tasarımı
Sütun 02

Kalibre Puanlama (IRT)

Puanları Madde Tepki Kuramı (IRT) ile kalibre ederiz — GRE ve GMAT’in arkasındaki psikometrik çerçevenin aynısı. Her senaryo bir güçlük parametresi (β) ve ayırt edicilik parametresi (α) taşır; zor senaryodaki 75, kolay senaryodaki 75’ten daha fazla anlam taşır.

β güçlükα ayırt edicilikSenaryolar arası karşılaştırılabilir
Sütun 03

Bayesyen Yetenek Tahmini

Tek bir konuşma örnektir, yargı değil. Leadify Bayesyen güncelleme kullanır: her seans yetenek tahminini (θ) açık bir güven aralığıyla keskinleştirir. Size yalnızca skoru değil, ondan ne kadar emin olduğumuzu da gösteririz — kanıt arttıkça kesinlik büyür.

θ tahminiGüven aralıklarıKanıt ağırlıklı
Sütun 04

Sürekli Doğrulama

Motoru gerçek sonuçlara karşı geriye dönük test ederiz: terfi kararları, elde tutma, performans notları, gelir hedefine ulaşma. Davranış veri seti büyüdükçe senaryo parametrelerini yeniden kalibre ederiz.

Sonuç bağlantılıSürekli yeniden kalibrasyonYan etki izlemesi
Puanlama hattı

Canlı konuşmadan doğrulanmış davranış kaydına.

  1. Adım 01

    Canlı konuşma

    Katılımcı, gerçekçi ve uyum sağlayan bir senaryoda AI karakterle etkileşime girer.

  2. Adım 02

    Davranış sinyali çıkarımı

    Sözel ve sözel ötesi belirteçler transkript ve sesten yakalanır.

  3. Adım 03

    Rubrik puanlaması

    Çok boyutlu, kalibre rubrikler; öz beyanı değil, gözlemlenebilir davranışı puanlar.

  4. Adım 04

    IRT düzeltmesi

    Güçlük ve ayırt edicilik parametreleri skoru senaryoya göre ağırlıklandırır.

  5. Adım 05

    Bayesyen güncelleme

    Yetenek tahmini (θ) açık bir güven aralığıyla keskinleşir.

  6. Adım 06

    Doğrulanmış davranış kaydı

    Her skor, onu üreten spesifik konuşma kanıtına kadar izlenebilir.

Doğrulanmış davranış verisi

"Doğrulanmış" tam olarak ne demek?

Her skor arkasında durabileceğimiz bir iddiadır — bir CHRO’ya, bir yönetim kuruluna ya da bir denetçiye karşı.

0.00
Öngörü geçerliği (r)
0%
Değerlendiriciler arası uyum
0%
Kanıta izlenebilir
  • Gözlemlenmiş, öz beyan değilher veri noktası canlı davranıştan gelir.

  • Standartaynı senaryo, aynı karakter, aynı rubrik — herkes için.

  • Kalibreskorlar karşılaştırılabilir olacak biçimde güçlüğe göre ayarlanır.

  • Sınırları belirliher skor açık bir güven aralığı taşır.

  • Denetlenebilirher skor, spesifik bir konuşma kanıtına kadar izlenebilir.

Standartlar

Profesyonel değerlendirme standartlarına göre inşa edildi.

Standards for Educational and Psychological Testing (AERA, APA, NCME) ve SIOP’un Principles for the Validation and Use of Personnel Selection Procedures rehberleriyle uyumlu olarak tasarladık.

APA StandartlarıSIOP İlkeleriGDPRKVKKSOC 2 (süreçte)
Seçilmiş araştırma kaynakları
  • Schmidt, F. L., & Hunter, J. E. (1998). The validity and utility of selection methods in personnel psychology. Psychological Bulletin, 124(2), 262–274.
  • Sackett, P. R., Zhang, C., Berry, C. M., & Lievens, F. (2022). Revisiting meta-analytic estimates of validity in personnel selection. Journal of Applied Psychology, 107(11), 2040–2068.
  • Lord, F. M. (1980). Applications of Item Response Theory to Practical Testing Problems. Lawrence Erlbaum Associates.
  • Arthur, W., Day, E. A., McNelly, T. L., & Edens, P. S. (2003). A meta-analysis of the criterion-related validity of assessment center dimensions. Personnel Psychology, 56(1), 125–153.
  • Cohen, J. (1988). Statistical Power Analysis for the Behavioral Sciences (2nd ed.). Lawrence Erlbaum Associates.
  • Phillips, J. J. (2003). Return on Investment in Training and Performance Improvement Programs (2nd ed.). Butterworth-Heinemann.
SSS

Doğrudan cevaplar.

Klasik değerlendirme merkezleri yüksek öngörü geçerliği sunar ama kişi başı 3.000–8.000 dolara mal olur ve yılda bir kez uygulanır. Leadify aynı sınıf davranış kanıtını AI simülasyonuyla sunar — istendiğinde, çok daha düşük maliyetle, psikometrik kalibrasyon dahil.
Hayır. Leadify güven aralıklarıyla birlikte davranışsal kanıt üretir. Kararı insanlar verir; Leadify o kararı daha iyi bilgilendirir.
Her rubrik kullanıma alınmadan önce uzman insan değerlendiricilere karşı kalibre edilir ve değerlendiriciler arası güvenirlik sürekli izlenir. Skorlar açık güven aralıkları taşır; kanıt zayıfsa aralık genişler, seans arttıkça daralır. İnsan değerlendiriciler her senaryo grubundan rastgele bir örneklemi denetler; uyuşmazlıklar rubriğin yeniden kalibrasyonuna girer.
Kişinin öz beyan anketinde ne yapacağını söylediğini değil, gerçekçi bir yeniden kurguda nasıl davrandığını ölçen yöntemdir. Değerlendirme merkezi geleneğinin modern, ölçeklenebilir hâlidir: gözlemlenebilir davranış kalibre bir rubriğe göre puanlanır.
Her senaryo ve rubriği demografik gruplar arasında olumsuz etki açısından izleriz. Kalibrasyon verisini, değerlendirici uyumunu ve skor dağılımlarını düzenli gözden geçiririz; farklı işleyiş için işaretlenen her maddeyi yeniden kalibre eder ya da hizmetten kaldırırız. Her skor, üretildiği spesifik konuşma kanıtına kadar denetlenebilir.
SınırlarDeğerlendirme Motoru · Kalibre · v2.13

Değerlendirme Motoru'nun yapmadığı şeyler.

En savunulabilir değerlendirme sağlayıcıları, sınırlarını açıkça söyleyenlerdir. Aşağıdaki her ifade, Leadify'ın yapmayı reddettiği bir iddiadır.

  • İşe alım kararlarını biz vermeyiz.

    Kararı insan verir. Leadify davranışsal kanıt üretir; terfi, işe alım ya da yedekleme kararı sorumlu karar vericiye aittir.

  • Kişilik puanlamıyoruz.

    Standart baskı altında gözlemlenebilir davranışı ölçeriz. Çıkarımsal özellik, kişilik tipolojisi ya da kara kutu arketip yok.

  • Sahip olmadığımız kesinliği iddia etmiyoruz.

    Her skor kendi güven aralığını taşır. Kanıt inceldikçe aralık genişler ve rapor bunu açıkça söyler — finansın ve yönetim kurulunun zaten okuduğu sayısal dilde.

Kurumsal dosya

Tam teknik dokümantasyonu ister misiniz?

Ekibimiz her müşterinin I/O psikoloji ve satın alma ekibini motorun içinden geçirir — kalibrasyon verisi, doğrulama çalışmaları, adalet izlemesi ve denetim kayıtlarıyla.