Bir meteoroloji enstitüsünde görevli bir veri bilimci, gün sonu hava durumunu "Açık", "Bulutlu" ve "Yağışlı" olmak üzere üç farklı kategoriye ayırmak amacıyla 10 farklı atmosferik ölçüm değişkenini kullanarak bir sınıflandırma modeli kurmak istemektedir. Değişken sayısını optimize etmek için analize adım adım (stepwise) diskriminant analizi uygulanmıştır.
Analiz sürecinde modele birinci adımda "Bağıl Nem", ikinci adımda "Rüzgâr Hızı" ve üçüncü adımda "Hava Basıncı" dâhil edilmiştir. Ancak dördüncü adıma gelindiğinde, algoritma daha önce modele girmiş olan "Rüzgâr Hızı" değişkenini modelden çıkarmıştır.
Buna göre, adım adım diskriminant analizinde "Rüzgâr Hızı" değişkeninin dördüncü adımda modelden çıkarılmasının temel istatistiksel gerekçesi ve bu işlemin modelin **Wilks' Lambda () istatistiği** üzerindeki beklenen etkisi aşağıdakilerin hangisinde doğru açıklanmıştır?
- "Rüzgâr Hızı"nın modele sağladığı benzersiz ayırma katkısını ölçen kısmi F-istatistiği, "Hava Basıncı"nın modele girmesiyle çıkarma eşiğinin (F-to-remove) altına inmiştir; bu çıkarma işlemi sonucunda modelin genel Wilks' Lambda değerinde istatistiksel olarak anlamlı bir büyüme (kötüleşme) olması beklenmez.Answer
- B"Rüzgâr Hızı"nın çıkarılmasıyla modeldeki değişken sayısı azaltılarak Wilks' Lambda değerinin 1'e daha fazla yaklaşması hedeflenmiştir; çünkü Wilks' Lambda değerinin 1'e yaklaşması, sınıflar arası ayırma gücünün arttığını ve modelin iyileştiğini gösterir.
- CÜçüncü adımda "Hava Basıncı"nın modele dâhil edilmesiyle kategorik hava durumu sınıfları algoritma tarafından sürekli bir yapıya dönüştürülmüş, "Rüzgâr Hızı" bu yeni sürekli bağımlı değişkene uyum sağlayamadığı için analizden dışlanmıştır.
- D"Rüzgâr Hızı" değişkeni, diğer ölçümlerle birlikte oluşturduğu korelasyon matrisinde en yüksek özdeğere ulaşmış ve toplam açıklanan varyansı tek başına domine ettiği için, modeldeki dengesizliği önlemek adına adım adım algoritma tarafından uzaklaştırılmıştır.
- E"Rüzgâr Hızı" modelde kaldığında sınıflandırma matrisinin köşegenlerinde yer alan doğru sınıflandırma oranları düşmüş, beklenen hata oranı öncelik olasılıkları dikkate alınmadan sıfıra yaklaştığı için algoritma bu değişkeni tutmayı reddetmiştir.