Soru

Zorluk: ZorGeriye Doğru Eleme Yöntemi (Backward Elimination)

Bir kamu politika analisti, illerin dijitalleşme endeksi puanlarını (YY) açıklamak üzere, potansiyel olarak etkili olduğu düşünülen 5 farklı bağımsız değişkenin (X1,X2,X3,X4,X5X_1, X_2, X_3, X_4, X_5) tamamını içeren bir başlangıç modeli kurmuştur. Analist, modele girecek nihai değişkenleri seçmek için α=0.05\alpha = 0.05 anlamlılık düzeyini kriter alan "Geriye Doğru Eleme (Backward Elimination)" algoritmasını uygulamaktadır.

Tüm değişkenlerin yer aldığı başlangıç (0. Adım) modelinde, bağımsız değişkenlerin katsayılarına ait p-değerleri aşağıdaki tabloda verilmiştir:

Değişkenp-değeri
X1X_10.024
X2X_20.138
X3X_30.710
X4X_40.009
X5X_50.245

Geriye doğru eleme algoritmasının işleyiş mantığı ve bağımsız değişkenlerin birbirleriyle olan potansiyel korelasyonları dikkate alındığında, bu modelleme süreciyle ilgili aşağıdaki ifadelerden hangisi kesinlikle doğrudur?

  1. A
    İlk adımda, p-değeri α=0.05\alpha = 0.05 sınırını aşan X2,X3X_2, X_3 ve X5X_5 değişkenlerinin tamamı modelden eş zamanlı olarak çıkarılır ve algoritma sonlanır.
  2. İlk adımda en büyük p-değerine sahip olan X3X_3 modelden çıkarılır; kalan değişkenlerle tahmin edilecek yeni modelde kısmi etkiler değişebileceği için ikinci adımda X5X_5'in eleneceği garanti edilemez.Cevap
  3. C
    Başlangıç modeline ait genel anlamlılık (F) testi istatistiksel olarak anlamlı çıkarsa, algoritma bireysel p-değerlerine bakmaksızın hiçbir değişkeni elemeden süreci tamamlar.
  4. D
    Geriye doğru eleme algoritmasında değişken çıkarılırken temel kural, modelin düzeltilmiş R2R^2 değerinin her adımda bir öncekine göre zorunlu olarak artış göstermesidir.
  5. E
    Algoritmanın ilk adımında X3X_3 modelden çıkarıldığında diğer değişkenlerin varyanslarının etkilenmeyeceği varsayıldığından, ikinci adımda elenecek değişken şimdiden kesin olarak X5X_5'tir.

Cevap

İlk adımda en büyük p-değerine sahip olan X3X_3 modelden çıkarılır; ancak kalan değişkenlerle model yeniden tahmin edildiğinde kısmi etkiler ve varyanslar değişebileceğinden, ikinci adımda X5X_5'in eleneceği kesin olarak bilinemez.
Geriye doğru eleme algoritması, tüm aday değişkenlerin yer aldığı 'tam model' ile başlar. Her iterasyonda, kritik sınırın (α=0.05\alpha=0.05) üzerinde kalan ve p-değeri en büyük olan tek bir değişken elenir. X3X_3 (0.710) elendikten sonra model kalan 4 değişkenle yeniden tahmin edilmek zorundadır. Regresyonda bağımsız değişkenler genellikle birbirleriyle belli ölçüde korelasyon (çoklu bağlantı) içerdiğinden, bir değişkenin eksilmesi diğerlerinin varyans-kovaryans yapısını değiştirir. Bu da standart hataların ve t-istatistiklerinin, dolayısıyla yeni p-değerlerinin değişmesine yol açar. Bu dinamik yapı nedeniyle, bir sonraki aşamada X5X_5'in p-değerinin aynı kalacağı veya en yüksek olmaya devam edeceği garanti edilemez.

Adım Adım Çözüm

1
Başlangıç modelindeki p-değerlerini incele ve algoritmanın ilk kuralını uygula.
En büyük p-değerine sahip olan X3X_3 (0.710 > 0.05) tespit edilir ve ilk adımda sadece bu değişken modelden çıkarılır.
Geriye doğru eleme yöntemi, her adımda sadece istatistiksel olarak en anlamsız (p-değeri en yüksek) tek bir değişkeni eler.
2
Değişken çıkarıldıktan sonra modelin yeni durumunu değerlendir.
Model geriye kalan 4 değişken (X1,X2,X4,X5X_1, X_2, X_4, X_5) ile yeniden tahmin edilir.
Bir değişkenin çıkarılması, çoklu doğrusal regresyonda model spesifikasyonunu değiştirir.
3
Yeniden tahminin kalan değişkenlerin p-değerleri üzerindeki etkisini analiz et.
Değişkenler arasındaki olası korelasyonlar nedeniyle, kalan 4 değişkenin standart hataları ve t-istatistikleri değişir.
Çoklu bağlantının varlığında, değişkenlerin kısmi etkileri birbirine bağlıdır. Bu sebeple başlangıçta 0.245 olan X5X_5'in p-değeri yeni modelde düşebilir veya yükselebilir; dolayısıyla ikinci adımda kimin eleneceği süreci yaşanmadan kesin olarak bilinemez.

Anahtar Kavram

Geriye Doğru Eleme (Backward Elimination) Algoritmasının Dinamik İşleyişi
Bu soruyu puanla