Bir kamu politika analisti, illerin dijitalleşme endeksi puanlarını () açıklamak üzere, potansiyel olarak etkili olduğu düşünülen 5 farklı bağımsız değişkenin () tamamını içeren bir başlangıç modeli kurmuştur. Analist, modele girecek nihai değişkenleri seçmek için anlamlılık düzeyini kriter alan "Geriye Doğru Eleme (Backward Elimination)" algoritmasını uygulamaktadır.
Tüm değişkenlerin yer aldığı başlangıç (0. Adım) modelinde, bağımsız değişkenlerin katsayılarına ait p-değerleri aşağıdaki tabloda verilmiştir:
| Değişken | p-değeri |
|---|---|
| 0.024 | |
| 0.138 | |
| 0.710 | |
| 0.009 | |
| 0.245 |
Geriye doğru eleme algoritmasının işleyiş mantığı ve bağımsız değişkenlerin birbirleriyle olan potansiyel korelasyonları dikkate alındığında, bu modelleme süreciyle ilgili aşağıdaki ifadelerden hangisi kesinlikle doğrudur?
- Aİlk adımda, p-değeri sınırını aşan ve değişkenlerinin tamamı modelden eş zamanlı olarak çıkarılır ve algoritma sonlanır.
- İlk adımda en büyük p-değerine sahip olan modelden çıkarılır; kalan değişkenlerle tahmin edilecek yeni modelde kısmi etkiler değişebileceği için ikinci adımda 'in eleneceği garanti edilemez.Cevap
- CBaşlangıç modeline ait genel anlamlılık (F) testi istatistiksel olarak anlamlı çıkarsa, algoritma bireysel p-değerlerine bakmaksızın hiçbir değişkeni elemeden süreci tamamlar.
- DGeriye doğru eleme algoritmasında değişken çıkarılırken temel kural, modelin düzeltilmiş değerinin her adımda bir öncekine göre zorunlu olarak artış göstermesidir.
- EAlgoritmanın ilk adımında modelden çıkarıldığında diğer değişkenlerin varyanslarının etkilenmeyeceği varsayıldığından, ikinci adımda elenecek değişken şimdiden kesin olarak 'tir.
Cevap
İlk adımda en büyük p-değerine sahip olan modelden çıkarılır; ancak kalan değişkenlerle model yeniden tahmin edildiğinde kısmi etkiler ve varyanslar değişebileceğinden, ikinci adımda 'in eleneceği kesin olarak bilinemez.
Geriye doğru eleme algoritması, tüm aday değişkenlerin yer aldığı 'tam model' ile başlar. Her iterasyonda, kritik sınırın () üzerinde kalan ve p-değeri en büyük olan tek bir değişken elenir. (0.710) elendikten sonra model kalan 4 değişkenle yeniden tahmin edilmek zorundadır. Regresyonda bağımsız değişkenler genellikle birbirleriyle belli ölçüde korelasyon (çoklu bağlantı) içerdiğinden, bir değişkenin eksilmesi diğerlerinin varyans-kovaryans yapısını değiştirir. Bu da standart hataların ve t-istatistiklerinin, dolayısıyla yeni p-değerlerinin değişmesine yol açar. Bu dinamik yapı nedeniyle, bir sonraki aşamada 'in p-değerinin aynı kalacağı veya en yüksek olmaya devam edeceği garanti edilemez.
Adım Adım Çözüm
Anahtar Kavram
Geriye Doğru Eleme (Backward Elimination) Algoritmasının Dinamik İşleyişi