Bir halk sağlığı uzmanı, ilçelerdeki hastane doluluk oranlarını () açıklamak için 8 potansiyel bağımsız değişkenle doğrusal regresyon analizi yapmaktadır. Uzman üç farklı model kurmuş ve aşağıdaki tanısal bulguları elde etmiştir:
- Model I: Tümü (8 değişken) modele dâhil edilmiştir. , Düzeltilmiş . Artıkların (kalıntıların) tahmin edilen değerlere göre çizilen saçılım grafiğinde belirgin bir "huni (funnel)" biçimi gözlenmiştir.
- Model II: Adımsal (stepwise) regresyon ile 4 değişken seçilmiştir. , Düzeltilmiş . Artıklar rastgele dağılmakla birlikte, modele ait bir gözlemin Cook Uzaklığı (Cook's Distance) olarak hesaplanmıştır.
- Model III: Geriye doğru eleme (backward elimination) ile 5 değişken seçilmiştir. , Düzeltilmiş . Artıklar rastgele dağılmakta ve tüm gözlemlerin Cook Uzaklığı düzeyindedir.
Buna göre, bu modellerin geçerliliği ve seçimi konusunda aşağıdaki değerlendirmelerden hangisi istatistiksel olarak en uygundur?
- Model III tercih edilmelidir; çünkü Model I'deki değişen varyans sorunu bulunmamaktadır ve Model II'de regresyon doğrusunu aşırı etkileyen uç değerden kaçınılmıştır.Cevap
- BModel I seçilmelidir; çünkü değeri en yüksektir ve artıkların huni biçiminde dağılması regresyon katsayılarının yansız ve en küçük varyanslı olduğunu kanıtlar.
- CDüzeltilmiş değeri en yüksek olduğu için Model II kesinlikle en iyi modeldir; Cook Uzaklığının 'dan büyük olması o gözlemin modelin açıklayıcılığını artırdığını gösterir.
- DModel I'deki huni görünümü otokorelasyon sorununun bir göstergesidir; bu nedenle veriler üzerinde durağanlaştırma işlemi uygulanarak zaman serisi analizi yapılmalıdır.
- EModel II ve Model III'te değişken sayısı azaltılarak oluşturulan modeller, En Küçük Kareler (EKK) yönteminin "tüm bağımsız değişkenler modele dâhil edilmelidir" ilkesini ihlal ettiği için geçersizdir.