Question

Difficulty: MediumArtık Analizi ve Model Seçimi

Bir halk sağlığı uzmanı, ilçelerdeki hastane doluluk oranlarını (YY) açıklamak için 8 potansiyel bağımsız değişkenle doğrusal regresyon analizi yapmaktadır. Uzman üç farklı model kurmuş ve aşağıdaki tanısal bulguları elde etmiştir:

- Model I: Tümü (8 değişken) modele dâhil edilmiştir. R2=0.86R^2 = 0.86, Düzeltilmiş R2=0.74R^2 = 0.74. Artıkların (kalıntıların) tahmin edilen değerlere göre çizilen saçılım grafiğinde belirgin bir "huni (funnel)" biçimi gözlenmiştir.
- Model II: Adımsal (stepwise) regresyon ile 4 değişken seçilmiştir. R2=0.80R^2 = 0.80, Düzeltilmiş R2=0.78R^2 = 0.78. Artıklar rastgele dağılmakla birlikte, modele ait bir gözlemin Cook Uzaklığı (Cook's Distance) Di=1.8D_i = 1.8 olarak hesaplanmıştır.
- Model III: Geriye doğru eleme (backward elimination) ile 5 değişken seçilmiştir. R2=0.81R^2 = 0.81, Düzeltilmiş R2=0.77R^2 = 0.77. Artıklar rastgele dağılmakta ve tüm gözlemlerin Cook Uzaklığı Di<0.4D_i < 0.4 düzeyindedir.

Buna göre, bu modellerin geçerliliği ve seçimi konusunda aşağıdaki değerlendirmelerden hangisi istatistiksel olarak en uygundur?

  1. Model III tercih edilmelidir; çünkü Model I'deki değişen varyans sorunu bulunmamaktadır ve Model II'de regresyon doğrusunu aşırı etkileyen uç değerden kaçınılmıştır.Answer
  2. B
    Model I seçilmelidir; çünkü R2R^2 değeri en yüksektir ve artıkların huni biçiminde dağılması regresyon katsayılarının yansız ve en küçük varyanslı olduğunu kanıtlar.
  3. C
    Düzeltilmiş R2R^2 değeri en yüksek olduğu için Model II kesinlikle en iyi modeldir; Cook Uzaklığının 1.01.0'dan büyük olması o gözlemin modelin açıklayıcılığını artırdığını gösterir.
  4. D
    Model I'deki huni görünümü otokorelasyon sorununun bir göstergesidir; bu nedenle veriler üzerinde durağanlaştırma işlemi uygulanarak zaman serisi analizi yapılmalıdır.
  5. E
    Model II ve Model III'te değişken sayısı azaltılarak oluşturulan modeller, En Küçük Kareler (EKK) yönteminin "tüm bağımsız değişkenler modele dâhil edilmelidir" ilkesini ihlal ettiği için geçersizdir.

Answer

Model III'ün tercih edilmesi gerektiğini savunan seçenek doğrudur. Çünkü Model I'deki değişen varyans sorunu giderilmiş ve Model II'deki aşırı etkili gözlemden (outlier/influential point) kaçınılmıştır.
Doğru yanıt, Model III'ün en sağlam model olduğunu belirten ifadedir. Model seçimi sadece Düzeltilmiş R-kare gibi uyum iyiliği ölçütleriyle yapılamaz; artık (kalıntı) analizlerinin de sorunsuz olması gerekir. Model I huni görünümü ile değişen varyans varsayımını ihlal ederken, Model II Cook Uzaklığı eşik değerini (1.0) aşan bir aykırı/etkin gözleme sahip olduğu için güvenilir değildir. Model III hem yüksek Düzeltilmiş R-kare sunar hem de varsayımları ihlal etmez.

Step-by-Step Solution

1
Model I'in tanısal özelliklerini incele.
8 değişkenli bu modelde R2R^2 (0.86) ile Düzeltilmiş R2R^2 (0.74) arasında büyük bir fark vardır, bu durum gereksiz değişkenlerin varlığına (aşırı uyum) işaret eder. Ayrıca, artıkların "huni (funnel)" biçiminde dağılması ciddi bir "değişen varyans (heteroskedastisite)" sorunu olduğunu gösterir.
Model I'in istatistiksel çıkarımları (t ve F testleri) güvenilir değildir.
2
Model II'nin tanısal özelliklerini incele.
Düzeltilmiş R2R^2 en yüksek (0.78) olmasına rağmen, bir gözlemin Cook Uzaklığı Di=1.8D_i = 1.8'dir.
Genel kural olarak Cook Uzaklığının 1'den büyük olması (Di>1D_i > 1), ilgili gözlemin regresyon katsayılarını tek başına ciddi şekilde değiştirecek kadar "etkin gözlem (influential observation)" olduğunu kanıtlar. Bu model tek bir veriye aşırı duyarlıdır.
3
Model III'ün tanısal özelliklerini incele.
Düzeltilmiş R2R^2 (0.77) oldukça rekabetçidir. Artıklar rastgele dağılmıştır (değişen varyans yok) ve tüm Cook Uzaklıkları 0.40.4'ün altındadır (aşırı etkili gözlem yok).
Varsayımları sağlayan ve veriye uyumu yeterli olan en sağlam ve güvenilir yapı Model III'tür.

Key Concept

Regresyon Modellerinde Artık Analizi ve Varsayım İhlallerinin Tespiti
Rate this question