Question

Difficulty: HardArtık Analizi ve Model Seçimi

Bir halk sağlığı uzmanı, bölgelerin ortalama yaşam süresini tahmin etmek amacıyla 10 farklı bağımsız değişken (hava kalitesi endeksi, kişi başına düşen hekim sayısı vb.) kullanarak bir çoklu doğrusal regresyon modeli (Model I) kurmuştur. Model I'e ait belirleme katsayısı R2=0.88R^2 = 0.88, düzeltilmiş belirleme katsayısı Rˉ2=0.81\bar{R}^2 = 0.81 ve Akaike Bilgi Kriteri (AIC) 156.4156.4 olarak hesaplanmıştır.

Uzman, model seçimi yöntemlerinden adım adım regresyon (stepwise) algoritmasını uygulayarak bağımsız değişken sayısını 4'e düşürmüş ve Model II'yi elde etmiştir. Model II için R2=0.85R^2 = 0.85, Rˉ2=0.84\bar{R}^2 = 0.84 ve AIC =124.8= 124.8 bulunmuştur.

Daha sonra Model II için yapılan artık (kalıntı) analizinde; standartlaştırılmış artıkların standartlaştırılmış tahmin değerlerine karşı çizilen saçılım grafiğinde (scatter plot) noktaların sıfır çizgisi etrafında belirli bir yapı veya huni biçimi oluşturmaksızın tamamen rastgele dağıldığı gözlemlenmiştir. Ayrıca artıkların normal olasılık grafiğinde (Q-Q plot) noktaların 45 derecelik düz bir köşegen etrafında oldukça yakın konumlandığı tespit edilmiştir.

Buna göre, gerçekleştirilen model seçimi ve artık analizi süreciyle ilgili aşağıdaki ifadelerden hangisi doğrudur?

  1. Model II, açıklayıcı değişken sayısındaki azalışa rağmen düzeltilmiş Rˉ2\bar{R}^2'nin artması ve AIC değerinin düşmesi nedeniyle Model I'e tercih edilmelidir; ayrıca artık grafikleri, varyansın homojenliği ve hataların normal dağılımı varsayımlarının sağlandığını desteklemektedir.Answer
  2. B
    Açıklanan varyans oranını ifade eden standart R2R^2 değeri Model I'de daha yüksek (0.88>0.850.88 > 0.85) olduğu için Model I daha üstün bir uyum iyiliğine sahiptir; model seçimi aşamasında düzeltilmiş Rˉ2\bar{R}^2 yerine her zaman standart R2R^2 dikkate alınmalıdır.
  3. C
    Model II'nin bilgi kriterlerine göre daha başarılı olması, çoklu doğrusal bağlantı sorununu ortadan kaldırmıştır; ancak artıkların sıfır etrafında tamamen rastgele dağılması modelde ciddi bir değişen varyans (heteroskedastisite) problemi olduğunu kanıtlar.
  4. D
    Artıkların normal olasılık grafiğinde (Q-Q plot) köşegen etrafında toplanması, hata terimleri arasında otokorelasyon bulunmadığını gösterir; bu durum, EKK tahmincilerinin varyanslarının minimum olmasını tek başına garanti eder.
  5. E
    Model II'ye geçişte değişken sayısının azaltılmasıyla standart R2R^2 değerinde meydana gelen düşüş, En Küçük Kareler (EKK) tahmincilerinin yansızlık (sapmasızlık) özelliğini kaybettiğini gösterir ve bu nedenle parametre tahminleri geçersizdir.

Answer

Model II, daha düşük AIC ve daha yüksek düzeltilmiş R-kare değerine sahip olduğundan daha iyi bir modeldir; ayrıca artık analizleri varyansın homojenliği ve normallik varsayımlarının sağlandığını teyit etmektedir.
Doğru seçenekte belirtildiği gibi, model seçimi kriterlerinde temel prensip 'ceza' içeren ölçütleri dikkate almaktır. Model II'de değişken sayısı 10'dan 4'e düşmesine rağmen düzeltilmiş belirleme katsayısının (0.810.81'den 0.840.84'e) artması ve AIC değerinin (156.4156.4'ten 124.8124.8'e) düşmesi, Model II'nin daha 'cimri' (parsimonious) ve aşırı öğrenme (overfitting) riskinden uzak, bilgi kaybı düşük bir model olduğunu gösterir. Ayrıca, artıkların tahmin değerlerine karşı çizilen grafiğinde rastgele dağılım olması değişen varyans (heteroskedastisite) sorunu olmadığını (varyansın homojenliğini), Q-Q grafiğindeki doğrusallık ise hata terimlerinin normal dağıldığını kanıtlar.

Step-by-Step Solution

1
Model I ve Model II'nin performans ölçütlerini karşılaştırmak.
Model II'de daha az değişken olmasına rağmen düzeltilmiş R-kare daha yüksek (0.84>0.810.84 > 0.81) ve AIC değeri daha düşüktür (124.8<156.4124.8 < 156.4).
Farklı sayıda bağımsız değişkene sahip modeller kıyaslanırken standart R-kare yerine serbestlik derecesine göre düzeltme yapan düzeltilmiş R-kare ve bilgi kriterleri (AIC/BIC) kullanılır.
2
Artıkların (kalıntıların) saçılım grafiğini yorumlamak.
Noktaların sıfır çizgisi etrafında rastgele dağılması ve bir huni/koni şekli oluşturmaması gözlemlenmiştir.
Bu durum, hata terimlerinin varyansının sabit olduğu (homoskedastisite) varsayımının sağlandığını kanıtlar.
3
Normal olasılık (Q-Q) grafiğini yorumlamak.
Noktalar 45 derecelik köşegen doğru etrafında toplanmıştır.
Q-Q grafiğinde teorik kantiller ile örneklem kantillerinin doğrusal bir ilişki göstermesi, hata terimlerinin normal dağıldığı varsayımının geçerli olduğunu doğrular.

Key Concept

Regresyon modellerinde bilgi kriterleri (AIC) ile model seçimi ve artık grafikleri yardımıyla EKK varsayımlarının (normallik, homoskedastisite) sınanması.
Rate this question