Soru

Zorluk: OrtaArtık Analizi ve Model Seçimi

Bir gayrimenkul değerleme uzmanı, konut fiyatlarını (YY) tahmin etmek için konutun büyüklüğü (X1X_1), oda sayısı (X2X_2) ve bina yaşı (X3X_3) değişkenleriyle Model 1'i kurmuştur. Daha sonra bu modele şehir merkezine uzaklık (X4X_4) ve toplu taşımaya yakınlık (X5X_5) değişkenlerini ekleyerek Model 2'yi oluşturmuştur. Modellere ait özet istatistikler ve artık (kalıntı) analizi bulguları aşağıdaki tabloda verilmiştir:

İstatistik / BulguModel 1Model 2
Standart Belirleme Katsayısı (R2R^2)0.780.780.810.81
Düzeltilmiş Belirleme Katsayısı (Radj2R^2_{adj})0.760.760.720.72
AIC (Akaike Bilgi Kriteri)1245.41245.41310.81310.8
Maksimum Cook Uzaklığı (DiD_i)0.450.451.821.82
Artıkların Normal Q-Q GrafiğiDoğruya çok yakınS şeklinde belirgin sapma

Bu tabloya ve analiz bulgularına göre, model seçimi ve varsayımlar hakkında aşağıdakilerden hangisi kesinlikle söylenebilir?

  1. X4X_4 ve X5X_5 değişkenlerinin modele eklenmesi modelin istatistiksel uyumunu iyileştirmemiştir; ayrıca Model 2'de hata terimlerinin normallik varsayımı ihlal edilmiş ve regresyon sonuçlarını aşırı etkileyen (etkin) bir gözlem tespit edilmiştir.Cevap
  2. B
    Standart R2R^2 değeri 0.780.78'den 0.810.81'e yükseldiği için Model 2 tercih edilmelidir; modelde açıklayıcı değişken sayısı arttıkça düzeltilmiş R2R^2 yerine standart R2R^2 referans alınmalıdır.
  3. C
    Maksimum Cook Uzaklığının 1.821.82 değerine ulaşması, yeni değişkenlerin eklenmesiyle modelde şiddetli bir çoklu doğrusal bağlantı (multicollinearity) oluştuğunu ve tahmincilerin varyanslarının küçüldüğünü kanıtlar.
  4. D
    Düzeltilmiş R2R^2'nin 0.720.72'ye düşmesi ve hata terimlerinin normal dağılımdan sapması, En Küçük Kareler (EKK) formüllerindeki hata kareler toplamının hesaplanmasında açık bir işlem hatası yapıldığını gösterir.
  5. E
    Q-Q grafiğindeki S şeklindeki sapma, hata terimleri arasında güçlü bir otokorelasyon (ardışık bağımlılık) bulunduğunu ve bu durumun EKK tahmincilerini sapmalı hale getirdiğini gösterir.

Cevap

Yeni eklenen değişkenler modelin uyumunu iyileştirmemiştir; Model 2'de normallik varsayımı ihlali ve regresyon sonuçlarını aşırı etkileyen aykırı/etkin bir gözlem tespit edilmiştir.
Bu soru iki temel regresyon konusunu test etmektedir: Model seçimi ve kalıntı (artık) analizi. İlk olarak, Model 2'de standart R2R^2 artmasına rağmen düzeltilmiş R2R^2'nin düşmesi ve AIC'nin artması, eklenen X4X_4 ve X5X_5 değişkenlerinin gereksiz olduğunu ve model kalitesini bozduğunu ifade eder. İkinci olarak, kalıntı analizindeki Cook Uzaklığı metriği, değerinin 1'in üzerinde olmasıyla (burada 1.821.82) regresyon katsayılarını tek başına ciddi şekilde değiştiren 'etkin (influential)' bir gözlemin varlığına işaret eder. Artıkların Normal Q-Q grafiğinde teorik doğrudan ayrılarak S şekli oluşturması ise normallik varsayımının kesin olarak ihlal edildiğini gösterir. Bu üç doğru tespit yalnızca doğru seçenekte bir arada verilmiştir.

Adım Adım Çözüm

1
Model 1 ve Model 2'nin uyum iyiliği ölçütlerini (Standart R-kare, Düzeltilmiş R-kare ve AIC) karşılaştırmak.
Standart R-kare 0.780.78'den 0.810.81'e çıkmış olsa da, Düzeltilmiş R-kare 0.760.76'dan 0.720.72'ye düşmüş ve AIC değeri 1245.41245.4'ten 1310.81310.8'e yükselmiştir.
Farklı sayıda bağımsız değişkene sahip modeller karşılaştırılırken serbestlik derecesini dikkate alan Düzeltilmiş R-kare ve AIC/BIC gibi cezalandırıcı kriterlere bakılır. Bu değerlerin kötüleşmesi, Model 2'nin Model 1'den daha zayıf olduğunu gösterir.
2
Model 2 için verilen artık (kalıntı) analizi bulgularını (Cook Uzaklığı ve Q-Q grafiği) yorumlamak.
Cook Uzaklığı (DiD_i) 1.821.82 (yani >1>1) bulunmuş ve Q-Q grafiğinde S şeklinde belirgin bir sapma görülmüştür.
Cook Uzaklığının 11'den büyük olması modelde regresyon katsayılarını aşırı ölçüde değiştiren etkin (influential) bir gözlem olduğunu belirtir. Q-Q grafiğindeki S şeklindeki eğrisellik ise hata terimlerinin normal dağılım varsayımından saptığını (örneğin kalın kuyruklu bir dağılıma sahip olduğunu) kanıtlar.
3
Tüm bulguları birleştirerek nihai model değerlendirmesini yapmak.
Model 2'ye eklenen yeni değişkenler modelin istatistiksel kalitesini bozmuştur, varsayım ihlalleri (normallikten sapma) mevcuttur ve veri setinde sonuçları manipüle eden en az bir etkin gözlem vardır.
Bulgular doğrudan modelin açıklayıcılık gücünün azaldığını ve teşhis (diagnostic) testlerinin problemli olduğunu işaret etmektedir.

Anahtar Kavram

Regresyon modellerinde değişken seçimi ölçütleri (Düzeltilmiş R2R^2, AIC) ve artıkların teşhis testleri (Cook Uzaklığı, Normallik).
Bu soruyu puanla