Question

Difficulty: HardArtık Analizi ve Model Seçimi

Bir bölgesel kalkınma ajansında görevli uzman, 81 ilin imalat sanayi ihracat hacmini (YY) tahmin etmek için 6 farklı bağımsız değişken içeren bir çoklu doğrusal regresyon modeli (Model I) kurmuştur. Daha sonra, model seçimi kriterleri ve değişken seçimi yöntemleri kullanılarak 4 bağımsız değişkenden oluşan yeni bir model (Model II) elde edilmiştir. Modellere ait bazı özet istatistikler ve artık analizi sonuçları aşağıda verilmiştir:

İstatistik / TestModel I (6 Değişken)Model II (4 Değişken)
Belirleme Katsayısı (R2R^2)0.840.840.810.81
Düzeltilmiş Belirleme Katsayısı (Rˉ2\bar{R}^2)0.780.780.800.80
Akaike Bilgi Kriteri (AICAIC)412.5412.5385.2385.2
Shapiro-Wilk Testi (pp-değeri)0.010.010.180.18
Maksimum Cook Uzaklığı (DD)0.850.851.451.45

(Not: Anlamlılık düzeyi α=0.05\alpha = 0.05 olarak alınacaktır. Shapiro-Wilk testi için H0H_0: Artıklar normal dağılıma uygundur.)

Bu bilgilere göre, model seçimi ve artık analizi süreciyle ilgili aşağıdaki ifadelerden hangisi doğrudur?

  1. Model II, bilgi kriteri (AICAIC) ve düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2) dikkate alındığında daha uygun bir modeldir; Model II'de artıkların normal dağılım varsayımı sağlanmasına rağmen, analiz sonuçlarını aşırı etkileyebilecek bir gözlem bulunmaktadır.Answer
  2. B
    Model I'in standart belirleme katsayısı (R2R^2) daha yüksek olduğundan bağımsız değişkenlerin bağımlı değişkeni açıklama gücü daha fazladır; bu nedenle model seçimi kuralları gereği Model II yerine Model I tercih edilmelidir.
  3. C
    Model I'de Shapiro-Wilk testi pp-değeri 0.050.05'ten küçük çıktığı için artıkların normal dağıldığı varsayımı sağlanırken, Model II'de p>0.05p > 0.05 olduğundan bu varsayım ihlal edilmiştir.
  4. D
    Model II'de maksimum Cook uzaklığı (Cook's DD) değerinin 11'den büyük çıkması, modeldeki bağımsız değişkenler arasında ciddi bir çoklu doğrusal bağlantı (multicollinearity) problemi olduğunu kanıtlar.
  5. E
    Model I'in AICAIC değeri daha yüksek olduğu için modelin veri setine uyumu daha iyidir ve Model II'ye göre değişen varyans (heteroskedastisite) sorununa karşı daha dirençlidir.

Answer

Model II'nin düzeltilmiş R-kare ve AIC kriterlerine göre daha üstün olduğunu, Shapiro-Wilk testine göre artıkların normal dağıldığını, ancak Cook uzaklığı değerine bakılarak etkili bir gözlem barındırdığını belirten seçenek doğrudur.
Verilen bilgiler bütünleşik olarak değerlendirildiğinde; Model II'nin düzeltilmiş belirleme katsayısının daha yüksek ve Akaike Bilgi Kriterinin daha düşük olması onun Model I'e kıyasla daha uygun bir yapıya sahip olduğunu kanıtlar. Ayrıca Model II'de Shapiro-Wilk testinin pp-değeri 0.050.05'ten büyük olduğu için (0.180.18) artıkların normal dağıldığı varsayımı ihlal edilmemiştir. Ancak tablodaki maksimum Cook Uzaklığı değerinin 11'den büyük (1.451.45) çıkması, tahmin edilen modelde katsayıları aşırı etkileyen sapan bir gözlemin varlığına işaret etmektedir.

Step-by-Step Solution

1
Model seçimi kriterlerini karşılaştırarak en iyi modeli belirle.
Model I için Rˉ2=0.78\bar{R}^2=0.78, AIC=412.5AIC=412.5; Model II için Rˉ2=0.80\bar{R}^2=0.80, AIC=385.2AIC=385.2. Model II'nin düzeltilmiş belirleme katsayısı daha yüksek ve AIC değeri daha düşüktür. Bu nedenle Model II daha iyi bir modeldir.
Farklı sayıda bağımsız değişken içeren modeller karşılaştırılırken standart R2R^2 yerine serbestlik derecesini dikkate alan Rˉ2\bar{R}^2 ve düşük bilgi kaybını hedefleyen (küçük olanın tercih edildiği) AICAIC kullanılır.
2
Shapiro-Wilk test sonuçlarını yorumlayarak normallik varsayımını kontrol et.
Model I için p=0.01<0.05p=0.01 < 0.05 (Normallik reddedilir). Model II için p=0.18>0.05p=0.18 > 0.05 (Normallik reddedilemez, varsayım sağlanır).
Artıkların normallik testlerinde H0H_0 hipotezi dağılımın normal olduğunu belirtir. Anlamlılık düzeyi (0.050.05) aşıldığında normallik şartı sağlanmış kabul edilir.
3
Maksimum Cook Uzaklığı (DD) değerlerini yorumla.
Model II'de Cook Uzaklığı değeri 1.451.45'tir. Bu değer genellikle eşik kabul edilen 11'den büyüktür.
Cook Uzaklığı'nın 11'den büyük olması, o gözlemin regresyon katsayılarını tek başına ciddi şekilde değiştirebilecek kadar etkili (influential point) olduğunu ifade eder.

Key Concept

Regresyonda Model Seçimi Kriterleri ve Artık Analizi Tanı Testleri
Rate this question