Question

Difficulty: HardArtık Analizi ve Model Seçimi

Bir eğitim politikaları uzmanı, ortaöğretim kurumlarının üniversiteye yerleştirme oranlarını (YY) açıklamak amacıyla, okulun fiziki donanımı, öğretmen başına düşen öğrenci sayısı gibi 7 farklı potansiyel bağımsız değişken içeren bir veri seti ile çalışmaktadır. Değişken seçme algoritmaları kullanılarak tahmin edilen iki alternatif regresyon denkleminin temel özet istatistikleri aşağıdaki tabloda verilmiştir:

ModelBağımsız Değişken SayısıR2R^2Rˉ2\bar{R}^2AICAIC
Birinci Taslak Model40,750,72184,3
İkinci Taslak Model50,780,68196,5

Uzman, bilgi kriterleri ve belirleme katsayılarını değerlendirerek analizi sürdüreceği nihai modeli belirlemiştir. Daha sonra, seçilen bu nihai modelin geçerliliğini sınamak amacıyla öğrenci (studentized) artık değerlerini dikey eksene, modelin ürettiği tahmin değerlerini (Y^\hat{Y}) ise yatay eksene yerleştirerek bir saçılım grafiği elde etmiştir. Bu grafikte, tahmin değerleri büyüdükçe noktaların dikey eksendeki yayılımının da giderek arttığı ve sağa doğru genişleyen belirgin bir huni biçiminin ortaya çıktığı görülmüştür.

Bu araştırma sürecindeki bulgulara göre, uzmanın yaptığı model seçimi ve karşılaştığı duruma ilişkin aşağıdaki değerlendirmelerden hangisi istatistiksel olarak en doğrudur?

  1. Daha düşük bilgi kriteri ve daha yüksek serbestlik derecesine göre düzeltilmiş açıklayıcılık oranı sunduğu için Birinci Taslak Model tercih edilmelidir; saptanan grafiksel doku ise hata terimlerinin sabit varyanslılık varsayımının ihlal edildiğini gösterdiğinden, katsayıların standart hatalarının White veya benzeri dirençli (robust) tahmincilerle düzeltilmesi gerekir.Answer
  2. B
    Açıklanan varyans oranını (R2R^2) daha yüksek bir seviyeye taşıdığı için İkinci Taslak Modelin seçilmesi uygundur; grafikteki dışa açılan yapı ise analize eklenen beşinci değişkenin çoklu doğrusal bağlantı sorununu tetiklediğine işaret eder.
  3. C
    Daha az sayıda parametre ile daha yüksek bir düzeltilmiş R2R^2 değerine ulaşıldığı için Birinci Taslak Model nihai denklem olarak kullanılmalıdır; ancak elde edilen huni biçimli saçılım, hata terimlerinin ardışık bağımlılık içerdiğini kanıtladığından Durbin-Watson testi ile otokorelasyon sınaması yapılmalıdır.
  4. D
    Bilgi kriteri (AICAIC) değeri daha yüksek olduğu için İkinci Taslak Modelin bilgi kaybı daha düşüktür ve bu model tercih edilmelidir; grafikte gözlenen genişleyen yayılım ise modelin hata terimlerinin normal dağılmadığını gösterir.
  5. E
    En küçük kareler (EKK) denklemlerinde bağımsız değişken eklenmesi modelin açıklama gücünü yapısal olarak her koşulda artıracağından İkinci Taslak Model üzerinden ilerlenmelidir; serpilme grafiğindeki örüntü ise kalıntıların beklenen değerinin sıfır olma varsayımının sağlanamadığını gösterir.

Answer

Daha düşük bilgi kriteri ve daha yüksek serbestlik derecesine göre düzeltilmiş açıklayıcılık oranı sunduğu için Birinci Taslak Model tercih edilmelidir; saptanan grafiksel doku ise hata terimlerinin sabit varyanslılık varsayımının ihlal edildiğini gösterdiğinden, katsayıların standart hatalarının White veya benzeri dirençli (robust) tahmincilerle düzeltilmesi gerekir.
Çoklu doğrusal regresyonda aday modeller arasından seçim yapılırken standart belirleme katsayısı (R2R^2) yanıltıcı olabilir; çünkü açıklayıcı değişken eklendikçe R2R^2 yapay bir şekilde artış gösterir. Bu nedenle modele eklenen parametrenin maliyetini (serbestlik derecesi kaybını) dikkate alan Düzeltilmiş R2R^2 (Rˉ2\bar{R}^2) ve Akaike Bilgi Kriteri (AICAIC) gibi ölçütler referans alınmalıdır. Tabloda Birinci Taslak Model, daha düşük AICAIC ve daha yüksek Rˉ2\bar{R}^2 değerlerine sahip olduğundan istatistiksel açıdan kesinlikle daha üstündür. Diğer taraftan, artıkların (kalıntıların) tahmin değerlerine göre çizilen serpilme diyagramında dışa doğru açılan bir huni (funnel) şeklinin görülmesi, hataların varyansının sabit kalmadığını, yani 'değişen varyans (heteroskedastisite)' sorunu bulunduğunu ispatlar. Bu varsayım ihlalinin tipik çözüm yöntemlerinden biri, t-istatistiklerini güvenilir kılmak adına katsayı varyanslarının White veya Huber-White gibi dirençli (robust) yöntemlerle hesaplanmasıdır. Tüm bu gerekçeleri eksiksiz yansıtan doğru yanıt, Birinci Taslak Modeli ve dirençli standart hatalar çözümünü birlikte sunan seçenektir.

Step-by-Step Solution

1
Model seçimi kriterlerinin (AIC ve Düzeltilmiş R-kare) karşılaştırılması
Birinci Taslak Modelin AIC değeri (184,3) daha düşük ve Düzeltilmiş R-kare değeri (0,72) daha yüksektir.
AIC değerinin küçük olması bilgi kaybının az olduğunu, Düzeltilmiş R-kare değerinin yüksek olması ise modelin açıklama gücünün serbestlik derecesi kaybına değdiğini gösterir.
2
İkinci Taslak Modeldeki R-kare artışının değerlendirilmesi
Standart R-kare değeri 0,75'ten 0,78'e çıkmış olsa da, Düzeltilmiş R-kare 0,68'e düşmüştür.
Modele yeni bir değişken eklendiğinde standart R-kare matematiksel olarak düşemez. Ancak eklenen 5. değişkenin modele getirdiği ek açıklayıcılık, parametre sayısındaki artışın (serbestlik derecesi kaybı) yarattığı cezayı karşılayamadığı için Düzeltilmiş R-kare azalmıştır.
3
Artıklar saçılım grafiğindeki huni biçimli örüntünün yorumlanması
Tahmin değerleri büyüdükçe artıkların yayılımının (varyansının) arttığı saptanmıştır.
Bu grafiksel doku, hata terimlerinin varyansının bağımlı veya bağımsız değişkenlerin seviyelerine göre değiştiğini, yani sabit varyans varsayımının (homoskedastisite) bozulduğunu ve değişen varyans (heteroskedastisite) sorunu yaşandığını açıkça kanıtlar.
4
Değişen varyans sorununun analitik çözümünün belirlenmesi
Model tahminlerinde dirençli (robust) standart hatalar kullanılmalıdır.
Değişen varyans durumunda EKK katsayı tahmincileri yansız kalmaya devam etse de etkinliklerini kaybederler ve t-testleri güvenilmez hale gelir. Bu nedenle standart hataların White gibi dirençli yöntemlerle düzeltilmesi gerekir.

Key Concept

Model Seçim Kriterleri ve Değişen Varyansın (Heteroskedastisite) Tespiti
Estimated Time:2m 0s
Rate this question