Artık Analizi ve Model Seçimi

19 soru

Soru 1Soru

Bir araştırmacı, bir şirketin aylık satış miktarını (YY) tahmin etmek için 5 farklı bağımsız değişkenin yer aldığı bir çoklu doğrusal regresyon analizi yapmaktadır. Değişken seçimi (model selection) sürecinde ileriye doğru seçim (forward selection) yöntemi kullanılarak elde edilen iki farklı aday modele ait özet istatistikler ve artık (kalıntı) analizi sonuçları aşağıdaki tabloda verilmiştir.

İstatistik / TestModel IModel II
Bağımsız Değişken Sayısı25
Belirleme Katsayısı (R2R^2)0.750.77
Düzeltilmiş R2R^2 (Rˉ2\bar{R}^2)0.720.69
Shapiro-Wilk Testi (pp-değeri)0.1450.021
White Testi (pp-değeri)0.2310.042

(Not: Anlamlılık düzeyi α=0.05\alpha = 0.05 olarak alınacaktır.)

Regresyon varsayımları ve model seçim kriterleri dikkate alındığında, bu iki modelle ilgili aşağıdaki ifadelerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: Model I tercih edilmelidir; çünkü düzeltilmiş R2R^2 değeri daha yüksektir ve artıkların normal dağılım ile sabit varyans varsayımları sağlanmaktadır.

Cevap

Düzeltilmiş belirleme katsayısı daha yüksek olan ve varsayımları sağlayan Model I tercih edilmelidir.
Çoklu doğrusal regresyonda aday modeller arasından seçim yapılırken, açıklayıcı değişken sayısının etkisinden arındırılmış olan Düzeltilmiş R² değerinin yüksek olması istenir. Model I'de bu değer daha yüksektir. Ayrıca regresyon modelinin güvenilirliği için artıkların (kalıntıların) normal dağılması ve varyansının sabit olması gerekir. Varsayım testlerinde H0 hipotezleri 'uygunluk/sağlanma' durumunu ifade ettiği için p > 0.05 olması istenir. Model I'de her iki testin p-değeri 0.05'ten büyük olduğu için regresyon varsayımları eksiksiz şekilde sağlanmaktadır.

Adım Adım Çözüm

1
Model seçim kriteri olan Düzeltilmiş R² değerlerinin karşılaştırılması.
Model I'in düzeltilmiş R² değeri (0.72), Model II'den (0.69) daha büyüktür.
Değişken sayısı farklı olan modeller karşılaştırılırken standart R² yerine ceza terimi içeren Düzeltilmiş R² dikkate alınır.
2
Shapiro-Wilk normallik testi sonuçlarının değerlendirilmesi.
Model I için p=0.145 > 0.05 olduğundan normallik varsayımı sağlanır. Model II için p=0.021 < 0.05 olduğundan varsayım ihlal edilmiştir.
Normallik testinde H0 hipotezi 'Artıklar normal dağılmaktadır' şeklindedir. Varsayımın sağlanması için H0 reddedilememelidir (p > 0.05).
3
White sabit varyans testi sonuçlarının değerlendirilmesi.
Model I için p=0.231 > 0.05 olduğundan sabit varyans varsayımı sağlanır. Model II için p=0.042 < 0.05 olduğundan varsayım ihlal edilmiştir.
White testinde H0 hipotezi 'Varyans sabittir' şeklindedir. Varsayımın sağlanması için H0 reddedilememelidir (p > 0.05).

Anahtar Kavram

Model Seçim Kriterleri ve Regresyon Varsayımlarının Sınanması
Tahmini Süre:1m 30s
Soru 2Soru

Bir kamu kurumu uzmanı, illerin sosyo-ekonomik gelişmişlik endeksini tahmin etmek amacıyla iki farklı çoklu doğrusal regresyon modeli kurmuştur. Modellerin performansını karşılaştırmak için bazı uyum iyiliği ve model seçim kriterleri hesaplanarak aşağıdaki tabloda verilmiştir:

KriterModel A (4 Bağımsız Değişken)Model B (5 Bağımsız Değişken)
Belirleme Katsayısı (R2R^2)0,820,84
Düzeltilmiş Belirleme Katsayısı (Rˉ2\bar{R}^2)0,800,77
Akaike Bilgi Kriteri (AIC)115,4128,6
Bayesian Bilgi Kriteri (BIC)121,2136,1

Not: Model B, Model A'daki 4 bağımsız değişkene ilave olarak 1 yeni bağımsız değişken daha içermektedir.

Bu tabloya göre, uzmanın model seçimi ve değişken ekleme süreciyle ilgili yapacağı en doğru değerlendirme aşağıdakilerden hangisidir?

Cevabı ve açıklamayı göster

Cevap: Model B'ye eklenen ilave değişken, modelin açıklama gücüne anlamlı bir katkı sağlamamış ve serbestlik derecesindeki kaybı telafi edememiştir; bu nedenle daha sade olan Model A tercih edilmelidir.

Cevap

Model B'ye eklenen ilave değişken, modelin açıklama gücüne anlamlı bir katkı sağlamamış ve serbestlik derecesindeki kaybı telafi edememiştir; bu nedenle daha sade olan Model A tercih edilmelidir.
Bir modele yeni bir bağımsız değişken eklendiğinde standart R2R^2 değeri matematiksel olarak her zaman artar veya sabit kalır. Ancak, eklenen değişkenin modele katkısı marjinalse, serbestlik derecesindeki kaybı hesaba katan düzeltilmiş R2R^2 değeri düşer. Benzer şekilde, model karmaşıklığını cezalandıran Akaike (AIC) ve Bayesian (BIC) bilgi kriterlerinde daha düşük değerler istenir. Tabloda Model B'nin AIC ve BIC değerleri daha yüksek, düzeltilmiş R2R^2 değeri ise daha düşüktür. Bu tablo, eklenen 5. değişkenin modelin açıklama gücüne anlamlı bir katkı sağlamadığını ve parsimoni (sadelik) ilkesi gereği Model A'nın tercih edilmesi gerektiğini açıkça göstermektedir.

Adım Adım Çözüm

1
Standart belirleme katsayısındaki (R2R^2) değişimi incelemek
Model B'nin R2R^2 değeri (0,84), Model A'dan (0,82) yüksektir.
Modele yeni bir bağımsız değişken eklendiğinde R2R^2 matematiksel olarak daima artar veya en kötü ihtimalle sabit kalır. Bu tek başına modelin iyileştiğini göstermez.
2
Düzeltilmiş belirleme katsayısındaki (Rˉ2\bar{R}^2) değişimi incelemek
Rˉ2\bar{R}^2 değeri 0,80'den 0,77'ye düşmüştür.
Düzeltilmiş R2R^2, model karmaşıklığını ve serbestlik derecesindeki kaybı cezalandırır. Değerin düşmesi, eklenen 5. değişkenin katkısının istatistiksel maliyetini karşılamadığını gösterir.
3
Bilgi kriterlerindeki (AIC ve BIC) değişimi değerlendirmek
Hem AIC hem de BIC değerleri Model B'de yükselmiştir.
Bilgi kriterlerinde (AIC, BIC, vb.) daha düşük değerler daha iyi uyumu ve parsimoniyi (sadelik) ifade eder. Değerlerin artması Model B'nin gereksiz karmaşıklaştığını doğrular.
4
Nihai kararı vermek
Model A tercih edilmelidir.
Tüm geçerli model seçim kriterleri (Rˉ2\bar{R}^2, AIC, BIC), açıklayıcılık ve sadelik dengesinde Model A'nın daha üstün olduğunu göstermektedir.

Anahtar Kavram

Model Seçim Kriterleri (R2R^2, Düzeltilmiş R2R^2, AIC, BIC) ve Parsimoni (Sadelik) İlkesi
Tahmini Süre:1m 30s
Soru 3Soru

Bir kamu kurumunda enerji uzmanı olarak çalışan bir araştırmacı, ilçedeki günlük elektrik tüketimini (YY) tahmin etmek amacıyla 6 bağımsız değişkenli (hava sıcaklığı, nem, nüfus, sanayi endeksi, rüzgar hızı, tatil kukla değişkeni) bir başlangıç regresyon modeli (Model I) kurmuştur.

Daha sonra "geriye doğru eleme" (backward elimination) yöntemi kullanılarak istatistiksel olarak anlamsız olan iki değişken modelden çıkarılmış ve 4 bağımsız değişkenli yeni bir model (Model II) elde edilmiştir.

Bu iki modele ait özet istatistikler ve Model II'nin artık (kalıntı) analizine ilişkin bazı bulgular aşağıda verilmiştir:
- Model I: R2=0.784R^2 = 0.784, Düzeltilmiş R2=0.732R^2 = 0.732, AIC=342.5AIC = 342.5
- Model II: R2=0.768R^2 = 0.768, Düzeltilmiş R2=0.751R^2 = 0.751, AIC=315.8AIC = 315.8
- Model II Artık Analizi: Shapiro-Wilk testi pp-değeri =0.15= 0.15, Durbin-Watson istatistiği =2.05= 2.05, Öğrenci (Studentized) artıkları [1.8,1.9][-1.8, 1.9] aralığındadır.

Elde edilen bu bulgulara göre, model seçimi ve artık analizi ile ilgili aşağıdaki ifadelerden hangisi kesinlikle doğrudur?

Cevabı ve açıklamayı göster

Cevap: Model II, bilgi kriteri (AIC) ve düzeltilmiş belirleme katsayısı (R2R^2) dikkate alındığında Model I'e tercih edilmelidir; ayrıca Model II'nin hata terimleri normal dağılım varsayımını sağlamakta ve modelde otokorelasyon ile belirgin bir uç değer (outlier) sorunu bulunmamaktadır.

Cevap

Model II, bilgi kriteri (AIC) ve düzeltilmiş belirleme katsayısı bağlamında Model I'e tercih edilmelidir; hata terimleri normal dağılım varsayımını sağlamakta ve otokorelasyon veya uç değer sorunu bulunmamaktadır.
Model II'de daha az açıklayıcı değişken yer almasına rağmen düzeltilmiş R-kare değeri (0.751 > 0.732) artmış ve AIC değeri (315.8 < 342.5) düşmüştür. Bu durum, eleme işlemi sonrası Model II'nin parsimoni (sadelik) ve açıklayıcılık dengesinde daha üstün bir model olduğunu kanıtlar. Ayrıca, Shapiro-Wilk testinin p-değerinin 0.05'ten büyük (0.15) çıkması normal dağılım varsayımının sağlandığını, Durbin-Watson istatistiğinin 2'ye yakın (2.05) çıkması otokorelasyon bulunmadığını, kalıntıların dar bir aralıkta [-1.8, 1.9] toplanması ise uç değer problemi yaşanmadığını göstermektedir.

Adım Adım Çözüm

1
Model performans metriklerinin (Standart R-kare, Düzeltilmiş R-kare ve AIC) karşılaştırılarak yorumlanması.
Model II'nin standart R-kare değeri Model I'den düşük olmasına rağmen, Düzeltilmiş R-kare değeri daha yüksektir (0.751 > 0.732) ve AIC değeri daha düşüktür (315.8 < 342.5).
Farklı sayıda bağımsız değişkene sahip modeller karşılaştırılırken, gereksiz değişken kullanımını cezalandıran düzeltilmiş R-kare ve AIC kriterleri referans alınmalıdır.
2
Shapiro-Wilk normallik testi p-değerinin anlamlılık düzeyi (alfa = 0.05) ile kıyaslanması.
p-değeri (0.15) > 0.05 olduğu için 'Hata terimleri normal dağılmaktadır' şeklindeki H0 hipotezi reddedilemez.
Artıkların normal dağılıp dağılmadığını test eden istatistiklerde, yüksek p-değeri varsayımın sağlandığına işaret eder.
3
Durbin-Watson (DW) istatistiğinin ve standardize edilmiş artıkların (öğrenci artıkları) analiz edilmesi.
DW değeri (2.05) tam 2.00 civarında yer aldığından otokorelasyon yoktur. Artıkların [-1.8, 1.9] aralığında kalması ise ±2 veya ±3 sınırlarını aşmadığı için uç değer (outlier) probleminin bulunmadığını gösterir.
EKK'nın klasik varsayımlarından otokorelasyon yokluğu test edilirken DW'nin 2'ye yakınlığı aranır; uç değer analizi için artıkların genel kabul görmüş standart sapma bantlarında kalması beklenir.

Anahtar Kavram

Model Seçim Kriterleri ve Artık Analizi Varsayım Kontrolleri
Soru 4Soru

Bir halk sağlığı uzmanı, bölgelerin ortalama yaşam süresini tahmin etmek amacıyla 10 farklı bağımsız değişken (hava kalitesi endeksi, kişi başına düşen hekim sayısı vb.) kullanarak bir çoklu doğrusal regresyon modeli (Model I) kurmuştur. Model I'e ait belirleme katsayısı R2=0.88R^2 = 0.88, düzeltilmiş belirleme katsayısı Rˉ2=0.81\bar{R}^2 = 0.81 ve Akaike Bilgi Kriteri (AIC) 156.4156.4 olarak hesaplanmıştır.

Uzman, model seçimi yöntemlerinden adım adım regresyon (stepwise) algoritmasını uygulayarak bağımsız değişken sayısını 4'e düşürmüş ve Model II'yi elde etmiştir. Model II için R2=0.85R^2 = 0.85, Rˉ2=0.84\bar{R}^2 = 0.84 ve AIC =124.8= 124.8 bulunmuştur.

Daha sonra Model II için yapılan artık (kalıntı) analizinde; standartlaştırılmış artıkların standartlaştırılmış tahmin değerlerine karşı çizilen saçılım grafiğinde (scatter plot) noktaların sıfır çizgisi etrafında belirli bir yapı veya huni biçimi oluşturmaksızın tamamen rastgele dağıldığı gözlemlenmiştir. Ayrıca artıkların normal olasılık grafiğinde (Q-Q plot) noktaların 45 derecelik düz bir köşegen etrafında oldukça yakın konumlandığı tespit edilmiştir.

Buna göre, gerçekleştirilen model seçimi ve artık analizi süreciyle ilgili aşağıdaki ifadelerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: Model II, açıklayıcı değişken sayısındaki azalışa rağmen düzeltilmiş Rˉ2\bar{R}^2'nin artması ve AIC değerinin düşmesi nedeniyle Model I'e tercih edilmelidir; ayrıca artık grafikleri, varyansın homojenliği ve hataların normal dağılımı varsayımlarının sağlandığını desteklemektedir.

Cevap

Model II, daha düşük AIC ve daha yüksek düzeltilmiş R-kare değerine sahip olduğundan daha iyi bir modeldir; ayrıca artık analizleri varyansın homojenliği ve normallik varsayımlarının sağlandığını teyit etmektedir.
Doğru seçenekte belirtildiği gibi, model seçimi kriterlerinde temel prensip 'ceza' içeren ölçütleri dikkate almaktır. Model II'de değişken sayısı 10'dan 4'e düşmesine rağmen düzeltilmiş belirleme katsayısının (0.810.81'den 0.840.84'e) artması ve AIC değerinin (156.4156.4'ten 124.8124.8'e) düşmesi, Model II'nin daha 'cimri' (parsimonious) ve aşırı öğrenme (overfitting) riskinden uzak, bilgi kaybı düşük bir model olduğunu gösterir. Ayrıca, artıkların tahmin değerlerine karşı çizilen grafiğinde rastgele dağılım olması değişen varyans (heteroskedastisite) sorunu olmadığını (varyansın homojenliğini), Q-Q grafiğindeki doğrusallık ise hata terimlerinin normal dağıldığını kanıtlar.

Adım Adım Çözüm

1
Model I ve Model II'nin performans ölçütlerini karşılaştırmak.
Model II'de daha az değişken olmasına rağmen düzeltilmiş R-kare daha yüksek (0.84>0.810.84 > 0.81) ve AIC değeri daha düşüktür (124.8<156.4124.8 < 156.4).
Farklı sayıda bağımsız değişkene sahip modeller kıyaslanırken standart R-kare yerine serbestlik derecesine göre düzeltme yapan düzeltilmiş R-kare ve bilgi kriterleri (AIC/BIC) kullanılır.
2
Artıkların (kalıntıların) saçılım grafiğini yorumlamak.
Noktaların sıfır çizgisi etrafında rastgele dağılması ve bir huni/koni şekli oluşturmaması gözlemlenmiştir.
Bu durum, hata terimlerinin varyansının sabit olduğu (homoskedastisite) varsayımının sağlandığını kanıtlar.
3
Normal olasılık (Q-Q) grafiğini yorumlamak.
Noktalar 45 derecelik köşegen doğru etrafında toplanmıştır.
Q-Q grafiğinde teorik kantiller ile örneklem kantillerinin doğrusal bir ilişki göstermesi, hata terimlerinin normal dağıldığı varsayımının geçerli olduğunu doğrular.

Anahtar Kavram

Regresyon modellerinde bilgi kriterleri (AIC) ile model seçimi ve artık grafikleri yardımıyla EKK varsayımlarının (normallik, homoskedastisite) sınanması.
Soru 5Soru

Bir tarım ekonomisti, farklı buğday türlerinin dönüm başına verimini (YY) tahmin etmek için çeşitli iklim ve toprak özelliklerini içeren bağımsız değişkenlerle farklı regresyon modelleri kurmuştur. Elde edilen modellerin karşılaştırmalı performans ölçütleri aşağıda verilmiştir:

ModelBağımsız Değişken Sayısı (kk)R2R^2Düzeltilmiş R2R^2AIC
I30.680.66145
II50.740.72120
III70.770.69135

Model seçiminin ardından araştırmacı, seçilen modelin standartlaştırılmış artık (standardized residual) değerlerini incelemiş ve üç gözlemin değerinin +3.5+3.5 ile +4.2+4.2 arasında olduğunu tespit etmiştir.

Buna göre, araştırmacının model seçimi ve artık analizi değerlendirmesiyle ilgili aşağıdaki ifadelerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: Model II, düzeltilmiş R2R^2'yi maksimize edip AIC değerini minimize ettiği için en uygun modeldir ve standartlaştırılmış artığı 33'ten büyük olan gözlemler aykırı değer (outlier) olarak sınıflandırılır.

Cevap

Düzeltilmiş R-kare ve AIC kriterlerine göre en uygun model olan Model II seçilmeli ve 3'ten büyük standartlaştırılmış artığa sahip gözlemler aykırı değer olarak kabul edilmelidir.
Çoklu doğrusal regresyonda en iyi modeli seçerken R2R^2 yerine, değişken sayısındaki artışı cezalandıran düzeltilmiş R2R^2 ve AIC gibi kriterlere bakılır. Model II, hem düzeltilmiş R2R^2'yi (0.72) maksimize etmiş hem de AIC değerini (120) minimize etmiştir. Artık analizinde ise standartlaştırılmış (veya öğrencileştirilmiş) kalıntıların mutlak değer olarak 33'ten büyük olması, istatistiksel analizlerde genel kabul görmüş bir aykırı değer (outlier) kanıtıdır. Bu nedenle doğru seçenek, Model II'yi seçen ve artık bulgusunu aykırı değer olarak doğru biçimde sınıflandıran ifadedir.

Adım Adım Çözüm

1
Farklı model spesifikasyonlarına ait ölçütleri karşılaştırarak en iyi modeli belirlemek.
Model II'nin düzeltilmiş R2R^2 değeri (0.72) en yüksektir ve AIC değeri (120) en düşüktür.
Çoklu regresyonda modele anlamsız değişken eklendiğinde standart R2R^2 yapay olarak artar. Bu nedenle modelleri kıyaslarken serbestlik derecesi kaybını dikkate alan düzeltilmiş R2R^2 ve Akaike Bilgi Kriteri (AIC) kullanılmalıdır.
2
Standartlaştırılmış artık (standardized residual) değerlerini yorumlamak.
Üç gözlemin standartlaştırılmış artık değerleri 3'ten büyüktür (+3.5 ve +4.2 arası).
Regresyon analizinde standartlaştırılmış veya öğrencileştirilmiş artıkların mutlak değer olarak 3'ü aşması, o gözlemlerin tahmin edilen doğrudan çok uzakta yer alan aykırı değerler (outlier) olduğunu gösterir.

Anahtar Kavram

Model Seçim Kriterleri (AIC, Düzeltilmiş R-kare) ve Artık Analizinde Aykırı Değer Tespiti
Soru 6Soru

Bir bölgesel kalkınma ajansında görevli uzman, 81 ilin imalat sanayi ihracat hacmini (YY) tahmin etmek için 6 farklı bağımsız değişken içeren bir çoklu doğrusal regresyon modeli (Model I) kurmuştur. Daha sonra, model seçimi kriterleri ve değişken seçimi yöntemleri kullanılarak 4 bağımsız değişkenden oluşan yeni bir model (Model II) elde edilmiştir. Modellere ait bazı özet istatistikler ve artık analizi sonuçları aşağıda verilmiştir:

İstatistik / TestModel I (6 Değişken)Model II (4 Değişken)
Belirleme Katsayısı (R2R^2)0.840.840.810.81
Düzeltilmiş Belirleme Katsayısı (Rˉ2\bar{R}^2)0.780.780.800.80
Akaike Bilgi Kriteri (AICAIC)412.5412.5385.2385.2
Shapiro-Wilk Testi (pp-değeri)0.010.010.180.18
Maksimum Cook Uzaklığı (DD)0.850.851.451.45

(Not: Anlamlılık düzeyi α=0.05\alpha = 0.05 olarak alınacaktır. Shapiro-Wilk testi için H0H_0: Artıklar normal dağılıma uygundur.)

Bu bilgilere göre, model seçimi ve artık analizi süreciyle ilgili aşağıdaki ifadelerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: Model II, bilgi kriteri (AICAIC) ve düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2) dikkate alındığında daha uygun bir modeldir; Model II'de artıkların normal dağılım varsayımı sağlanmasına rağmen, analiz sonuçlarını aşırı etkileyebilecek bir gözlem bulunmaktadır.

Cevap

Model II'nin düzeltilmiş R-kare ve AIC kriterlerine göre daha üstün olduğunu, Shapiro-Wilk testine göre artıkların normal dağıldığını, ancak Cook uzaklığı değerine bakılarak etkili bir gözlem barındırdığını belirten seçenek doğrudur.
Verilen bilgiler bütünleşik olarak değerlendirildiğinde; Model II'nin düzeltilmiş belirleme katsayısının daha yüksek ve Akaike Bilgi Kriterinin daha düşük olması onun Model I'e kıyasla daha uygun bir yapıya sahip olduğunu kanıtlar. Ayrıca Model II'de Shapiro-Wilk testinin pp-değeri 0.050.05'ten büyük olduğu için (0.180.18) artıkların normal dağıldığı varsayımı ihlal edilmemiştir. Ancak tablodaki maksimum Cook Uzaklığı değerinin 11'den büyük (1.451.45) çıkması, tahmin edilen modelde katsayıları aşırı etkileyen sapan bir gözlemin varlığına işaret etmektedir.

Adım Adım Çözüm

1
Model seçimi kriterlerini karşılaştırarak en iyi modeli belirle.
Model I için Rˉ2=0.78\bar{R}^2=0.78, AIC=412.5AIC=412.5; Model II için Rˉ2=0.80\bar{R}^2=0.80, AIC=385.2AIC=385.2. Model II'nin düzeltilmiş belirleme katsayısı daha yüksek ve AIC değeri daha düşüktür. Bu nedenle Model II daha iyi bir modeldir.
Farklı sayıda bağımsız değişken içeren modeller karşılaştırılırken standart R2R^2 yerine serbestlik derecesini dikkate alan Rˉ2\bar{R}^2 ve düşük bilgi kaybını hedefleyen (küçük olanın tercih edildiği) AICAIC kullanılır.
2
Shapiro-Wilk test sonuçlarını yorumlayarak normallik varsayımını kontrol et.
Model I için p=0.01<0.05p=0.01 < 0.05 (Normallik reddedilir). Model II için p=0.18>0.05p=0.18 > 0.05 (Normallik reddedilemez, varsayım sağlanır).
Artıkların normallik testlerinde H0H_0 hipotezi dağılımın normal olduğunu belirtir. Anlamlılık düzeyi (0.050.05) aşıldığında normallik şartı sağlanmış kabul edilir.
3
Maksimum Cook Uzaklığı (DD) değerlerini yorumla.
Model II'de Cook Uzaklığı değeri 1.451.45'tir. Bu değer genellikle eşik kabul edilen 11'den büyüktür.
Cook Uzaklığı'nın 11'den büyük olması, o gözlemin regresyon katsayılarını tek başına ciddi şekilde değiştirebilecek kadar etkili (influential point) olduğunu ifade eder.

Anahtar Kavram

Regresyonda Model Seçimi Kriterleri ve Artık Analizi Tanı Testleri
Soru 7Soru

Bir Hazine ve Maliye Bakanlığı uzmanı, 60 ilin vergi tahsilat performansını (YY) tahmin etmek amacıyla 7 bağımsız değişken içeren bir çoklu doğrusal regresyon modeli (Model I) tahmin etmiştir. Analiz sonucunda R2=0.88R^2 = 0.88 ve genel F-istatistiği anlamlı bulunmuştur. Modelin artık (kalıntı) ve teşhis (diagnostic) istatistikleri incelendiğinde aşağıdaki bulgular elde edilmiştir:

- 28 numaralı ilin standartlaştırılmış artık değeri e28=1.15e_{28}^* = 1.15 olarak hesaplanmıştır.
- Aynı gözlemin kaldıraç (leverage) değeri h28,28=0.82h_{28,28} = 0.82 (kritik eşiğin çok üzerinde) ve Cook Uzaklığı D28=2.1D_{28} = 2.1 olarak bulunmuştur.
- 28 numaralı gözlem veri setinden çıkarılarak model yeniden tahmin edildiğinde (Model II), Model I'de %5 anlamlılık düzeyinde istatistiksel olarak anlamlı bulunan üç bağımsız değişkenin anlamsız hâle geldiği saptanmıştır.
- Uzman daha sonra, kalan 59 gözlem üzerinden farklı alt model kombinasyonlarını sınamış; Akaike Bilgi Kriteri (AIC) ve Mallows CpC_p istatistiği en düşük olan daraltılmış bir modeli (Model III) nihai model olarak belirlemiştir.

Bu araştırma süreci ve bulgular dikkate alındığında, aşağıdaki ifadelerden hangisi istatistiksel olarak kesinlikle doğrudur?

Cevabı ve açıklamayı göster

Cevap: 28 numaralı gözlem, bağımlı değişken (YY) yönünden belirgin bir aykırı değer olmamasına karşın, bağımsız değişken (XX) uzayında etkin (influential) bir noktadır ve Model I'deki bazı parametrelerin anlamlılığını tek başına yönlendirmiştir.

Cevap

Standartlaştırılmış artığı düşük ancak kaldıraç ve Cook uzaklığı yüksek olan gözlemin, aykırı değer olmamasına rağmen regresyon katsayılarını tek başına belirleyen etkin (influential) bir nokta olduğunu belirten seçenektir.
Doğru seçenekte belirtildiği üzere; bir noktanın standartlaştırılmış artığının düşük olması, onun Y yönünde sapan bir değer olmadığını ifade eder. Ancak yüksek kaldıraç değeri, bağımsız değişkenlerin (X) ortalamasından çok uzak olduğunu gösterir. Yüksek Cook Uzaklığı ise bu x-değerinin regresyon doğrusunu bir manivela gibi kendine çekerek eğimleri değiştirdiğini doğrular. Bu nokta çıkarıldığında değişkenlerin anlamsızlaşması, daha önce görülen 'anlamlılık' tablosunun tamamen bu tek noktanın yarattığı geometrik bir illüzyon olduğunu ispatlar.

Adım Adım Çözüm

1
Standartlaştırılmış artık (standardized residual) değerini yorumla.
e28=1.15e_{28}^* = 1.15 değeri, genel kabul gören mutlak 2 veya 3 eşiğinden küçüktür.
Gözlemin bağımlı değişken (YY) düzleminde bir aykırı değer (outlier) olmadığını tespit etmek için.
2
Kaldıraç (leverage, hiih_{ii}) ve Cook Uzaklığı (DiD_i) değerlerini analiz et.
h28,28=0.82h_{28,28} = 0.82 değeri X uzayında çok uçta yer aldığını, D28=2.1D_{28} = 2.1 değeri ise bu noktanın regresyon doğrusunu şiddetle kendine çektiğini gösterir.
Gözlemin model parametreleri üzerindeki etkisini (influence) belirlemek için.
3
Noktanın çıkarılmasıyla (Model II) katsayıların anlamsızlaşmasını değerlendir.
Orijinal modeldeki istatistiksel anlamlılığın genel veriden değil, sadece 28 numaralı gözlemin yarattığı yapay çekimden kaynaklandığı kanıtlanmıştır.
Model seçim sürecinin geçerliliğini ve etkin noktanın yarattığı illüzyonu kavramak için.

Anahtar Kavram

Regresyon Teşhis İstatistikleri (Kaldıraç, Cook Uzaklığı ve Aykırı Değerler) ve Model Seçimi
Tahmini Süre:2m 30s
Soru 8Soru

Bir kamu strateji biriminde yürütülen projede, bağımlı bir değişkenin (YY) tahmin edilmesi amacıyla iki farklı regresyon modeli oluşturulmuş ve modellerin performans ölçütleri aşağıdaki tabloda özetlenmiştir:

ÖlçütModel IModel II
Bağımsız Değişken Sayısı (kk)35
Belirleme Katsayısı (R2R^2)0,850,86
Düzeltilmiş R2R^20,820,81
Akaike Bilgi Kriteri (AICAIC)240,0248,0

Buna göre, bu modellerin karşılaştırılması ve seçimine ilişkin aşağıdaki ifadelerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: Model I, hem daha yüksek düzeltilmiş belirleme katsayısına hem de daha düşük bir bilgi kriteri değerine sahip olduğu için Model II'den daha iyi bir modeldir.

Cevap

Model I'in hem daha yüksek düzeltilmiş belirleme katsayısına hem de daha düşük bir bilgi kriteri değerine sahip olduğu için daha iyi bir model olduğu ifadesi doğrudur.
Model seçiminde tek başına R2R^2 değeri yanıltıcıdır çünkü modele ne kadar çok değişken eklenirse eklensin R2R^2 asla azalmaz. Düzeltilmiş R2R^2 (AdjR2Adj R^2) ise gereksiz değişken eklendiğinde düşebilir. Model I'in AdjR2Adj R^2 değerinin Model II'den yüksek olması (0,82 > 0,81) ve Akaike Bilgi Kriteri (AICAIC) değerinin Model II'den düşük olması (240 < 248), Model I'in veriyi daha etkili ve dengeli bir şekilde açıkladığını kanıtlar.

Adım Adım Çözüm

1
Belirleme katsayılarını (R2R^2 ve Düzeltilmiş R2R^2) karşılaştırın.
Model II'nin R2R^2 değeri (0,86) Model I'den (0,85) yüksek olsa da, değişken sayısını cezalandıran Düzeltilmiş R2R^2 değeri Model I'de (0,82) daha yüksektir.
Modele gereksiz değişken eklendiğinde R2R^2 yapay olarak artabilir, bu yüzden düzeltilmiş değer daha güvenilirdir.
2
Bilgi kriterlerini (AICAIC) karşılaştırın.
Model I'in AICAIC değeri (240,0), Model II'nin AICAIC değerinden (248,0) daha düşüktür.
Model seçiminde AIC değerinin düşük olması, modelin veri üzerindeki bilgi kaybının daha az olduğunu ve parsimoni ilkesine daha yakın olduğunu gösterir.
3
Son kararı verin.
Model I her iki kriterde de daha iyi performans göstermektedir.
Düzeltilmiş R2R^2 değerinin yüksek, AICAIC değerinin düşük olması Model I'i üstün kılar.

Anahtar Kavram

Model seçim kriterleri (AdjR2Adj R^2 ve AICAIC) ve parsimoni ilkesi.

Alternatif Yöntem

Aynı modeller için BIC (Bayesyen Bilgi Kriteri) değeri de hesaplanabilir. BIC, değişken sayısı için AIC'den daha ağır bir ceza uygular ve genellikle daha parsimonik modelleri tercih eder.
Tahmini Süre:1m 30s
Soru 9Soru

Bir Sanayi ve Teknoloji Bakanlığı uzmanı, organize sanayi bölgelerindeki işletmelerin yıllık yenilik kapasite endeksini (YY) tahmin etmek için 6 potansiyel bağımsız değişken (Ar-Ge harcaması, patent sayısı, çalışan sayısı vb.) kullanarak çoklu doğrusal regresyon analizi yapmaktadır. Uzman, aşamalı (stepwise) regresyon yöntemiyle değişken seçimi yapmış ve aşağıdaki üç aday modeli elde etmiştir:

ModelBağımsız Değişken Sayısı (kk)R2R^2Düzeltilmiş R2R^2AICAIC
I30.680.65245.2
II40.710.69238.4
III60.740.66251.6

Uzman ayrıca aday modellerden birinin artık (residual) analizini incelediğinde; standartlaştırılmış artıkların ±3\pm 3 sınırları içerisinde yer aldığını, ancak tahmin edilen değerler arttıkça artıkların serpilme diyagramında huni (koni) şeklinde dışa doğru açılan belirgin bir yayılım gösterdiğini tespit etmiştir.

Buna göre, uzmanın elde ettiği bulgularla ilgili aşağıdaki değerlendirmelerden hangisi istatistiksel olarak doğrudur?

Cevabı ve açıklamayı göster

Cevap: Model III'te R2R^2 değerinin en yüksek olmasına rağmen Düzeltilmiş R2R^2'nin düşmesi ve AICAIC'nin artması eklenen değişkenlerin modele anlamlı bir katkı sağlamadığını gösterir; artıkların huni şeklindeki yayılımı ise değişen varyans (heteroskedastisite) sorununa işaret eder.

Cevap

Doğru seçenek, Model III'te değişken sayısının artmasının R2R^2'yi yapay olarak yükselttiğini ancak Düzeltilmiş R2R^2'yi düşürdüğünü saptayan ve huni şeklindeki artık dağılımını değişen varyans sorunu olarak teşhis eden ifadedir.
Verilen tabloda Model II en düşük AICAIC değerine ve en yüksek Düzeltilmiş R2R^2 değerine sahiptir. Model III'e fazladan eklenen değişkenler R2R^2'yi matematiksel bir zorunluluk olarak artırmış olsa da, Düzeltilmiş R2R^2'yi düşürmüş ve AICAIC'yi yükseltmiştir; bu durum eklenen değişkenlerin açıklayıcı bir gücü olmadığını ispatlar. Öte yandan, tahmin edilen değerlere karşı çizilen artıklarda gözlemlenen dışa doğru açılan huni yapısı, klasik doğrusal regresyonun 'hata terimlerinin varyansı sabittir' varsayımının ihlal edildiğini, yani değişen varyans (heteroskedastisite) sorunu yaşandığını kesin olarak göstermektedir.

Adım Adım Çözüm

1
Aday modellerin performans kriterlerini karşılaştır.
Model II'nin Düzeltilmiş R2R^2'si en yüksek (0.69) ve AICAIC değeri en düşüktür (238.4). Model III'ün R2R^2'si yüksek olsa da Düzeltilmiş R2R^2'si Model II'den düşüktür.
Modele eklenen fazladan 2 değişkenin bağımlı değişkendeki değişimi açıklamakta yetersiz kaldığını ve ceza faktöründen dolayı model performansını düşürdüğünü belirlemek için.
2
Artık analizi bulgularını yorumla.
Standartlaştırılmış artıkların ±3\pm 3 aralığında olması uç değer probleminin olmadığını; artıkların tahmin edilen değerlere karşı huni (koni) şeklinde yayılması ise hata terimlerinin varyansının sabit olmadığını gösterir.
EKK varsayımlarının ihlal edilip edilmediğini teşhis etmek için.
3
Bulguları sentezleyerek doğru seçeneği belirle.
Model III'ün eklenen değişkenlerinin anlamlı olmadığı ve serpilme diyagramındaki örüntünün değişen varyans (heteroskedastisite) anlamına geldiği tespit edilir.
Model seçimi ve varsayım kontrollerine dair iki aşamalı analizin doğru kuramsal karşılığını bulmak için.

Anahtar Kavram

Model Seçim Kriterleri (R2R^2, Düzeltilmiş R2R^2, AICAIC) ve Değişen Varyans Teşhisi
Tahmini Süre:2m 0s
Soru 10Soru

Bir eğitim politikaları uzmanı, ortaöğretim kurumlarının üniversiteye yerleştirme oranlarını (YY) açıklamak amacıyla, okulun fiziki donanımı, öğretmen başına düşen öğrenci sayısı gibi 7 farklı potansiyel bağımsız değişken içeren bir veri seti ile çalışmaktadır. Değişken seçme algoritmaları kullanılarak tahmin edilen iki alternatif regresyon denkleminin temel özet istatistikleri aşağıdaki tabloda verilmiştir:

ModelBağımsız Değişken SayısıR2R^2Rˉ2\bar{R}^2AICAIC
Birinci Taslak Model40,750,72184,3
İkinci Taslak Model50,780,68196,5

Uzman, bilgi kriterleri ve belirleme katsayılarını değerlendirerek analizi sürdüreceği nihai modeli belirlemiştir. Daha sonra, seçilen bu nihai modelin geçerliliğini sınamak amacıyla öğrenci (studentized) artık değerlerini dikey eksene, modelin ürettiği tahmin değerlerini (Y^\hat{Y}) ise yatay eksene yerleştirerek bir saçılım grafiği elde etmiştir. Bu grafikte, tahmin değerleri büyüdükçe noktaların dikey eksendeki yayılımının da giderek arttığı ve sağa doğru genişleyen belirgin bir huni biçiminin ortaya çıktığı görülmüştür.

Bu araştırma sürecindeki bulgulara göre, uzmanın yaptığı model seçimi ve karşılaştığı duruma ilişkin aşağıdaki değerlendirmelerden hangisi istatistiksel olarak en doğrudur?

Cevabı ve açıklamayı göster

Cevap: Daha düşük bilgi kriteri ve daha yüksek serbestlik derecesine göre düzeltilmiş açıklayıcılık oranı sunduğu için Birinci Taslak Model tercih edilmelidir; saptanan grafiksel doku ise hata terimlerinin sabit varyanslılık varsayımının ihlal edildiğini gösterdiğinden, katsayıların standart hatalarının White veya benzeri dirençli (robust) tahmincilerle düzeltilmesi gerekir.

Cevap

Daha düşük bilgi kriteri ve daha yüksek serbestlik derecesine göre düzeltilmiş açıklayıcılık oranı sunduğu için Birinci Taslak Model tercih edilmelidir; saptanan grafiksel doku ise hata terimlerinin sabit varyanslılık varsayımının ihlal edildiğini gösterdiğinden, katsayıların standart hatalarının White veya benzeri dirençli (robust) tahmincilerle düzeltilmesi gerekir.
Çoklu doğrusal regresyonda aday modeller arasından seçim yapılırken standart belirleme katsayısı (R2R^2) yanıltıcı olabilir; çünkü açıklayıcı değişken eklendikçe R2R^2 yapay bir şekilde artış gösterir. Bu nedenle modele eklenen parametrenin maliyetini (serbestlik derecesi kaybını) dikkate alan Düzeltilmiş R2R^2 (Rˉ2\bar{R}^2) ve Akaike Bilgi Kriteri (AICAIC) gibi ölçütler referans alınmalıdır. Tabloda Birinci Taslak Model, daha düşük AICAIC ve daha yüksek Rˉ2\bar{R}^2 değerlerine sahip olduğundan istatistiksel açıdan kesinlikle daha üstündür. Diğer taraftan, artıkların (kalıntıların) tahmin değerlerine göre çizilen serpilme diyagramında dışa doğru açılan bir huni (funnel) şeklinin görülmesi, hataların varyansının sabit kalmadığını, yani 'değişen varyans (heteroskedastisite)' sorunu bulunduğunu ispatlar. Bu varsayım ihlalinin tipik çözüm yöntemlerinden biri, t-istatistiklerini güvenilir kılmak adına katsayı varyanslarının White veya Huber-White gibi dirençli (robust) yöntemlerle hesaplanmasıdır. Tüm bu gerekçeleri eksiksiz yansıtan doğru yanıt, Birinci Taslak Modeli ve dirençli standart hatalar çözümünü birlikte sunan seçenektir.

Adım Adım Çözüm

1
Model seçimi kriterlerinin (AIC ve Düzeltilmiş R-kare) karşılaştırılması
Birinci Taslak Modelin AIC değeri (184,3) daha düşük ve Düzeltilmiş R-kare değeri (0,72) daha yüksektir.
AIC değerinin küçük olması bilgi kaybının az olduğunu, Düzeltilmiş R-kare değerinin yüksek olması ise modelin açıklama gücünün serbestlik derecesi kaybına değdiğini gösterir.
2
İkinci Taslak Modeldeki R-kare artışının değerlendirilmesi
Standart R-kare değeri 0,75'ten 0,78'e çıkmış olsa da, Düzeltilmiş R-kare 0,68'e düşmüştür.
Modele yeni bir değişken eklendiğinde standart R-kare matematiksel olarak düşemez. Ancak eklenen 5. değişkenin modele getirdiği ek açıklayıcılık, parametre sayısındaki artışın (serbestlik derecesi kaybı) yarattığı cezayı karşılayamadığı için Düzeltilmiş R-kare azalmıştır.
3
Artıklar saçılım grafiğindeki huni biçimli örüntünün yorumlanması
Tahmin değerleri büyüdükçe artıkların yayılımının (varyansının) arttığı saptanmıştır.
Bu grafiksel doku, hata terimlerinin varyansının bağımlı veya bağımsız değişkenlerin seviyelerine göre değiştiğini, yani sabit varyans varsayımının (homoskedastisite) bozulduğunu ve değişen varyans (heteroskedastisite) sorunu yaşandığını açıkça kanıtlar.
4
Değişen varyans sorununun analitik çözümünün belirlenmesi
Model tahminlerinde dirençli (robust) standart hatalar kullanılmalıdır.
Değişen varyans durumunda EKK katsayı tahmincileri yansız kalmaya devam etse de etkinliklerini kaybederler ve t-testleri güvenilmez hale gelir. Bu nedenle standart hataların White gibi dirençli yöntemlerle düzeltilmesi gerekir.

Anahtar Kavram

Model Seçim Kriterleri ve Değişen Varyansın (Heteroskedastisite) Tespiti
Tahmini Süre:2m 0s
Soru 11Soru

Bir e-ticaret şirketindeki veri bilimci, müşterilerin yıllık harcama tutarlarını (YY) tahmin etmek amacıyla müşteri demografisi ve site içi etkileşim verilerini kullanarak iki farklı çoklu doğrusal regresyon modeli geliştirmiştir:

Model I: 3 bağımsız değişken içermektedir. R2=0.68R^2 = 0.68, Düzeltilmiş R2=0.66R^2 = 0.66, BIC=512BIC = 512
Model II: 8 bağımsız değişken içermektedir. R2=0.73R^2 = 0.73, Düzeltilmiş R2=0.61R^2 = 0.61, BIC=560BIC = 560

Veri bilimci, model seçim kriterleri yardımıyla istatistiksel olarak en uygun modeli tercih etmiştir. Ardından, tercih edilen modelin varsayımlarını kontrol etmek için standartlaştırılmış artıkların (hata terimlerinin), tahmini değerlere (Y^\hat{Y}) karşı saçılım diyagramını oluşturmuştur. Diyagram incelendiğinde, tahmini değerler ekseninde sağa doğru gidildikçe artıkların sıfır ekseni etrafındaki dağılım aralığının belirgin şekilde genişlediği ve huniye benzer bir görünüm aldığı saptanmıştır.

Buna göre, veri bilimcinin seçtiği model ve saçılım diyagramından hareketle teşhis ettiği modelleme sorunu aşağıdakilerden hangisinde doğru olarak verilmiştir?

Cevabı ve açıklamayı göster

Cevap: Model I seçilmelidir; grafikteki görünüm değişen varyans sorununa işaret etmektedir.

Cevap

Doğru yanıt, Model I'in seçilmesi ve grafikteki görünümün değişen varyans (heteroskedastisite) sorununa işaret etmesidir.
Model karşılaştırmasında, farklı sayıda açıklayıcı değişken içeren modelleri değerlendirmek için standart R-kare yerine Düzeltilmiş R-kare ve bilgi kriterlerine (BIC) bakılmalıdır. Model I, daha yüksek Düzeltilmiş R-kare (0.66 > 0.61) ve daha düşük BIC (512 < 560) sunduğundan en uygun modeldir. İkinci olarak, standartlaştırılmış artıkların tahmini değerlere karşı çizilen saçılım diyagramında artıkların yayılımının bir yöne doğru artması (huni şekli), hata terimlerinin varyansının sabit olmadığını, yani değişen varyans (heteroskedastisite) sorunu yaşandığını açıkça kanıtlar.

Adım Adım Çözüm

1
Model seçimi kriterlerini (Düzeltilmiş R-kare ve BIC) karşılaştırmak.
Model I'in Düzeltilmiş R2R^2 değeri (0.66), Model II'den (0.61) büyüktür. Model I'in BIC değeri (512), Model II'den (560) küçüktür.
Değişken sayısı farklı olan modeller karşılaştırılırken standart R2R^2 yerine ceza terimi içeren Düzeltilmiş R2R^2 veya bilgi kriterleri (AIC, BIC) kullanılmalıdır.
2
Modellerden en uygun olanını seçmek.
Daha az değişkenle daha yüksek açıklayıcılık (Düzeltilmiş R2R^2) ve daha düşük bilgi kriteri (BIC) sağlayan Model I seçilmelidir.
BIC'nin küçük olması ve Düzeltilmiş R2R^2'nin büyük olması modelin veri setine daha iyi uyum sağladığını gösterir.
3
Artık grafiğindeki huni görünümünü yorumlamak.
Tahmini değerler (Y^\hat{Y}) arttıkça artıkların varyansının (yayılımının) artması durumu tespit edilir.
Artıkların sıfır etrafında sabit bir varyansla (rastgele bir bulut şeklinde) dağılması gerekir. Huni şekli, değişen varyans (heteroskedastisite) sorununun karakteristik bir belirtisidir.

Anahtar Kavram

Model seçim kriterleri (Düzeltilmiş R-kare, BIC) ve artık (rezidü) analizinde varsayım ihlallerinin grafiksel tespiti.
Tahmini Süre:1m 30s
Soru 12Soru

Tarım ve Orman Bakanlığı bünyesinde yürütülen bir projede, buğday verimi (YY) ile toprak kalitesi (X1X_1), gübre miktarı (X2X_2), sulama sıklığı (X3X_3) ve sıcaklık (X4X_4) arasındaki ilişkiyi analiz etmek amacıyla iki farklı regresyon modeli kurulmuştur. Modellere ilişkin elde edilen istatistiksel sonuçlar aşağıdaki tabloda sunulmuştur:

İstatistiksel ÖlçütModel IModel II
Bağımsız Değişken Sayısı (kk)47
Belirleme Katsayısı (R2R^2)0,840,87
Düzeltilmiş R2R^2 (Rˉ2\bar{R}^2)0,810,78
Akaike Bilgi Kriteri (AIC)420,5455,2
Artıkların Serpilme GrafiğiRastgele DağılımBelirgin Huni Görünümü

Bu verilere dayanarak, model seçimi ve artık analizi (residual analysis) açısından yapılan aşağıdaki değerlendirmelerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: Model I tercih edilmelidir; çünkü hem düzeltilmiş belirleme katsayısı daha yüksektir hem de artıklar regresyon varsayımlarına uygun bir dağılım sergilemektedir.

Cevap

Model I'in tercih edilmesi gerektiği, çünkü düzeltilmiş belirleme katsayısının daha yüksek olması ve artıkların varsayımlara uygun rastgele bir dağılım sergilemesidir.
Model I, Model II'ye kıyasla daha az bağımsız değişken içermesine rağmen daha yüksek bir düzeltilmiş belirleme katsayısına (Rˉ2\bar{R}^2) ve daha düşük bir AIC değerine sahiptir. Bu durum Model I'in daha etkin ve parsimonik olduğunu gösterir. Ayrıca, artıkların rastgele dağılım sergilemesi, değişen varyans gibi temel varsayım ihlallerinin olmadığını teyit eder; bu nedenle Model I tercih edilmelidir.

Adım Adım Çözüm

1
Düzeltilmiş Belirleme Katsayılarını (Rˉ2\bar{R}^2) karşılaştırın.
Model I (0,81) > Model II (0,78).
Model I, serbestlik derecesine göre düzeltildiğinde daha fazla açıklayıcılık sunmaktadır.
2
Akaike Bilgi Kriteri (AIC) değerlerini karşılaştırın.
Model I (420,5) < Model II (455,2).
Bilgi kriterlerinde düşük değerler, karmaşıklık ve uyum arasındaki dengenin daha iyi kurulduğunu (parsimony) gösterir.
3
Artık (residual) grafiklerini analiz edin.
Model I rastgele dağılırken, Model II huni şekli sergilemektedir.
Huni şekli değişen varyans (heteroscedasticity) sorununa işaret eder ve Model II'nin güvenilirliğini sarsar.

Anahtar Kavram

Model Seçim Kriterleri ve Artık Analizi
Soru 13Soru

Bir halk sağlığı uzmanı, ilçelerdeki hastane doluluk oranlarını (YY) açıklamak için 8 potansiyel bağımsız değişkenle doğrusal regresyon analizi yapmaktadır. Uzman üç farklı model kurmuş ve aşağıdaki tanısal bulguları elde etmiştir:

- Model I: Tümü (8 değişken) modele dâhil edilmiştir. R2=0.86R^2 = 0.86, Düzeltilmiş R2=0.74R^2 = 0.74. Artıkların (kalıntıların) tahmin edilen değerlere göre çizilen saçılım grafiğinde belirgin bir "huni (funnel)" biçimi gözlenmiştir.
- Model II: Adımsal (stepwise) regresyon ile 4 değişken seçilmiştir. R2=0.80R^2 = 0.80, Düzeltilmiş R2=0.78R^2 = 0.78. Artıklar rastgele dağılmakla birlikte, modele ait bir gözlemin Cook Uzaklığı (Cook's Distance) Di=1.8D_i = 1.8 olarak hesaplanmıştır.
- Model III: Geriye doğru eleme (backward elimination) ile 5 değişken seçilmiştir. R2=0.81R^2 = 0.81, Düzeltilmiş R2=0.77R^2 = 0.77. Artıklar rastgele dağılmakta ve tüm gözlemlerin Cook Uzaklığı Di<0.4D_i < 0.4 düzeyindedir.

Buna göre, bu modellerin geçerliliği ve seçimi konusunda aşağıdaki değerlendirmelerden hangisi istatistiksel olarak en uygundur?

Cevabı ve açıklamayı göster

Cevap: Model III tercih edilmelidir; çünkü Model I'deki değişen varyans sorunu bulunmamaktadır ve Model II'de regresyon doğrusunu aşırı etkileyen uç değerden kaçınılmıştır.

Cevap

Model III'ün tercih edilmesi gerektiğini savunan seçenek doğrudur. Çünkü Model I'deki değişen varyans sorunu giderilmiş ve Model II'deki aşırı etkili gözlemden (outlier/influential point) kaçınılmıştır.
Doğru yanıt, Model III'ün en sağlam model olduğunu belirten ifadedir. Model seçimi sadece Düzeltilmiş R-kare gibi uyum iyiliği ölçütleriyle yapılamaz; artık (kalıntı) analizlerinin de sorunsuz olması gerekir. Model I huni görünümü ile değişen varyans varsayımını ihlal ederken, Model II Cook Uzaklığı eşik değerini (1.0) aşan bir aykırı/etkin gözleme sahip olduğu için güvenilir değildir. Model III hem yüksek Düzeltilmiş R-kare sunar hem de varsayımları ihlal etmez.

Adım Adım Çözüm

1
Model I'in tanısal özelliklerini incele.
8 değişkenli bu modelde R2R^2 (0.86) ile Düzeltilmiş R2R^2 (0.74) arasında büyük bir fark vardır, bu durum gereksiz değişkenlerin varlığına (aşırı uyum) işaret eder. Ayrıca, artıkların "huni (funnel)" biçiminde dağılması ciddi bir "değişen varyans (heteroskedastisite)" sorunu olduğunu gösterir.
Model I'in istatistiksel çıkarımları (t ve F testleri) güvenilir değildir.
2
Model II'nin tanısal özelliklerini incele.
Düzeltilmiş R2R^2 en yüksek (0.78) olmasına rağmen, bir gözlemin Cook Uzaklığı Di=1.8D_i = 1.8'dir.
Genel kural olarak Cook Uzaklığının 1'den büyük olması (Di>1D_i > 1), ilgili gözlemin regresyon katsayılarını tek başına ciddi şekilde değiştirecek kadar "etkin gözlem (influential observation)" olduğunu kanıtlar. Bu model tek bir veriye aşırı duyarlıdır.
3
Model III'ün tanısal özelliklerini incele.
Düzeltilmiş R2R^2 (0.77) oldukça rekabetçidir. Artıklar rastgele dağılmıştır (değişen varyans yok) ve tüm Cook Uzaklıkları 0.40.4'ün altındadır (aşırı etkili gözlem yok).
Varsayımları sağlayan ve veriye uyumu yeterli olan en sağlam ve güvenilir yapı Model III'tür.

Anahtar Kavram

Regresyon Modellerinde Artık Analizi ve Varsayım İhlallerinin Tespiti
Soru 14Soru

Bir üretim tesisinde, günlük enerji tüketimini (YY) tahmin etmek amacıyla üretim miktarı (X1X_1), ortalama hava sıcaklığı (X2X_2) ve makinelerin ortalama yaşı (X3X_3) bağımsız değişkenleri kullanılarak üç farklı doğrusal regresyon modeli tahmin edilmiştir. Modellerin performans ölçütleri ve artık (hata) analizi sonuçları aşağıdaki tabloda verilmiştir:

ModelBağımsız DeğişkenlerR2R^2Düzeltilmiş R2R^2 (Rˉ2\bar{R}^2)AICArtık Varyansı
IX1X_10.650.64850Sabit
IIX1,X2X_1, X_20.780.76710Sabit
IIIX1,X2,X3X_1, X_2, X_30.820.74735Değişen

Not: Tüm modellerde artıkların normal dağılıma uyduğu ve otokorelasyon bulunmadığı tespit edilmiştir.

Bu analiz sonuçlarına göre, araştırmacının model seçimi ve artık analizi değerlendirmesiyle ilgili aşağıdakilerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: Model II, en düşük AIC değerine ve en yüksek düzeltilmiş R2R^2 değerine sahip olması, ayrıca sabit varyans varsayımını sağlaması nedeniyle tahmin için en uygun modeldir.

Cevap

Düzeltilmiş R-kare değeri en yüksek ve AIC değeri en düşük olan, aynı zamanda değişen varyans sorunu barındırmayan Model II en uygun modeldir.
Model II, diğer modellere kıyasla en düşük AIC (710) ve en yüksek düzeltilmiş R2R^2 (0.76) değerlerine sahiptir. Bunun yanı sıra, artık analizi sonucunda sabit varyans (homoskedastisite) varsayımını sağladığı görülmektedir. Bu özellikleriyle tahmin ve çıkarım yapmak için en güvenilir ve istatistiksel açıdan en uygun modeldir.

Adım Adım Çözüm

1
Modellerin açıklama gücünü ve bilgi kriterlerini karşılaştırmak.
Model II'nin düzeltilmiş R2R^2 değeri (0.76) en yüksek, AIC değeri (710) ise en düşüktür.
Farklı sayıda bağımsız değişken içeren modeller karşılaştırılırken standart R-kare yerine düzeltilmiş R-kare ve AIC kriterleri kullanılmalıdır.
2
Modellerin regresyon varsayımlarını sağlayıp sağlamadığını kontrol etmek.
Model I ve Model II sabit varyans varsayımını sağlarken, Model III'te değişen varyans sorunu mevcuttur.
İstatistiksel çıkarımların güvenilir olması için kalıntıların (artıkların) sabit varyanslı olması (homoskedastisite) gereklidir.
3
Performans ve varsayım sonuçlarını birleştirerek nihai kararı vermek.
Model II hem kriterler bakımından en iyi sonucu vermiş hem de varsayımları sağlamıştır.
Model III hem kriterlerde Model II'nin gerisinde kalmış hem de EKK tahmin edicilerinin etkinliğini bozan değişen varyans sorununa maruz kalmıştır.

Anahtar Kavram

Regresyonda Model Seçim Kriterleri ve Artık Analizi
Soru 15Soru

Çoklu doğrusal regresyon analizinde, modele yeni bağımsız değişkenler eklendiğinde belirleme katsayısının (R2R^2) matematiksel olarak hiçbir zaman azalmaması ve genellikle artma eğiliminde olması, farklı sayıda değişken içeren modellerin karşılaştırılmasını zorlaştırmaktadır. Bu durumu kontrol altına almak ve modelleri daha sağlıklı bir şekilde kıyaslayabilmek amacıyla kullanılan istatistik aşağıdakilerden hangisidir?

Cevabı ve açıklamayı göster

Cevap: Düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2)

Cevap

Düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2)
Düzeltilmiş belirleme katsayısı, modeldeki bağımsız değişken sayısını (p) ve örneklem hacmini (n) dikkate alan bir serbestlik derecesi düzeltmesi yapar. Bu sayede modele eklenen gereksiz değişkenler için bir 'ceza' uygulanmış olur ve farklı karmaşıklıktaki modellerin birbirleriyle adil bir şekilde karşılaştırılmasına olanak tanır.

Adım Adım Çözüm

1
Regresyon modellerinde R2R^2 ve Rˉ2\bar{R}^2 arasındaki farkı belirle.
R2R^2 değişken sayısı arttıkça artarken, Rˉ2\bar{R}^2 serbestlik derecesine göre düzeltme yapar.
Model karşılaştırmasında değişken sayısının 'ceza' olarak modele yansıtılması gerekir.
2
Düzeltilmiş belirleme katsayısının formülünü incele.
Rˉ2=1(1R2)n1np1\bar{R}^2 = 1 - (1 - R^2) \frac{n-1}{n-p-1} formülünde pp (değişken sayısı) arttıkça payda küçülür.
Anlamsız değişken eklenmesi Rˉ2\bar{R}^2 değerinin düşmesine neden olabilir, bu da model seçimi için bir kriter sunar.

Anahtar Kavram

Modeller arası karşılaştırmada düzeltilmiş belirleme katsayısının kullanımı

Daha Fazla Pratik

AIC ve BIC gibi bilgi kriterlerinin (Information Criteria) hangi durumlarda düzeltilmiş R-kare'ye tercih edildiğini inceleyebilirsiniz.
Tahmini Süre:45s
Soru 16Soru

Bir belediyenin çevre planlama departmanında görevli bir istatistikçi, ilçelerdeki günlük kişi başı su tüketim miktarını (YY) tahmin etmek için sosyodemografik ve altyapı değişkenlerini kullanarak iki farklı doğrusal regresyon modeli geliştirmiştir. Modellerin özet istatistikleri aşağıda verilmiştir:

ModelBağımsız Değişken SayısıR2R^2Düzeltilmiş R2R^2AICAIC
Model I60.760.68312.8
Model II20.730.71289.4

Analiz sonucunda, Model II'nin tahmin edilen değerlerine (Y^\hat{Y}) karşı çizilen standartlaştırılmış artıklar grafiğinde, değerler büyüdükçe artıkların sıfır etrafındaki yayılımının bariz bir huni görünümü aldığı tespit edilmiştir.

Bu bulgulara göre, modellerin karşılaştırılması ve artık analizi ile ilgili aşağıdaki ifadelerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: Düzeltilmiş R2R^2'nin yüksek ve AICAIC değerinin düşük olması sebebiyle Model II tercih edilmelidir; ancak artıklardaki huni görünümü değişen varyans sorunu olduğuna ve standart hataların güvenilirliğini yitirdiğine işaret eder.

Cevap

Modeller değerlendirilirken Düzeltilmiş R-kare'nin daha yüksek ve AIC değerinin daha düşük olması nedeniyle Model II'nin tercih edilmesi gerektiği; artıklardaki huni şeklindeki saçılımın ise değişen varyans (heteroskedastisite) sorununa ve dolayısıyla geçersiz standart hatalara işaret ettiğini belirten seçenektir.
Verilen tabloda Model II'nin değişken sayısı daha az olmasına rağmen Düzeltilmiş R-kare değeri daha yüksek ve AIC değeri daha düşüktür; bu durum istatistiksel olarak daha iyi ve sade bir model olduğunu gösterir. Artıklardaki 'huni' şekli ise değişen varyansın (heteroskedastisite) en tipik grafiksel belirtisidir. Bu sorunun varlığında EKK katsayıları yansızlığını korusa da, standart hataları hesaplanırken kullanılan varsayım çöktüğü için istatistiksel testler ve güven aralıkları güvenilirliğini yitirir.

Adım Adım Çözüm

1
Model seçim kriterlerinin (R2R^2, Düzeltilmiş R2R^2, AICAIC) değerlendirilmesi.
Farklı sayıda bağımsız değişken içeren modeller karşılaştırılırken standart R2R^2 yerine Düzeltilmiş R2R^2 ve AICAIC kriterleri dikkate alınır. Model II'nin Düzeltilmiş R2R^2'si (0.71 > 0.68) daha yüksek ve AICAIC değeri (289.4 < 312.8) daha düşüktür. Bu nedenle Model II tercih edilir.
Standart R2R^2 modele eklenen her gereksiz değişkenle bile artma eğilimindedir. Model sadeliğini de cezalandıran Düzeltilmiş R2R^2 ve AICAIC, model seçiminde daha doğru metriklerdir.
2
Artık analizi bulgularının (huni görünümü) yorumlanması.
Tahmin edilen Y^\hat{Y} değerleri büyüdükçe artıkların yayılımının genişlemesi (huni şekli), hata terimlerinin varyansının sabit olmadığı anlamına gelir. Bu duruma 'değişen varyans' (heteroskedastisite) adı verilir.
EKK varsayımlarından biri hata terimlerinin varyansının tüm gözlemler için sabit olmasıdır. Grafiksel artık analizi bu varsayımın ihlal edildiğini açıkça göstermektedir.
3
Değişen varyans sorununun model üzerindeki etkilerinin belirlenmesi.
Değişen varyans varlığında EKK tahmin edicileri yansız (sapmasız) kalmaya devam eder, ancak minimum varyanslı (etkin) olma özelliklerini kaybederler. Standart hatalar yanlış hesaplanacağı için t ve F hipotez testleri güvenilirliğini yitirir.
Varsayım ihlallerinin sonuçlarını bilmek, regresyon modelinin güvenilirliğini değerlendirmek için kritik öneme sahiptir.

Anahtar Kavram

Model seçim kriterleri (Düzeltilmiş R-kare, AIC) ve Artık analizinde değişen varyans tespiti
Soru 17Soru

Bir lojistik şirketi, şehirlerarası kargo teslimat sürelerini tahmin etmek amacıyla mesafe, araç tipi ve hava durumu indeksi değişkenlerini kullanarak bir çoklu doğrusal regresyon modeli tahmin etmiştir. Modelin yeterliliğini değerlendirmek için yapılan artık (kalıntı) analizi kapsamında, veri setindeki 42 numaralı gözlem birimi için aşağıdaki teşhis istatistikleri hesaplanmıştır:

- Standartlaştırılmış artık (Standardized residual) değeri: 3.83.8
- Cook Uzaklığı (Cook's D) değeri: 1.421.42
- Kaldıraç (Leverage) istatistiği (hiih_{ii}): Veri seti için belirlenen kritik eşik değerin oldukça üzerinde.

Genel kabul görmüş istatistiksel kurallar çerçevesinde, 42 numaralı gözlemin model üzerindeki etkisi ve niteliği hakkında aşağıdaki değerlendirmelerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: Bu gözlem, hem bağımlı değişken yönünden bir aykırı değerdir (outlier) hem de bağımsız değişkenler uzayında uçta yer alarak regresyon katsayıları üzerinde güçlü bir yönlendirici etki (influential) yaratmaktadır.

Cevap

42 numaralı gözlem hem bir aykırı değer (outlier) hem de kaldıraç noktası (leverage point) özelliklerini bir arada taşıyarak modelin katsayı tahminleri üzerinde güçlü bir yönlendirici etki (influential) oluşturmaktadır.
Verilen istatistikler regresyon teşhis analizinin üç farklı boyutunu yansıtır: Standartlaştırılmış artığın yüksek olması gözlemin bir aykırı değer (outlier) olduğuna, kaldıraç istatistiğinin yüksek olması gözlemin X uzayında uçta yer aldığına işaret eder. Bu iki durumun birleşimi, Cook Uzaklığının 1'den büyük çıkmasıyla doğrulanmış olup, gözlemin regresyon katsayılarını ciddi şekilde değiştiren yönlendirici/etkin (influential) bir gözlem olduğunu kanıtlamaktadır.

Adım Adım Çözüm

1
Standartlaştırılmış artık (standardized residual) değerini yorumla.
Değer 3.8 olarak verilmiştir. Mutlak değerce 2 veya 3'ten büyük olması, bu gözlemin bağımlı değişken (Y) ekseninde modelin tahminlerinden sapan bir aykırı değer (outlier) olduğunu gösterir.
Artıkların standart normal dağılıma yakınsadığı varsayımı altında uç değerleri tespit etmek.
2
Kaldıraç (leverage) istatistiğini değerlendir.
Eşik değerin oldukça üzerinde çıkmıştır. Bu durum, gözlemin bağımsız değişkenler (X) uzayında veri kümesinin merkezinden çok uzakta yer aldığını kanıtlar.
Gözlemin X eksenlerinde katsayı doğrusunu kendine çekme potansiyelini belirlemek.
3
Cook Uzaklığı (Cook's D) değerini analiz et.
Değer 1.42 olarak bulunmuştur. Genel kabul gören kurala göre 1'den büyük Cook uzaklığı, ilgili gözlemin etkin/yönlendirici (influential) olduğunu gösterir.
Aykırı değer ve kaldıraç noktasının regresyon katsayılarını ne kadar değiştirdiğini bütünleşik olarak ölçmek.

Anahtar Kavram

Artık Analizi ve Etkin (Influential) Gözlemlerin Tespiti
Soru 18Soru

Bir Kalkınma Ajansı uzmanı, illerin 'Sürdürülebilir Kalkınma Endeksi' (YY) puanlarını tahmin etmek amacıyla iki farklı regresyon modeli geliştirmiştir. Model 1'de 3 bağımsız değişken, Model 2'de ise bu değişkenlere ek olarak 2 yeni değişken daha (toplam 5 değişken) kullanılmıştır. Analiz sonuçlarına ilişkin özet istatistikler aşağıdaki tabloda sunulmuştur:

İstatistikModel 1Model 2
Bağımsız Değişken Sayısı (kk)35
Belirleme Katsayısı (R2R^2)0,780,81
Düzeltilmiş R2R^2 (Aˉdj.R2Ādj. R^2)0,750,72
Akaike Bilgi Kriteri (AICAIC)320,5345,8

Buna göre, model seçimi ve istatistiksel değerlendirme ile ilgili aşağıdakilerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: Model 1 tercih edilmelidir; çünkü düzeltilmiş R2R^2 değerinin daha yüksek ve AICAIC değerinin daha düşük olması modelin daha etkin olduğunu gösterir.

Cevap

Model 1'in seçilmesi gerektiğini belirten, düzeltilmiş R-kare ve AIC değerlerine dayanan ifade doğrudur.
Model 1'in tercih edilmesi gerektiğini savunan ifade doğrudur; çünkü istatistiksel model seçiminde 'en az değişkenle en yüksek açıklayıcılık' (parsimoni) hedeflenir. Model 2'de değişken sayısı artmasına rağmen düzeltilmiş R-kare değerinin düşmesi ve AIC değerinin yükselmesi, modele eklenen yeni değişkenlerin modele anlamlı bir katkı sağlamadığını, aksine modelin karmaşıklığını gereksiz yere artırdığını gösterir.

Adım Adım Çözüm

1
R2R^2 ve Düzeltilmiş R2R^2 değerlerini karşılaştırın.
Model 2'nin R2R^2 değeri (0,81) daha yüksek olsa da, serbestlik derecesine göre düzeltilmiş R2R^2 değeri (0,72), Model 1'in değerinden (0,75) daha düşüktür.
Modele eklenen yeni değişkenlerin açıklayıcılığa katkısı, serbestlik derecesi kaybını telafi edememiştir.
2
AICAIC (Akaike Bilgi Kriteri) değerlerini inceleyin.
Model 1 için AIC=320,5AIC = 320,5 iken Model 2 için AIC=345,8AIC = 345,8 olarak hesaplanmıştır.
Model seçiminde daha düşük AICAIC değerine sahip olan model, bilgi kaybını minimize ettiği için tercih edilir.
3
Karar verin.
Model 1 seçilir.
Hem düzeltilmiş R2R^2 hem de AICAIC kriterleri Model 1'in daha parsimoniyel (az değişkenle yüksek açıklayıcılık) ve etkin olduğunu göstermektedir.

Anahtar Kavram

Model Seçim Kriterleri (Parsimoni İlkesi)

Daha Fazla Pratik

Benzer bir soruda BIC (Bayesian Information Criterion) değerlerini karşılaştırarak parsimoni ilkesini pekiştirebilirsiniz.
Tahmini Süre:1m 40s
Soru 19Soru

Bir gayrimenkul değerleme uzmanı, konut fiyatlarını (YY) tahmin etmek için konutun büyüklüğü (X1X_1), oda sayısı (X2X_2) ve bina yaşı (X3X_3) değişkenleriyle Model 1'i kurmuştur. Daha sonra bu modele şehir merkezine uzaklık (X4X_4) ve toplu taşımaya yakınlık (X5X_5) değişkenlerini ekleyerek Model 2'yi oluşturmuştur. Modellere ait özet istatistikler ve artık (kalıntı) analizi bulguları aşağıdaki tabloda verilmiştir:

İstatistik / BulguModel 1Model 2
Standart Belirleme Katsayısı (R2R^2)0.780.780.810.81
Düzeltilmiş Belirleme Katsayısı (Radj2R^2_{adj})0.760.760.720.72
AIC (Akaike Bilgi Kriteri)1245.41245.41310.81310.8
Maksimum Cook Uzaklığı (DiD_i)0.450.451.821.82
Artıkların Normal Q-Q GrafiğiDoğruya çok yakınS şeklinde belirgin sapma

Bu tabloya ve analiz bulgularına göre, model seçimi ve varsayımlar hakkında aşağıdakilerden hangisi kesinlikle söylenebilir?

Cevabı ve açıklamayı göster

Cevap: X4X_4 ve X5X_5 değişkenlerinin modele eklenmesi modelin istatistiksel uyumunu iyileştirmemiştir; ayrıca Model 2'de hata terimlerinin normallik varsayımı ihlal edilmiş ve regresyon sonuçlarını aşırı etkileyen (etkin) bir gözlem tespit edilmiştir.

Cevap

Yeni eklenen değişkenler modelin uyumunu iyileştirmemiştir; Model 2'de normallik varsayımı ihlali ve regresyon sonuçlarını aşırı etkileyen aykırı/etkin bir gözlem tespit edilmiştir.
Bu soru iki temel regresyon konusunu test etmektedir: Model seçimi ve kalıntı (artık) analizi. İlk olarak, Model 2'de standart R2R^2 artmasına rağmen düzeltilmiş R2R^2'nin düşmesi ve AIC'nin artması, eklenen X4X_4 ve X5X_5 değişkenlerinin gereksiz olduğunu ve model kalitesini bozduğunu ifade eder. İkinci olarak, kalıntı analizindeki Cook Uzaklığı metriği, değerinin 1'in üzerinde olmasıyla (burada 1.821.82) regresyon katsayılarını tek başına ciddi şekilde değiştiren 'etkin (influential)' bir gözlemin varlığına işaret eder. Artıkların Normal Q-Q grafiğinde teorik doğrudan ayrılarak S şekli oluşturması ise normallik varsayımının kesin olarak ihlal edildiğini gösterir. Bu üç doğru tespit yalnızca doğru seçenekte bir arada verilmiştir.

Adım Adım Çözüm

1
Model 1 ve Model 2'nin uyum iyiliği ölçütlerini (Standart R-kare, Düzeltilmiş R-kare ve AIC) karşılaştırmak.
Standart R-kare 0.780.78'den 0.810.81'e çıkmış olsa da, Düzeltilmiş R-kare 0.760.76'dan 0.720.72'ye düşmüş ve AIC değeri 1245.41245.4'ten 1310.81310.8'e yükselmiştir.
Farklı sayıda bağımsız değişkene sahip modeller karşılaştırılırken serbestlik derecesini dikkate alan Düzeltilmiş R-kare ve AIC/BIC gibi cezalandırıcı kriterlere bakılır. Bu değerlerin kötüleşmesi, Model 2'nin Model 1'den daha zayıf olduğunu gösterir.
2
Model 2 için verilen artık (kalıntı) analizi bulgularını (Cook Uzaklığı ve Q-Q grafiği) yorumlamak.
Cook Uzaklığı (DiD_i) 1.821.82 (yani >1>1) bulunmuş ve Q-Q grafiğinde S şeklinde belirgin bir sapma görülmüştür.
Cook Uzaklığının 11'den büyük olması modelde regresyon katsayılarını aşırı ölçüde değiştiren etkin (influential) bir gözlem olduğunu belirtir. Q-Q grafiğindeki S şeklindeki eğrisellik ise hata terimlerinin normal dağılım varsayımından saptığını (örneğin kalın kuyruklu bir dağılıma sahip olduğunu) kanıtlar.
3
Tüm bulguları birleştirerek nihai model değerlendirmesini yapmak.
Model 2'ye eklenen yeni değişkenler modelin istatistiksel kalitesini bozmuştur, varsayım ihlalleri (normallikten sapma) mevcuttur ve veri setinde sonuçları manipüle eden en az bir etkin gözlem vardır.
Bulgular doğrudan modelin açıklayıcılık gücünün azaldığını ve teşhis (diagnostic) testlerinin problemli olduğunu işaret etmektedir.

Anahtar Kavram

Regresyon modellerinde değişken seçimi ölçütleri (Düzeltilmiş R2R^2, AIC) ve artıkların teşhis testleri (Cook Uzaklığı, Normallik).