Regresyon Analizi

210 soru

Soru 61Soru

Bir büyükşehir belediyesi, ilçelerindeki aylık katı atık toplama maliyetlerini (YY, bin TL) analiz etmek amacıyla bir regresyon modeli kurmuştur. Modelde bağımsız değişken olarak ilçe nüfusu (XX, bin kişi) ve bölge türü (Konut, Ticari, Sanayi) yer almaktadır. "Konut" bölgesi referans (baz) kategori olarak alınmış ve modele şu kukla değişkenler eklenmiştir:

D1={1,Bo¨lge tu¨ru¨ Ticari ise0,Dig˘er durumlardaD_1 = \begin{cases} 1, & \text{Bölge türü Ticari ise} \\ 0, & \text{Diğer durumlarda} \end{cases}

D2={1,Bo¨lge tu¨ru¨ Sanayi ise0,Dig˘er durumlardaD_2 = \begin{cases} 1, & \text{Bölge türü Sanayi ise} \\ 0, & \text{Diğer durumlarda} \end{cases}

Tahmin edilen regresyon denklemi Y^=120+3X+50D1+90D2\hat{Y} = 120 + 3X + 50D_1 + 90D_2 olarak elde edilmiştir.

Buna göre, tahmin denklemindeki 9090 katsayısının istatistiksel yorumu aşağıdakilerden hangisidir?

Cevabı ve açıklamayı göster

Cevap: Nüfus büyüklüğü sabit tutulduğunda, sanayi bölgesindeki bir ilçenin aylık katı atık toplama maliyetinin konut bölgesindeki bir ilçeye kıyasla ortalama 90 bin TL daha fazla olacağı tahmin edilmektedir.

Cevap

Doğru cevap, sanayi bölgesi ile referans kategori olan konut bölgesi arasındaki ortalama farkı ifade eden seçenektir.
Çoklu regresyon modelinde ana etki olarak yer alan bir kukla değişkenin katsayısı, modele dahil edilen diğer sürekli değişkenler (nüfus) sabit tutulduğunda, kukla değişkenin temsil ettiği kategorinin (Sanayi) dışarıda bırakılan referans kategoriye (Konut) göre bağımlı değişkende (maliyet) yarattığı ortalama farktır.

Adım Adım Çözüm

1
Regresyon modelindeki referans (baz) kategoriyi belirle.
Modelde sadece Ticari (D1D_1) ve Sanayi (D2D_2) için kukla değişkenler bulunduğundan, tanımlanmayan kategori olan 'Konut' referans kategoridir.
Kukla değişken tuzağından kaçınmak için bir kategori model dışında bırakılır ve diğer tüm katsayılar bu referans kategoriye göre yorumlanır.
2
Referans kategori (Konut) için modelin beklenen değerini yaz.
D1=0D_1=0 ve D2=0D_2=0 olduğunda denklem: Y^Konut=120+3X\hat{Y}_{Konut} = 120 + 3X
Konut bölgesi için her iki kukla değişken de 0 değerini alır.
3
Sanayi bölgesi için modelin beklenen değerini yaz.
D1=0D_1=0 ve D2=1D_2=1 olduğunda denklem: Y^Sanayi=120+3X+90(1)=120+3X+90\hat{Y}_{Sanayi} = 120 + 3X + 90(1) = 120 + 3X + 90
Sanayi bölgesi için D2D_2 değişkeni 1, D1D_1 değişkeni 0 değerini alır.
4
İki beklenen değer arasındaki farkı hesapla ve yorumla.
Y^SanayiY^Konut=(120+3X+90)(120+3X)=90\hat{Y}_{Sanayi} - \hat{Y}_{Konut} = (120 + 3X + 90) - (120 + 3X) = 90.
X (nüfus) sabit tutulduğunda, 90 katsayısı sanayi bölgesinin referans kategori olan konut bölgesinden ortalama ne kadar farklı olduğunu gösterir.

Anahtar Kavram

Kukla Değişken Katsayılarının Yorumlanması
Soru 62Soru

Bir ziraat mühendisi, buğday rekoltesini (YY) açıklamak amacıyla yıllık yağış miktarı (X1X_1) ve kullanılan gübre miktarı (X2X_2) değişkenlerini incelemektedir. Araştırmacı ilk olarak sadece yıllık yağış miktarının yer aldığı basit doğrusal regresyon modelini kurmuş ve belirleme katsayısını R2=0,60R^2 = 0,60 olarak hesaplamıştır.

Daha sonra gübre miktarını da modele eklemeye karar vermiştir. Yağış miktarının etkisi sabit tutulduğunda, rekolte ile gübre miktarı arasındaki kısmi korelasyon katsayısı rY2.1=0,50r_{Y2.1} = 0,50 olarak bulunmuştur.

Veri setinde toplam n=33n = 33 gözlem bulunduğuna göre, X1X_1 ve X2X_2'nin birlikte yer aldığı iki bağımsız değişkenli çoklu doğrusal regresyon modelinin düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2) kaçtır?

Cevabı ve açıklamayı göster

Cevap: 0,680,68

Cevap

Yeni modelin düzeltilmiş belirleme katsayısı 0,68'dir.
Doğru sonuca ulaşmak için iki aşamalı bir analiz gereklidir. İlk olarak, kısmi korelasyon katsayısının karesi (0,502=0,250,50^2 = 0,25) alınarak, yeni değişkenin eski modelin açıklayamadığı varyansın %25'ini açıkladığı bulunur. Eski modelin açıklayamadığı varyans oranı 10,60=0,401 - 0,60 = 0,40'tır. Bu durumda yeni değişkenin toplam açıklayıcılığa katkısı 0,25×0,40=0,100,25 \times 0,40 = 0,10'dur ve yeni R2=0,60+0,10=0,70R^2 = 0,60 + 0,10 = 0,70 olur. İkinci aşamada, bu standart R2R^2 üzerinden n=33n=33 ve k=2k=2 kullanılarak düzeltilmiş R2R^2 hesaplanır: Rˉ2=1(10,70)×(32/30)=10,32=0,68\bar{R}^2 = 1 - (1 - 0,70) \times (32 / 30) = 1 - 0,32 = 0,68.

Adım Adım Çözüm

1
Kısmi belirtme katsayısını hesapla.
rY2.12=(0,50)2=0,25r_{Y2.1}^2 = (0,50)^2 = 0,25
Kısmi korelasyon katsayısının karesi, modele yeni eklenen değişkenin, bağımlı değişkendeki daha önce açıklanamayan varyansın ne kadarını açıkladığını gösterir.
2
Kısmi belirtme katsayısı formülünü kullanarak yeni modelin standart R2R^2 değerini bul.
rY2.12=RY.122RY.121RY.120,25=RY.1220,6010,600,25=RY.1220,600,40RY.122=0,70r_{Y2.1}^2 = \frac{R^2_{Y.12} - R^2_{Y.1}}{1 - R^2_{Y.1}} \Rightarrow 0,25 = \frac{R^2_{Y.12} - 0,60}{1 - 0,60} \Rightarrow 0,25 = \frac{R^2_{Y.12} - 0,60}{0,40} \Rightarrow R^2_{Y.12} = 0,70
Modelin önceki ve sonraki açıklama oranları arasındaki ilişki, kısmi korelasyonun tanımından ileri gelir.
3
Çoklu regresyon modeli için parametreleri belirle.
n=33n = 33, bağımsız değişken sayısı k=2k = 2. Serbestlik dereceleri: pay (n1)=32(n-1) = 32, payda (nk1)=30(n-k-1) = 30.
Düzeltilmiş R2R^2 formülünde kullanılacak doğru serbestlik derecelerini belirlemek zorunludur.
4
Düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2) formülünü uygula.
Rˉ2=1(1R2)n1nk1=1(10,70)3230=10,30×3230=10,32=0,68\bar{R}^2 = 1 - (1 - R^2) \frac{n-1}{n-k-1} = 1 - (1 - 0,70) \frac{32}{30} = 1 - 0,30 \times \frac{32}{30} = 1 - 0,32 = 0,68
Modele eklenen yeni değişkenlerin parametre sayısını cezalandırmak için, serbestlik derecesine göre düzeltilmiş ölçüt kullanılmalıdır.

Anahtar Kavram

Kısmi belirtme katsayısı (r2r^2) ile çoklu belirleme katsayısı (R2R^2) arasındaki matematiksel ilişki ve Düzeltilmiş R2R^2 formülünün serbestlik dereceleri ile birlikte uygulanması.
Soru 63Soru

Bir kamu kurumunun insan kaynakları birimi, kuruma yeni başlayan personelin başlangıç maaşlarını (YY, bin TL) incelemek amacıyla bir regresyon modeli kurmuştur. Modelde bağımsız değişken olarak personelin önceki iş deneyimi süresi (XX, yıl) ve eğitim durumu kullanılmıştır.

Eğitim durumu "Lise", "Lisans" ve "Yüksek Lisans" olmak üzere üç kategoriden oluşmaktadır. Model tahmininde "Lise" mezunları temel (referans) kategori olarak alınmış ve diğer kategoriler için aşağıdaki kukla değişkenler tanımlanmıştır:
- D1=1D_1 = 1 (Personel Lisans mezunu ise), 00 (Diğer durumlarda)
- D2=1D_2 = 1 (Personel Yüksek Lisans mezunu ise), 00 (Diğer durumlarda)

En küçük kareler (EKK) yöntemiyle tahmin edilen regresyon denklemi aşağıda verilmiştir:
Y^=40+3X+10D1+18D2\hat{Y} = 40 + 3X + 10D_1 + 18D_2

Buna göre, tahmin edilen modelle ilgili aşağıdaki ifadelerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: İş deneyimleri aynı olan iki personelden yüksek lisans mezunu olanın beklenen başlangıç maaşı, lise mezunu olana göre ortalama 18 bin TL daha yüksektir.

Cevap

İş deneyimleri aynı olan iki personelden yüksek lisans mezunu olanın beklenen başlangıç maaşının, lise mezunu olana göre ortalama 18 bin TL daha yüksek olduğu ifadesi doğrudur.
Kukla değişkenli regresyon modellerinde bir kukla değişkenin eğim katsayısı, diğer bağımsız değişkenler sabit tutulduğunda o kategorinin referans kategoriye (temel gruba) kıyasla bağımlı değişkende yarattığı ortalama farkı gösterir. Bu modelde referans kategori 'Lise'dir. Yüksek lisans mezuniyetini temsil eden D2D_2 değişkeninin katsayısı 18'dir. Bu durum, iş deneyimi (XX) aynı olan personeller karşılaştırıldığında, yüksek lisans mezunlarının lise mezunlarına göre ortalama 18 bin TL daha yüksek başlangıç maaşı alacağını kesin olarak ifade eder.

Adım Adım Çözüm

1
Modeldeki referans kategoriyi ve kukla değişkenleri belirle.
Referans kategori 'Lise'dir. D1D_1 Lisans'ı, D2D_2 Yüksek Lisans'ı temsil etmektedir.
Kukla değişken katsayıları her zaman referans kategoriye göre olan mutlak farkı ifade eder.
2
D2D_2 katsayısını yorumla.
D2D_2'nin katsayısı olan 18, Yüksek Lisans (D2=1,D1=0D_2=1, D_1=0) ile Lise (D1=0,D2=0D_1=0, D_2=0) arasındaki marjinal farktır.
Diğer bağımsız değişkenler (iş deneyimi XX) sabit tutulduğunda, D2D_2'nin katsayısı referans kategoriye göre beklenen YY artışını verir.
3
Seçenekleri analiz et.
Yüksek lisans mezunlarının lise mezunlarına göre ortalama 18 bin TL daha fazla maaşla başladığı ifadesi 18D218D_2 teriminin doğru ve tam karşılığıdır.
Katsayı, modele giren kategorinin (yüksek lisans), girmeyen kategoriye (lise) göre oluşturduğu etkiyi ölçer.

Anahtar Kavram

Kukla değişken katsayılarının yorumlanması ve Referans (Baz) Kategori
Soru 64Soru

Bir kamu kurumunda enerji uzmanı olarak çalışan bir araştırmacı, ilçedeki günlük elektrik tüketimini (YY) tahmin etmek amacıyla 6 bağımsız değişkenli (hava sıcaklığı, nem, nüfus, sanayi endeksi, rüzgar hızı, tatil kukla değişkeni) bir başlangıç regresyon modeli (Model I) kurmuştur.

Daha sonra "geriye doğru eleme" (backward elimination) yöntemi kullanılarak istatistiksel olarak anlamsız olan iki değişken modelden çıkarılmış ve 4 bağımsız değişkenli yeni bir model (Model II) elde edilmiştir.

Bu iki modele ait özet istatistikler ve Model II'nin artık (kalıntı) analizine ilişkin bazı bulgular aşağıda verilmiştir:
- Model I: R2=0.784R^2 = 0.784, Düzeltilmiş R2=0.732R^2 = 0.732, AIC=342.5AIC = 342.5
- Model II: R2=0.768R^2 = 0.768, Düzeltilmiş R2=0.751R^2 = 0.751, AIC=315.8AIC = 315.8
- Model II Artık Analizi: Shapiro-Wilk testi pp-değeri =0.15= 0.15, Durbin-Watson istatistiği =2.05= 2.05, Öğrenci (Studentized) artıkları [1.8,1.9][-1.8, 1.9] aralığındadır.

Elde edilen bu bulgulara göre, model seçimi ve artık analizi ile ilgili aşağıdaki ifadelerden hangisi kesinlikle doğrudur?

Cevabı ve açıklamayı göster

Cevap: Model II, bilgi kriteri (AIC) ve düzeltilmiş belirleme katsayısı (R2R^2) dikkate alındığında Model I'e tercih edilmelidir; ayrıca Model II'nin hata terimleri normal dağılım varsayımını sağlamakta ve modelde otokorelasyon ile belirgin bir uç değer (outlier) sorunu bulunmamaktadır.

Cevap

Model II, bilgi kriteri (AIC) ve düzeltilmiş belirleme katsayısı bağlamında Model I'e tercih edilmelidir; hata terimleri normal dağılım varsayımını sağlamakta ve otokorelasyon veya uç değer sorunu bulunmamaktadır.
Model II'de daha az açıklayıcı değişken yer almasına rağmen düzeltilmiş R-kare değeri (0.751 > 0.732) artmış ve AIC değeri (315.8 < 342.5) düşmüştür. Bu durum, eleme işlemi sonrası Model II'nin parsimoni (sadelik) ve açıklayıcılık dengesinde daha üstün bir model olduğunu kanıtlar. Ayrıca, Shapiro-Wilk testinin p-değerinin 0.05'ten büyük (0.15) çıkması normal dağılım varsayımının sağlandığını, Durbin-Watson istatistiğinin 2'ye yakın (2.05) çıkması otokorelasyon bulunmadığını, kalıntıların dar bir aralıkta [-1.8, 1.9] toplanması ise uç değer problemi yaşanmadığını göstermektedir.

Adım Adım Çözüm

1
Model performans metriklerinin (Standart R-kare, Düzeltilmiş R-kare ve AIC) karşılaştırılarak yorumlanması.
Model II'nin standart R-kare değeri Model I'den düşük olmasına rağmen, Düzeltilmiş R-kare değeri daha yüksektir (0.751 > 0.732) ve AIC değeri daha düşüktür (315.8 < 342.5).
Farklı sayıda bağımsız değişkene sahip modeller karşılaştırılırken, gereksiz değişken kullanımını cezalandıran düzeltilmiş R-kare ve AIC kriterleri referans alınmalıdır.
2
Shapiro-Wilk normallik testi p-değerinin anlamlılık düzeyi (alfa = 0.05) ile kıyaslanması.
p-değeri (0.15) > 0.05 olduğu için 'Hata terimleri normal dağılmaktadır' şeklindeki H0 hipotezi reddedilemez.
Artıkların normal dağılıp dağılmadığını test eden istatistiklerde, yüksek p-değeri varsayımın sağlandığına işaret eder.
3
Durbin-Watson (DW) istatistiğinin ve standardize edilmiş artıkların (öğrenci artıkları) analiz edilmesi.
DW değeri (2.05) tam 2.00 civarında yer aldığından otokorelasyon yoktur. Artıkların [-1.8, 1.9] aralığında kalması ise ±2 veya ±3 sınırlarını aşmadığı için uç değer (outlier) probleminin bulunmadığını gösterir.
EKK'nın klasik varsayımlarından otokorelasyon yokluğu test edilirken DW'nin 2'ye yakınlığı aranır; uç değer analizi için artıkların genel kabul görmüş standart sapma bantlarında kalması beklenir.

Anahtar Kavram

Model Seçim Kriterleri ve Artık Analizi Varsayım Kontrolleri
Soru 65Soru

Bir halk sağlığı uzmanı, bölgelerin ortalama yaşam süresini tahmin etmek amacıyla 10 farklı bağımsız değişken (hava kalitesi endeksi, kişi başına düşen hekim sayısı vb.) kullanarak bir çoklu doğrusal regresyon modeli (Model I) kurmuştur. Model I'e ait belirleme katsayısı R2=0.88R^2 = 0.88, düzeltilmiş belirleme katsayısı Rˉ2=0.81\bar{R}^2 = 0.81 ve Akaike Bilgi Kriteri (AIC) 156.4156.4 olarak hesaplanmıştır.

Uzman, model seçimi yöntemlerinden adım adım regresyon (stepwise) algoritmasını uygulayarak bağımsız değişken sayısını 4'e düşürmüş ve Model II'yi elde etmiştir. Model II için R2=0.85R^2 = 0.85, Rˉ2=0.84\bar{R}^2 = 0.84 ve AIC =124.8= 124.8 bulunmuştur.

Daha sonra Model II için yapılan artık (kalıntı) analizinde; standartlaştırılmış artıkların standartlaştırılmış tahmin değerlerine karşı çizilen saçılım grafiğinde (scatter plot) noktaların sıfır çizgisi etrafında belirli bir yapı veya huni biçimi oluşturmaksızın tamamen rastgele dağıldığı gözlemlenmiştir. Ayrıca artıkların normal olasılık grafiğinde (Q-Q plot) noktaların 45 derecelik düz bir köşegen etrafında oldukça yakın konumlandığı tespit edilmiştir.

Buna göre, gerçekleştirilen model seçimi ve artık analizi süreciyle ilgili aşağıdaki ifadelerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: Model II, açıklayıcı değişken sayısındaki azalışa rağmen düzeltilmiş Rˉ2\bar{R}^2'nin artması ve AIC değerinin düşmesi nedeniyle Model I'e tercih edilmelidir; ayrıca artık grafikleri, varyansın homojenliği ve hataların normal dağılımı varsayımlarının sağlandığını desteklemektedir.

Cevap

Model II, daha düşük AIC ve daha yüksek düzeltilmiş R-kare değerine sahip olduğundan daha iyi bir modeldir; ayrıca artık analizleri varyansın homojenliği ve normallik varsayımlarının sağlandığını teyit etmektedir.
Doğru seçenekte belirtildiği gibi, model seçimi kriterlerinde temel prensip 'ceza' içeren ölçütleri dikkate almaktır. Model II'de değişken sayısı 10'dan 4'e düşmesine rağmen düzeltilmiş belirleme katsayısının (0.810.81'den 0.840.84'e) artması ve AIC değerinin (156.4156.4'ten 124.8124.8'e) düşmesi, Model II'nin daha 'cimri' (parsimonious) ve aşırı öğrenme (overfitting) riskinden uzak, bilgi kaybı düşük bir model olduğunu gösterir. Ayrıca, artıkların tahmin değerlerine karşı çizilen grafiğinde rastgele dağılım olması değişen varyans (heteroskedastisite) sorunu olmadığını (varyansın homojenliğini), Q-Q grafiğindeki doğrusallık ise hata terimlerinin normal dağıldığını kanıtlar.

Adım Adım Çözüm

1
Model I ve Model II'nin performans ölçütlerini karşılaştırmak.
Model II'de daha az değişken olmasına rağmen düzeltilmiş R-kare daha yüksek (0.84>0.810.84 > 0.81) ve AIC değeri daha düşüktür (124.8<156.4124.8 < 156.4).
Farklı sayıda bağımsız değişkene sahip modeller kıyaslanırken standart R-kare yerine serbestlik derecesine göre düzeltme yapan düzeltilmiş R-kare ve bilgi kriterleri (AIC/BIC) kullanılır.
2
Artıkların (kalıntıların) saçılım grafiğini yorumlamak.
Noktaların sıfır çizgisi etrafında rastgele dağılması ve bir huni/koni şekli oluşturmaması gözlemlenmiştir.
Bu durum, hata terimlerinin varyansının sabit olduğu (homoskedastisite) varsayımının sağlandığını kanıtlar.
3
Normal olasılık (Q-Q) grafiğini yorumlamak.
Noktalar 45 derecelik köşegen doğru etrafında toplanmıştır.
Q-Q grafiğinde teorik kantiller ile örneklem kantillerinin doğrusal bir ilişki göstermesi, hata terimlerinin normal dağıldığı varsayımının geçerli olduğunu doğrular.

Anahtar Kavram

Regresyon modellerinde bilgi kriterleri (AIC) ile model seçimi ve artık grafikleri yardımıyla EKK varsayımlarının (normallik, homoskedastisite) sınanması.
Soru 66Soru

Bir tarım ekonomisti, farklı buğday türlerinin dönüm başına verimini (YY) tahmin etmek için çeşitli iklim ve toprak özelliklerini içeren bağımsız değişkenlerle farklı regresyon modelleri kurmuştur. Elde edilen modellerin karşılaştırmalı performans ölçütleri aşağıda verilmiştir:

ModelBağımsız Değişken Sayısı (kk)R2R^2Düzeltilmiş R2R^2AIC
I30.680.66145
II50.740.72120
III70.770.69135

Model seçiminin ardından araştırmacı, seçilen modelin standartlaştırılmış artık (standardized residual) değerlerini incelemiş ve üç gözlemin değerinin +3.5+3.5 ile +4.2+4.2 arasında olduğunu tespit etmiştir.

Buna göre, araştırmacının model seçimi ve artık analizi değerlendirmesiyle ilgili aşağıdaki ifadelerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: Model II, düzeltilmiş R2R^2'yi maksimize edip AIC değerini minimize ettiği için en uygun modeldir ve standartlaştırılmış artığı 33'ten büyük olan gözlemler aykırı değer (outlier) olarak sınıflandırılır.

Cevap

Düzeltilmiş R-kare ve AIC kriterlerine göre en uygun model olan Model II seçilmeli ve 3'ten büyük standartlaştırılmış artığa sahip gözlemler aykırı değer olarak kabul edilmelidir.
Çoklu doğrusal regresyonda en iyi modeli seçerken R2R^2 yerine, değişken sayısındaki artışı cezalandıran düzeltilmiş R2R^2 ve AIC gibi kriterlere bakılır. Model II, hem düzeltilmiş R2R^2'yi (0.72) maksimize etmiş hem de AIC değerini (120) minimize etmiştir. Artık analizinde ise standartlaştırılmış (veya öğrencileştirilmiş) kalıntıların mutlak değer olarak 33'ten büyük olması, istatistiksel analizlerde genel kabul görmüş bir aykırı değer (outlier) kanıtıdır. Bu nedenle doğru seçenek, Model II'yi seçen ve artık bulgusunu aykırı değer olarak doğru biçimde sınıflandıran ifadedir.

Adım Adım Çözüm

1
Farklı model spesifikasyonlarına ait ölçütleri karşılaştırarak en iyi modeli belirlemek.
Model II'nin düzeltilmiş R2R^2 değeri (0.72) en yüksektir ve AIC değeri (120) en düşüktür.
Çoklu regresyonda modele anlamsız değişken eklendiğinde standart R2R^2 yapay olarak artar. Bu nedenle modelleri kıyaslarken serbestlik derecesi kaybını dikkate alan düzeltilmiş R2R^2 ve Akaike Bilgi Kriteri (AIC) kullanılmalıdır.
2
Standartlaştırılmış artık (standardized residual) değerlerini yorumlamak.
Üç gözlemin standartlaştırılmış artık değerleri 3'ten büyüktür (+3.5 ve +4.2 arası).
Regresyon analizinde standartlaştırılmış veya öğrencileştirilmiş artıkların mutlak değer olarak 3'ü aşması, o gözlemlerin tahmin edilen doğrudan çok uzakta yer alan aykırı değerler (outlier) olduğunu gösterir.

Anahtar Kavram

Model Seçim Kriterleri (AIC, Düzeltilmiş R-kare) ve Artık Analizinde Aykırı Değer Tespiti
Soru 67Soru

Bir bölgesel kalkınma ajansında görevli uzman, 81 ilin imalat sanayi ihracat hacmini (YY) tahmin etmek için 6 farklı bağımsız değişken içeren bir çoklu doğrusal regresyon modeli (Model I) kurmuştur. Daha sonra, model seçimi kriterleri ve değişken seçimi yöntemleri kullanılarak 4 bağımsız değişkenden oluşan yeni bir model (Model II) elde edilmiştir. Modellere ait bazı özet istatistikler ve artık analizi sonuçları aşağıda verilmiştir:

İstatistik / TestModel I (6 Değişken)Model II (4 Değişken)
Belirleme Katsayısı (R2R^2)0.840.840.810.81
Düzeltilmiş Belirleme Katsayısı (Rˉ2\bar{R}^2)0.780.780.800.80
Akaike Bilgi Kriteri (AICAIC)412.5412.5385.2385.2
Shapiro-Wilk Testi (pp-değeri)0.010.010.180.18
Maksimum Cook Uzaklığı (DD)0.850.851.451.45

(Not: Anlamlılık düzeyi α=0.05\alpha = 0.05 olarak alınacaktır. Shapiro-Wilk testi için H0H_0: Artıklar normal dağılıma uygundur.)

Bu bilgilere göre, model seçimi ve artık analizi süreciyle ilgili aşağıdaki ifadelerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: Model II, bilgi kriteri (AICAIC) ve düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2) dikkate alındığında daha uygun bir modeldir; Model II'de artıkların normal dağılım varsayımı sağlanmasına rağmen, analiz sonuçlarını aşırı etkileyebilecek bir gözlem bulunmaktadır.

Cevap

Model II'nin düzeltilmiş R-kare ve AIC kriterlerine göre daha üstün olduğunu, Shapiro-Wilk testine göre artıkların normal dağıldığını, ancak Cook uzaklığı değerine bakılarak etkili bir gözlem barındırdığını belirten seçenek doğrudur.
Verilen bilgiler bütünleşik olarak değerlendirildiğinde; Model II'nin düzeltilmiş belirleme katsayısının daha yüksek ve Akaike Bilgi Kriterinin daha düşük olması onun Model I'e kıyasla daha uygun bir yapıya sahip olduğunu kanıtlar. Ayrıca Model II'de Shapiro-Wilk testinin pp-değeri 0.050.05'ten büyük olduğu için (0.180.18) artıkların normal dağıldığı varsayımı ihlal edilmemiştir. Ancak tablodaki maksimum Cook Uzaklığı değerinin 11'den büyük (1.451.45) çıkması, tahmin edilen modelde katsayıları aşırı etkileyen sapan bir gözlemin varlığına işaret etmektedir.

Adım Adım Çözüm

1
Model seçimi kriterlerini karşılaştırarak en iyi modeli belirle.
Model I için Rˉ2=0.78\bar{R}^2=0.78, AIC=412.5AIC=412.5; Model II için Rˉ2=0.80\bar{R}^2=0.80, AIC=385.2AIC=385.2. Model II'nin düzeltilmiş belirleme katsayısı daha yüksek ve AIC değeri daha düşüktür. Bu nedenle Model II daha iyi bir modeldir.
Farklı sayıda bağımsız değişken içeren modeller karşılaştırılırken standart R2R^2 yerine serbestlik derecesini dikkate alan Rˉ2\bar{R}^2 ve düşük bilgi kaybını hedefleyen (küçük olanın tercih edildiği) AICAIC kullanılır.
2
Shapiro-Wilk test sonuçlarını yorumlayarak normallik varsayımını kontrol et.
Model I için p=0.01<0.05p=0.01 < 0.05 (Normallik reddedilir). Model II için p=0.18>0.05p=0.18 > 0.05 (Normallik reddedilemez, varsayım sağlanır).
Artıkların normallik testlerinde H0H_0 hipotezi dağılımın normal olduğunu belirtir. Anlamlılık düzeyi (0.050.05) aşıldığında normallik şartı sağlanmış kabul edilir.
3
Maksimum Cook Uzaklığı (DD) değerlerini yorumla.
Model II'de Cook Uzaklığı değeri 1.451.45'tir. Bu değer genellikle eşik kabul edilen 11'den büyüktür.
Cook Uzaklığı'nın 11'den büyük olması, o gözlemin regresyon katsayılarını tek başına ciddi şekilde değiştirebilecek kadar etkili (influential point) olduğunu ifade eder.

Anahtar Kavram

Regresyonda Model Seçimi Kriterleri ve Artık Analizi Tanı Testleri
Soru 68Soru

Bir yerel yönetim analisti, ilçelerdeki aylık su tüketim miktarını (YY) açıklamak için hanehalkı büyüklüğü (X1X_1) ve ortalama gelir düzeyi (X2X_2) değişkenlerini kullanarak bir çoklu doğrusal regresyon modeli tahmin etmiştir. Analist, daha sonra teorik olarak su tüketimiyle hiçbir ilişkisi olmayan ve istatistiksel olarak anlamsız olduğu bilinen "ilçe belediye başkanının yaşını" (X3X_3) modele yeni bir açıklayıcı değişken olarak eklemiştir.

Buna göre, X3X_3 değişkeninin modele dâhil edilmesi sonucunda standart belirleme katsayısı (R2R^2) ve düzeltilmiş belirleme katsayısının (Rˉ2\bar{R}^2) alacağı değerler ile ilgili aşağıdakilerden hangisi kesinlikle doğrudur?

Cevabı ve açıklamayı göster

Cevap: R2R^2 değeri artar veya sabit kalır, Rˉ2\bar{R}^2 değeri ise serbestlik derecesi kaybı nedeniyle azalır.

Cevap

Standart belirleme katsayısı olan R-kare değeri artar veya sabit kalır, ancak düzeltilmiş R-kare değeri serbestlik derecesindeki kayıptan dolayı azalır.
Çoklu doğrusal regresyon analizinde modele yeni bir açıklayıcı değişken (anlamsız bile olsa) eklendiğinde, standart belirleme katsayısı (R2R^2) matematiksel hesaplama gereği hiçbir zaman azalmaz; yapay olarak artar veya en kötü ihtimalle sabit kalır. Ancak düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2), tahminde kullanılan parametre sayısına (k) göre serbestlik derecesini düzelttiği için modele bir ceza uygular. Eklenen değişken modeldeki varyansı açıklamada yetersiz kalıyorsa (istatistiksel olarak anlamsızsa), serbestlik derecesindeki kayıp telafi edilemez ve Rˉ2\bar{R}^2 değeri düşer.

Adım Adım Çözüm

1
Standart belirleme katsayısının (R2R^2) davranışını analiz et.
R2R^2 modeli oluşturan bağımsız değişken sayısı arttıkça matematiksel olarak artar (ya da nadiren aynı kalır); hiçbir zaman azalmaz.
EKK (En Küçük Kareler) yöntemi, hata kareler toplamını minimize ettiği için fazladan eklenen her değişken, anlamsız bile olsa, varyansın küçük bir kısmını tesadüfen açıklayarak R2R^2'yi şişirir.
2
Düzeltilmiş belirleme katsayısının (Rˉ2\bar{R}^2) davranışını analiz et.
Rˉ2\bar{R}^2, formülünde (n1)/(nk1)(n-1)/(n-k-1) çarpanını barındırır ve modele eklenen her yeni değişken (kk) için bir serbestlik derecesi cezası uygular.
Düzeltilmiş R2R^2, yalnızca modelin açıklama gücüne anlamlı (t-istatistiği mutlak değerce 1'den büyük) katkı sağlayan değişkenler eklendiğinde artar. Anlamsız bir değişken eklendiğinde ceza faktörü baskın gelir ve Rˉ2\bar{R}^2 düşer.
3
Senaryodaki değişkenin (X3X_3) etkisini sentezle.
X3X_3 (belediye başkanının yaşı) anlamsız bir değişken olduğu için modelin R2R^2'si yapay olarak artarken (veya çok nadiren aynı kalırken), Rˉ2\bar{R}^2 kesinlikle azalacaktır.
Modelin kalitesini ölçerken anlamsız değişkenlerin yarattığı yanılsamayı gidermek için düzeltilmiş katsayı dikkate alınır.

Anahtar Kavram

Regresyon modeline yeni bir değişken eklendiğinde, standart belirleme katsayısı (R2R^2) asla azalmazken; düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2), eklenen değişken istatistiksel olarak anlamsızsa serbestlik derecesi cezası nedeniyle azalır.
Tahmini Süre:1m 0s
Soru 69Soru

Merkez Bankası bünyesinde çalışan bir uzman, para arzı büyümesi ile kısa vadeli faiz oranları arasındaki ilişkiyi aylık veriler üzerinden analiz etmektedir. Tahmin edilen statik çoklu regresyon modelinde, hata terimleri arasında birinci mertebeden güçlü bir pozitif ardışık bağımlılık (otokorelasyon) bulunduğu tespit edilmiştir.

Bu modelde otokorelasyon sorunu göz ardı edilerek En Küçük Kareler (EKK) yöntemiyle elde edilen sonuçların istatistiksel özellikleri ve doğuracağı pratik sonuçlar hakkında aşağıdakilerden hangisi kesinlikle doğrudur?

Cevabı ve açıklamayı göster

Cevap: EKK ile hesaplanan katsayı standart hataları genellikle gerçek değerinden daha küçük çıkma eğilimindedir; bu durum tt-istatistiklerini şişirerek Tip I hata yapma riskini artırır.

Cevap

EKK ile hesaplanan katsayı standart hataları genellikle gerçek değerinden daha küçük çıkma eğilimindedir; bu durum tt-istatistiklerini şişirerek Tip I hata yapma riskini artırır.
Pozitif otokorelasyon durumunda En Küçük Kareler yöntemi, katsayıların standart hatalarını gerçekte olduğundan daha düşük (aşağı yönlü sapmalı) hesaplar. Standart hatanın test formülünde paydada yer alması nedeniyle tt-istatistikleri (t=β^/SE(β^)t = \hat{\beta} / SE(\hat{\beta})) yapay olarak büyük çıkar. Bu durum, istatistiksel olarak etkisiz olan değişkenlerin anlamlıymış gibi görünmesine neden olarak Tip I hata yapma olasılığını (doğru olan yokluk hipotezini reddetme) ciddi biçimde artırır.

Adım Adım Çözüm

1
Otokorelasyonun EKK tahmin edicileri üzerindeki doğrudan etkisini değerlendirmek.
Tahmin ediciler (katsayılar) sapmasız ve tutarlı kalır, ancak Gauss-Markov teoremi ihlal edildiği için en iyi (etkin / minimum varyanslı) olma özelliklerini kaybederler.
Otokorelasyon (Cov(ui,uj)0Cov(u_i, u_j) \neq 0) beklenebilir değer operatörünü etkilemez ancak varyans-kovaryans matrisinin köşegen dışı elemanlarını sıfırdan farklı yapar.
2
Pozitif otokorelasyonun tahmin edilen standart hatalar üzerindeki yönlü etkisini belirlemek.
Pozitif ardışık bağımlılıkta, ardışık hata terimleri birbirini sönümlemediğinden EKK'nın klasik standart hata formülü, gerçek varyansı olduğundan daha küçük (aşağı yönlü sapmalı) tahmin eder.
Hataların aynı işareti üst üste alma eğilimi, kalıntı kareleri toplamını (RSS) yapay olarak düşürür.
3
Düşük hesaplanan standart hataların hipotez testlerine yansımasını incelemek.
Standart hata paydada yer aldığı için tt-istatistiği (t=β^/SE(β^)t = \hat{\beta} / SE(\hat{\beta})) hesaplanması gerekenden daha büyük çıkar.
Şişmiş tt-istatistikleri, gerçekte anlamsız olan bağımsız değişkenlerin istatistiksel olarak anlamlı bulunmasına yol açarak Tip I hata (yanlış alarm) yapma olasılığını artırır.

Anahtar Kavram

Otokorelasyonun Sonuçları ve Tip I Hata İlişkisi
Soru 70Soru

Bir Hazine ve Maliye Bakanlığı uzmanı, 60 ilin vergi tahsilat performansını (YY) tahmin etmek amacıyla 7 bağımsız değişken içeren bir çoklu doğrusal regresyon modeli (Model I) tahmin etmiştir. Analiz sonucunda R2=0.88R^2 = 0.88 ve genel F-istatistiği anlamlı bulunmuştur. Modelin artık (kalıntı) ve teşhis (diagnostic) istatistikleri incelendiğinde aşağıdaki bulgular elde edilmiştir:

- 28 numaralı ilin standartlaştırılmış artık değeri e28=1.15e_{28}^* = 1.15 olarak hesaplanmıştır.
- Aynı gözlemin kaldıraç (leverage) değeri h28,28=0.82h_{28,28} = 0.82 (kritik eşiğin çok üzerinde) ve Cook Uzaklığı D28=2.1D_{28} = 2.1 olarak bulunmuştur.
- 28 numaralı gözlem veri setinden çıkarılarak model yeniden tahmin edildiğinde (Model II), Model I'de %5 anlamlılık düzeyinde istatistiksel olarak anlamlı bulunan üç bağımsız değişkenin anlamsız hâle geldiği saptanmıştır.
- Uzman daha sonra, kalan 59 gözlem üzerinden farklı alt model kombinasyonlarını sınamış; Akaike Bilgi Kriteri (AIC) ve Mallows CpC_p istatistiği en düşük olan daraltılmış bir modeli (Model III) nihai model olarak belirlemiştir.

Bu araştırma süreci ve bulgular dikkate alındığında, aşağıdaki ifadelerden hangisi istatistiksel olarak kesinlikle doğrudur?

Cevabı ve açıklamayı göster

Cevap: 28 numaralı gözlem, bağımlı değişken (YY) yönünden belirgin bir aykırı değer olmamasına karşın, bağımsız değişken (XX) uzayında etkin (influential) bir noktadır ve Model I'deki bazı parametrelerin anlamlılığını tek başına yönlendirmiştir.

Cevap

Standartlaştırılmış artığı düşük ancak kaldıraç ve Cook uzaklığı yüksek olan gözlemin, aykırı değer olmamasına rağmen regresyon katsayılarını tek başına belirleyen etkin (influential) bir nokta olduğunu belirten seçenektir.
Doğru seçenekte belirtildiği üzere; bir noktanın standartlaştırılmış artığının düşük olması, onun Y yönünde sapan bir değer olmadığını ifade eder. Ancak yüksek kaldıraç değeri, bağımsız değişkenlerin (X) ortalamasından çok uzak olduğunu gösterir. Yüksek Cook Uzaklığı ise bu x-değerinin regresyon doğrusunu bir manivela gibi kendine çekerek eğimleri değiştirdiğini doğrular. Bu nokta çıkarıldığında değişkenlerin anlamsızlaşması, daha önce görülen 'anlamlılık' tablosunun tamamen bu tek noktanın yarattığı geometrik bir illüzyon olduğunu ispatlar.

Adım Adım Çözüm

1
Standartlaştırılmış artık (standardized residual) değerini yorumla.
e28=1.15e_{28}^* = 1.15 değeri, genel kabul gören mutlak 2 veya 3 eşiğinden küçüktür.
Gözlemin bağımlı değişken (YY) düzleminde bir aykırı değer (outlier) olmadığını tespit etmek için.
2
Kaldıraç (leverage, hiih_{ii}) ve Cook Uzaklığı (DiD_i) değerlerini analiz et.
h28,28=0.82h_{28,28} = 0.82 değeri X uzayında çok uçta yer aldığını, D28=2.1D_{28} = 2.1 değeri ise bu noktanın regresyon doğrusunu şiddetle kendine çektiğini gösterir.
Gözlemin model parametreleri üzerindeki etkisini (influence) belirlemek için.
3
Noktanın çıkarılmasıyla (Model II) katsayıların anlamsızlaşmasını değerlendir.
Orijinal modeldeki istatistiksel anlamlılığın genel veriden değil, sadece 28 numaralı gözlemin yarattığı yapay çekimden kaynaklandığı kanıtlanmıştır.
Model seçim sürecinin geçerliliğini ve etkin noktanın yarattığı illüzyonu kavramak için.

Anahtar Kavram

Regresyon Teşhis İstatistikleri (Kaldıraç, Cook Uzaklığı ve Aykırı Değerler) ve Model Seçimi
Tahmini Süre:2m 30s
Soru 71Soru

Bir kamu kurumu, işletmelerin vergi inceleme süreçlerinin tamamlanma süresini (YY, gün) analiz etmek amacıyla bir çoklu doğrusal regresyon modeli kurmuştur. Analizde işletme büyüklüğü (Küçük, Orta, Büyük) ve faaliyet sektörü (Hizmet, İmalat) kategorik açıklayıcı değişkenler olarak kullanılmıştır.

Modelde "Küçük" ölçekli işletmeler ve "Hizmet" sektörü referans (baz) kategori olarak belirlenmiş ve aşağıdaki kukla değişkenler tanımlanmıştır:
- DOrta=1D_{Orta} = 1 (İşletme orta ölçekli ise), aksi halde 00
- DBuyuk=1D_{Buyuk} = 1 (İşletme büyük ölçekli ise), aksi halde 00
- SImalat=1S_{Imalat} = 1 (İşletme imalat sektöründe ise), aksi halde 00

Bu değişkenler ve etkileşim terimleri kullanılarak tahmin edilen regresyon modeli aşağıdaki gibidir:
Y=β0+β1DOrta+β2DBuyuk+β3SImalat+β4(DOrta×SImalat)+β5(DBuyuk×SImalat)+εY = \beta_0 + \beta_1 D_{Orta} + \beta_2 D_{Buyuk} + \beta_3 S_{Imalat} + \beta_4 (D_{Orta} \times S_{Imalat}) + \beta_5 (D_{Buyuk} \times S_{Imalat}) + \varepsilon

Buna göre, büyük ölçekli bir imalat sanayi işletmesinin beklenen inceleme süresinin, orta ölçekli bir hizmet sektörü işletmesinin beklenen inceleme süresinden ne kadar fazla olduğunu veren parametre kombinasyonu aşağıdakilerden hangisidir?

Cevabı ve açıklamayı göster

Cevap: β2β1+β3+β5\beta_2 - \beta_1 + \beta_3 + \beta_5

Cevap

İki işletme tipi arasındaki farkı bulmak için, modele ilgili kukla değişken değerleri girilerek beklenen değerler hesaplanmalı ve birbirinden çıkarılmalıdır. Doğru kombinasyon β2β1+β3+β5\beta_2 - \beta_1 + \beta_3 + \beta_5 şeklindedir.
Büyük ölçekli imalat işletmesi için modele DBuyuk=1D_{Buyuk}=1 ve SImalat=1S_{Imalat}=1 değerleri girildiğinde, etkileşim terimi de 11 olur ve beklenen değer β0+β2+β3+β5\beta_0 + \beta_2 + \beta_3 + \beta_5 bulunur. Orta ölçekli hizmet işletmesi için DOrta=1D_{Orta}=1 ve SImalat=0S_{Imalat}=0 girildiğinde beklenen değer β0+β1\beta_0 + \beta_1 olur. İkisi arasındaki fark alındığında β0\beta_0 sabitleri birbirini götürür ve geriye β2β1+β3+β5\beta_2 - \beta_1 + \beta_3 + \beta_5 kombinasyonu kalır.

Adım Adım Çözüm

1
Büyük ölçekli imalat sanayi işletmesi için beklenen süreyi hesapla.
DBuyuk=1D_{Buyuk} = 1, SImalat=1S_{Imalat} = 1, diğer kukla değişkenler 00 olur. Beklenen değer: E(Y)=β0+β2(1)+β3(1)+β5(1)=β0+β2+β3+β5E(Y) = \beta_0 + \beta_2(1) + \beta_3(1) + \beta_5(1) = \beta_0 + \beta_2 + \beta_3 + \beta_5
Regresyon denkleminde işletmenin özelliklerine uygun kukla değişkenler 11 değerini alır.
2
Orta ölçekli hizmet sektörü işletmesi için beklenen süreyi hesapla.
DOrta=1D_{Orta} = 1, SImalat=0S_{Imalat} = 0, diğer kukla değişkenler 00 olur. Beklenen değer: E(Y)=β0+β1(1)=β0+β1E(Y) = \beta_0 + \beta_1(1) = \beta_0 + \beta_1
Hizmet sektörü referans kategori olduğu için SImalatS_{Imalat} değişkeni ve ona bağlı etkileşim terimleri 00 olur.
3
İki beklenen değer arasındaki farkı al.
Fark = (β0+β2+β3+β5)(β0+β1)=β2β1+β3+β5(\beta_0 + \beta_2 + \beta_3 + \beta_5) - (\beta_0 + \beta_1) = \beta_2 - \beta_1 + \beta_3 + \beta_5
Soruda büyük ölçekli imalat işletmesinin orta ölçekli hizmet işletmesinden ne kadar fazla süre gerektirdiği sorulmaktadır.

Anahtar Kavram

Etkileşimli Kukla Değişkenli Modellerde Katsayı Yorumu
Tahmini Süre:2m 0s
Soru 72Soru

Bir e-ticaret platformunun veri analisti, platformdaki satıcıların aylık satış gelirlerini (YY) modellemektedir. Analist, başlangıçta yalnızca satıcıların aylık reklam harcamalarını (X1X_1) bağımsız değişken olarak kullandığı basit doğrusal regresyon modelini tahmin etmiş ve belirleme katsayısını (R2R^2) 0,600,60 olarak hesaplamıştır.

Daha sonra modele, satıcıların platformda geçirdikleri aktif süreyi (X2X_2) ikinci bir bağımsız değişken olarak eklemeye karar vermiştir. Reklam harcamalarının etkisi sabit tutulduğunda, aylık satış gelirleri ile aktif süre arasındaki kısmi korelasyon katsayısı 0,500,50 olarak bulunmuştur.

Analizin yapıldığı örneklem hacmi n=23n = 23 olduğuna göre, her iki bağımsız değişkenin (X1X_1 ve X2X_2) yer aldığı yeni çoklu regresyon modelinin düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2) kaçtır?

Cevabı ve açıklamayı göster

Cevap: 0,67

Cevap

Düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2) 0,670,67 olarak hesaplanır.
Verilen senaryoda öncelikle X2X_2 değişkeninin modele eklenmesiyle oluşan yeni standart belirleme katsayısı (R2R^2) hesaplanmalıdır. Bunun formülü: Ry.122=Ry.12+rYX2.X12(1Ry.12)R^2_{y.12} = R^2_{y.1} + r^2_{Y X_2 . X_1}(1 - R^2_{y.1}) şeklindedir. Değerler yerine konduğunda Ry.122=0,60+(0,50)2×(10,60)=0,70R^2_{y.12} = 0,60 + (0,50)^2 \times (1 - 0,60) = 0,70 bulunur. İkinci aşamada, örneklem hacmi (n=23n=23) ve bağımsız değişken sayısı (k=2k=2) dikkate alınarak düzeltme işlemi yapılır: Rˉ2=1[n1nk1(1R2)]=1[2220(10,70)]=1(1,1×0,30)=0,67\bar{R}^2 = 1 - [\frac{n-1}{n-k-1}(1 - R^2)] = 1 - [\frac{22}{20}(1 - 0,70)] = 1 - (1,1 \times 0,30) = 0,67 sonucuna ulaşılır.

Adım Adım Çözüm

1
Yeni değişkenin modelin açıklayıcılığına olan net katkısını bulmak için kısmi korelasyon katsayısının karesi hesaplanır.
rYX2.X12=0,502=0,25r^2_{Y X_2 . X_1} = 0,50^2 = 0,25
Kısmi korelasyon katsayısının karesi, modele yeni eklenen değişkenin, önceki modelde açıklanamayan varyansın ne kadarını açıkladığını gösterir.
2
Elde edilen katkı payı kullanılarak iki bağımsız değişkenli yeni modelin çoklu belirleme katsayısı (Ry.122R^2_{y.12}) hesaplanır.
Ry.122=0,60+0,25×(10,60)=0,60+0,25×0,40=0,60+0,10=0,70R^2_{y.12} = 0,60 + 0,25 \times (1 - 0,60) = 0,60 + 0,25 \times 0,40 = 0,60 + 0,10 = 0,70
Yeni çoklu belirleme katsayısı, eski belirleme katsayısı ile yeni değişkenin ek katkısının toplamına eşittir.
3
n=23n=23 gözlem ve k=2k=2 bağımsız değişken bilgileri kullanılarak düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2) formülü uygulanır.
Rˉ2=1[2312321×(10,70)]=1[2220×0,30]=1(1,1×0,30)=10,33=0,67\bar{R}^2 = 1 - \left[ \frac{23-1}{23-2-1} \times (1 - 0,70) \right] = 1 - \left[ \frac{22}{20} \times 0,30 \right] = 1 - (1,1 \times 0,30) = 1 - 0,33 = 0,67
Düzeltilmiş R-kare, modele yeni bir değişken eklendiğinde serbestlik derecesindeki kaybı cezalandırarak modelin performansını daha gerçekçi bir şekilde ölçer.

Anahtar Kavram

Modele yeni bir değişken eklendiğinde, standart R2R^2'deki artış kısmi korelasyon üzerinden hesaplanabilir. Ancak bu yeni değer, örneklem hacmi ve değişken sayısına göre düzeltilerek Rˉ2\bar{R}^2 bulunmalıdır.
Soru 73Soru

Makroekonomik bir göstergenin yıllar itibarıyla seyrini açıklamak üzere kurulan bir doğrusal regresyon modelinin kalıntı (artık) terimleri incelenmiş ve Durbin-Watson test istatistiği d=0,65d = 0,65 olarak hesaplanmıştır. İlgili anlamlılık düzeyinde tablo kritik değerleri dikkate alındığında, modelde hata terimleri arasında pozitif yönlü otokorelasyon olduğu kesinleşmiştir.

Buna göre, En Küçük Kareler (EKK) yöntemi ile elde edilen katsayı tahminleri ve bu tahminlere dayalı istatistiksel çıkarımlar hakkında aşağıdakilerden hangisi kesinlikle doğrudur?

Cevabı ve açıklamayı göster

Cevap: Katsayı tahminleri yansızlık (sapmasızlık) özelliğini korur ancak minimum varyansa sahip olma özelliğini yitirir, bu da standart hataların genellikle gerçekte olduğundan küçük tahmin edilmesine yol açar.

Cevap

Katsayı tahminleri yansızlık (sapmasızlık) özelliğini korur ancak minimum varyansa sahip olma özelliğini yitirir, bu da standart hataların genellikle gerçekte olduğundan küçük tahmin edilmesine yol açar.
Doğru seçenek otokorelasyonun EKK tahmincileri üzerindeki etkisini eksiksiz özetlemektedir. Otokorelasyon varlığında model katsayıları hala doğru merkeze odaklanır (yansızdır), ancak tahminlerin yayılımı (varyansı) minimum değildir. Matematiksel olarak pozitif otokorelasyon durumunda standart hata formülü aşağı yönlü bir yanlılık barındırır, yani standart hatalar gerçek değerinden daha küçük tahmin edilir. Bu da t-istatistiklerini olduğundan büyük gösterir.

Adım Adım Çözüm

1
Soruda verilen Durbin-Watson test istatistiğinin (d=0,65d=0,65) işaret ettiği sorunu ve temel özelliklerini belirlemek
dd değeri 2'den belirgin şekilde küçük (0'a yakın) olduğu için modelde kuvvetli bir pozitif otokorelasyon sorunu olduğu görülür.
Durbin-Watson istatistiği 0 ile 4 arasında değer alır; değerin 0'a yaklaşması pozitif ardışık bağımlılığı (otokorelasyonu) ifade eder.
2
Otokorelasyonun En Küçük Kareler (EKK) tahmin edicilerinin özellikleri (Gauss-Markov varsayımları) üzerindeki etkisini analiz etmek
Otokorelasyon varlığında EKK tahmin edicileri doğrusallık, yansızlık (sapmasızlık) ve tutarlılık özelliklerini korur. Ancak varyansları minimum olmaktan çıkar (etkinlik bozulur).
Hata terimlerinin birbiriyle ilişkili olması, EKK katsayılarının beklenen değerini değiştirmez ancak varyans-kovaryans matrisinin yapısını bozar.
3
Etkinlik kaybının istatistiksel testler (t ve F testleri) üzerindeki pratik sonucunu değerlendirmek
Özellikle pozitif otokorelasyon durumunda, kalıntıların varyansı ve dolayısıyla katsayıların standart hataları olduğundan daha küçük tahmin edilir.
Standart hataların yapay olarak küçük çıkması, istatistiksel anlamlılığı gösteren t-değerlerinin çok yüksek hesaplanmasına ve gerçekte anlamsız olan değişkenlerin anlamlıymış gibi yorumlanmasına yol açar.

Anahtar Kavram

Otokorelasyonun EKK Tahmincileri Üzerindeki Etkileri
Soru 74Soru

Bir Çalışma ve Sosyal Güvenlik Bakanlığı uzmanı, aktif işgücü piyasası programlarına harcanan bütçenin (XX), istihdam oranları (YY) üzerindeki etkisini değerlendirmek amacıyla n=50n=50 ilin verisini kullanarak bir basit doğrusal regresyon modeli tahmin etmiştir. Yapılan analiz sonucunda, bütçe harcamalarına ait eğim katsayısı (β1\beta_1) için %95\%95 güven aralığı [0.18,3.42][-0.18, 3.42] olarak hesaplanmıştır.

Bu bulguya göre, β1\beta_1 katsayısının istatistiksel anlamlılığı ve sıfır hipotezi (H0:β1=0H_0: \beta_1 = 0) testine ilişkin aşağıdakilerden hangisi kesinlikle doğrudur?

Cevabı ve açıklamayı göster

Cevap: %5\%5 anlamlılık düzeyinde yapılan iki yönlü bir testte H0:β1=0H_0: \beta_1 = 0 hipotezi reddedilemez ve program bütçesinin istihdam üzerinde istatistiksel olarak anlamlı bir etkisi olmadığı sonucuna varılır.

Cevap

Doğru seçenek, güven aralığı 0 değerini içerdiği için %5 anlamlılık düzeyinde sıfır hipotezinin reddedilemeyeceğini ve etkinin anlamsız olduğunu belirten seçenektir.
Regresyon analizinde, %95 güven aralığı ile %5 anlamlılık düzeyinde yapılan iki yönlü hipotez testi birbirinin tamamlayıcısıdır. Eğer test edilen parametre değeri (bu örnekte sıfır) güven aralığının sınırları içinde kalıyorsa, o parametrenin sıfıra eşit olduğunu savunan H0 hipotezi reddedilemez. [0.18,3.42][-0.18, 3.42] aralığı 0'ı kapsadığı için program bütçesinin istihdam üzerinde istatistiksel olarak anlamlı bir etkisi olmadığı sonucuna varılır.

Adım Adım Çözüm

1
Güven aralığı ve hipotez testi ilişkisinin belirlenmesi.
Regresyon katsayıları için oluşturulan %(1-\alpha) güven aralığı, \alpha anlamlılık düzeyinde yapılan iki yönlü t-testinin kabul bölgesini temsil eder.
Güven aralığı, sıfır hipotezinin reddedilemediği tüm olası katsayı değerlerini kapsar.
2
Sıfır hipotezinde test edilen değerin güven aralığına dâhil olup olmadığının kontrol edilmesi.
Hipotez testi H0:β1=0H_0: \beta_1 = 0 olduğu için, 0 değeri kontrol edilir. 0 değeri, hesaplanan [0.18,3.42][-0.18, 3.42] aralığının içinde yer almaktadır.
Test edilen değer (0), aralığın alt sınırından (-0.18) büyük ve üst sınırından (3.42) küçüktür.
3
İstatistiksel anlamlılık ve hipotez testi için kesin kararın verilmesi.
0 değeri %95 güven aralığı içinde olduğundan, %5 anlamlılık düzeyinde H0 hipotezi reddedilemez. Bütçenin istihdam üzerinde anlamlı bir etkisi yoktur.
Parametrenin 0 olma ihtimali %95 güven düzeyinde dışlanamamıştır.

Anahtar Kavram

Güven Aralığı ve Hipotez Testi Dualitesi (İkiliği)
Soru 75Soru

Bir Kalkınma Ajansı uzmanı, 40 farklı ilçeye ait verileri kullanarak "Kişi Başına Düşen Katma Değer"i (YY) modellemektedir. Başlangıçta modele "Sanayi Elektrik Tüketimi" (X1X_1) ve "Ortalama Eğitim Süresi" (X2X_2) değişkenlerini dahil ederek birinci modeli kurmuş ve çoklu belirleme katsayısını (R2R^2) 07200{}720 olarak hesaplamıştır.

Daha sonra uzman, modele "İlçedeki Banka Şubesi Sayısı" (X3X_3) değişkenini de ekleyerek ikinci bir model tahmin etmiştir. Bu yeni modelde R2R^2 değerinin hafifçe artarak 07210{}721'e yükseldiği, ancak düzeltilmiş belirleme katsayısının (Rˉ2\bar{R}^2) birinci modele göre daha düşük bir değer aldığı gözlemlenmiştir.

Buna göre, X3X_3 değişkeninin modele katkısı ve istatistiksel özellikleri ile ilgili aşağıdaki değerlendirmelerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: Modele sonradan eklenen X3X_3 değişkeninin katsayısına ait t-istatistiğinin mutlak değeri 1'den küçüktür ve bu değişkenin marjinal katkısı, serbestlik derecesindeki kaybı telafi edememiştir.

Cevap

Doğru yanıt, düzeltilmiş belirleme katsayısının düşmesinin temel nedeninin, yeni eklenen değişkene ait t-istatistiğinin mutlak değerinin 1'den küçük olması ve bu durumun serbestlik derecesi kaybını karşılayamaması olduğunu ifade eden seçenektir.
Düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2), modele yeni bir açıklayıcı değişken eklendiğinde, yalnızca bu yeni değişkenin marjinal açıklayıcılık katkısı serbestlik derecesindeki cezayı aştığında artar. Regresyon analizindeki temel matematiksel kurallara göre, modele yeni eklenen bir değişkenin t-istatistiğinin mutlak değeri 1'den büyükse (t>1|t| > 1) düzeltilmiş R2R^2 artar; eğer 1'den küçükse (t<1|t| < 1) azalır. Senaryoda Rˉ2\bar{R}^2 azaldığı için, X3X_3 değişkenine ait t-istatistiğinin mutlak değerce 1'den küçük olduğu ve modele sağladığı ek bilginin, kaybettiği serbestlik derecesini telafi etmeye yetmediği kesin olarak söylenebilir.

Adım Adım Çözüm

1
R2R^2 ve Düzeltilmiş R2R^2'nin modele yeni değişken eklendiğindeki tepkilerini karşılaştırmak.
R2R^2 değeri her zaman artma veya sabit kalma eğilimindeyken, Düzeltilmiş R2R^2 parametre sayısındaki artıştan dolayı serbestlik derecesi kaybını cezalandırır.
Sorudaki çelişkili gibi görünen durumun (birinin artıp diğerinin azalması) temel formülsel mantığını kavramak için.
2
Düzeltilmiş R2R^2'deki değişimi belirleyen matematiksel koşulu (t-istatistiği kuralı) uygulamak.
Ekonometrik teoriye göre, modele eklenen k.k. değişkenin düzeltilmiş R2R^2'yi artırabilmesi için tk>1|t_k| > 1 şartı sağlanmalıdır.
Düzeltilmiş R2R^2 azaldığına göre, eklenen değişkenin (X3X_3) t-istatistiğinin mutlak değerinin 1'den küçük olduğu kuralını doğrulamak için.
3
T-istatistiğinin zayıflığı ile kısmi korelasyon ve açıklayıcılık gücü arasındaki bağı kurmak.
t<1|t| < 1 olması, X3X_3'ün modeldeki diğer değişkenler sabitken YY üzerindeki kısmi korelasyonunun çok zayıf olduğunu ve modele yaptığı marjinal katkının serbestlik derecesi kaybını telafi edemediğini kanıtlar.
Doğru ifadedeki istatistiksel yargının bütününü doğrulamak için.

Anahtar Kavram

Düzeltilmiş R-Kare, t-İstatistiği ve Kısmi Korelasyon İlişkisi
Tahmini Süre:2m 0s
Soru 76Soru

Bir araştırmacı, n=100n = 100 gözlem kullanarak Yi=β0+β1X1i+β2X2i+uiY_i = \beta_0 + \beta_1 X_{1i} + \beta_2 X_{2i} + u_i şeklinde iki bağımsız değişkenli bir çoklu doğrusal regresyon modeli tahmin etmiştir. Araştırmacı, modelde değişen varyans (heteroskedastisite) sorunu olup olmadığını sınamak amacıyla hata terimlerinin normallik varsayımına dayanmayan White testini (çapraz çarpımlar dâhil) uygulamaya karar vermiştir. Yardımcı regresyon modelini tahmin etmiş ve bu modele ait belirleme katsayısını R2=0.25R^2 = 0.25 olarak hesaplamıştır.

Buna göre; White test istatistiğinin değeri, bu istatistiğin asimptotik olarak uyduğu ki-kare (χ2\chi^2) dağılımının serbestlik derecesi ve değişen varyans sorununun En Küçük Kareler (EKK) tahmin edicileri üzerindeki teorik etkisi aşağıdakilerin hangisinde doğru olarak verilmiştir?

Cevabı ve açıklamayı göster

Cevap: Test istatistiği 2525, serbestlik derecesi 55'tir; EKK tahmin edicileri yansız kalmasına rağmen etkinliğini yitirir ve standart hatalar sapmalı olduğu için geleneksel tt ve FF testleri geçersiz olur.

Cevap

Test istatistiği 25, serbestlik derecesi 5'tir; EKK tahmin edicileri yansız kalmasına rağmen etkinliğini yitirir ve standart hatalar sapmalı olduğu için t ve F testleri geçersiz olur.
Doğru yanıt üç aşamalı analizi eksiksiz yapar: 1) LM test istatistiği n×R2=100×0.25=25n \times R^2 = 100 \times 0.25 = 25'tir. 2) İki bağımsız değişkenli modelin White yardımcı regresyonunda değişkenlerin kendileri (2), kareleri (2) ve çapraz çarpımı (1) olmak üzere toplam 5 terim yer alır, bu sebeple istatistik 5 serbestlik dereceli ki-kare dağılır. 3) Değişen varyans, Gauss-Markov teoremine göre yansızlığı bozmaz ancak varyansı büyütür (etkinlik kaybı) ve klasik yöntemle hesaplanan standart hataları sapmalı hâle getirerek hipotez testlerini (tt, FF) geçersiz kılar.

Adım Adım Çözüm

1
White (LM) test istatistiğinin hesaplanması.
LM=n×R2=100×0.25=25LM = n \times R^2 = 100 \times 0.25 = 25
White test istatistiği, gözlem sayısı (nn) ile yardımcı regresyon modelinden elde edilen belirleme katsayısının (R2R^2) çarpımıyla bulunur.
2
Yardımcı regresyondaki bağımsız değişken sayısının ve serbestlik derecesinin belirlenmesi.
Yardımcı regresyon değişkenleri: X1,X2,X12,X22,X1X2X_1, X_2, X_1^2, X_2^2, X_1 X_2. Toplam p=5p = 5 bağımsız değişken vardır. Bu nedenle sd=5sd = 5'tir.
Çapraz çarpımlı orijinal White testinde bağımlı değişken hata terimlerinin karesidir (u^2\hat{u}^2). Açıklayıcı değişkenler ise asıl modeldeki değişkenlerin kendileri, kareleri ve birbirleriyle olan çapraz çarpımlarıdır.
3
Değişen varyansın EKK tahmin edicileri üzerindeki teorik etkisinin değerlendirilmesi.
Tahmin ediciler yansızdır (E(β^)=βE(\hat{\beta}) = \beta), ancak minimum varyanslı (etkin) değildir. Standart hatalar sapmalıdır ve hipotez testleri geçersizdir.
Gauss-Markov varsayımlarından sabit varyans (homoskedastisite) ihlal edildiğinde, EKK tahmin edicileri yansızlık ve tutarlılık özelliklerini korur ancak En İyi (Best/Minimum Varyans) olma özelliğini kaybeder. Klasik varyans formülü sapmalı sonuç ürettiği için tt ve FF istatistikleri güvenilirliğini yitirir.

Anahtar Kavram

White Testi Hesaplaması ve Değişen Varyansın Gauss-Markov Sonuçları
Soru 77Soru

Bir e-ticaret platformunun yöneticisi, satıcılara ait mağazaların aylık platform içi reklam harcamaları (XX, bin TL) ile bu mağazaların aylık satış gelirleri (YY, bin TL) arasındaki ilişkiyi incelemek istemektedir.

Rastgele seçilen 3636 mağazaya ait veriler analiz edildiğinde aşağıdaki özet istatistikler elde edilmiştir:

* Reklam harcamalarının ortalaması: xˉ=20\bar{x} = 20
* Satış gelirlerinin ortalaması: yˉ=150\bar{y} = 150
* Reklam harcamalarının standart sapması: sx=4s_x = 4
* Satış gelirlerinin standart sapması: sy=25s_y = 25
* Değişkenler arasındaki korelasyon katsayısı: r=0,80r = 0,80

Bu bilgilere göre, En Küçük Kareler (EKK) yöntemiyle tahmin edilen basit doğrusal regresyon denklemi (y^=β^0+β^1x\hat{y} = \hat{\beta}_0 + \hat{\beta}_1 x) aşağıdakilerden hangisidir?

Cevabı ve açıklamayı göster

Cevap: y^=50+5x\hat{y} = 50 + 5x

Cevap

y^=50+5x\hat{y} = 50 + 5x denklemi doğru regresyon modelidir.
Basit doğrusal regresyon modelinde, özet istatistikler verildiğinde EKK tahmin edicileri ardışık olarak hesaplanır. Önce β^1=rsysx\hat{\beta}_1 = r \cdot \frac{s_y}{s_x} formülü ile eğim 0,80(25/4)=50,80 \cdot (25/4) = 5 olarak bulunur. Ardından β^0=yˉβ^1xˉ\hat{\beta}_0 = \bar{y} - \hat{\beta}_1 \bar{x} formülü ile sabit terim 150(520)=50150 - (5 \cdot 20) = 50 olarak bulunur. Bu değerler denklemde yerine konduğunda sonuç y^=50+5x\hat{y} = 50 + 5x olur.

Adım Adım Çözüm

1
Eğim katsayısının (β^1\hat{\beta}_1) hesaplanması
β^1=0,80254=0,806,25=5\hat{\beta}_1 = 0,80 \cdot \frac{25}{4} = 0,80 \cdot 6,25 = 5
Basit doğrusal regresyonda eğim, korelasyon katsayısı ile bağımlı ve bağımsız değişkenin standart sapmalarının oranının çarpımına eşittir (β^1=rsysx\hat{\beta}_1 = r \cdot \frac{s_y}{s_x}).
2
Sabit terimin (β^0\hat{\beta}_0) hesaplanması
β^0=150(520)=150100=50\hat{\beta}_0 = 150 - (5 \cdot 20) = 150 - 100 = 50
EKK regresyon doğrusu her zaman ortalamalar noktasından (xˉ,yˉ)(\bar{x}, \bar{y}) geçer. Bu nedenle β^0=yˉβ^1xˉ\hat{\beta}_0 = \bar{y} - \hat{\beta}_1 \bar{x} formülü kullanılarak sabit terim bulunur.
3
Regresyon denkleminin yazılması
y^=50+5x\hat{y} = 50 + 5x
Hesaplanan katsayılar standart y^=β^0+β^1x\hat{y} = \hat{\beta}_0 + \hat{\beta}_1 x denkleminde yerine konur.

Anahtar Kavram

EKK Yöntemiyle Eğim ve Kesme Noktası Tahmini
Soru 78Soru

Bir makroekonomik analizde, ihracat hacmini (YY) açıklamak üzere döviz kuru (X1X_1), yurt dışı gelir endeksi (X2X_2) ve kapasite kullanım oranı (X3X_3) bağımsız değişkenleri modele dahil edilerek En Küçük Kareler (EKK) yöntemiyle tahmin yapılmıştır. Modelin genel anlamlılığını sınayan FF-istatistiği oldukça yüksek ve pp-değeri 0,0010,001'den küçük çıkmasına rağmen, modele dahil edilen X1X_1 ve X2X_2 değişkenlerine ait katsayıların tt-istatistikleri istatistiksel olarak anlamsız bulunmuştur. Yapılan tanısal (diagnostik) testlerde, X1X_1 değişkenine ait Tolerans (Tolerance) değeri 0,050,05 olarak hesaplanmıştır.

Bu modelde karşılaşılan ekonometrik sorun ve EKK tahmincilerinin istatistiksel özellikleri hakkında aşağıdaki ifadelerden hangisi kesinlikle doğrudur?

Cevabı ve açıklamayı göster

Cevap: X1X_1 değişkeninin Varyans Şişirme Faktörü (VIF) değeri 2020'dir ve bu durum modelde ciddi bir çoklu doğrusal bağlantı olduğuna işaret eder; ancak bu sorun EKK tahmincilerinin sapmasızlık özelliğini bozmaz, yalnızca tahmin varyanslarını büyüterek etkinliklerini ortadan kaldırır.

Cevap

Doğru seçenek, ilgili değişkenin VIF değerinin 20 olduğunu, bunun çoklu doğrusal bağlantıyı gösterdiğini ve bu sorunun EKK tahmincilerinin sapmasızlığını bozmayıp yalnızca varyanslarını büyüterek etkinliklerini yok ettiğini belirten ifadedir.
Tolerans değeri 0,050,05 olarak verilen bir değişkenin VIF değeri 10,05=20\frac{1}{0,05} = 20'dir. VIF değerinin 1010'dan büyük olması, modeldeki çoklu doğrusal bağlantının tehlikeli boyutlarda olduğuna işaret eder. Teorik olarak, çoklu doğrusal bağlantı sorunu Gauss-Markov varsayımlarından sapmasızlık ilkesini ihlal etmez. Tahminciler (β^\hat{\beta}) ortalamada hala gerçek katsayıları (β\beta) verir. Ancak varyans formülündeki (1Rj2)(1 - R_j^2) veya Tolerans ifadesi paydayı küçülttüğü için tahmin varyansları devasa boyutlara ulaşır. Bu durum EKK tahmincilerinin en küçük varyanslı (etkin) olma özelliklerini yitirmelerine ve tt-istatistiklerinin istatistiksel olarak anlamsız çıkmasına neden olur.

Adım Adım Çözüm

1
Tolerans (Tolerance) değeri kullanılarak Varyans Şişirme Faktörü (VIF) hesaplanır.
VIF=1Tolerans=10,05=20VIF = \frac{1}{Tolerans} = \frac{1}{0,05} = 20 olarak bulunur.
Çoklu doğrusal bağlantının şiddetini ölçmek ve genel kabul gören 1010 eşik değeri ile karşılaştırmak için VIF formülü uygulanmalıdır.
2
Hesaplanan VIF değeri ile FF ve tt istatistikleri birlikte yorumlanarak ekonometrik problem teşhis edilir.
VIF=20>10VIF = 20 > 10 olması ve modelin genel olarak anlamlı (FF testi) ancak parametrelerin bireysel olarak anlamsız (tt testi) çıkması, ciddi bir çoklu doğrusal bağlantı (multicollinearity) sorununu kanıtlar.
Değişkenler arası yüksek korelasyon, standart hataları şişirerek t-değerlerini düşürür ancak genel açıklama gücünü (R2R^2 ve FF) yüksek tutar.
3
Çoklu doğrusal bağlantının EKK (En Küçük Kareler) tahmincileri üzerindeki etkisi değerlendirilir.
Çoklu doğrusal bağlantı, bağımsız değişkenlerin hata terimi ile ilişkili olmasına yol açmadığından sapmasızlık (unbiasedness) özelliğini bozmaz. Sadece tahmin varyanslarını (standart hataları) büyüterek etkinlik (efficiency) özelliğinin kaybolmasına neden olur.
Gauss-Markov teoremine göre sapmasızlık için XX matrisinin tam ranklı olması yeterlidir; bağlantı 'tam' (perfect) olmadığı sürece katsayılar sapmasızdır.

Anahtar Kavram

Çoklu Doğrusal Bağlantı (Multicollinearity) ve EKK Tahmincilerine Etkisi
Tahmini Süre:2m 0s
Soru 79Soru

Bir tedarik zinciri analisti, teslimat sürelerini (YY) tahmin etmek amacıyla mesafe (X1X_1), yük ağırlığı (X2X_2), trafik yoğunluk endeksi (X3X_3) ve sürücü deneyimi (X4X_4) bağımsız değişkenlerini modele dahil ederek 3535 gözlemden oluşan bir veri seti ile çoklu doğrusal regresyon analizi gerçekleştirmiştir.

Model sonucunda, trafik yoğunluk endeksi (X3X_3) değişkenine ait tahmini eğim katsayısı β^3=6.4\hat{\beta}_3 = 6.4 ve bu katsayının standart hatası Sβ^3=3.2S_{\hat{\beta}_3} = 3.2 olarak hesaplanmıştır.

Regresyonda parametrelerin anlamlılığına ilişkin hipotez testleri ve güven aralıkları dikkate alındığında, aşağıdaki ifadelerden hangisi doğrudur?

(Not: Sağ kuyruk olasılıklarına göre bazı tt dağılımı tablo değerleri (t(α;sd)t_{(\alpha; sd)}) aşağıda verilmiştir:
t(0.05;30)=1.697t_{(0.05; 30)} = 1.697 , t(0.025;30)=2.042t_{(0.025; 30)} = 2.042
t(0.05;34)=1.691t_{(0.05; 34)} = 1.691 , t(0.025;34)=2.032t_{(0.025; 34)} = 2.032)

Cevabı ve açıklamayı göster

Cevap: İlgili katsayı %10\%10 anlamlılık düzeyinde istatistiksel olarak anlamlı iken, bu katsayı için hesaplanacak %95\%95 güven aralığı sıfır değerini kapsar.

Cevap

İlgili katsayı %10 anlamlılık düzeyinde istatistiksel olarak anlamlı iken, %95 güven aralığı sıfır değerini kapsar.
Verilen katsayı için hesaplanan t-istatistiği 2.00'dır ve modelin serbestlik derecesi 30'dur. %10 düzeyindeki çift yönlü test için kritik sınır 1.697 iken %5 düzeyi için 2.042'dir. t = 2.00 değeri bu iki kritik sınırın arasında kaldığından değişken %10 düzeyinde anlamlıdır (hipotez reddedilir) ancak %5 düzeyinde anlamlı değildir (hipotez reddedilemez). Güven aralığı ve hipotez testi ikiliği gereği, %5 anlamlılık düzeyinde reddedilemeyen bir hipotezin %95 güven aralığı hesaplandığında bu aralığın içinde mutlaka sıfır (0) değeri bulunur.

Adım Adım Çözüm

1
Regresyon katsayısının anlamlılık testi için hesaplanan t-istatistiğini bulma.
t=β^3Sβ^3=6.43.2=2.00t = \frac{\hat{\beta}_3}{S_{\hat{\beta}_3}} = \frac{6.4}{3.2} = 2.00
Bir bağımsız değişkenin istatistiksel anlamlılığı, tahmini eğim katsayısının standart hatasına oranlanmasıyla hesaplanan t-değeri üzerinden test edilir.
2
Test için kullanılacak serbestlik derecesini (sd) hesaplama.
sd=nk1=3541=30sd = n - k - 1 = 35 - 4 - 1 = 30
Çoklu doğrusal regresyon analizinde t-testi için serbestlik derecesi toplam gözlem sayısından, tahmin edilen parametre sayısının (k bağımsız değişken + 1 sabit) çıkarılmasıyla elde edilir.
3
%10 anlamlılık düzeyi (α=0.10\alpha = 0.10) için test sonucunu değerlendirme.
Kritik değer t(0.05;30)=1.697t_{(0.05; 30)} = 1.697'dir. Hesaplanan t=2.00>1.697t = 2.00 > 1.697 olduğundan H0H_0 reddedilir.
Çift yönlü testte hesaplanan t istatistiğinin mutlak değeri tablo kritik değerinden büyük olduğu için katsayı %10 düzeyinde anlamlıdır. Bu durum %90 güven aralığının sıfır değerini içermediğini gösterir.
4
%5 anlamlılık düzeyi (α=0.05\alpha = 0.05) ve %95 güven aralığı için test sonucunu değerlendirme.
Kritik değer t(0.025;30)=2.042t_{(0.025; 30)} = 2.042'dir. Hesaplanan t=2.00<2.042t = 2.00 < 2.042 olduğundan H0H_0 reddedilemez.
Hesaplanan t istatistiği 2.042 değerini aşamadığı için %5 düzeyinde anlamlılık yoktur. Hipotezin reddedilememesi ile %95 güven aralığının sıfır (0) değerini kapsaması eşdeğer sonuçlardır.

Anahtar Kavram

Regresyonda Hipotez Testleri ve Güven Aralıkları
Tahmini Süre:2m 30s
Soru 80Soru

Kamu maliyesi alanında çalışan bir veri analisti, belediyelerin öz gelirlerini (YY) modellemek için çeşitli demografik ve ekonomik göstergeleri (X1,X2,,XkX_1, X_2, \dots, X_k) kullanmaktadır. Analist, modele dahil ettiği 'kişi başına düşen motorlu taşıt sayısı' (X3X_3) değişkenini bağımlı, diğer tüm bağımsız değişkenleri ise açıklayıcı olarak kullanarak bir yardımcı regresyon denklemi tahmin etmiş ve bu denkleme ait belirtme katsayısını (R32R^2_3) 0,980,98 olarak bulmuştur.

Buna göre, X3X_3 değişkenine ilişkin hesaplanacak tolerans (tolerance) ve VIF değerleri ile modeldeki En Küçük Kareler (EKK) tahmincilerinin özellikleri hakkında aşağıdaki ifadelerden hangisi kesinlikle doğrudur?

Cevabı ve açıklamayı göster

Cevap: Tolerans değeri 0,020,02 ve VIF değeri 5050'dir; modelde şiddetli çoklu doğrusal bağlantı vardır, bu durum EKK tahmincilerinin sapmasızlığını bozmaz ancak varyanslarını büyüterek etkinliklerini yok eder.

Cevap

Tolerans değeri 0,020,02 ve VIF değeri 5050'dir; modelde şiddetli çoklu doğrusal bağlantı vardır, bu durum EKK tahmincilerinin sapmasızlığını bozmaz ancak varyanslarını büyüterek etkinliklerini yok eder.
Tolerans değeri, 1Rj21 - R^2_j formülü ile hesaplanır. Bu durumda Tolerans =10,98=0,02= 1 - 0,98 = 0,02 olur. VIF değeri ise toleransın çarpmaya göre tersidir, yani VIF =1/Tolerans=1/0,02=50= 1 / \text{Tolerans} = 1 / 0,02 = 50'dir. VIF değerinin 1010'dan büyük olması, modelde şiddetli bir çoklu doğrusal bağlantı (multicollinearity) sorunu olduğuna işaret eder. Çoklu doğrusal bağlantı, EKK tahmincilerinin sapmasızlık (unbiasedness) özelliğini bozmaz, ancak parametre tahminlerinin varyanslarını şişirerek (büyüterek) tahmincilerin etkinliğini ortadan kaldırır. Bu nedenle standart hatalar büyür, t-istatistikleri küçülür ve değişkenler istatistiksel olarak anlamsız çıkabilir.

Adım Adım Çözüm

1
Tolerans değerinin hesaplanması
1R321 - R^2_3 formülü kullanılarak 10,98=0,021 - 0,98 = 0,02 bulunur.
Tolerans, bir bağımsız değişkenin diğer bağımsız değişkenler tarafından açıklanamayan (bağımsız) kısmını ifade eder.
2
VIF (Varyans Şişirme Faktörü) değerinin hesaplanması
1/Tolerans1 / \text{Tolerans} formülü kullanılarak 1/0,02=501 / 0,02 = 50 elde edilir.
VIF, toleransın çarpmaya göre tersidir ve çoklu doğrusal bağlantı nedeniyle varyansın ne kadar şiştiğini gösterir.
3
VIF değerinin yorumlanması
Hesaplanan VIF değeri (5050), kritik eşik olan 1010'dan çok büyük olduğu için şiddetli çoklu doğrusal bağlantı teşhis edilir.
Genel kabul gören kurala göre VIF >10> 10 (bazı kaynaklarda >5> 5) ciddi bağlantı sorununa işaret eder.
4
EKK tahmincilerine etkisinin belirlenmesi
Tahminciler sapmasız kalır ancak varyansları büyür, böylece etkinlikleri (minimum varyans özelliği) bozulur.
Çoklu doğrusal bağlantı, modelin varsayımlarından biri olan değişkenler arası bağımsızlığı zedeler ancak hata terimi ile ilgili olmadığı için sapmasızlığı etkilemez.

Anahtar Kavram

Çoklu doğrusal bağlantı teşhisi (Tolerans ve VIF) ve EKK tahmincileri üzerindeki etkileri
ÖncekiSayfa 4 / 11Sonraki