Regresyon Analizi

210 soru

Soru 81Soru

Çalışma ve Sosyal Güvenlik Bakanlığı'nda görevli bir uzman, işsizlik oranını etkileyen faktörleri belirlemek amacıyla 55 bağımsız değişkenin yer aldığı bir çoklu doğrusal regresyon modeli kurmuştur. 2626 gözlem değerine dayalı olarak elde edilen varyans analizi (ANOVA) tablosunun bir kısmı aşağıda verilmiştir:

Varyans KaynağıKareler Toplamı (KT)Serbestlik Derecesi (sd)
Regresyon (Model)150150?
Hata (Artık)5050?
Genel200200?

Buna göre, modelin belirleme katsayısı (R2R^2) ve hesaplanan FF istatistiği değeri aşağıdakilerin hangisinde doğru verilmiştir?

Cevabı ve açıklamayı göster

Cevap: R2=0,75R^2 = 0,75 ve F=12F = 12

Cevap

Modelin belirleme katsayısı 0,750,75 ve hesaplanan FF istatistiği değeri 1212 olarak bulunur.
Doğru seçenekte belirtilen değerler, verilen kareler toplamı ve gözlem sayıları kullanılarak yapılan standart ANOVA hesaplamalarına tam uyum sağlamaktadır. R2R^2 değeri 0,750,75 olup, regresyon kareler ortalamasının (3030) hata kareler ortalamasına (2,52,5) oranı tam olarak 1212 çıkmaktadır.

Adım Adım Çözüm

1
Belirleme katsayısını (R2R^2) hesaplayın.
R2=RKTGKT=150200=0,75R^2 = \frac{RKT}{GKT} = \frac{150}{200} = 0,75
Belirleme katsayısı, bağımlı değişkendeki toplam değişimin model tarafından açıklanan kısmını gösterir.
2
Serbestlik derecelerini belirleyin.
sdreg=k=5sd_{reg} = k = 5 ve sdhata=nk1=2651=20sd_{hata} = n - k - 1 = 26 - 5 - 1 = 20
kk bağımsız değişken sayısını, nn ise gözlem sayısını temsil eder.
3
Kareler ortalamalarını hesaplayın.
RKO=1505=30RKO = \frac{150}{5} = 30 ve HKO=5020=2,5HKO = \frac{50}{20} = 2,5
Kareler ortalaması, kareler toplamının ilgili serbestlik derecesine bölünmesiyle elde edilir.
4
FF istatistiğini hesaplayın.
F=RKOHKO=302,5=12F = \frac{RKO}{HKO} = \frac{30}{2,5} = 12
FF testi, modelin bütünsel olarak anlamlılığını test etmek için kullanılır.

Anahtar Kavram

Regresyon modelinde varyans analizi (ANOVA) bileşenleri ve R2R^2 ile FF istatistiği arasındaki matematiksel ilişki.

Daha Fazla Pratik

Aynı verilerle modelin standart hatasını (se) hesaplamayı deneyebilirsiniz.

Alternatif Yöntem

R2R^2 değeri bilindiğinde FF istatistiği şu formülle de teyit edilebilir: F=R2/k(1R2)/(nk1)F = \frac{R^2 / k}{(1 - R^2) / (n - k - 1)}. Burada F=0,75/50,25/20=0,150,0125=12F = \frac{0,75 / 5}{0,25 / 20} = \frac{0,15}{0,0125} = 12 elde edilir.
Tahmini Süre:1m 30s
Soru 82Soru

Bir tarım il müdürlüğünde çalışan bir ziraat mühendisi, buğday rekoltesini (YY) etkileyen faktörleri incelemek amacıyla; yıllık yağış miktarı (X1X_1), gübre kullanım miktarı (X2X_2) ve ortalama sıcaklık (X3X_3) bağımsız değişkenlerini içeren Y=Xβ+εY = X\beta + \varepsilon çoklu doğrusal regresyon modelini En Küçük Kareler (EKK) yöntemiyle tahmin etmiştir.

Elde edilen modelin istatistiksel değerlendirmesi ve EKK tahmincilerinin özellikleri dikkate alındığında, aşağıdaki ifadelerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: Modele rekolte üzerinde hiçbir istatistiksel anlamlı etkisi olmayan yeni bir bağımsız değişken eklendiğinde, standart belirleme katsayısı (R2R^2) azalmazken, düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2) düşüş gösterir.

Cevap

Modele rekolte üzerinde hiçbir istatistiksel anlamlı etkisi olmayan yeni bir bağımsız değişken eklendiğinde, standart belirleme katsayısı (R2R^2) azalmazken, düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2) düşüş gösterir.
Çoklu doğrusal regresyon modellerinde standart belirleme katsayısı (R2R^2), 1(Hata Kareler Toplamı/Genel Kareler Toplamı)1 - (Hata\ Kareler\ Toplamı / Genel\ Kareler\ Toplamı) formülüyle hesaplanır ve modele bağımsız değişken eklendiğinde Hata Kareler Toplamı hiçbir zaman artamayacağı için R2R^2 asla azalmaz. Ancak düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2), serbestlik derecesini denkleme katarak (n-k-1) hesaplandığından, rekolte üzerinde anlamlı bir açıklayıcılığı olmayan, yani modele katkısından çok serbestlik derecesi kaybına yol açan yeni bir değişken eklendiğinde değeri düşecektir.

Adım Adım Çözüm

1
Çoklu doğrusal regresyon modelinde standart belirleme katsayısı (R2R^2) ve düzeltilmiş belirleme katsayısının (Rˉ2\bar{R}^2) formülleri ile modele yeni değişken eklendiğindeki matematiksel davranışları analiz edilir.
R2R^2 değeri sisteme eklenen her yeni değişkende (açıklayıcılığı sıfır olsa bile) matematiksel yapı gereği azalmaz. Ancak Rˉ2\bar{R}^2 formülünde serbestlik derecesi kısıtı bulunduğu için anlamsız değişken eklenmesi durumunda ceza mekanizması devreye girer ve değer düşer.
Modelin açıklayıcı gücünü ölçen kriterler arasındaki temel yapısal farkın tespiti için bu inceleme gereklidir.
2
EKK tahmincisinin matris formülü ve sapmasızlık özellikleri incelenir.
EKK katsayı vektörünün doğru formülü β^=(XX)1XY\hat{\beta} = (X'X)^{-1}X'Y'dir. Çoklu doğrusal bağlantı varyansları artırır ancak tahmincinin sapmasızlığını bozmaz.
Varsayım ihlalleri ile matris operasyonlarının tahmin üzerindeki etkilerini ayrıştırmak için bu değerlendirme yapılır.
3
Kukla değişken yorumlaması ve hipotez testlerinde kullanılan test istatistiklerinin (t-testi) hesaplanma yöntemi kontrol edilir.
Kukla değişkenler modelin kesme noktasında (sabit terimde) kaymaya neden olur, eğimi değiştirmez. t-istatistiği ise tahmin değerinin standart hataya çarpımıyla değil, standart hataya bölümüyle (t=β^/Sβ^t = \hat{\beta}/S_{\hat{\beta}}) bulunur.
Model katsayılarının yorumu ve anlamlılık sınamalarındaki kavramsal yanılgıları elemek amacıyla analiz edilir.

Anahtar Kavram

Çoklu Doğrusal Regresyon Modellerinde Değerlendirme Kriterleri ve EKK Özellikleri
Soru 83Soru

Bir kamu strateji biriminde yürütülen projede, bağımlı bir değişkenin (YY) tahmin edilmesi amacıyla iki farklı regresyon modeli oluşturulmuş ve modellerin performans ölçütleri aşağıdaki tabloda özetlenmiştir:

ÖlçütModel IModel II
Bağımsız Değişken Sayısı (kk)35
Belirleme Katsayısı (R2R^2)0,850,86
Düzeltilmiş R2R^20,820,81
Akaike Bilgi Kriteri (AICAIC)240,0248,0

Buna göre, bu modellerin karşılaştırılması ve seçimine ilişkin aşağıdaki ifadelerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: Model I, hem daha yüksek düzeltilmiş belirleme katsayısına hem de daha düşük bir bilgi kriteri değerine sahip olduğu için Model II'den daha iyi bir modeldir.

Cevap

Model I'in hem daha yüksek düzeltilmiş belirleme katsayısına hem de daha düşük bir bilgi kriteri değerine sahip olduğu için daha iyi bir model olduğu ifadesi doğrudur.
Model seçiminde tek başına R2R^2 değeri yanıltıcıdır çünkü modele ne kadar çok değişken eklenirse eklensin R2R^2 asla azalmaz. Düzeltilmiş R2R^2 (AdjR2Adj R^2) ise gereksiz değişken eklendiğinde düşebilir. Model I'in AdjR2Adj R^2 değerinin Model II'den yüksek olması (0,82 > 0,81) ve Akaike Bilgi Kriteri (AICAIC) değerinin Model II'den düşük olması (240 < 248), Model I'in veriyi daha etkili ve dengeli bir şekilde açıkladığını kanıtlar.

Adım Adım Çözüm

1
Belirleme katsayılarını (R2R^2 ve Düzeltilmiş R2R^2) karşılaştırın.
Model II'nin R2R^2 değeri (0,86) Model I'den (0,85) yüksek olsa da, değişken sayısını cezalandıran Düzeltilmiş R2R^2 değeri Model I'de (0,82) daha yüksektir.
Modele gereksiz değişken eklendiğinde R2R^2 yapay olarak artabilir, bu yüzden düzeltilmiş değer daha güvenilirdir.
2
Bilgi kriterlerini (AICAIC) karşılaştırın.
Model I'in AICAIC değeri (240,0), Model II'nin AICAIC değerinden (248,0) daha düşüktür.
Model seçiminde AIC değerinin düşük olması, modelin veri üzerindeki bilgi kaybının daha az olduğunu ve parsimoni ilkesine daha yakın olduğunu gösterir.
3
Son kararı verin.
Model I her iki kriterde de daha iyi performans göstermektedir.
Düzeltilmiş R2R^2 değerinin yüksek, AICAIC değerinin düşük olması Model I'i üstün kılar.

Anahtar Kavram

Model seçim kriterleri (AdjR2Adj R^2 ve AICAIC) ve parsimoni ilkesi.

Alternatif Yöntem

Aynı modeller için BIC (Bayesyen Bilgi Kriteri) değeri de hesaplanabilir. BIC, değişken sayısı için AIC'den daha ağır bir ceza uygular ve genellikle daha parsimonik modelleri tercih eder.
Tahmini Süre:1m 30s
Soru 84Soru

Bir belediyenin ulaşım dairesi, günlük toplu taşıma yolcu sayısını (YY); bilet fiyatı (X1X_1), ortalama hava sıcaklığı (X2X_2) ve otopark ücretleri (X3X_3) bağımsız değişkenlerini kullanarak bir çoklu doğrusal regresyon modeli kurmuştur. Modelin tahmin edilmesi ve sonuçların yorumlanması süreciyle ilgili aşağıdaki ifadelerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: Sıcaklık değişkenine (X2X_2) ait katsayı; bilet fiyatı (X1X_1) ve otopark ücretleri (X3X_3) sabit tutulduğunda, sıcaklıktaki bir birimlik değişimin yolcu sayısı (YY) üzerindeki beklenen etkisini gösterir.

Cevap

Sıcaklık değişkenine (X2X_2) ait kısmi regresyon katsayısı, modeldeki diğer bağımsız değişkenler (X1X_1 ve X3X_3) sabit tutulduğunda sıcaklıktaki bir birimlik değişimin yolcu sayısı üzerindeki beklenen değişimini ifade eder.
Çoklu doğrusal regresyon analizinde bir bağımsız değişkenin katsayısı, modelde yer alan diğer tüm bağımsız değişkenlerin etkileri sabit tutulduğunda (kontrol edildiğinde), o değişkendeki 1 birimlik değişimin bağımlı değişken üzerindeki ortalama etkisini ölçer. Bu durum istatistikte 'kısmi regresyon katsayısı' yorumu olarak adlandırılır.

Adım Adım Çözüm

1
Kısmi regresyon katsayılarının yorumunu analiz etme.
Çoklu regresyonda her bir katsayı, 'ceteris paribus' (diğer şartlar sabitken) varsayımı altında yorumlanır.
Bağımsız değişkenler arasındaki korelasyonun etkisini arındırmak ve her değişkenin 'net' katkısını ölçmek için bu varsayım gereklidir.
2
Düzeltilmiş R-kare ve standart R-kare arasındaki farkı değerlendirme.
R2R^2 asla azalmazken, Rˉ2\bar{R}^2 modele anlamsız değişken eklendiğinde azalabilir.
Düzeltilmiş R-kare, serbestlik derecesi kaybını hesaba katarak modeldeki yapay artışları engeller.
3
En Küçük Kareler (EKK) tahmincilerinin Gauss-Markov özelliklerini gözden geçirme.
Varsayım ihlalleri (otokorelasyon vb.) sapmasızlığı etkilemez, etkinliği etkiler.
Sapmasızlık özelliği hata teriminin beklenen değerinin sıfır olmasıyla (E[ϵ]=0E[\epsilon]=0) ilgilidir, varyans yapısıyla ilgili değildir.

Anahtar Kavram

Çoklu Doğrusal Regresyon Katsayılarının Yorumlanması ve Model Özellikleri

Daha Fazla Pratik

Çoklu regresyonda bağımsız değişkenler arasındaki yüksek korelasyonun (çoklu doğrusal bağlantı) katsayıların varyansları ve t-testi sonuçları üzerindeki etkilerini inceleyebilirsiniz.
Tahmini Süre:1m 30s
Soru 85Soru

Bir ulaşım planlama uzmanı, büyükşehirlerdeki ortalama trafik sıkışıklık endeksini (YY) açıklamak için nüfus yoğunluğu (X1X_1) ve ana arter kapasitesi (X2X_2) değişkenlerini kullanarak bir çoklu doğrusal regresyon modeli kurmuştur. Uzman, daha sonra mevcut modele kişi başına düşen otopark sayısı (X3X_3) değişkenini de dâhil etmiştir.

Yeni değişken (X3X_3) modele eklendiğinde, modelin standart belirleme katsayısının (R2R^2) bir miktar arttığı, ancak düzeltilmiş belirleme katsayısının (Rˉ2\bar{R}^2) azaldığı gözlemlenmiştir. Ayrıca, X1X_1 ve X2X_2 sabit tutulduğunda X3X_3 ile YY arasındaki kısmi korelasyon katsayısı istatistiksel olarak anlamsız bulunmuştur.

Buna göre, düzeltilmiş belirleme katsayısındaki (Rˉ2\bar{R}^2) azalmanın istatistiksel nedeni aşağıdakilerden hangisidir?

Cevabı ve açıklamayı göster

Cevap: Yeni değişkenin modele sağladığı ek açıklama payının, değişken sayısının artmasından kaynaklanan serbestlik derecesi kaybını telafi edemeyecek kadar küçük olması

Cevap

Yeni değişkenin modele sağladığı ek açıklama payının, değişken sayısının artmasından kaynaklanan serbestlik derecesi kaybını telafi edemeyecek kadar küçük olması
Doğru yanıt, düzeltilmiş R-karenin (Rˉ2 \bar{R}^2 ) temel mantığını yansıtır. Standart R-kare (R2R^2), modele değişken eklendikçe matematiksel olarak artma eğilimindedir. Bunu engellemek için Rˉ2 \bar{R}^2 formülünde pay ve payda serbestlik derecelerine (n1n-1 ve nk1n-k-1) bölünür. Yeni bir değişken eklendiğinde serbestlik derecesi azalır. Eğer yeni değişkenin açıkladığı varyans (kısmi korelasyonu) çok zayıfsa, bu değişkenin sağladığı katkı serbestlik derecesindeki kaybı (cezayı) telafi edemez ve Rˉ2 \bar{R}^2 düşer. Kısmi korelasyonun anlamsız bulunması da bu telafinin yapılamadığını matematiksel olarak doğrulamaktadır.

Adım Adım Çözüm

1
Standart belirleme katsayısının (R2R^2) davranışını analiz et
Modele herhangi bir değişken eklendiğinde R2R^2 asla azalmaz, ya sabit kalır ya da artar.
Çünkü yeni değişken, bağımlı değişkendeki varyansın en kötü ihtimalle %0'ını açıklar.
2
Düzeltilmiş belirleme katsayısının (Rˉ2\bar{R}^2) davranışını analiz et
Rˉ2\bar{R}^2, modele eklenen anlamsız değişkenler için formülündeki (nk1)(n-k-1) serbestlik derecesi nedeniyle cezalandırma yapar.
Bu ceza mekanizması, gereksiz değişkenlerin modele eklenmesini engellemek için tasarlanmıştır.
3
Kısmi korelasyon ile Rˉ2\bar{R}^2 ilişkisini kur
Eklenen değişkenin t-istatistiği mutlak değerce 1'den küçükse (kısmi korelasyonu çok zayıfsa), Rˉ2\bar{R}^2 düşer.
Değişkenin getirdiği açıklayıcılık katkısı (AKT'deki artış), paydadaki serbestlik derecesi kaybından daha azdır.

Anahtar Kavram

Standart ve Düzeltilmiş Belirleme Katsayıları Arasındaki Fark
Soru 86Soru

Bir istatistik uzmanı, YY bağımlı değişkeni ile XX bağımsız değişkeni arasındaki teorik ilişkiyi Yi=E(YXi)+uiY_i = E(Y|X_i) + u_i şeklinde ifade etmiştir. Burada E(YXi)=β0+β1XiE(Y|X_i) = \beta_0 + \beta_1 X_i ifadesi modelin deterministik (sistematik) bileşenini, uiu_i ise stokastik (rastgele) bileşenini temsil etmektedir. EKK (En Küçük Kareler) yöntemi, stokastik bileşenin karesel toplamını (ui2\sum u_i^2) minimize ederek deterministik bileşendeki katsayıları tahmin etmeyi amaçlar.

Modelin varsayım kontrolleri sonucunda; uiu_i terimlerinin birbirinden bağımsız olduğu (otokorelasyon bulunmadığı) ve normal dağılıma uyduğu, ancak varyanslarının sabit kalmayıp XiX_i değerleriyle birlikte artış gösterdiği (değişen varyans) saptanmıştır.

Gauss-Markov teoremi ve EKK tahmin edicilerinin temel özellikleri dikkate alındığında, bu durumun model üzerindeki teorik etkisiyle ilgili aşağıdakilerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: Değişen varyans sorunu nedeniyle EKK tahmin edicileri Gauss-Markov teoremi kapsamındaki 'minimum varyanslı' (en iyi) olma özelliğini kaybeder; ancak modelin deterministik bileşenine ait katsayı tahminleri doğrusal ve tarafsız kalmaya devam eder.

Cevap

Değişen varyans sorunu nedeniyle EKK tahmin edicileri 'minimum varyanslı' (en iyi) olma özelliğini kaybeder; ancak deterministik bileşen tahminleri doğrusal ve tarafsız kalır.
EKK tahmin edicileri, bağımlı değişkenin doğrusal bir fonksiyonu olarak elde edildikleri için 'doğrusal' ve hata terimlerinin beklenen değeri sıfır olduğu sürece 'tarafsız' özelliklerini korurlar. Gauss-Markov teoremine göre tahmin edicilerin BLUE olabilmesi için hata terimlerinin sabit varyansa sahip olması (homoskedastisite) zorunludur. Sorudaki senaryoda değişen varyans tespit edildiği için, EKK tahmin edicileri minimum varyanslı olma (en iyi) avantajını kaybetmiş, fakat doğrusallık ve tarafsızlık özelliklerini korumuştur.

Adım Adım Çözüm

1
Modelin deterministik ve stokastik bileşenlerinin rollerini ve EKK'nın çalışma prensibini analiz etmek.
EKK, stokastik hataların karesel toplamını (ui2\sum u_i^2) minimize ederek deterministik kısım olan β0+β1Xi\beta_0 + \beta_1 X_i katsayılarını hesaplar. Bu işlem cebirsel olduğundan, varsayım ihlalleri formüllerin hesaplanabilirliğini veya parametrelerin doğrusallığını engellemez.
EKK'nın temel cebirsel mantığının varsayım ihlallerinden (doğrusallık ve hesaplanabilirlik bağlamında) nasıl etkilendiğini ortaya koymak için.
2
Gauss-Markov teoreminin ön koşullarını ve normallik varsayımının yerini değerlendirmek.
Gauss-Markov teoremi, EKK'nın BLUE (En İyi Doğrusal Tarafsız) olması için hataların beklenen değerinin sıfır olmasını, sabit varyanslı olmasını ve otokorelasyon barındırmamasını şart koşar. Normallik varsayımı ise BLUE olmak için değil, istatistiksel çıkarım (t ve F testleri) yapabilmek için gereklidir.
Soruda bahsedilen normallik koşulunun sağlanmasının, değişen varyans problemini telafi edip edemeyeceğini netleştirmek için.
3
Değişen varyans (heteroskedastisite) sorununun EKK tahmin edicileri üzerindeki istatistiksel etkisini kesinleştirmek.
Değişen varyans durumunda EKK tahmin edicileri tarafsız (unbiased) ve doğrusal (linear) kalmaya devam eder, ancak minimum varyanslı (best) olma özelliğini yitirir. Yani BLUE kısaltmasındaki 'B' harfi (Best) kaybolur.
Varsayım ihlalinin tahmin edicinin hangi spesifik özelliğini bozduğunu tespit etmek için.

Anahtar Kavram

Gauss-Markov Teoremi ve Varsayım İhlallerinin Etkileri
Soru 87Soru

Bir sağlık ekonomisti, ilçelerin ortalama yaşam süresini (YY) açıklamak için kişi başına düşen sağlık harcaması (X1X_1) ve kişi başına düşen yeşil alan miktarını (X2X_2) içeren bir çoklu doğrusal regresyon modeli tahmin etmiştir. Ekonomist daha sonra bu modele, ortalama yaşam süresi ile kısmi korelasyonu oldukça zayıf olan ve tt-istatistiğinin mutlak değeri 1'den küçük olan "ilçedeki sinema salonu sayısı" (X3X_3) değişkenini ekleyerek modeli yeniden tahmin etmiştir.
\Buna göre, X3X_3 değişkeninin modele eklenmesiyle başlangıçtaki modele kıyasla belirleme katsayısı (R2R^2) ve düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2) değerlerinde nasıl bir değişim gözlenir?

Cevabı ve açıklamayı göster

Cevap: R2R^2 artar veya aynı kalır, Rˉ2\bar{R}^2 azalır.

Cevap

R-kare artar veya aynı kalır, düzeltilmiş R-kare ise azalır.
Çoklu doğrusal regresyonda modele yeni bir bağımsız değişken eklendiğinde, belirlilik katsayısı (R2R^2) matematiksel olarak asla azalmaz; modele sağladığı marjinal katkı sıfır olsa bile aynı kalır, sıfırdan farklıysa artar. Ancak düzeltilmiş belirlilik katsayısı (Rˉ2\bar{R}^2), modele eklenen her yeni değişken için kaybedilen serbestlik derecesini hesaba katar. Ekonometride geçerli olan kesin bir kurala göre; modele sonradan eklenen bir değişkenin tt-istatistiğinin mutlak değeri 1'den küçükse (t<1|t| < 1), açıklanan varyanstaki cüzi artış, serbestlik derecesindeki kaybı karşılayamaz ve sonuç olarak Rˉ2\bar{R}^2 azalır. Bu nedenle doğru seçenek R2R^2'nin azalmayacağını, Rˉ2\bar{R}^2'nin ise azalacağını ifade eden seçenektir.

Adım Adım Çözüm

1
R2R^2'nin doğasını değerlendir
Modele yeni bir açıklayıcı değişken eklendiğinde, bu değişkenin katsayısı sıfır olmadığı sürece Açıklanan Kareler Toplamı artar ve Hata Kareler Toplamı azalır. Bu nedenle R2R^2 asla azalmaz; artar veya en kötü ihtimalle aynı kalır.
En Küçük Kareler (EKK) yönteminin matematiksel bir özelliğidir.
2
Düzeltilmiş R2R^2 (Rˉ2\bar{R}^2) hesaplamasını analiz et
Rˉ2\bar{R}^2, açıklayıcı değişken sayısını cezalandıran bir yapıya sahiptir. Formülü serbestlik derecelerine dayanır.
Modeldeki gereksiz değişken artışını kontrol etmek ve modelleri karşılaştırmak için kullanılır.
3
tt-istatistiği ile Rˉ2\bar{R}^2 ilişkisini kur
Ekonometrik kurala göre, modele yeni eklenen bir değişkenin tt-istatistiğinin mutlak değeri 1'den küçükse (t<1|t| < 1), bu değişkenin modele sağladığı ek açıklayıcılık gücü, serbestlik derecesinde yaratılan kaybı telafi edemez. Bu durumda Rˉ2\bar{R}^2 değeri kesinlikle düşer.
X3X_3 değişkeninin tt-istatistiği 1'den küçük olduğu için düzeltilmiş belirleme katsayısı azalacaktır.

Anahtar Kavram

Modele eklenen yeni bir değişkenin R2R^2'yi asla azaltmaması ve tt-istatistiğinin mutlak değeri 1'den küçük olduğunda Rˉ2\bar{R}^2'yi düşürmesi.
Tahmini Süre:1m 0s
Soru 88Soru

Bir Sanayi ve Teknoloji Bakanlığı uzmanı, organize sanayi bölgelerindeki işletmelerin yıllık yenilik kapasite endeksini (YY) tahmin etmek için 6 potansiyel bağımsız değişken (Ar-Ge harcaması, patent sayısı, çalışan sayısı vb.) kullanarak çoklu doğrusal regresyon analizi yapmaktadır. Uzman, aşamalı (stepwise) regresyon yöntemiyle değişken seçimi yapmış ve aşağıdaki üç aday modeli elde etmiştir:

ModelBağımsız Değişken Sayısı (kk)R2R^2Düzeltilmiş R2R^2AICAIC
I30.680.65245.2
II40.710.69238.4
III60.740.66251.6

Uzman ayrıca aday modellerden birinin artık (residual) analizini incelediğinde; standartlaştırılmış artıkların ±3\pm 3 sınırları içerisinde yer aldığını, ancak tahmin edilen değerler arttıkça artıkların serpilme diyagramında huni (koni) şeklinde dışa doğru açılan belirgin bir yayılım gösterdiğini tespit etmiştir.

Buna göre, uzmanın elde ettiği bulgularla ilgili aşağıdaki değerlendirmelerden hangisi istatistiksel olarak doğrudur?

Cevabı ve açıklamayı göster

Cevap: Model III'te R2R^2 değerinin en yüksek olmasına rağmen Düzeltilmiş R2R^2'nin düşmesi ve AICAIC'nin artması eklenen değişkenlerin modele anlamlı bir katkı sağlamadığını gösterir; artıkların huni şeklindeki yayılımı ise değişen varyans (heteroskedastisite) sorununa işaret eder.

Cevap

Doğru seçenek, Model III'te değişken sayısının artmasının R2R^2'yi yapay olarak yükselttiğini ancak Düzeltilmiş R2R^2'yi düşürdüğünü saptayan ve huni şeklindeki artık dağılımını değişen varyans sorunu olarak teşhis eden ifadedir.
Verilen tabloda Model II en düşük AICAIC değerine ve en yüksek Düzeltilmiş R2R^2 değerine sahiptir. Model III'e fazladan eklenen değişkenler R2R^2'yi matematiksel bir zorunluluk olarak artırmış olsa da, Düzeltilmiş R2R^2'yi düşürmüş ve AICAIC'yi yükseltmiştir; bu durum eklenen değişkenlerin açıklayıcı bir gücü olmadığını ispatlar. Öte yandan, tahmin edilen değerlere karşı çizilen artıklarda gözlemlenen dışa doğru açılan huni yapısı, klasik doğrusal regresyonun 'hata terimlerinin varyansı sabittir' varsayımının ihlal edildiğini, yani değişen varyans (heteroskedastisite) sorunu yaşandığını kesin olarak göstermektedir.

Adım Adım Çözüm

1
Aday modellerin performans kriterlerini karşılaştır.
Model II'nin Düzeltilmiş R2R^2'si en yüksek (0.69) ve AICAIC değeri en düşüktür (238.4). Model III'ün R2R^2'si yüksek olsa da Düzeltilmiş R2R^2'si Model II'den düşüktür.
Modele eklenen fazladan 2 değişkenin bağımlı değişkendeki değişimi açıklamakta yetersiz kaldığını ve ceza faktöründen dolayı model performansını düşürdüğünü belirlemek için.
2
Artık analizi bulgularını yorumla.
Standartlaştırılmış artıkların ±3\pm 3 aralığında olması uç değer probleminin olmadığını; artıkların tahmin edilen değerlere karşı huni (koni) şeklinde yayılması ise hata terimlerinin varyansının sabit olmadığını gösterir.
EKK varsayımlarının ihlal edilip edilmediğini teşhis etmek için.
3
Bulguları sentezleyerek doğru seçeneği belirle.
Model III'ün eklenen değişkenlerinin anlamlı olmadığı ve serpilme diyagramındaki örüntünün değişen varyans (heteroskedastisite) anlamına geldiği tespit edilir.
Model seçimi ve varsayım kontrollerine dair iki aşamalı analizin doğru kuramsal karşılığını bulmak için.

Anahtar Kavram

Model Seçim Kriterleri (R2R^2, Düzeltilmiş R2R^2, AICAIC) ve Değişen Varyans Teşhisi
Tahmini Süre:2m 0s
Soru 89Soru

Sanayi ve Teknoloji Bakanlığı’nda görevli bir uzman, organize sanayi bölgelerindeki yüksek teknolojili ürün üretim miktarını (YY) etkileyen faktörleri belirlemek amacıyla 44 bağımsız değişkenin yer aldığı bir çoklu doğrusal regresyon modeli kurmuştur. 2525 gözlem üzerinden yapılan analiz sonucunda elde edilen varyans analizi (ANOVA) tablosunun bir kısmı aşağıda verilmiştir:

Varyans KaynağıSerbestlik Derecesi (sdsd)Kareler Toplamı (KTKT)Kareler Ortalaması (KOKO)FF
Regresyon44???
Hata (Artık)?100100?
Genel2424500500

Buna göre, kurulan regresyon modelinin belirleme katsayısı (R2R^2) ve modelin genel anlamlılığını sınayan FF istatistiği değeri sırasıyla aşağıdakilerden hangisidir?

Cevabı ve açıklamayı göster

Cevap: 0,800,80 ve 2020

Cevap

Modelin belirleme katsayısı 0,800,80 ve FF istatistiği değeri 2020 olarak hesaplanır.
Doğru değerleri içeren seçenekte; belirleme katsayısı R2=400/500=0,80R^2 = 400/500 = 0,80 olarak bulunmuş, ardından regresyon ve hata kareler ortalamaları sırasıyla 100100 ve 55 olarak hesaplanarak F=100/5=20F = 100/5 = 20 değerine ulaşılmıştır. Bu sonuçlar, varyans analizi tablosundaki matematiksel ilişkilerle tam uyumludur.

Adım Adım Çözüm

1
Regresyon Kareler Toplamını (SSRSSR) hesaplayınız.
SSR=SSTSSE=500100=400SSR = SST - SSE = 500 - 100 = 400
Genel Kareler Toplamı, Regresyon ve Hata Kareler Toplamlarının toplamına eşittir.
2
Belirleme Katsayısını (R2R^2) hesaplayınız.
R2=SSRSST=400500=0,80R^2 = \frac{SSR}{SST} = \frac{400}{500} = 0,80
Belirleme katsayısı, bağımlı değişkendeki toplam değişimin ne kadarının bağımsız değişkenlerce açıklandığını gösterir.
3
Hata Serbestlik Derecesini (sdhatasd_{hata}) bulunuz.
sdhata=sdgenelsdreg=244=20sd_{hata} = sd_{genel} - sd_{reg} = 24 - 4 = 20
Toplam serbestlik derecesi, bileşenlerin serbestlik dereceleri toplamıdır (n1=k+(nk1)n-1 = k + (n-k-1)).
4
Regresyon Kareler Ortalamasını (MSRMSR) hesaplayınız.
MSR=SSRsdreg=4004=100MSR = \frac{SSR}{sd_{reg}} = \frac{400}{4} = 100
Kareler ortalaması, kareler toplamının ilgili serbestlik derecesine bölünmesiyle bulunur.
5
Hata Kareler Ortalamasını (MSEMSE) hesaplayınız.
MSE=SSEsdhata=10020=5MSE = \frac{SSE}{sd_{hata}} = \frac{100}{20} = 5
Hata kareler ortalaması, modelin varyans tahmincisidir.
6
F istatistiğini hesaplayınız.
F=MSRMSE=1005=20F = \frac{MSR}{MSE} = \frac{100}{5} = 20
FF testi, modelin genel anlamlılığını (tüm eğim katsayılarının sıfır olduğu H0H_0 hipotezini) sınamak için kullanılır.

Anahtar Kavram

Regresyon modellerinde varyans analizi (ANOVA), toplam değişkenliği açıklanan ve açıklanamayan kısımlara ayırarak modelin anlamlılığını (FF testi) ve açıklayıcılık gücünü (R2R^2) ölçmemizi sağlar.

Alternatif Yöntem

FF istatistiği, belirleme katsayısı biliniyorsa şu formülle de bulunabilir: F=R2/k(1R2)/(nk1)F = \frac{R^2 / k}{(1-R^2) / (n-k-1)}. Bu soruda F=0,80/40,20/20=0,200,01=20F = \frac{0,80 / 4}{0,20 / 20} = \frac{0,20}{0,01} = 20.
Tahmini Süre:1m 30s
Soru 90Soru

Bir kalkınma iktisatçısı, gelişmekte olan bir ülkenin 1980-2025 dönemine ait yıllık doğrudan yabancı yatırım girişleri ile ekonomik büyüme oranları arasındaki ilişkiyi doğrusal bir regresyon modeli kurarak incelemiştir. Modelin En Küçük Kareler (EKK) yöntemiyle tahmin edilmesinin ardından, ardışık hata terimleri arasında bir ilişki olup olmadığını sınamak amacıyla Durbin-Watson (dd) test istatistiği hesaplanmış ve testin sonucu d=0,38d = 0,38 olarak bulunmuştur.

Bu bulguya göre, kurulan modelde ortaya çıkan istatistiksel durum ve EKK tahmin edicilerinin özellikleri hakkında aşağıdaki ifadelerden hangisi kesinlikle doğrudur?

Cevabı ve açıklamayı göster

Cevap: Modelde pozitif yönlü güçlü bir otokorelasyon bulunmaktadır; bu durum EKK tahmin edicilerinin sapmasızlık özelliğini bozmaz ancak katsayılara ait standart hataların genellikle olduğundan daha küçük hesaplanmasına ve Tip I hata (gerçekte anlamsız olan değişkenin anlamlı bulunması) olasılığının artmasına neden olur.

Cevap

Durbin-Watson istatistiğinin sıfıra yakın olması güçlü pozitif otokorelasyonu ifade eder; bu durum EKK tahmin edicilerinin sapmasızlığını bozmaz fakat standart hataların küçük hesaplanmasına ve Tip I hata riskinin artmasına yol açar.
Doğru seçenek, Durbin-Watson değerinin anlamını ve pozitif otokorelasyonun EKK tahmin edicileri üzerindeki net teorik etkisini eksiksiz açıklamaktadır. Durbin-Watson dd istatistiği 00 ile 44 arasında değer alır; 22 otokorelasyon olmadığını, 00'a yaklaşan değerler pozitif otokorelasyonu, 44'e yaklaşan değerler ise negatif otokorelasyonu gösterir. Verilen d=0,38d=0,38 değeri güçlü bir pozitif otokorelasyona işaret etmektedir. Otokorelasyon, tahmin edicilerin sapmasızlığını bozmaz ancak minimum varyans (etkinlik) özelliğini ortadan kaldırır. Makroekonomik serilerde pozitif otokorelasyon genellikle standart hataların aşağı yönlü sapmalı (olduğundan küçük) tahmin edilmesine neden olur. Standart hataların küçülmesi, t-değerlerini matematiksel olarak büyütür ve modeldeki değişkenlerin gerçekte anlamsız olsalar bile istatistiksel olarak anlamlı bulunması (Tip I hata) riskini artırır.

Adım Adım Çözüm

1
Durbin-Watson (dd) test istatistiğinin hesaplanan değerini yorumlama.
Test istatistiği d=0,38d = 0,38 olarak verilmiştir. dd değeri 00 ile 44 arasında değişir (d2(1ρ)d \approx 2(1-\rho)). Değerin 00'a çok yakın olması, hata terimleri arasında pozitif yönlü güçlü bir ardışık bağımlılık (otokorelasyon) olduğunu kanıtlar.
Otokorelasyonun yönünü ve varlığını tespit etmek, model varsayımlarının ihlal edilip edilmediğini anlamak için gereklidir.
2
Pozitif otokorelasyonun EKK tahmin edicilerinin temel özellikleri üzerindeki etkisini belirleme.
Otokorelasyon varlığında, EKK tahmin edicileri doğrusal, sapmasız ve tutarlı olma özelliklerini korur. Ancak, minimum varyans (etkinlik) özelliğini yitirirler.
Otokorelasyon katsayıların beklenen değerini etkilemez ancak varyans-kovaryans matrisinin yapısını bozar.
3
Etkinlik kaybının istatistiksel testler üzerindeki pratik sonucunu değerlendirme.
Ekonomik zaman serileri genellikle pozitif eğilimli olduğundan, pozitif otokorelasyon katsayı varyanslarının ve standart hataların olduğundan daha küçük (aşağı yönlü sapmalı) tahmin edilmesine neden olur. Bu durum, tt istatistiklerinin yapay olarak büyümesine ve H0H_0 hipotezinin gereksiz yere reddedilerek Tip I hata yapma olasılığının artmasına sebep olur.
Standart hatalardaki sapmanın yönü, hipotez testlerinin (tt ve FF testleri) oluşturacağı yanılgı türünü doğrudan belirler.

Anahtar Kavram

Durbin-Watson Testi ve Otokorelasyonun Sonuçları
Soru 91Soru

Bir Çalışma ve Sosyal Güvenlik Bakanlığı uzmanı, işletmelerde meydana gelen yıllık iş kazası sayısını (YY) modellemek amacıyla bir doğrusal regresyon analizi yapmaktadır. Açıklayıcı değişken olarak işletmedeki personel sayısı (XX) ve işletmenin tehlike sınıfı (Az Tehlikeli, Tehlikeli, Çok Tehlikeli) kullanılmıştır.

Modelde sabit terim (β0\beta_0) bulunmakta olup, "Az Tehlikeli" sınıfı baz (referans) kategori olarak alınmıştır. Tahmin edilen model aşağıda verilmiştir:
Yi=β0+β1Xi+β2D1i+β3D2i+εiY_i = \beta_0 + \beta_1 X_i + \beta_2 D_{1i} + \beta_3 D_{2i} + \varepsilon_i

Kukla değişkenler şu şekildedir:
D1iD_{1i}: İşletme "Tehlikeli" sınıftaysa 1, değilse 0
D2iD_{2i}: İşletme "Çok Tehlikeli" sınıftaysa 1, değilse 0

En Küçük Kareler (EKK) yöntemiyle elde edilen katsayı tahminleri aşağıdaki tabloda verilmiştir:

ParametreAçıklamaTahmin Değeri
β^0\hat{\beta}_0Sabit Terim2,4
β^1\hat{\beta}_1Personel Sayısı (XX) Katsayısı0,05
β^2\hat{\beta}_2"Tehlikeli" Sınıf (D1D_1) Katsayısı3,6
β^3\hat{\beta}_3"Çok Tehlikeli" Sınıf (D2D_2) Katsayısı8,1

Bu regresyon modelinin spesifikasyonu ve tahmin sonuçları dikkate alındığında, aşağıdaki ifadelerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: Personel sayıları aynı olan iki işletmeden "Çok Tehlikeli" sınıfta olanın beklenen yıllık iş kazası sayısı, "Tehlikeli" sınıfta olana göre 4,5 daha fazladır.

Cevap

Doğru seçenek, aynı personel sayısına sahip iki işletmeden 'Çok Tehlikeli' sınıfta olanın 'Tehlikeli' olana göre 4,5 daha fazla kaza beklenen değerine sahip olduğunu belirten ifadedir.
Modelde 'Az Tehlikeli' sınıf referans kategori olduğu için, 'Tehlikeli' ve 'Çok Tehlikeli' sınıfların katsayıları doğrudan referans sınıfa göre olan farkları gösterir. Aynı personel sayısına sahip işletmelerden 'Çok Tehlikeli' sınıf ile 'Tehlikeli' sınıf arasındaki net fark, bu iki kategorinin katsayıları arasındaki farka (β^3β^2=8,13,6=4,5\hat{\beta}_3 - \hat{\beta}_2 = 8,1 - 3,6 = 4,5) eşittir.

Adım Adım Çözüm

1
Her bir tehlike sınıfı için regresyon denkleminin oluşturulması
Az Tehlikeli: Y=2,4+0,05XY = 2,4 + 0,05X, Tehlikeli: Y=2,4+0,05X+3,6Y = 2,4 + 0,05X + 3,6, Çok Tehlikeli: Y=2,4+0,05X+8,1Y = 2,4 + 0,05X + 8,1
Sabit terimli bir modelde, her kategorinin beklenen değerini bulmak için ilgili kukla değişken yerine 1 yazılarak referans kategoriyle (sabit terimle) birleştirilir.
2
Çok Tehlikeli ve Tehlikeli sınıfların karşılaştırılması
Fark = (2,4+0,05X+8,1)(2,4+0,05X+3,6)=8,13,6=4,5(2,4 + 0,05X + 8,1) - (2,4 + 0,05X + 3,6) = 8,1 - 3,6 = 4,5
Kategorik değişkenlerin kendi içindeki farklarını bulmak için ilgili kukla değişkenlerin katsayıları birbirinden çıkarılır.
3
Kukla değişken tuzağının değerlendirilmesi
Sabit terim bulunduğundan baz kategori olan 'Az Tehlikeli' sınıf için kukla değişken eklenmemesi doğru bir spesifikasyondur.
Aksi takdirde tam çoklu doğrusal bağlantı sorunu ortaya çıkar.

Anahtar Kavram

Kukla Değişkenli Regresyon Katsayılarının Yorumlanması
Soru 92Soru

Bir tarım ekonomisti, farklı coğrafi bölgelerdeki buğday verimini (YY, kg/dekar) analiz etmek amacıyla bir regresyon modeli kurmuştur. Bölgeler; İç Anadolu, Marmara, Ege ve Karadeniz olmak üzere dört gruba ayrılmıştır. Araştırmacı, "İç Anadolu" bölgesini referans (baz) kategori olarak belirlemiş ve diğer bölgeler için aşağıdaki kukla değişkenleri tanımlamıştır:

X1X_1: Marmara Bölgesi (1 = Evet, 0 = Hayır)
X2X_2: Ege Bölgesi (1 = Evet, 0 = Hayır)
X3X_3: Karadeniz Bölgesi (1 = Evet, 0 = Hayır)

Tahmin edilen regresyon denklemi şu şekildedir:
Y^=280+40X115X2+25X3\hat{Y} = 280 + 40X_1 - 15X_2 + 25X_3

Buna göre, Ege Bölgesi'ndeki bir ilin tahmini ortalama buğday verimi, Marmara Bölgesi'ndeki bir ilin tahmini ortalama buğday veriminden ne kadar azdır?

Cevabı ve açıklamayı göster

Cevap: 5555 kg/dekar

Cevap

Ege Bölgesi'ndeki tahmini ortalama verim, Marmara Bölgesi'nden 5555 kg/dekar daha azdır.
Marmara bölgesi için tahmin edilen değer 280+40=320280 + 40 = 320, Ege bölgesi için ise 28015=265280 - 15 = 265 birimdir. Bu iki değer arasındaki fark 320265=55320 - 265 = 55 olarak hesaplanır. Alternatif olarak, Marmara ve Ege arasındaki fark katsayıların farkıyla (40(15)=5540 - (-15) = 55) doğrudan bulunabilir.

Adım Adım Çözüm

1
Marmara Bölgesi için tahmini ortalama verim değerini hesaplayınız.
Y^Marmara=280+40(1)15(0)+25(0)=320\hat{Y}_{Marmara} = 280 + 40(1) - 15(0) + 25(0) = 320 kg/dekar.
Marmara bölgesi için X1=1X_1 = 1, diğer kukla değişkenler ise 00 değerini alır.
2
Ege Bölgesi için tahmini ortalama verim değerini hesaplayınız.
Y^Ege=280+40(0)15(1)+25(0)=265\hat{Y}_{Ege} = 280 + 40(0) - 15(1) + 25(0) = 265 kg/dekar.
Ege bölgesi için X2=1X_2 = 1, diğer kukla değişkenler ise 00 değerini alır.
3
İki bölge arasındaki farkı hesaplayınız.
320265=55320 - 265 = 55 kg/dekar.
Ege bölgesinin Marmara bölgesine göre ne kadar düşük olduğu sorulduğu için iki tahmin arasındaki fark alınır.

Anahtar Kavram

Kukla değişken katsayıları, ilgili kategorinin referans kategoriye göre farkını gösterir; iki farklı kukla değişken kategorisi arasındaki fark ise katsayıların farkı (β1β2\beta_1 - \beta_2) ile bulunur.

İpuçları

1
Her iki bölge için de kukla değişken değerlerini yerine koyarak tahmini verimleri ayrı ayrı bulun.
2
Referans grubun (İç Anadolu) tüm kukla değişkenlerinin 0 olduğunu unutmayın.
Tahmini Süre:1m 30s
Soru 93Soru

Bir zincir marketin veri analitik ekibi, şubelerin haftalık satış gelirlerini (YY) tahmin etmek için bir çoklu doğrusal regresyon modeli geliştirmiştir. Modelde, mağazanın bulunduğu bölgenin nüfus yoğunluğu ve mağaza alanı olmak üzere 22 bağımsız değişken kullanılmıştır. Rastgele seçilen 3333 şubeye ait verilerle yapılan regresyon analizine ilişkin varyans analizi (ANOVA) tablosunun bir kısmı aşağıda verilmiştir:

Varyans KaynağıSerbestlik Derecesi (SD)Kareler Toplamı (KT)Kareler Ortalaması (KO)F
Regresyon2214001400
Artık (Hata)600600
Genel (Toplam)323220002000

Buna göre, kurulan modelin belirleme katsayısı (R2R^2), düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2) ve FF test istatistiği değerleri sırasıyla aşağıdakilerden hangisinde doğru verilmiştir?

Cevabı ve açıklamayı göster

Cevap: R2=0,70;Rˉ2=0,68;F=35R^2 = 0,70 \quad ; \quad \bar{R}^2 = 0,68 \quad ; \quad F = 35

Cevap

Modelin belirleme katsayısı (R2R^2) 0,700,70, düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2) 0,680,68 ve FF istatistiği 3535 değerlerini almaktadır.
Varyans analizi tablosuna göre regresyon kareler toplamı (KT) 14001400 ve genel KT 20002000'dir. R2=1400/2000=0,70R^2 = 1400/2000 = 0,70 bulunur. FF istatistiği için kareler ortalamaları hesaplanmalıdır: Regresyon KO = 1400/2=7001400/2 = 700 ve Hata KO = 600/30=20600/30 = 20'dir. Buradan F=700/20=35F = 700/20 = 35 elde edilir. Düzeltilmiş R2R^2 ise serbestlik derecelerine bölünmüş varyansların oranıyla bulunur: Rˉ2=1[20/(2000/32)]=1(20/62,5)=10,32=0,68\bar{R}^2 = 1 - [20 / (2000/32)] = 1 - (20/62,5) = 1 - 0,32 = 0,68'dir.

Adım Adım Çözüm

1
R2=KTRegresyon/KTGenelR^2 = \text{KT}_{\text{Regresyon}} / \text{KT}_{\text{Genel}} formülünü uygulayın.
R2=1400/2000=0,70R^2 = 1400 / 2000 = 0,70 bulunur.
Belirleme katsayısı, bağımlı değişkendeki toplam varyansın ne kadarının kurulan regresyon modeli tarafından açıklandığını gösterir.
2
Hata serbestlik derecesini (SDHataSD_{\text{Hata}}) ve Hata Kareler Ortalamasını (KOHata\text{KO}_{\text{Hata}}) hesaplayın.
SDHata=322=30SD_{\text{Hata}} = 32 - 2 = 30. KOHata=600/30=20\text{KO}_{\text{Hata}} = 600 / 30 = 20.
Test istatistiği (FF) ve düzeltilmiş R2R^2 hesaplamalarında serbestlik derecesine bölünmüş hata varyansına ihtiyaç vardır.
3
Regresyon Kareler Ortalamasını (KORegresyon\text{KO}_{\text{Regresyon}}) hesaplayıp FF test istatistiğini bulun.
KORegresyon=1400/2=700\text{KO}_{\text{Regresyon}} = 1400 / 2 = 700. F=KORegresyon/KOHata=700/20=35F = \text{KO}_{\text{Regresyon}} / \text{KO}_{\text{Hata}} = 700 / 20 = 35.
FF istatistiği, modelin bütünüyle anlamlılığını test etmek için açıklanan varyans ile açıklanamayan varyansın (serbestlik dereceleri kullanılarak) orantılanmasıdır.
4
Rˉ2=1[(KTHata/SDHata)/(KTGenel/SDGenel)]\bar{R}^2 = 1 - [ ( \text{KT}_{\text{Hata}} / SD_{\text{Hata}} ) / ( \text{KT}_{\text{Genel}} / SD_{\text{Genel}} ) ] formülünü kullanarak düzeltilmiş belirleme katsayısını hesaplayın.
Rˉ2=1[20/(2000/32)]=1(20/62,5)=10,32=0,68\bar{R}^2 = 1 - [ 20 / (2000 / 32) ] = 1 - (20 / 62,5) = 1 - 0,32 = 0,68.
Düzeltilmiş R2R^2, modele eklenen bağımsız değişken sayısına göre açıklayıcılık oranını standartlaştırır ve sahte iyileşmeleri engeller.

Anahtar Kavram

Varyans Analizi Tablosundan R-Kare, Düzeltilmiş R-Kare ve F-İstatistiği Hesaplamaları
Soru 94Soru

Klasik doğrusal regresyon modeli varsayımlarının sağlandığı bir araştırmada, bir kamu kurumunda çalışan personelin hizmet içi eğitim süreleri (XX, saat) ile aylık performans puanları (YY) arasındaki ilişki incelenmektedir. 8 personelden elde edilen gözlemlere ilişkin özet istatistikler aşağıda verilmiştir:

İstatistikDeğer
nn8
Xi\sum X_i40
Yi\sum Y_i80
Xi2\sum X_i^2250
XiYi\sum X_i Y_i480

Buna göre, Gauss-Markov teoremi çerçevesinde En Küçük Kareler (EKK) yöntemiyle tahmin edilen regresyon denklemi aşağıdakilerden hangisidir?

Cevabı ve açıklamayı göster

Cevap: Y^=2+1,6X\hat{Y} = 2 + 1,6X

Cevap

En Küçük Kareler yöntemiyle tahmin edilen denklem Y^=2+1,6X\hat{Y} = 2 + 1,6X şeklindedir.
Verilen özet istatistikler kullanılarak yapılan hesaplamada, eğim katsayısı 1,6 ve sabit terim 2 olarak bulunmuştur. Gauss-Markov teoremi, bu yöntemin sunduğu tahmincilerin en iyi doğrusal tarafsız tahminciler (BLUE) olduğunu garanti eder.

Adım Adım Çözüm

1
Aritmetik ortalamaların hesaplanması
Xˉ=40/8=5\bar{X} = 40/8 = 5 ve Yˉ=80/8=10\bar{Y} = 80/8 = 10
Katsayı formüllerinde kullanılacak olan merkezî eğilim ölçülerini belirlemek için gereklidir.
2
Eğim katsayısının (β^1\hat{\beta}_1) hesaplanması
β^1=nXiYiXiYinXi2(Xi)2=8(480)(40)(80)8(250)(40)2=3840320020001600=640400=1,6\hat{\beta}_1 = \frac{n\sum X_i Y_i - \sum X_i \sum Y_i}{n\sum X_i^2 - (\sum X_i)^2} = \frac{8(480) - (40)(80)}{8(250) - (40)^2} = \frac{3840 - 3200}{2000 - 1600} = \frac{640}{400} = 1,6
Bağımsız değişkendeki bir birimlik değişimin bağımlı değişken üzerindeki etkisini ölçmek için EKK formülü uygulanır.
3
Sabit terimin (β^0\hat{\beta}_0) hesaplanması
β^0=Yˉβ^1Xˉ=10(1,6×5)=108=2\hat{\beta}_0 = \bar{Y} - \hat{\beta}_1\bar{X} = 10 - (1,6 \times 5) = 10 - 8 = 2
Regresyon doğrusunun y-eksenini kestiği noktayı bulmak için ortalamalar üzerinden hesaplama yapılır.
4
Denklemin oluşturulması
Y^=2+1,6X\hat{Y} = 2 + 1,6X
Tahmin edilen parametrelerin genel model formuna yerleştirilmesiyle nihai denklem elde edilir.

Anahtar Kavram

En Küçük Kareler (EKK) yöntemi, artık kareler toplamını minimize ederek parametre tahmini yapar ve Gauss-Markov varsayımları altında 'En İyi Doğrusal Tarafsız Tahmin Edici' (BLUE) özelliğine sahiptir.
Soru 95Soru

Bir ekonomist, bir ülkenin yıllık turizm gelirlerini (YY) etkileyen faktörleri incelemek amacıyla; turist sayısı (X1X_1) ve reel döviz kuru (X2X_2) değişkenlerini içeren bir çoklu doğrusal regresyon modeli kurmuştur. Modelin matris gösterimi Y=Xβ+εY = \mathbf{X}\beta + \varepsilon şeklindedir. Bu modelin özellikleri ve parametre tahminleri ile ilgili aşağıdaki ifadelerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: Kısmi regresyon katsayıları, diğer bağımsız değişkenler sabit tutulduğunda ilgili bağımsız değişkendeki bir birimlik değişimin bağımlı değişken üzerindeki etkisini gösterir.

Cevap

Kısmi regresyon katsayıları, diğer tüm bağımsız değişkenlerin etkileri sabit tutulduğunda (ceteris paribus), bir birimlik değişimin bağımlı değişken üzerindeki net etkisini ifade eder.
Çoklu doğrusal regresyon modelinde kısmi regresyon katsayıları, modeldeki diğer tüm bağımsız değişkenlerin etkileri arındırıldıktan sonra (sabit tutulduğunda) ilgili bağımsız değişkendeki bir birimlik değişimin bağımlı değişken üzerindeki beklenen etkisini ölçer. Bu durum 'ceteris paribus' varsayımı olarak bilinir.

Adım Adım Çözüm

1
Modelin yapısını tanımla
Y=β0+β1X1+β2X2+εY = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \varepsilon
Çoklu doğrusal regresyon modelinin genel yapısını anlamak için gereklidir.
2
Katsayıların yorumunu değerlendir
β1\beta_1 katsayısı, X2X_2 sabitken X1X_1'deki değişimin YY üzerindeki etkisidir.
Kısmi regresyon katsayıları 'ceteris paribus' varsayımı altında yorumlanır.
3
Belirleme katsayılarını analiz et
Rˉ2\bar{R}^2 her zaman artmaz, R2R^2 her zaman artar veya sabit kalır.
Modele değişken eklenmesinin farklı ölçütler üzerindeki etkisini ayırt etmek gerekir.
4
Matris özelliklerini kontrol et
Var(β^)=σ2(XX)1\text{Var}(\hat{\beta}) = \sigma^2 (\mathbf{X}'\mathbf{X})^{-1}
EKK tahmin edicilerinin varyansının matris formundaki doğruluğunu teyit etmek için gereklidir.

Anahtar Kavram

Çoklu doğrusal regresyon modelinde katsayı yorumu ve model varsayımları
Tahmini Süre:1m 40s
Soru 96Soru

Bir eğitim politikaları uzmanı, ortaöğretim kurumlarının üniversiteye yerleştirme oranlarını (YY) açıklamak amacıyla, okulun fiziki donanımı, öğretmen başına düşen öğrenci sayısı gibi 7 farklı potansiyel bağımsız değişken içeren bir veri seti ile çalışmaktadır. Değişken seçme algoritmaları kullanılarak tahmin edilen iki alternatif regresyon denkleminin temel özet istatistikleri aşağıdaki tabloda verilmiştir:

ModelBağımsız Değişken SayısıR2R^2Rˉ2\bar{R}^2AICAIC
Birinci Taslak Model40,750,72184,3
İkinci Taslak Model50,780,68196,5

Uzman, bilgi kriterleri ve belirleme katsayılarını değerlendirerek analizi sürdüreceği nihai modeli belirlemiştir. Daha sonra, seçilen bu nihai modelin geçerliliğini sınamak amacıyla öğrenci (studentized) artık değerlerini dikey eksene, modelin ürettiği tahmin değerlerini (Y^\hat{Y}) ise yatay eksene yerleştirerek bir saçılım grafiği elde etmiştir. Bu grafikte, tahmin değerleri büyüdükçe noktaların dikey eksendeki yayılımının da giderek arttığı ve sağa doğru genişleyen belirgin bir huni biçiminin ortaya çıktığı görülmüştür.

Bu araştırma sürecindeki bulgulara göre, uzmanın yaptığı model seçimi ve karşılaştığı duruma ilişkin aşağıdaki değerlendirmelerden hangisi istatistiksel olarak en doğrudur?

Cevabı ve açıklamayı göster

Cevap: Daha düşük bilgi kriteri ve daha yüksek serbestlik derecesine göre düzeltilmiş açıklayıcılık oranı sunduğu için Birinci Taslak Model tercih edilmelidir; saptanan grafiksel doku ise hata terimlerinin sabit varyanslılık varsayımının ihlal edildiğini gösterdiğinden, katsayıların standart hatalarının White veya benzeri dirençli (robust) tahmincilerle düzeltilmesi gerekir.

Cevap

Daha düşük bilgi kriteri ve daha yüksek serbestlik derecesine göre düzeltilmiş açıklayıcılık oranı sunduğu için Birinci Taslak Model tercih edilmelidir; saptanan grafiksel doku ise hata terimlerinin sabit varyanslılık varsayımının ihlal edildiğini gösterdiğinden, katsayıların standart hatalarının White veya benzeri dirençli (robust) tahmincilerle düzeltilmesi gerekir.
Çoklu doğrusal regresyonda aday modeller arasından seçim yapılırken standart belirleme katsayısı (R2R^2) yanıltıcı olabilir; çünkü açıklayıcı değişken eklendikçe R2R^2 yapay bir şekilde artış gösterir. Bu nedenle modele eklenen parametrenin maliyetini (serbestlik derecesi kaybını) dikkate alan Düzeltilmiş R2R^2 (Rˉ2\bar{R}^2) ve Akaike Bilgi Kriteri (AICAIC) gibi ölçütler referans alınmalıdır. Tabloda Birinci Taslak Model, daha düşük AICAIC ve daha yüksek Rˉ2\bar{R}^2 değerlerine sahip olduğundan istatistiksel açıdan kesinlikle daha üstündür. Diğer taraftan, artıkların (kalıntıların) tahmin değerlerine göre çizilen serpilme diyagramında dışa doğru açılan bir huni (funnel) şeklinin görülmesi, hataların varyansının sabit kalmadığını, yani 'değişen varyans (heteroskedastisite)' sorunu bulunduğunu ispatlar. Bu varsayım ihlalinin tipik çözüm yöntemlerinden biri, t-istatistiklerini güvenilir kılmak adına katsayı varyanslarının White veya Huber-White gibi dirençli (robust) yöntemlerle hesaplanmasıdır. Tüm bu gerekçeleri eksiksiz yansıtan doğru yanıt, Birinci Taslak Modeli ve dirençli standart hatalar çözümünü birlikte sunan seçenektir.

Adım Adım Çözüm

1
Model seçimi kriterlerinin (AIC ve Düzeltilmiş R-kare) karşılaştırılması
Birinci Taslak Modelin AIC değeri (184,3) daha düşük ve Düzeltilmiş R-kare değeri (0,72) daha yüksektir.
AIC değerinin küçük olması bilgi kaybının az olduğunu, Düzeltilmiş R-kare değerinin yüksek olması ise modelin açıklama gücünün serbestlik derecesi kaybına değdiğini gösterir.
2
İkinci Taslak Modeldeki R-kare artışının değerlendirilmesi
Standart R-kare değeri 0,75'ten 0,78'e çıkmış olsa da, Düzeltilmiş R-kare 0,68'e düşmüştür.
Modele yeni bir değişken eklendiğinde standart R-kare matematiksel olarak düşemez. Ancak eklenen 5. değişkenin modele getirdiği ek açıklayıcılık, parametre sayısındaki artışın (serbestlik derecesi kaybı) yarattığı cezayı karşılayamadığı için Düzeltilmiş R-kare azalmıştır.
3
Artıklar saçılım grafiğindeki huni biçimli örüntünün yorumlanması
Tahmin değerleri büyüdükçe artıkların yayılımının (varyansının) arttığı saptanmıştır.
Bu grafiksel doku, hata terimlerinin varyansının bağımlı veya bağımsız değişkenlerin seviyelerine göre değiştiğini, yani sabit varyans varsayımının (homoskedastisite) bozulduğunu ve değişen varyans (heteroskedastisite) sorunu yaşandığını açıkça kanıtlar.
4
Değişen varyans sorununun analitik çözümünün belirlenmesi
Model tahminlerinde dirençli (robust) standart hatalar kullanılmalıdır.
Değişen varyans durumunda EKK katsayı tahmincileri yansız kalmaya devam etse de etkinliklerini kaybederler ve t-testleri güvenilmez hale gelir. Bu nedenle standart hataların White gibi dirençli yöntemlerle düzeltilmesi gerekir.

Anahtar Kavram

Model Seçim Kriterleri ve Değişen Varyansın (Heteroskedastisite) Tespiti
Tahmini Süre:2m 0s
Soru 97Soru

Bir perakende zincirinin veri bilimi ekibi, mağazaların aylık satış gelirlerini (YY) modellemek için mağaza metrekaresi (X1X_1), çalışan sayısı (X2X_2) ve günlük ortalama ziyaretçi sayısı (X3X_3) değişkenlerini kullanarak En Küçük Kareler (EKK) yöntemiyle bir çoklu doğrusal regresyon analizi yürütmektedir.

Yapılan ön incelemelerde, çalışan sayısı (X2X_2) ile günlük ortalama ziyaretçi sayısı (X3X_3) arasında çok yüksek bir korelasyon bulunduğu ve modelde ciddi bir çoklu doğrusal bağlantı (multicollinearity) sorunu olduğu tespit edilmiştir. Ayrıca, X2X_2 değişkenine ait tolerans (tolerance) değeri 0,050,05 olarak hesaplanmıştır.

Bu regresyon modelindeki çoklu doğrusal bağlantı sorunu ve sonuçları hakkında aşağıdakilerden hangisi kesinlikle doğrudur?

Cevabı ve açıklamayı göster

Cevap: X2X_2 değişkeni için Varyans Şişirme Faktörü (VIF) değeri 2020'dir; çoklu doğrusal bağlantı EKK tahmincilerinin sapmasızlık özelliğini bozmaz ancak varyanslarını büyüterek etkinliklerini ortadan kaldırır.

Cevap

VIF değerinin 20 olduğunu ve çoklu doğrusal bağlantının sapmasızlığı bozmayıp etkinliği ortadan kaldırdığını (varyansı büyüttüğünü) belirten ifadedir.
Tolerans değeri 0,050,05 olarak verildiğine göre, Varyans Şişirme Faktörü VIF=10,05=20\text{VIF} = \frac{1}{0,05} = 20 olarak hesaplanır. Regresyon analizinde çoklu doğrusal bağlantı (multicollinearity) sorunu, bağımsız değişkenler arasında yüksek korelasyon olması durumudur. Bu durum EKK tahmincilerinin sapmasızlık (unbiasedness) ve tutarlılık (consistency) özelliklerini bozmaz. Ancak tahmincilerin varyanslarını ve standart hatalarını büyüterek (şişirerek) etkinliklerini (efficiency) kaybetmelerine ve t-istatistiklerinin küçülmesine (değişkenlerin istatistiksel olarak anlamsız görünmesine) neden olur.

Adım Adım Çözüm

1
VIF değerini hesapla
VIF=1Tolerans=10,05=20\text{VIF} = \frac{1}{\text{Tolerans}} = \frac{1}{0,05} = 20
Tolerans ve VIF ters orantılıdır, VIF formülü 1 bölü tolerans değeridir.
2
Çoklu doğrusal bağlantının EKK tahmincileri üzerindeki teorik etkilerini değerlendir
Tahminciler hala sapmasız (unbiased) ve tutarlı (consistent) kalır, ancak minimum varyans (efficiency) özelliğini kaybeder.
EKK'nın Gauss-Markov varsayımlarına göre, bağımsız değişkenler arası korelasyon sapmasızlığı etkilemez, sadece standart hataları şişirir.
3
Seçenekleri analiz et
Sadece VIF değerini 20 olarak doğru hesaplayan ve sapmasızlığın bozulmadığını, ancak etkinliğin (varyansın) olumsuz etkilendiğini belirten seçenek doğrudur.
Diğer seçenekler ya VIF formülünü yanlış kullanmış ya da çoklu bağlantının etkilerini sapma, otokorelasyon veya değişen varyans ile karıştırmıştır.

Anahtar Kavram

Çoklu doğrusal bağlantının (multicollinearity) tespiti (Tolerans ve VIF ilişkisi) ve EKK tahmincileri üzerindeki sonuçları (sapmasızlığın korunması, etkinliğin yitirilmesi).
Soru 98Soru

Bir vergi dairesi başkanlığı, ilçelerde yıllık olarak gerçekleştirilen vergi denetim sayısı (XX) ile tahsil edilen ek vergi geliri (YY, milyon TL) arasındaki ilişkiyi incelemek amacıyla basit doğrusal regresyon modeli (Y^=β^0+β^1X\hat{Y} = \hat{\beta}_0 + \hat{\beta}_1 X) kurmak istemektedir.

Rastgele seçilen 10 ilçe için elde edilen özet istatistikler aşağıda verilmiştir:
i=110Xi=400\sum_{i=1}^{10} X_i = 400
i=110Yi=300\sum_{i=1}^{10} Y_i = 300
i=110(XiXˉ)2=500\sum_{i=1}^{10} (X_i - \bar{X})^2 = 500
i=110(YiYˉ)2=200\sum_{i=1}^{10} (Y_i - \bar{Y})^2 = 200
i=110(XiXˉ)(YiYˉ)=250\sum_{i=1}^{10} (X_i - \bar{X})(Y_i - \bar{Y}) = 250

Buna göre, En Küçük Kareler (EKK) yöntemi ile tahmin edilen regresyon denklemi aşağıdakilerden hangisidir?

Cevabı ve açıklamayı göster

Cevap: Y^=10+0,50X\hat{Y} = 10 + 0,50 X

Cevap

Doğru regresyon denklemi Y^=10+0,50X\hat{Y} = 10 + 0,50 X şeklindedir.
Tahmin edilen regresyon denklemi En Küçük Kareler (EKK) formülleri ile elde edilir. İlk olarak eğim katsayısı hesaplanır: β^1=(XiXˉ)(YiYˉ)(XiXˉ)2=250500=0,50\hat{\beta}_1 = \frac{\sum (X_i - \bar{X})(Y_i - \bar{Y})}{\sum (X_i - \bar{X})^2} = \frac{250}{500} = 0,50. Ardından kesme noktası hesaplanır: Gözlem sayısı n=10n=10 olduğundan ortalamalar Xˉ=40010=40\bar{X} = \frac{400}{10} = 40 ve Yˉ=30010=30\bar{Y} = \frac{300}{10} = 30 olarak bulunur. Bu değerler β^0=Yˉβ^1Xˉ\hat{\beta}_0 = \bar{Y} - \hat{\beta}_1 \bar{X} formülünde yerine konulduğunda β^0=30(0,50×40)=10\hat{\beta}_0 = 30 - (0,50 \times 40) = 10 elde edilir. Denklem Y^=10+0,50X\hat{Y} = 10 + 0,50 X olarak kurulur.

Adım Adım Çözüm

1
Bağımlı ve bağımsız değişkenlerin örneklem ortalamalarını hesaplama
Xˉ=40010=40\bar{X} = \frac{400}{10} = 40 ve Yˉ=30010=30\bar{Y} = \frac{300}{10} = 30
EKK tahmin edicilerinden kesme noktasının hesaplanabilmesi için örneklem ortalamalarına ihtiyaç vardır.
2
Eğim katsayısını (β^1\hat{\beta}_1) hesaplama
β^1=250500=0,50\hat{\beta}_1 = \frac{250}{500} = 0,50
Eğim katsayısı, X ve Y arasındaki çarpım toplamlarının (kovaryansın payı), X'in kareler toplamına (varyansın payı) oranı ile bulunur.
3
Kesme noktasını (β^0\hat{\beta}_0) hesaplama
β^0=30(0,50×40)=3020=10\hat{\beta}_0 = 30 - (0,50 \times 40) = 30 - 20 = 10
Regresyon doğrusu örneklem ortalamalarından (Xˉ\bar{X}, Yˉ\bar{Y}) geçmek zorundadır, bu nedenle β^0=Yˉβ^1Xˉ\hat{\beta}_0 = \bar{Y} - \hat{\beta}_1 \bar{X} formülü kullanılır.

Anahtar Kavram

Basit Doğrusal Regresyonda EKK Formülleri
Soru 99Soru

Klasik doğrusal regresyon modellerinde hata terimleri arasındaki ardışık bağımlılığın (otokorelasyon) tespiti amacıyla kullanılan Durbin-Watson (dd) testi ile ilgili aşağıdaki ifadelerden hangisi yanlıştır?

Cevabı ve açıklamayı göster

Cevap: Hata terimleri arasında ikinci veya daha yüksek dereceden bir otokorelasyon yapısı (AR(p)AR(p)) mevcut olduğunda da ardışık bağımlılığı belirlemede en güçlü test yöntemidir.

Cevap

Durbin-Watson testinin yüksek dereceden otokorelasyon yapılarında en güçlü test olduğunu savunan ifade yanlıştır; bu test yalnızca birinci dereceden otokorelasyonu test edebilir.
Durbin-Watson (dd) testi, istatistiksel olarak sadece birinci dereceden otokorelasyon (AR(1)AR(1)) süreçlerini test etmek üzere geliştirilmiştir. Hata terimleri arasında ikinci (AR(2)AR(2)) veya daha yüksek dereceden bir bağımlılık söz konusu olduğunda DW testi bu yapıyı belirlemede yetersiz kalır ve en güçlü test olma özelliğini yitirir. Bu gibi durumlarda Breusch-Godfrey (BG) testi gibi daha kapsamlı yöntemler kullanılır.

Adım Adım Çözüm

1
Durbin-Watson (dd) testinin temel kullanım amacını belirle.
Durbin-Watson testi, hata terimleri arasındaki birinci dereceden ardışık bağımlılığın (ut=ρut1+ϵtu_t = \rho u_{t-1} + \epsilon_t) varlığını sınar.
Testin matematiksel altyapısı sadece ardışık iki hata terimi arasındaki ilişkiye dayanır.
2
Testin varsayımlarını ve kısıtlarını gözden geçir.
Modelde sabit terim olmalı, gecikmeli bağımlı değişken olmamalı ve yüksek dereceli otokorelasyon aranmamalıdır.
Bu koşullar sağlanmadığında test istatistiği beklenen dağılımı sergilemez ve sonuçlar yanıltıcı olur.
3
Seçeneklerdeki ifadeleri bu teknik bilgilerle karşılaştır.
İkinci veya daha yüksek dereceden otokorelasyon yapıları (AR(2),AR(3)AR(2), AR(3) vb.) için Durbin-Watson testinin yetersiz olduğu görülür.
Yüksek dereceli otokorelasyon durumunda hata terimleri arasındaki daha uzak gecikmeli ilişkiler söz konusudur ve bu ancak Breusch-Godfrey (LM) gibi daha genel testlerle tespit edilebilir.

Anahtar Kavram

Durbin-Watson Testi Sınırları
Tahmini Süre:1m 30s
Soru 100Soru

Büyük bir imalat tesisinde çalışan kalite mühendisi, üretilen çelik halatların kopma dayanımını (YY) tahmin etmek amacıyla bir çoklu doğrusal regresyon modeli geliştirmektedir. İlk modelde açıklayıcı değişken olarak sadece "halatın üretiminde kullanılan karbon oranı" (X1X_1) yer almaktadır. Mühendis daha sonra, "üretim sırasındaki ortam sıcaklığı" (X2X_2) değişkenini de tahmine dahil etmiştir. Yapılan ek analizlerde, karbon oranı sabit tutulduğunda kopma dayanımı ile ortam sıcaklığı arasındaki kısmi korelasyon katsayısının oldukça düşük olduğu ve modele yeni eklenen X2X_2 değişkenine ait parametre tahmininin t-istatistiğinin mutlak değerce 1'in altında (t<1|t| < 1) kaldığı belirlenmiştir. Buna göre, X2X_2 değişkeninin modele dahil edilmesi sonucunda standart belirleme katsayısı (R2R^2) ve düzeltilmiş belirleme katsayısının (Rˉ2\bar{R}^2) değişimi ile ilgili aşağıdaki ifadelerden hangisi kesinlikle doğrudur?

Cevabı ve açıklamayı göster

Cevap: Standart belirleme katsayısı (R2R^2) azalmazken, düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2) düşüş gösterir.

Cevap

Standart belirleme katsayısı (R2R^2) azalmazken, düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2) düşüş gösterir.
Çoklu doğrusal regresyon analizinde, modele yeni bir bağımsız değişken eklendiğinde standart belirleme katsayısı (R2R^2) formülü gereği asla azalmaz (ya artar ya da aynı kalır). Ancak düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2), modele eklenen parametre sayısına göre serbestlik derecesi cezası uygular. Eğer modele eklenen yeni değişkenin bağımlı değişkenle olan kısmi korelasyonu çok zayıfsa ve t-istatistiği mutlak değerce 1'den küçükse (t<1|t| < 1), bu değişkenin modele getirdiği açıklama gücü, kaybettiği serbestlik derecesini telafi edemez ve sonuç olarak Rˉ2\bar{R}^2 değeri düşer.

Adım Adım Çözüm

1
Modele yeni bir açıklayıcı değişken eklendiğinde standart belirleme katsayısının (R2R^2) davranışını değerlendirin.
R2R^2 formülü gereği Hata Kareler Toplamı (RSS) azalma veya sabit kalma eğiliminde olduğundan, R2R^2 hiçbir zaman düşmez.
En Küçük Kareler yöntemi, açıklanan varyansı maksimize etmeye çalışır; yeni bir değişken, modelin açıklama gücünü matematiksel olarak düşüremez.
2
Düzeltilmiş belirleme katsayısının (Rˉ2\bar{R}^2) formülündeki cezalandırma mantığını ve t-istatistiği ile olan ilişkisini analiz edin.
Eğer modele eklenen yeni değişkenin marjinal katkısı çok düşükse (t-istatistiğinin mutlak değeri 1'den küçükse), değişken sayısının artmasından kaynaklanan serbestlik derecesi cezası, modeldeki açıklanan varyans artışından daha baskın olur.
Rˉ2=1(1R2)n1nk1\bar{R}^2 = 1 - (1 - R^2) \frac{n - 1}{n - k - 1} formülüne göre, değişken sayısı (kk) arttığında paydaya gelen kısıt, eğer değişkenin katkısı (t<1|t| < 1) yetersizse, katsayının genel değerini düşürür.
3
Soru metnindeki kısıtları adımlarla birleştirerek doğru seçeneği belirleyin.
R2R^2 değerinin azalmayacağı, Rˉ2\bar{R}^2 değerinin ise t<1|t| < 1 şartından dolayı düşeceği sonucuna varılır.
Bu iki matematiksel özelliğin aynı anda ifade edildiği tek seçenek, R2R^2'nin azalmadığını ve Rˉ2\bar{R}^2'nin düştüğünü belirten seçenektir.

Anahtar Kavram

Düzeltilmiş R-Kare ve Değişken Ekleme Kriteri
ÖncekiSayfa 5 / 11Sonraki
Regresyon Analizi Alıştırma Soruları — KPSS İstatistik — Sayfa 5 | Examkin