Regresyon Analizi

210 soru

Soru 201Soru

Zaman serisi verileri ile En Küçük Kareler (EKK) yöntemi kullanılarak tahmin edilen bir doğrusal regresyon modelinde, hata terimleri arasında pozitif yönlü birinci dereceden otokorelasyon, yani AR(1)AR(1) bulunduğu tespit edilmiştir.

Otokorelasyon sorununun modelde giderilmediği ve standart EKK tahmincilerinin kullanılmaya devam edildiği bu durumun sonuçlarına ilişkin aşağıdaki değerlendirmelerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: EKK tahmincileri sapmasızlık özelliğini korur; ancak katsayıların standart hataları genellikle olduğundan küçük hesaplanacağı için t-istatistikleri yapay olarak büyük çıkar ve Tip 1 hata olasılığı artar.

Cevap

EKK tahmincileri sapmasızlık özelliğini korur; ancak katsayıların standart hataları genellikle olduğundan küçük hesaplanacağı için t-istatistikleri yapay olarak büyük çıkar ve Tip 1 hata olasılığı artar.
Otokorelasyon varlığında En Küçük Kareler (EKK) tahmincileri sapmasız ve tutarlı olma özelliklerini korur, ancak etkinliklerini (minimum varyans) kaybederler. Özellikle pozitif otokorelasyon durumunda, hata terimlerinin varyansı ve dolayısıyla parametre tahmincilerinin standart hataları olduğundan daha küçük (aşağı yönlü sapmalı) tahmin edilir. Bu durum, t-istatistiklerinin (Katsayı / Standart Hata) yapay olarak büyük çıkmasına ve gerçekte anlamsız olan değişkenlerin anlamlıymış gibi görünmesine, yani Tip 1 hata olasılığının artmasına yol açar.

Adım Adım Çözüm

1
Otokorelasyonun EKK tahmincilerinin temel istatistiksel özellikleri üzerindeki etkisini belirlemek.
EKK tahmincileri sapmasız ve tutarlı kalır, ancak en iyi (minimum varyanslı) olma özelliğini, yani etkinliğini yitirir.
Otokorelasyon Gauss-Markov varsayımlarından Cov(ui,uj)=0Cov(u_i, u_j) = 0 koşulunu ihlal eder, ancak E(ui)=0E(u_i) = 0 varsayımı geçerliliğini korur.
2
Pozitif yönlü AR(1) durumunda varyans tahminindeki sapmanın yönünü tespit etmek.
Hata varyansı ve buna bağlı olarak parametrelerin standart hataları gerçek değerinden daha küçük (aşağı yönlü sapmalı) hesaplanır.
Pozitif otokorelasyonda ardışık hata terimleri aynı işareti taşıma eğilimindedir, bu da kalıntıların kareleri toplamını (RSS) yapay olarak küçültür.
3
Standart hatalardaki küçülmenin hipotez testleri üzerindeki yansımalarını değerlendirmek.
Hesaplanan t-istatistikleri gerçekte olduğundan daha büyük çıkar ve H0H_0 hipotezinin yanlışlıkla reddedilme (Tip 1 hata) olasılığı artar.
t-istatistiği, katsayı tahmininin standart hataya oranıdır. Paydanın yapay olarak küçülmesi kesrin değerini büyütür ve gerçekte anlamsız olan değişkenlerin istatistiksel olarak anlamlı bulunmasına yol açar.

Anahtar Kavram

Otokorelasyonun EKK tahmincileri ve hipotez testleri üzerindeki sonuçları
Soru 202Soru

Bir araştırmacı, bir malın talebi (YY) ile fiyatı (XX) arasındaki yapısal ilişkiyi incelemek amacıyla Yi=β0+β1Xi+εiY_i = \beta_0 + \beta_1 X_i + \varepsilon_i biçiminde basit doğrusal regresyon modeli kurmuştur. Modeldeki kitle parametreleri En Küçük Kareler (EKK) yöntemiyle tahmin edilmiş ve modelin teorik geçerliliği sınanmıştır.

Bu analizin teorik çerçevesi, model bileşenleri ve Gauss-Markov varsayımları dikkate alındığında, aşağıdaki ifadelerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: Hata terimlerinin normal dağılıma sahip olması, EKK tahmin edicilerinin BLUE (En İyi Doğrusal Tarafsız Tahmin Edici) olabilmesi için gerekli bir koşul değildir; ancak katsayılara yönelik hipotez testlerinin ve güven aralıklarının geçerliliği için zorunludur.

Cevap

Hata terimlerinin normal dağılımı varsayımı, EKK tahmin edicilerinin BLUE özelliğini kazanması için zorunlu olmamasına rağmen, hipotez testleri ve güven aralıkları için bir ön koşuldur.
Doğru ifadede belirtildiği gibi, Klasik Doğrusal Regresyon Modelinde (KLRM) Gauss-Markov teoremi bağlamında bir tahmin edicinin BLUE (Best Linear Unbiased Estimator) olabilmesi için normallik varsayımı gerekmez. Doğrusallık, sıfır ortalamalı hata, sabit varyans ve ardışık bağımlılığın olmaması BLUE için yeterlidir. Ancak elde edilen b katsayılarının anlamlılığını sınamak (t-testi) ve modelin bütünsel anlamlılığını test etmek (F-testi) için katsayı tahminlerinin belirli bir olasılık dağılımına (normal dağılım) sahip olması matematiksel olarak zorunludur.

Adım Adım Çözüm

1
Regresyon modelinin deterministik ve stokastik bileşenlerinin ayrımını analiz etmek.
Deterministik bileşenin açıklanan kısmı, stokastik bileşenin açıklanamayan kısmı yansıttığı tespit edilir.
Kavramsal tanımların doğruluğunu teyit etmek için formül yapısı değerlendirilmelidir.
2
Gauss-Markov teoremi öncüllerini ve BLUE özelliklerini değerlendirmek.
Teoremin normallik varsayımını içermediği, sadece minimum varyans (etkinlik) ve tarafsızlık üzerine kurulduğu belirlenir.
Varsayım ihlallerinin sonuçlarını (sapma vs. etkinlik kaybı) doğru sınıflandırmak regresyon analizinin temelidir.
3
Normallik varsayımının istatistiksel çıkarımdaki rolünü incelemek.
T ve F dağılımlarının elde edilebilmesi için hata terimlerinin normal dağılması gerektiği doğrulanır.
Nokta tahmini ile aralık tahmini (güven aralığı/hipotez testi) arasındaki teorik gereksinim farkını ayırt etmek.

Anahtar Kavram

Gauss-Markov Teoremi ve Klasik Doğrusal Regresyon Modeli Varsayımları
Soru 203Soru

Bir araştırmacı, bir bağımlı değişkeni (YY) açıklamak amacıyla iki bağımsız değişken (X1X_1 ve X2X_2) kullanarak bir çoklu doğrusal regresyon modeli tahmin etmiştir. Daha sonra, modele bağımlı değişkenle teorik ilişkisi çok zayıf olan ve istatistiksel olarak anlamsız bulunan yeni bir bağımsız değişken (X3X_3) ilave etmiştir.

Buna göre, X3X_3 değişkeninin modele eklenmesinin sonuçlarına ilişkin aşağıdakilerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: Belirleme katsayısı (R2R^2) aynı kalır veya artar, ancak düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2) azalır.

Cevap

Belirleme katsayısı (R2R^2) aynı kalır veya artar, ancak düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2) azalır.
Çoklu doğrusal regresyon modellerinde, modele eklenen yeni bir bağımsız değişkenin bağımlı değişkenle ilişkisi ne kadar zayıf olursa olsun, standart belirleme katsayısı (R2R^2) asla azalmaz; ya aynı kalır ya da artar. Ancak düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2), modele eklenen her yeni değişken için hata serbestlik derecesi üzerinden matematiksel bir ceza uygular. Eklenen değişkenin açıklayıcı gücü (örneğin t-değeri mutlak olarak 1'den küçükse) bu cezayı telafi edemeyecek kadar zayıf olduğunda, Rˉ2\bar{R}^2 mecburen azalır.

Adım Adım Çözüm

1
Çoklu doğrusal regresyon modeline yeni bir bağımsız değişken eklendiğinde R2R^2'nin nasıl değişeceğini değerlendirmek.
En küçük kareler (EKK) mantığı gereği, eklenen yeni değişkenin bağımlı değişkenle ilişkisi sıfır olsa bile hata kareler toplamı (HKT) artmaz. Bu nedenle standart belirleme katsayısı (R2R^2) asla azalmaz, aynı kalır veya artar.
R2R^2'nin hesaplanmasında değişken sayısına bağlı bir ceza mekanizması yoktur.
2
Modele yeni değişken eklendiğinde Rˉ2\bar{R}^2'nin nasıl değişeceğini değerlendirmek.
Düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2), hesaplanırken parametre sayısını (kk) dikkate alarak serbestlik derecesi üzerinden bir ceza uygular.
Bu ceza mekanizması, modele gereksiz değişken eklenmesinin önüne geçmek için kullanılır.
3
Anlamsız olan X3X_3 değişkeninin etkisini sentezlemek.
Eklenen X3X_3 değişkeni anlamsız olduğu için (açıklayıcı gücü çok düşük), HKT'deki ufak düşüş serbestlik derecesindeki kaybı telafi etmeye yetmez. Sonuç olarak Rˉ2\bar{R}^2 azalır.
Modele eklenen bir değişkenin Rˉ2\bar{R}^2'yi artırması için o değişkenin t-istatistiğinin mutlak değerinin 1'den büyük olması gerekir.

Anahtar Kavram

Çoklu doğrusal regresyon modelinde standart ve düzeltilmiş belirleme katsayılarının (R2R^2 ve Rˉ2\bar{R}^2) davranış özellikleri
Soru 204Soru

Zaman serisi verileri kullanılarak tahmin edilen bir çoklu doğrusal regresyon modelinde, hata terimleri bağımsızlığı varsayımının sınanması amacıyla uygulanan Durbin-Watson (DW) test istatistiği d=0,52d = 0,52 olarak hesaplanmıştır (Kritik değerler: dL=1,15d_L = 1,15 ve dU=1,56d_U = 1,56).

Otokorelasyon sorununun sonuçları dikkate alındığında, bu modeldeki En Küçük Kareler (EKK) tahmincilerinin özellikleri ve istatistiksel çıkarsamalar hakkında aşağıdaki ifadelerden hangisi kesinlikle doğrudur?

Cevabı ve açıklamayı göster

Cevap: EKK tahmincileri sapmasızlığını ve tutarlılığını korur ancak etkinlik özelliğini yitirir; standart hatalar olduğundan küçük tahmin edildiği için t-istatistikleri yapay olarak büyür.

Cevap

EKK tahmincileri sapmasızlığını ve tutarlılığını korur ancak etkinlik özelliğini yitirir; standart hatalar olduğundan küçük tahmin edildiği için t-istatistikleri yapay olarak büyür.
Doğru seçenekte belirtildiği gibi, Durbin-Watson değerinin alt kritik değerden küçük olması (0,52 < 1,15) pozitif otokorelasyonun varlığını kanıtlar. Pozitif otokorelasyon durumunda, En Küçük Kareler (EKK) tahmincileri doğrusal, sapmasız ve tutarlı kalmaya devam eder; yani katsayı tahminlerinin beklenen değeri gerçek parametreye eşittir. Ancak bu tahminciler en iyi (minimum varyanslı) olma özelliklerini kaybederler. En önemli pratik sonuç ise, hata terimleri arasındaki pozitif ilişkinin EKK standart hatalarının olduğundan daha küçük (aşağı yönlü sapmalı) tahmin edilmesine yol açmasıdır. Standart hatalar küçüldüğünde, t-istatistikleri (Tahmin / Standart Hata) yapay olarak büyür, bu da araştırmacının aslında anlamsız olan bir değişkeni anlamlı bulmasına (Tip I hatasının artmasına) neden olur.

Adım Adım Çözüm

1
DW test istatistiği ile kritik değerleri karşılaştırarak otokorelasyonun yönünü belirleme
Hesaplanan d = 0,52 değeri, alt kritik değer olan d_L = 1,15'ten küçüktür (0,52 < 1,15). Bu, H0 (otokorelasyon yoktur) hipotezinin reddedildiğini ve modelde pozitif yönlü birinci mertebeden otokorelasyon olduğunu gösterir.
DW testinde karar kuralı, istatistik d_L'den küçükse pozitif otokorelasyon olduğu yönündedir.
2
Pozitif otokorelasyonun EKK tahmincileri (katsayılar) üzerindeki etkisini değerlendirme
Otokorelasyon, Gauss-Markov varsayımlarından 'hata terimleri bağımsızdır' varsayımını ihlal eder. Ancak bu ihlal, tahmincilerin sapmasızlığını (Beklenen Değer = Gerçek Parametre) ve tutarlılığını bozmaz. Sadece tahmincilerin varyanslarının artık minimum olmamasına (etkinliğin kaybolmasına) yol açar.
EKK katsayı formülü hata terimlerinin kovaryans matrisinden bağımsız olarak sapmasızlık özelliğini matematiksel olarak sürdürür.
3
Pozitif otokorelasyonun standart hatalar ve hipotez testleri üzerindeki etkisini değerlendirme
Pozitif otokorelasyon varlığında, standart EKK varyans formülü gerçek varyansı olduğundan daha küçük hesaplar (aşağı yönlü sapma). Standart hata (payda) küçüldüğü için t-istatistiği (Katsayı / Standart Hata) yapay olarak büyür.
Bu durum, istatistiksel olarak anlamsız olan bağımsız değişkenlerin yanlışlıkla anlamlı bulunmasına (Tip I hatasının artmasına) neden olarak hipotez testlerini yanıltır.

Anahtar Kavram

Otokorelasyonun EKK tahmincileri ve hipotez testleri üzerindeki yapısal sonuçları
Soru 205Soru

Bir kamu kurumu, illerin sosyoekonomik gelişmişlik endeksi (YY) üzerindeki etkileri incelemek amacıyla 45 ilin verilerinden yararlanarak bir regresyon modeli kurmuştur. Modelde eğitim, sağlık, altyapı ve sanayi olmak üzere 4 farklı açıklayıcı değişken (X1,X2,X3,X4X_1, X_2, X_3, X_4) yer almaktadır.

Elde edilen sonuçlara göre, altyapı değişkeninin (X3X_3) katsayı tahmini β^3=5,0\hat{\beta}_3 = 5,0 ve bu tahmine ilişkin standart hata Sβ^3=2,5S_{\hat{\beta}_3} = 2,5 olarak bulunmuştur. Kurum uzmanı, altyapı değişkeninin endeks üzerinde anlamlı bir etkisinin olup olmadığını α=0,05\alpha = 0,05 hata payı ile çift yönlü olarak test edecektir.

Buna göre, altyapı katsayısına ait %95\%95 güven aralığı ve test kararı hakkında aşağıdakilerden hangisi doğrudur?

(Kritik değerler: Z0.025=1,960Z_{0.025} = 1,960; t0.05;40=1,684t_{0.05; 40} = 1,684; t0.025;40=2,020t_{0.025; 40} = 2,020; t0.025;44=2,015t_{0.025; 44} = 2,015)

Cevabı ve açıklamayı göster

Cevap: %95\%95 güven aralığı [0,05;10,05][-0,05 ; 10,05] olarak hesaplanır. Aralık sıfır değerini kapsadığı için H0H_0 hipotezi reddedilemez ve değişkenin etkisi anlamsızdır.

Cevap

Doğru cevap, güven aralığının [0,05;10,05][-0,05 ; 10,05] olarak hesaplandığı ve aralık sıfırı kapsadığı için değişkenin anlamsız olduğu seçenektir.
Serbestlik derecesi nk1=4541=40n - k - 1 = 45 - 4 - 1 = 40 olarak bulunur. %95\%95 güven aralığı için çift yönlü α=0,05\alpha=0,05 düzeyinde ilgili tablo değeri t0.025;40=2,020t_{0.025; 40} = 2,020'dir. Güven aralığı β^3±(ttablo×Sβ^3)=5,0±(2,020×2,5)=5,0±5,05\hat{\beta}_3 \pm (t_{tablo} \times S_{\hat{\beta}_3}) = 5,0 \pm (2,020 \times 2,5) = 5,0 \pm 5,05 formülüyle hesaplandığında [0,05;10,05][-0,05 ; 10,05] aralığı elde edilir. Bu aralık içinde 00 (sıfır) yer aldığı için yokluk hipotezi (H0:β3=0H_0: \beta_3 = 0) reddedilemez. Yani altyapı değişkeninin endeks üzerinde istatistiksel olarak anlamlı bir etkisi yoktur.

Adım Adım Çözüm

1
Serbestlik derecesinin (sd) hesaplanması.
sd=nk1=4541=40sd = n - k - 1 = 45 - 4 - 1 = 40
Çoklu doğrusal regresyon analizinde t-testi için serbestlik derecesi, toplam gözlem sayısından (nn) bağımsız değişken sayısı (kk) ve sabit terimin (1) çıkarılmasıyla bulunur.
2
Kritik tablo değerinin belirlenmesi.
t0.025;40=2,020t_{0.025; 40} = 2,020
Çift yönlü test ve %95\%95 güven aralığı için α=0,05\alpha = 0,05 anlamlılık düzeyi ikiye bölünür (0,025). 40 serbestlik derecesine karşılık gelen t değeri seçilir.
3
Güven aralığının (GA) sınırlarının hesaplanması.
GA=β^3±(ttablo×Sβ^3)=5,0±(2,020×2,5)=5,0±5,05=[0,05;10,05]GA = \hat{\beta}_3 \pm (t_{tablo} \times S_{\hat{\beta}_3}) = 5,0 \pm (2,020 \times 2,5) = 5,0 \pm 5,05 = [-0,05 ; 10,05]
Parametre tahmini üzerinden katsayının alabileceği gerçek değer aralığı, hesaplanan hata payı eklenip çıkarılarak elde edilir.
4
Hipotez testi bağlamında aralığın yorumlanması.
0[0,05;10,05]0 \in [-0,05 ; 10,05] olduğu için H0:β3=0H_0: \beta_3 = 0 hipotezi reddedilemez.
Sıfır (0) değeri oluşturulan %95\%95'lik güven aralığının içindeyse, anakütle parametresinin sıfır olma olasılığı istatistiksel olarak dışlanamaz. Bu da değişkenin bağımlı değişken üzerinde anlamlı bir etkisinin olmadığını gösterir.

Anahtar Kavram

Çoklu Regresyonda t-Testi ve Güven Aralıkları

Alternatif Yöntem

Güven aralığı hesaplamak yerine doğrudan hesaplanan t-istatistiği üzerinden hipotez testi sonuçlandırılabilir: thesap=5,02,5=2,0t_{hesap} = \frac{5,0}{2,5} = 2,0. Bu değer, tablo kritik değeri olan 2,0202,020'den mutlak değerce küçük olduğu için (2,0<2,0202,0 < 2,020) H0H_0 hipotezi reddedilemez. Güven aralığının da mecburen sıfırı kapsaması gerektiği bu yoldan türetilebilir.
Tahmini Süre:1m 30s
Soru 206Soru

Bir araştırmacı, ilçe belediyelerinin mali verilerini kullanarak altyapı harcamalarını etkileyen faktörleri incelemek amacıyla bir çoklu doğrusal regresyon modeli tahmin etmiştir. Ancak modelin hata terimlerinin sabit varyanslılık (homoskedastisite) varsayımını ihlal ettiği tespit edilmiştir.

Bu durumun parametre tahminleri üzerindeki etkileri ve sorunun teşhisinde kullanılan istatistiksel testlerle ilgili aşağıdaki değerlendirmelerden hangisi kesinlikle doğrudur?

Cevabı ve açıklamayı göster

Cevap: Hata terimlerinin normal dağılıma uyduğu varsayımının sağlanamadığı durumlarda, normal dağılım kısıtı gerektirmeyen ve açıklayıcı değişkenlerin kareleri ile çapraz çarpımlarını da modele dâhil eden White genel testinin kullanılması daha uygundur.

Cevap

Hata terimlerinin normal dağılıma uyduğu varsayımının sağlanamadığı durumlarda White genel testinin kullanılmasının daha uygun olduğunu belirten ifade doğrudur.
Değişen varyans durumunda sorunun teşhisi için çeşitli testler kullanılır. Bunlardan Goldfeld-Quandt testi, örneklemi ikiye bölerek alt ve üst grupların varyanslarını bir F-testi yardımıyla karşılaştırır; bu nedenle hata terimlerinin normal dağıldığı varsayımına sıkı sıkıya bağlıdır. Eğer bu varsayım sağlanamıyorsa, normal dağılım kısıtı gerektirmeyen ve büyük örneklem özelliklerine dayanan (asimptotik ki-kare dağılımı kullanan) White genel testi tercih edilmelidir. White testi ayrıca açıklayıcı değişkenlerin düzey değerlerinin yanı sıra karelerini ve çapraz çarpımlarını da (cross-products) modele ekleyerek değişen varyansın formunun bilinmediği durumlar için oldukça kapsamlı bir sınama imkânı sunar.

Adım Adım Çözüm

1
Değişen varyansın EKK tahmin edicileri üzerindeki teorik etkilerini değerlendir.
Tahmin ediciler yansızdır (sapmasızdır) ancak etkin (minimum varyanslı) değildir. Standart hatalar sapmalı hesaplanır, bu da t ve F testlerini geçersiz kılar.
Yansızlık ihlali iddia eden ve etkinliğin korunduğunu savunan seçenekleri elemek için.
2
Değişen varyansı tespit eden testlerin varsayımlarını ve matematiksel yapılarını incele.
Goldfeld-Quandt testi varyansların oranı üzerinden F-testi yaptığı için hata terimlerinin normal dağılmasını kesin olarak gerektirir. White testi ise asimptotik (ki-kare) bir testtir ve normallik varsayımı gerektirmez.
Test seçimi ve koşulları ile ilgili ifadelerin doğruluğunu teyit etmek için.
3
Alternatif testlerin (Park ve Glejser) yardımcı regresyon denklemlerini kontrol et.
Glejser testi u^i=β0+β1Xi|\hat{u}_i| = \beta_0 + \beta_1 X_i formatını kullanırken, Park testi ln(u^i2)\ln(\hat{u}_i^2) dönüşümünü kullanır.
Test isimlendirmelerinde yapılan hataları (kavram yanılgılarını) belirlemek için.
4
Diğer varsayım ihlallerinin tanımları ile mevcut senaryoyu karşılaştır.
Zaman içindeki ardışık bağımlılık otokorelasyondur, değişen varyans (heteroskedastisite) değildir.
Sorunların birbirine karıştırıldığı çeldiricileri elemek için.

Anahtar Kavram

Değişen varyansın teorik sonuçları ve tespitte kullanılan White, Goldfeld-Quandt, Park, Glejser testlerinin yapısal farklılıkları

Alternatif Yöntem

Soruyu çözerken tüm seçeneklerdeki ekonometrik sonuçları 'Yansızlık-Etkinlik-Standart Hata' matrisi üzerinden hızlıca eleyebilirsiniz. Değişen varyansta: Yansızlık VAR, Etkinlik YOK, Standart Hatalar GEÇERSİZ. Bu matris tek başına iki seçeneği eletir. Sonrasında testlerin yapısal formülleri hatırlanarak doğru sonuca ulaşılır.
Tahmini Süre:2m 0s
Soru 207Soru

Bir kamu kurumu, ihale edilen altyapı projelerinin tamamlanma süresini (YY, gün) öngörebilmek için projelerin yaklaşık maliyetini (XX, milyon TL) ve projelerin gerçekleştirildiği coğrafi bölgeyi dikkate alan bir çoklu doğrusal regresyon modeli kurmuştur. Her bir proje yalnızca bir bölgede yer almaktadır.

Projeler üç farklı bölgede (Marmara, İç Anadolu, Doğu Anadolu) yürütülmektedir. Analizde Marmara Bölgesi baz (referans) kategori olarak alınmış ve diğer bölgeler için aşağıdaki kukla (dummy) değişkenler tanımlanmıştır:

* D1=1D_1 = 1 (Proje İç Anadolu Bölgesinde ise), D1=0D_1 = 0 (Diğer durumlarda)
* D2=1D_2 = 1 (Proje Doğu Anadolu Bölgesinde ise), D2=0D_2 = 0 (Diğer durumlarda)

Tahmin edilen regresyon denklemi şu şekildedir:
Y^=150+4X+20D115D2\hat{Y} = 150 + 4X + 20D_1 - 15D_2

Buna göre, kurulan model ve elde edilen katsayılarla ilgili aşağıdaki ifadelerden hangisi yanlıştır?

Cevabı ve açıklamayı göster

Cevap: İç Anadolu Bölgesinde yürütülen bir projenin beklenen tamamlanma süresi, Doğu Anadolu Bölgesinde yürütülen aynı maliyetli bir projeden ortalama 5 gün daha uzundur.

Cevap

İç Anadolu Bölgesinde yürütülen bir projenin, Doğu Anadolu Bölgesinde yürütülen aynı maliyetli bir projeden ortalama 5 gün daha uzun sürede tamamlanacağını belirten ifade yanlıştır. Gerçek fark 35 gündür.
Soruda verilen ifadelerden yanlış olanı bulmamız istenmektedir. İç Anadolu ve Doğu Anadolu bölgeleri arasındaki farkı bulmak için, her iki bölgenin baz kategoriye (Marmara) olan uzaklıkları karşılaştırılmalıdır. Aynı maliyetli projeler için İç Anadolu Bölgesi'nin beklenen tamamlanma süresi baz kategoriye göre 20 gün daha uzunken, Doğu Anadolu Bölgesi'nin süresi baz kategoriye göre 15 gün daha kısadır. İki bölge arasındaki ortalama fark 20(15)=3520 - (-15) = 35 gündür. Bu nedenle, iki bölge arasındaki farkın 5 gün olduğunu belirten ifade matematiksel olarak yanlıştır ve sorunun doğru cevabıdır.

Adım Adım Çözüm

1
Regresyon denklemindeki baz kategorinin ve kukla değişkenlerin modele etkilerinin belirlenmesi.
Marmara Bölgesi baz kategoridir (D1=0,D2=0D_1=0, D_2=0). Sabit terim olan 150, Marmara bölgesi için başlangıç (kesme) noktasıdır.
Kukla değişken katsayılarının doğru yorumlanabilmesi için öncelikle referans noktasının tespit edilmesi gerekir.
2
İç Anadolu ve Doğu Anadolu bölgeleri arasındaki matematiksel farkın hesaplanması.
İç Anadolu bölgesi için model: Y^=150+4X+20=170+4X\hat{Y} = 150 + 4X + 20 = 170 + 4X. Doğu Anadolu bölgesi için model: Y^=150+4X15=135+4X\hat{Y} = 150 + 4X - 15 = 135 + 4X. Aralarındaki fark: 170135=35170 - 135 = 35 gün olarak bulunur.
Yanlış olan ifadeyi bulabilmek için baz kategori dışındaki iki bölge arasındaki net ortalama farkın bilinmesi zorunludur.
3
Seçeneklerdeki ifadelerin kontrol edilerek yanlış olanın tespit edilmesi.
İki bölge arasındaki farkın 5 gün olduğunu iddia eden seçenek tespit edilir. Diğer tüm seçeneklerdeki matematiksel ve teorik ifadelerin doğru olduğu doğrulanır.
Soruda bizden doğru olan değil, hatalı olan ifadenin bulunması istenmiştir.

Anahtar Kavram

Kukla (Dummy) Değişkenlerin Yorumlanması ve Kukla Değişken Tuzağı
Soru 208Soru

Bir Kalkınma Ajansı uzmanı, illerin 'Sürdürülebilir Kalkınma Endeksi' (YY) puanlarını tahmin etmek amacıyla iki farklı regresyon modeli geliştirmiştir. Model 1'de 3 bağımsız değişken, Model 2'de ise bu değişkenlere ek olarak 2 yeni değişken daha (toplam 5 değişken) kullanılmıştır. Analiz sonuçlarına ilişkin özet istatistikler aşağıdaki tabloda sunulmuştur:

İstatistikModel 1Model 2
Bağımsız Değişken Sayısı (kk)35
Belirleme Katsayısı (R2R^2)0,780,81
Düzeltilmiş R2R^2 (Aˉdj.R2Ādj. R^2)0,750,72
Akaike Bilgi Kriteri (AICAIC)320,5345,8

Buna göre, model seçimi ve istatistiksel değerlendirme ile ilgili aşağıdakilerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: Model 1 tercih edilmelidir; çünkü düzeltilmiş R2R^2 değerinin daha yüksek ve AICAIC değerinin daha düşük olması modelin daha etkin olduğunu gösterir.

Cevap

Model 1'in seçilmesi gerektiğini belirten, düzeltilmiş R-kare ve AIC değerlerine dayanan ifade doğrudur.
Model 1'in tercih edilmesi gerektiğini savunan ifade doğrudur; çünkü istatistiksel model seçiminde 'en az değişkenle en yüksek açıklayıcılık' (parsimoni) hedeflenir. Model 2'de değişken sayısı artmasına rağmen düzeltilmiş R-kare değerinin düşmesi ve AIC değerinin yükselmesi, modele eklenen yeni değişkenlerin modele anlamlı bir katkı sağlamadığını, aksine modelin karmaşıklığını gereksiz yere artırdığını gösterir.

Adım Adım Çözüm

1
R2R^2 ve Düzeltilmiş R2R^2 değerlerini karşılaştırın.
Model 2'nin R2R^2 değeri (0,81) daha yüksek olsa da, serbestlik derecesine göre düzeltilmiş R2R^2 değeri (0,72), Model 1'in değerinden (0,75) daha düşüktür.
Modele eklenen yeni değişkenlerin açıklayıcılığa katkısı, serbestlik derecesi kaybını telafi edememiştir.
2
AICAIC (Akaike Bilgi Kriteri) değerlerini inceleyin.
Model 1 için AIC=320,5AIC = 320,5 iken Model 2 için AIC=345,8AIC = 345,8 olarak hesaplanmıştır.
Model seçiminde daha düşük AICAIC değerine sahip olan model, bilgi kaybını minimize ettiği için tercih edilir.
3
Karar verin.
Model 1 seçilir.
Hem düzeltilmiş R2R^2 hem de AICAIC kriterleri Model 1'in daha parsimoniyel (az değişkenle yüksek açıklayıcılık) ve etkin olduğunu göstermektedir.

Anahtar Kavram

Model Seçim Kriterleri (Parsimoni İlkesi)

Daha Fazla Pratik

Benzer bir soruda BIC (Bayesian Information Criterion) değerlerini karşılaştırarak parsimoni ilkesini pekiştirebilirsiniz.
Tahmini Süre:1m 40s
Soru 209Soru

Bir istatistiksel araştırmada, bağımlı değişken (YY) ile bağımsız değişken (XX) arasındaki ilişkiyi incelemek amacıyla Yi=β0+β1Xi+uiY_i = \beta_0 + \beta_1 X_i + u_i biçiminde bir popülasyon regresyon modeli tanımlanmıştır. Parametre tahminleri için En Küçük Kareler (EKK) yöntemi kullanılmıştır.

Buna göre, EKK yönteminin dayandığı optimizasyon amacı ile elde edilecek tahmin edicilerin Gauss-Markov teoremine göre "En İyi" (minimum varyanslı) doğrusal tarafsız tahmin edici (BLUE) olmasını sağlayan temel varsayımlar aşağıdakilerin hangisinde sırasıyla doğru olarak verilmiştir?

Cevabı ve açıklamayı göster

Cevap: Artık kareleri toplamını (ei2\sum e_i^2) minimize etmek — Hata terimlerinin varyansının sabit olması ve aralarında otokorelasyon bulunmaması

Cevap

Doğru yanıt, optimizasyon amacının artık kareleri toplamını minimize etmek olduğu ve 'En İyi' özelliğinin sabit varyans ile otokorelasyon yokluğu varsayımlarına dayandığı seçenektir.
En Küçük Kareler (EKK) yönteminin temel optimizasyon amacı, örneklemdeki gözlemler ile modelin tahmin ettiği değerler arasındaki sapmaların (artıkların) kareleri toplamını (ei2\sum e_i^2) en aza indirmektir. Gauss-Markov teoremine göre, bu EKK tahmin edicilerinin doğrusal ve tarafsız tahmin ediciler arasında 'En İyi' yani en küçük varyanslı olabilmesi için modeldeki stokastik hata terimlerinin varyansının her gözlem için sabit olması (homoskedastisite) ve hata terimleri arasında yapısal bir ilişki bulunmaması (otokorelasyon olmaması) şarttır. Normallik bu teorem için gerekmez.

Adım Adım Çözüm

1
EKK (En Küçük Kareler) yönteminin matematiksel optimizasyon amacını tanımlama.
EKK yöntemi, gözlemlenen YiY_i değerleri ile tahmin edilen Y^i\hat{Y}_i değerleri arasındaki farkların (artıkların, eie_i) kareleri toplamını (ei2\sum e_i^2) en aza indirecek β0\beta_0 ve β1\beta_1 katsayılarını bulmayı amaçlar.
Regresyon doğrusunun verilere en iyi uyumunu sağlamak için pozitif ve negatif sapmaların birbirini götürmesini engelleyen kareler toplamı kullanılır.
2
Gauss-Markov teoremindeki "BLUE" (Best Linear Unbiased Estimator) tanımını inceleme.
BLUE ifadesindeki "Best" (En İyi) kelimesi, tahmin edicinin tüm doğrusal ve tarafsız tahmin ediciler arasında en küçük varyansa (minimum varyans) sahip olması anlamına gelir.
Varyansın küçük olması, tahminlerin kesinliğini ve güvenilirliğini artırır.
3
Minimum varyans özelliğini sağlayan spesifik varsayımları belirleme.
Tahmin edicilerin tarafsızlığını dışsallık varsayımı (E(uiX)=0E(u_i|X)=0) sağlarken; varyansın minimum ("En İyi") olmasını sağlayan varsayımlar hata terimlerinin sabit varyanslı olması (Var(ui)=σ2Var(u_i) = \sigma^2) ve birbirleriyle ilişkisiz (otokorelasyonsuz) olmasıdır.
Değişen varyans veya otokorelasyon durumunda EKK tahmin edicileri tarafsız kalmaya devam eder ancak minimum varyans özelliğini yitirir.

Anahtar Kavram

Gauss-Markov Teoremi ve EKK Optimizasyonu
Soru 210Soru

Bir gayrimenkul değerleme uzmanı, konut fiyatlarını (YY) tahmin etmek için konutun büyüklüğü (X1X_1), oda sayısı (X2X_2) ve bina yaşı (X3X_3) değişkenleriyle Model 1'i kurmuştur. Daha sonra bu modele şehir merkezine uzaklık (X4X_4) ve toplu taşımaya yakınlık (X5X_5) değişkenlerini ekleyerek Model 2'yi oluşturmuştur. Modellere ait özet istatistikler ve artık (kalıntı) analizi bulguları aşağıdaki tabloda verilmiştir:

İstatistik / BulguModel 1Model 2
Standart Belirleme Katsayısı (R2R^2)0.780.780.810.81
Düzeltilmiş Belirleme Katsayısı (Radj2R^2_{adj})0.760.760.720.72
AIC (Akaike Bilgi Kriteri)1245.41245.41310.81310.8
Maksimum Cook Uzaklığı (DiD_i)0.450.451.821.82
Artıkların Normal Q-Q GrafiğiDoğruya çok yakınS şeklinde belirgin sapma

Bu tabloya ve analiz bulgularına göre, model seçimi ve varsayımlar hakkında aşağıdakilerden hangisi kesinlikle söylenebilir?

Cevabı ve açıklamayı göster

Cevap: X4X_4 ve X5X_5 değişkenlerinin modele eklenmesi modelin istatistiksel uyumunu iyileştirmemiştir; ayrıca Model 2'de hata terimlerinin normallik varsayımı ihlal edilmiş ve regresyon sonuçlarını aşırı etkileyen (etkin) bir gözlem tespit edilmiştir.

Cevap

Yeni eklenen değişkenler modelin uyumunu iyileştirmemiştir; Model 2'de normallik varsayımı ihlali ve regresyon sonuçlarını aşırı etkileyen aykırı/etkin bir gözlem tespit edilmiştir.
Bu soru iki temel regresyon konusunu test etmektedir: Model seçimi ve kalıntı (artık) analizi. İlk olarak, Model 2'de standart R2R^2 artmasına rağmen düzeltilmiş R2R^2'nin düşmesi ve AIC'nin artması, eklenen X4X_4 ve X5X_5 değişkenlerinin gereksiz olduğunu ve model kalitesini bozduğunu ifade eder. İkinci olarak, kalıntı analizindeki Cook Uzaklığı metriği, değerinin 1'in üzerinde olmasıyla (burada 1.821.82) regresyon katsayılarını tek başına ciddi şekilde değiştiren 'etkin (influential)' bir gözlemin varlığına işaret eder. Artıkların Normal Q-Q grafiğinde teorik doğrudan ayrılarak S şekli oluşturması ise normallik varsayımının kesin olarak ihlal edildiğini gösterir. Bu üç doğru tespit yalnızca doğru seçenekte bir arada verilmiştir.

Adım Adım Çözüm

1
Model 1 ve Model 2'nin uyum iyiliği ölçütlerini (Standart R-kare, Düzeltilmiş R-kare ve AIC) karşılaştırmak.
Standart R-kare 0.780.78'den 0.810.81'e çıkmış olsa da, Düzeltilmiş R-kare 0.760.76'dan 0.720.72'ye düşmüş ve AIC değeri 1245.41245.4'ten 1310.81310.8'e yükselmiştir.
Farklı sayıda bağımsız değişkene sahip modeller karşılaştırılırken serbestlik derecesini dikkate alan Düzeltilmiş R-kare ve AIC/BIC gibi cezalandırıcı kriterlere bakılır. Bu değerlerin kötüleşmesi, Model 2'nin Model 1'den daha zayıf olduğunu gösterir.
2
Model 2 için verilen artık (kalıntı) analizi bulgularını (Cook Uzaklığı ve Q-Q grafiği) yorumlamak.
Cook Uzaklığı (DiD_i) 1.821.82 (yani >1>1) bulunmuş ve Q-Q grafiğinde S şeklinde belirgin bir sapma görülmüştür.
Cook Uzaklığının 11'den büyük olması modelde regresyon katsayılarını aşırı ölçüde değiştiren etkin (influential) bir gözlem olduğunu belirtir. Q-Q grafiğindeki S şeklindeki eğrisellik ise hata terimlerinin normal dağılım varsayımından saptığını (örneğin kalın kuyruklu bir dağılıma sahip olduğunu) kanıtlar.
3
Tüm bulguları birleştirerek nihai model değerlendirmesini yapmak.
Model 2'ye eklenen yeni değişkenler modelin istatistiksel kalitesini bozmuştur, varsayım ihlalleri (normallikten sapma) mevcuttur ve veri setinde sonuçları manipüle eden en az bir etkin gözlem vardır.
Bulgular doğrudan modelin açıklayıcılık gücünün azaldığını ve teşhis (diagnostic) testlerinin problemli olduğunu işaret etmektedir.

Anahtar Kavram

Regresyon modellerinde değişken seçimi ölçütleri (Düzeltilmiş R2R^2, AIC) ve artıkların teşhis testleri (Cook Uzaklığı, Normallik).
ÖncekiSayfa 11 / 11
Regresyon Analizi Alıştırma Soruları — KPSS İstatistik — Sayfa 11 | Examkin