Regresyon Analizi

210 soru

Soru 101Soru

Sanayi ve Teknoloji Bakanlığı, organize sanayi bölgelerindeki (OSB) işletmelerin Ar-Ge harcamaları (XX, milyon TL) ile tescil edilen faydalı model sayıları (YY, adet) arasındaki ilişkiyi incelemek için 16 farklı OSB'den kesit verisi toplamıştır.

Bu değişkenlere ilişkin hesaplanan bazı özet istatistikler aşağıda verilmiştir:

n=16n = 16
Xˉ=5\bar{X} = 5
Yˉ=24\bar{Y} = 24
i=116(XiXˉ)2=40\sum_{i=1}^{16} (X_i - \bar{X})^2 = 40
i=116(XiXˉ)(YiYˉ)=140\sum_{i=1}^{16} (X_i - \bar{X})(Y_i - \bar{Y}) = 140

Klasik doğrusal regresyon modelinin tüm varsayımlarının sağlandığı kabul edilmektedir.

Buna göre, En Küçük Kareler (EKK) yöntemiyle tahmin edilen doğrusal regresyon denklemi ve Gauss-Markov teoremine göre bu tahmincilerin sahip olduğu istatistiksel özellik aşağıdakilerin hangisinde birlikte doğru verilmiştir?

Cevabı ve açıklamayı göster

Cevap: Y^=6,5+3,5X\hat{Y} = 6,5 + 3,5X ; Doğrusal, yansız ve en küçük varyanslı (BLUE) tahmincilerdir.

Cevap

Regresyon denklemi Y^=6,5+3,5X\hat{Y} = 6,5 + 3,5X şeklinde olup, bu tahminciler Gauss-Markov teoremine göre doğrusal, yansız ve en küçük varyanslıdır.
Verilen özet istatistikler kullanılarak eğim katsayısı β^1=14040=3,5\hat{\beta}_1 = \frac{140}{40} = 3,5 ve sabit terim β^0=24(3,5×5)=6,5\hat{\beta}_0 = 24 - (3,5 \times 5) = 6,5 bulunur. Bu durum regresyon denkleminin Y^=6,5+3,5X\hat{Y} = 6,5 + 3,5X olduğunu gösterir. Gauss-Markov teoremine göre ise, klasik doğrusal regresyon varsayımları altında elde edilen bu EKK tahmincileri 'Doğrusal, Yansız ve En Küçük Varyanslı' (BLUE) tahmincilerdir.

Adım Adım Çözüm

1
Eğim katsayısını (β^1\hat{\beta}_1) hesapla.
β^1=(XiXˉ)(YiYˉ)(XiXˉ)2=14040=3,5\hat{\beta}_1 = \frac{\sum (X_i - \bar{X})(Y_i - \bar{Y})}{\sum (X_i - \bar{X})^2} = \frac{140}{40} = 3,5
Basit doğrusal regresyonda eğim, XX ve YY arasındaki ortak değişimin XX'in kendi içindeki değişimine oranıdır.
2
Sabit terimi (β^0\hat{\beta}_0) hesapla.
β^0=Yˉβ^1Xˉ=24(3,5×5)=2417,5=6,5\hat{\beta}_0 = \bar{Y} - \hat{\beta}_1\bar{X} = 24 - (3,5 \times 5) = 24 - 17,5 = 6,5
Regresyon doğrusu her zaman örneklem ortalamalarından (Xˉ,Yˉ)(\bar{X}, \bar{Y}) geçmek zorundadır, bu eşitlikten sabit terim çekilir.
3
Gauss-Markov teoreminin sonucunu belirle.
Tahminciler BLUE (Best Linear Unbiased Estimator) özelliklerine sahiptir.
Klasik doğrusal regresyon varsayımları (doğrusallık, sıfır koşullu ortalama, sabit varyans, otokorelasyon olmaması) sağlandığında EKK tahmincileri doğrusal, yansız ve en küçük varyanslı tahmincilerdir.

Anahtar Kavram

EKK Parametre Tahmini ve Gauss-Markov Teoremi
Soru 102Soru

Bir araştırma şirketinde çalışan veri analisti, hanehalkı tüketim harcamalarını (YY); hanehalkı geliri (X1X_1) ve hanehalkı büyüklüğü (X2X_2) değişkenleri ile açıklayan Y=β0+β1X1+β2X2+uY = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + u modelini En Küçük Kareler (EKK) yöntemiyle tahmin etmiştir. Bu modelin özellikleri ve istatistiksel sonuçlarının yorumlanması ile ilgili aşağıdakilerden hangisi yanlıştır?

Cevabı ve açıklamayı göster

Cevap: Modele hanehalkı harcamalarını etkileyebilecek yeni bir bağımsız değişken eklendiğinde, düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2) her durumda artış gösterir.

Cevap

Düzeltilmiş belirleme katsayısının (Rˉ2\bar{R}^2), modele yeni bir değişken eklendiğinde her durumda artacağını savunan ifade yanlıştır.
Düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2), modele yeni bağımsız değişkenler eklendiğinde serbestlik derecesindeki azalmayı hesaba katan bir ölçüttür. Standart belirleme katsayısı (R2R^2) modele her yeni değişken eklendiğinde artış gösterse de, düzeltilmiş belirleme katsayısı ancak eklenen değişkenin modele katkısı belirli bir düzeyin (istatistiksel olarak ilgili t-istatistiğinin karesinin 1'den büyük olması) üzerindeyse artar. Aksi takdirde, modele anlamsız değişken eklemek düzeltilmiş belirleme katsayısının düşmesine neden olur.

Adım Adım Çözüm

1
Belirleme katsayısı (R2R^2) ve düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2) arasındaki farkı tanımla.
R2R^2, modele değişken eklendikçe asla azalmaz; ancak Rˉ2\bar{R}^2, serbestlik derecesini dikkate alır.
Modele eklenen her değişken R2R^2 değerini yapay olarak yükseltebilir.
2
Düzeltilmiş R2R^2 formülünü analiz et: Rˉ2=1(1R2)n1nk1\bar{R}^2 = 1 - (1 - R^2) \frac{n-1}{n-k-1}
Eğer modele eklenen yeni değişkenin modele katkısı (t-istatistiği mutlak değerce 1'den küçükse) düşükse, Rˉ2\bar{R}^2 değeri düşebilir.
Rˉ2\bar{R}^2, açıklayıcı gücü olmayan değişkenlerin modele eklenmesini cezalandırır.
3
Seçeneklerdeki 'her durumda artış gösterir' ifadesinin doğruluğunu sorgula.
İfade yanlıştır çünkü Rˉ2\bar{R}^2 azalabilir, sabit kalabilir veya artabilir.
İstatistiksel olarak yeni değişkenin anlamlılık düzeyine bağlı bir değişim söz konusudur.

Anahtar Kavram

Belirleme Katsayısı ve Düzeltilmiş Belirleme Katsayısı İlişkisi
Soru 103Soru

Bir ekonomi araştırma enstitüsünde görevli bir uzman, imalat sanayindeki firmaların üretim maliyetlerini incelemektedir. Kurulan doğrusal regresyon modelinde, firma ölçeği (aktif büyüklüğü) büyüdükçe, modele ait kalıntıların (artıkların) dağılım aralığının da giderek genişlediği tespit edilmiştir.

Söz konusu problemin, model parametrelerinin tahmini ve istatistiksel değerlendirme süreçleri üzerindeki teorik yansımaları dikkate alındığında, aşağıdaki ifadelerden hangisi geçerlidir?

Cevabı ve açıklamayı göster

Cevap: Katsayı tahminleri kitle parametrelerini hedeflemede doğru merkezde kalmaya devam etse de, minimum varyanslı olma özelliğini kaybeder; standart hataların sapmalı ölçümü sebebiyle hipotez testleri yanıltıcı sonuçlar üretir.

Cevap

Katsayı tahminleri yansızlığını korur fakat minimum varyanslı olma özelliğini kaybeder; standart hataların hatalı ölçümü hipotez testlerini geçersiz kılar.
Değişen varyans (heteroscedasticity) ihlali yaşandığında, En Küçük Kareler (EKK) tahmin edicileri yansız (unbiased) olmaya devam eder; yani örneklem katsayılarının beklenen değeri kitle parametresine eşittir. Ancak sabit varyans varsayımı çöktüğü için EKK artık 'etkin' (minimum varyanslı) değildir. Varyansların formülleri yanlış çalıştığı için standart hatalar sapmalı olarak ölçülür. Standart hataların sapmalı olması ise hipotez testlerinde kullanılan tt ve FF istatistiklerinin geçersiz ve yanıltıcı olmasına yol açar.

Adım Adım Çözüm

1
Değişen varyans sorununun parametre tahmin değerleri üzerindeki etkisini belirleme
Değişen varyans probleminde EKK yöntemiyle elde edilen katsayılar sapmasızlık (yansızlık) özelliğini sürdürmeye devam eder.
Sapmasızlık özelliği hata teriminin varyans homojenliğine değil, bağımsız değişkenlerle ilişkisiz olmasına bağlıdır.
2
Tahminlerin varyans ve etkinlik (minimum varyans) durumunu değerlendirme
EKK katsayıları artık en küçük varyansa sahip değildir, Gauss-Markov kurallarına göre en iyi olma vasfı kaybolur.
Sabit varyans koşulunun bozulması, katsayı varyanslarını ölçen matrisin klasik formülünü geçersiz kılar.
3
Hipotez testleri üzerindeki olumsuz yansımaları tespit etme
Klasik formüllerle hesaplanan standart hatalar sapmalı değerler üreteceği için tt ve FF testleri güvenilmez olur.
Test istatistiklerinin paydasında yer alan standart hataların yanlış ölçülmesi, güven aralıklarını ve anlamlılık testlerini bozar.

Anahtar Kavram

Değişen Varyansın (Heteroscedasticity) EKK Tahmin Edicileri Üzerindeki Etkileri
Soru 104Soru

Bir zaman serisi verisi kullanılarak kurulan doğrusal regresyon modelinde, hata terimleri arasında ut=ρut1+ϵtu_t = \rho u_{t-1} + \epsilon_t (burada ρ<1|\rho| < 1 ve ρ0\rho \neq 0) şeklinde bir birinci dereceden otoregresif sürecin var olduğu saptanmıştır. Bu durumun varlığına rağmen modelin standart En Küçük Kareler (EKK) yöntemiyle tahmin edilmesine devam edilmiştir.

Buna göre, otokorelasyon sorununun varlığı altında EKK tahmincileri ve istatistiksel çıkarımlar hakkında aşağıdakilerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: Parametre tahmincileri yansız ve tutarlı kalmaya devam eder, ancak standart hatalar genellikle olduğundan küçük tahmin edildiği için hipotez testleri yanıltıcı olur.

Cevap

Parametre tahmincilerinin yansız ve tutarlı kalmaya devam ettiği ancak standart hataların yanlış (genellikle küçük) tahmin edilmesi nedeniyle hipotez testlerinin yanıltıcı olduğu seçenek doğrudur.
Klasik doğrusal regresyon varsayımlarından biri olan 'hata terimleri arasında ilişki olmaması' varsayımı ihlal edildiğinde (otokorelasyon), EKK tahmincileri hala yansız ve tutarlıdır. Ancak, bu tahminciler artık minimum varyanslı (etkin) değildir. Özellikle pozitif otokorelasyonda standart hatalar olduğundan küçük tahmin edildiği için hesaplanan tt istatistikleri yapay olarak büyük çıkar ve anlamsız değişkenlerin anlamlıymış gibi görünmesine (Tip I hata riskinin artmasına) neden olur.

Adım Adım Çözüm

1
Tahmincilerin yansızlık özelliğinin kontrol edilmesi
EKK tahmincisi β^=β+(XX)1Xu\hat{\beta} = \beta + (X'X)^{-1}X'u formülüne dayanır. E[uX]=0E[u|X]=0 olduğu sürece E[β^]=βE[\hat{\beta}] = \beta olur.
Otokorelasyon hata terimlerinin kendi aralarındaki ilişkiyi tanımlar, beklenen değerini değiştirmez.
2
Varyans ve etkinlik durumunun incelenmesi
Hata terimleri arasındaki bağımlılık nedeniyle Var(u)=σ2ΩVar(u) = \sigma^2 Ω (burada ΩIΩ \neq I) olur. Bu durumda Gauss-Markov teoremi gereği EKK artık 'en iyi' (BLUE) değildir.
Minimum varyans özelliğinin sağlanması için hataların birbiriyle ilişkisiz olması gerekir.
3
İstatistiki sonuçların değerlendirilmesi
Pozitif otokorelasyon (ρ>0ρ > 0) durumunda standart EKK varyans formülleri varyansı küçültme eğilimindedir (Var(β^)EKK<Var(β^)GercekVar(\hat{\beta})_{EKK} < Var(\hat{\beta})_{Gercek}).
Hataların ardışık benzerliği, verideki serbestlik derecesini gerçekte olduğundan daha fazlaymış gibi gösterir.

Anahtar Kavram

Otokorelasyonun EKK Tahmincileri Üzerindeki Etkisi

İpuçları

1
Otokorelasyonun parametrelerin yansızlığına mı yoksa varyansına mı etki ettiğini düşünün.
2
Gauss-Markov varsayımlarından biri bozulduğunda tahmincinin 'BLUE' kalıp kalmayacağını hatırlayın.

Daha Fazla Pratik

Durbin-Watson testinin hangi aralıklarda hangi otokorelasyon türüne işaret ettiğini tekrar edin.
Tahmini Süre:1m 30s
Soru 105Soru

Bir Sağlık Bakanlığı araştırmacısı, kamu hastanelerindeki hastaların ortalama yatış sürelerini (YY, gün) analiz etmek amacıyla bir regresyon modeli kurmuştur. Hastane türleri üç kategoriye ayrılmıştır: Genel Hastane, Eğitim ve Araştırma Hastanesi ve İhtisas Hastanesi.

Araştırmacı, "Genel Hastane" kategorisini referans (baz) grup olarak belirlemiş ve modeli aşağıdaki gibi tahmin etmiştir:

Y^=3,5+2,1D1+4,0D2\hat{Y} = 3,5 + 2,1 D_1 + 4,0 D_2

Burada;
D1D_1: Hastane türü "Eğitim ve Araştırma Hastanesi" ise 11, değilse 00,
D2D_2: Hastane türü "İhtisas Hastanesi" ise 11, değilse 00
değerini almaktadır.

Buna göre, tahmin edilen bu model ile ilgili aşağıdaki ifadelerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: İhtisas hastanelerindeki ortalama yatış süresi, genel hastanelere göre 4,04,0 gün daha uzundur.

Cevap

İhtisas hastanelerindeki ortalama yatış süresi, genel hastanelere göre 4,0 gün daha uzundur ifadesi doğrudur.
Kukla değişkenli regresyon modellerinde, modele dâhil edilen kukla değişkenlerin katsayıları, temsil ettikleri kategorinin referans (baz) kategoriye kıyasla bağımlı değişkende meydana getirdiği ortalama farkı gösterir. D2D_2 değişkeni ihtisas hastanelerini temsil ettiğine ve referans grup genel hastaneler olarak belirlendiğine göre, 4,04,0 katsayısı ihtisas hastanelerindeki yatış süresinin genel hastanelerden ortalama 4,04,0 gün daha uzun olduğunu kesin olarak ifade eder.

Adım Adım Çözüm

1
Referans grubun beklenen değerini hesaplama
D1=0D_1 = 0 ve D2=0D_2 = 0 olduğunda Y^=3,5+2,1(0)+4,0(0)=3,5\hat{Y} = 3,5 + 2,1(0) + 4,0(0) = 3,5 gün (Genel hastanelerin ortalaması).
Sabit terim (kesişim), modeldeki tüm açıklayıcı değişkenler sıfır olduğunda bağımlı değişkenin aldığı tahmini değerdir.
2
Kukla değişken katsayılarının anlamını yorumlama
D1D_1'in katsayısı olan 2,12,1, eğitim ve araştırma hastanelerinin referans gruba göre farkıdır. D2D_2'nin katsayısı olan 4,04,0, ihtisas hastanelerinin referans gruba göre farkıdır.
Regresyon modelinde kukla değişken katsayıları (eğimler), ilgili kategorinin referans alınan baz kategoriye kıyasla yarattığı marjinal etkiyi gösterir.
3
Doğru ifadeyi belirleme
D2D_2 katsayısı 4,04,0 olduğuna göre, ihtisas hastanelerinde yatış süresi genel hastanelere göre ortalama 4,04,0 gün daha fazladır.
Katsayıların yorumu doğrudan baz kategori üzerinden yapılır.

Anahtar Kavram

Kukla Değişken Katsayılarının Yorumlanması ve Baz Kategori
Soru 106Soru

Bir kamu kurumunda çalışan veri analisti, illerin 'sosyoekonomik gelişmişlik endeksi'ni (YY) açıklamak üzere kurduğu çoklu doğrusal regresyon modeline başlangıçta yalnızca 'okullaşma oranı' (X1X_1) değişkenini dahil etmiştir. Daha sonra analist, modele 'yıllık ortalama rüzgâr hızı' (X2X_2) gibi, YY ile teorik bir ilişkisi bulunmayan ve X1X_1'in etkisi sabit tutulduğunda YY ile arasındaki kısmi korelasyon katsayısı sıfıra çok yakın olan yeni bir bağımsız değişken eklemiştir.

Bu durumda, modele X2X_2 değişkeninin eklenmesinin standart belirleme katsayısı (R2R^2) ve düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2) üzerindeki beklenen etkisi aşağıdakilerden hangisinde doğru olarak ifade edilmiştir?

Cevabı ve açıklamayı göster

Cevap: Standart R2R^2 değeri azalmazken, düzeltilmiş Rˉ2\bar{R}^2 değeri modele anlamsız bir değişken eklenmesiyle serbestlik derecesi kaybedildiği için azalır.

Cevap

Standart belirleme katsayısı (R2R^2) matematiksel olarak hiçbir zaman azalmazken, düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2) modele açıklayıcılığı olmayan bir değişken eklendiğinde serbestlik derecesi kaybından dolayı azalır.
Doğru seçenek, regresyon modellerinde değişken seçimi ölçütlerinin temel çalışma mantığını yansıtır. Standart R2R^2, EKK yönteminin optimizasyon doğası gereği modele yeni bir değişken eklendiğinde (bu değişkenin bağımlı değişkenle teorik ilişkisi olmasa dahi) hata kareler toplamı artamayacağı için matematiksel olarak asla azalmaz. Ancak düzeltilmiş Rˉ2\bar{R}^2, modele eklenen her yeni bağımsız değişken için formülündeki (nk1)(n-k-1) paydası üzerinden bir 'serbestlik derecesi cezası' uygular. Yeni eklenen rüzgâr hızı değişkeninin kısmi korelasyonunun sıfıra yakın olması, modele ek bir açıklayıcılık katmadığını gösterir. Bu durumda elde edilen ihmal edilebilir varyans kazancı, serbestlik derecesindeki kayıptan (cezadan) daha küçük kalacağı için düzeltilmiş Rˉ2\bar{R}^2 değeri kesinlikle azalır.

Adım Adım Çözüm

1
Standart belirleme katsayısının (R2R^2) davranışını analiz et.
R2=1(SSE/SST)R^2 = 1 - (SSE/SST) formülüne göre, modele yeni bir bağımsız değişken eklendiğinde Hata Kareler Toplamı (SSE) ya azalır ya da sabit kalır. Bu nedenle R2R^2 asla azalmaz.
EKK tahmini, mevcut değişkenlerin yanına yenileri eklendiğinde uyumu en az eskisi kadar iyi yapacak şekilde parametreleri hesaplar.
2
Düzeltilmiş belirleme katsayısının (Rˉ2\bar{R}^2) davranışını analiz et.
Rˉ2=1[(1R2)×n1nk1]\bar{R}^2 = 1 - [ (1 - R^2) \times \frac{n-1}{n-k-1} ] formülünde, yeni bir değişken eklendiğinde katsayı sayısı (kk) 1 artar.
Bu durum serbestlik derecesinde (nk1)(n-k-1) kayba yol açar. Eğer yeni değişkenin kısmi korelasyonu sıfıra yakınsa, R2R^2'deki artış çok küçük olur ve formüldeki serbestlik derecesi cezası ağır basar.
3
Kısmi korelasyon ve değişken ekleme ilişkisini sentezle.
Bir değişkenin kısmi korelasyonu sıfıra yakınsa modele katkısı anlamsızdır. Bu durumda standart R2R^2 yapay olarak sabit kalsa veya mikroskobik düzeyde artsa bile, Rˉ2\bar{R}^2 kesinlikle düşer.
Rˉ2\bar{R}^2, modele eklenen gereksiz değişkenleri cezalandırmak için tasarlanmış bir metriktir.

Anahtar Kavram

Kısmi Korelasyon ve Düzeltilmiş R-Kare İlişkisi
Soru 107Soru

Bir kamu iktisadi teşebbüsünde çalışan bir istatistikçi, bir üretim hattındaki aylık elektrik tüketimi (YY) ile üretim miktarı (XX) arasındaki ilişkiyi incelemek amacıyla 2222 aylık veriyi kullanarak basit doğrusal regresyon analizi yapmıştır. Analiz sonucunda eğim katsayısı tahmini β^1=0,65\hat{\beta}_1 = 0,65 ve bu katsayıya ait standart hata se(β^1)=0,25se(\hat{\beta}_1) = 0,25 olarak bulunmuştur.

Aşağıdaki tabloda regresyon analizine ilişkin bazı özet bilgiler yer almaktadır:

Değişken / ParametreDeğer
Gözlem Sayısı (nn)2222
Eğim Katsayısı (β^1\hat{\beta}_1)0,650,65
Standart Hata (se(β^1)se(\hat{\beta}_1))0,250,25
Kritik Değer (t0,025;20t_{0,025; 20})2,0862,086

Buna göre, %95\%95 güven düzeyinde eğim katsayısı için oluşturulan güven aralığı ve katsayının anlamlılığına dair aşağıdakilerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: Güven aralığı [0,1285;1,1715][0,1285; 1,1715] olup eğim katsayısı %5\%5 anlamlılık düzeyinde istatistiksel olarak anlamlıdır.

Cevap

Güven aralığı [0,1285; 1,1715] olup eğim katsayısı %5 anlamlılık düzeyinde istatistiksel olarak anlamlıdır.
Güven aralığı hesaplanırken serbestlik derecesi n2=20n-2=20 olarak alınmalıdır. Kritik tt değeri olan 2,0862,086 ile standart hata (0,250,25) çarpıldığında 0,52150,5215 hata payına ulaşılır. Katsayı tahmini olan 0,650,65 değerine bu pay uygulandığında [0,1285;1,1715][0,1285; 1,1715] aralığı elde edilir. Bu aralık sıfır (00) değerini kapsamadığı için katsayı %5\%5 düzeyinde anlamlıdır.

Adım Adım Çözüm

1
Serbestlik derecesini belirle
sd=n2=222=20sd = n - 2 = 22 - 2 = 20
Basit doğrusal regresyonda iki parametre (β0\beta_0 ve β1\beta_1) tahmin edildiği için serbestlik derecesi n2n-2 formülüyle hesaplanır.
2
Hata payını (Margin of Error) hesapla
HP=t0,025;20×se(β^1)=2,086×0,25=0,5215HP = t_{0,025; 20} \times se(\hat{\beta}_1) = 2,086 \times 0,25 = 0,5215
Güven aralığı için hata payı, ilgili serbestlik derecesindeki kritik tablo değeri ile katsayının standart hatasının çarpılmasıyla bulunur.
3
Güven aralığı sınırlarını oluştur
Alt Sınır: 0,650,5215=0,12850,65 - 0,5215 = 0,1285; Üst Sınır: 0,65+0,5215=1,17150,65 + 0,5215 = 1,1715
Katsayı tahminine hesaplanan hata payı eklenip çıkarılarak parametrenin içinde yer alması beklenen aralık belirlenir.
4
İstatistiksel anlamlılığı değerlendir
thesap=0,65/0,25=2,6>2,086t_{hesap} = 0,65 / 0,25 = 2,6 > 2,086 veya 0[0,1285;1,1715]0 \notin [0,1285; 1,1715]
Oluşturulan güven aralığı sıfır değerini içermediği için (ikilik ilkesi gereği) katsayı %5 anlamlılık düzeyinde istatistiksel olarak anlamlı kabul edilir.

Anahtar Kavram

Güven aralığı ve hipotez testi arasındaki ikilik (duality) ilkesi
Tahmini Süre:2m 0s
Soru 108Soru

Bir e-ticaret şirketindeki veri bilimci, müşterilerin yıllık harcama tutarlarını (YY) tahmin etmek amacıyla müşteri demografisi ve site içi etkileşim verilerini kullanarak iki farklı çoklu doğrusal regresyon modeli geliştirmiştir:

Model I: 3 bağımsız değişken içermektedir. R2=0.68R^2 = 0.68, Düzeltilmiş R2=0.66R^2 = 0.66, BIC=512BIC = 512
Model II: 8 bağımsız değişken içermektedir. R2=0.73R^2 = 0.73, Düzeltilmiş R2=0.61R^2 = 0.61, BIC=560BIC = 560

Veri bilimci, model seçim kriterleri yardımıyla istatistiksel olarak en uygun modeli tercih etmiştir. Ardından, tercih edilen modelin varsayımlarını kontrol etmek için standartlaştırılmış artıkların (hata terimlerinin), tahmini değerlere (Y^\hat{Y}) karşı saçılım diyagramını oluşturmuştur. Diyagram incelendiğinde, tahmini değerler ekseninde sağa doğru gidildikçe artıkların sıfır ekseni etrafındaki dağılım aralığının belirgin şekilde genişlediği ve huniye benzer bir görünüm aldığı saptanmıştır.

Buna göre, veri bilimcinin seçtiği model ve saçılım diyagramından hareketle teşhis ettiği modelleme sorunu aşağıdakilerden hangisinde doğru olarak verilmiştir?

Cevabı ve açıklamayı göster

Cevap: Model I seçilmelidir; grafikteki görünüm değişen varyans sorununa işaret etmektedir.

Cevap

Doğru yanıt, Model I'in seçilmesi ve grafikteki görünümün değişen varyans (heteroskedastisite) sorununa işaret etmesidir.
Model karşılaştırmasında, farklı sayıda açıklayıcı değişken içeren modelleri değerlendirmek için standart R-kare yerine Düzeltilmiş R-kare ve bilgi kriterlerine (BIC) bakılmalıdır. Model I, daha yüksek Düzeltilmiş R-kare (0.66 > 0.61) ve daha düşük BIC (512 < 560) sunduğundan en uygun modeldir. İkinci olarak, standartlaştırılmış artıkların tahmini değerlere karşı çizilen saçılım diyagramında artıkların yayılımının bir yöne doğru artması (huni şekli), hata terimlerinin varyansının sabit olmadığını, yani değişen varyans (heteroskedastisite) sorunu yaşandığını açıkça kanıtlar.

Adım Adım Çözüm

1
Model seçimi kriterlerini (Düzeltilmiş R-kare ve BIC) karşılaştırmak.
Model I'in Düzeltilmiş R2R^2 değeri (0.66), Model II'den (0.61) büyüktür. Model I'in BIC değeri (512), Model II'den (560) küçüktür.
Değişken sayısı farklı olan modeller karşılaştırılırken standart R2R^2 yerine ceza terimi içeren Düzeltilmiş R2R^2 veya bilgi kriterleri (AIC, BIC) kullanılmalıdır.
2
Modellerden en uygun olanını seçmek.
Daha az değişkenle daha yüksek açıklayıcılık (Düzeltilmiş R2R^2) ve daha düşük bilgi kriteri (BIC) sağlayan Model I seçilmelidir.
BIC'nin küçük olması ve Düzeltilmiş R2R^2'nin büyük olması modelin veri setine daha iyi uyum sağladığını gösterir.
3
Artık grafiğindeki huni görünümünü yorumlamak.
Tahmini değerler (Y^\hat{Y}) arttıkça artıkların varyansının (yayılımının) artması durumu tespit edilir.
Artıkların sıfır etrafında sabit bir varyansla (rastgele bir bulut şeklinde) dağılması gerekir. Huni şekli, değişen varyans (heteroskedastisite) sorununun karakteristik bir belirtisidir.

Anahtar Kavram

Model seçim kriterleri (Düzeltilmiş R-kare, BIC) ve artık (rezidü) analizinde varsayım ihlallerinin grafiksel tespiti.
Tahmini Süre:1m 30s
Soru 109Soru

Basit doğrusal regresyon analizinde, bağımlı değişkenin sistematik (deterministik) kısmını temsil eden parametrelerin En Küçük Kareler (EKK) yöntemi ile tahmin edilmesi sürecinde, Gauss-Markov teoreminin geçerliliği büyük önem taşır.

Buna göre, klasik varsayımlar altında EKK tahmin edicilerinin sahip olduğu "En İyi Doğrusal Tarafsız Tahmin Edici" (BLUE) özelliği ile ilgili aşağıdakilerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: Tahmin edicilerin "En İyi" (Best) olması, Gauss-Markov varsayımları altında EKK tahmin edicilerinin, tüm doğrusal ve tarafsız tahmin ediciler sınıfında minimum varyansa sahip olduğunu ifade eder.

Cevap

Tahmin edicilerin 'En İyi' (Best) olması, Gauss-Markov varsayımları altında EKK tahmin edicilerinin, tüm doğrusal ve tarafsız tahmin ediciler sınıfında minimum varyansa sahip olduğunu ifade eder.
BLUE (En İyi Doğrusal Tarafsız Tahmin Edici) özelliğindeki 'En İyi' ifadesi, bir tahmin edicinin tarafsız olması kaydıyla, benzerleri arasında en küçük varyansa (en yüksek etkinliğe) sahip olması demektir. Gauss-Markov teoremi, belirli varsayımlar altında EKK tahmin edicilerinin bu mülkiyete sahip olduğunu kanıtlar.

Adım Adım Çözüm

1
BLUE kavramının bileşenlerini tanımla.
BLUE: Best (En İyi/Etkin), Linear (Doğrusal), Unbiased (Tarafsız), Estimator (Tahmin Edici).
Soruda istenen özelliğin teorik çerçevesini belirlemek için gereklidir.
2
Gauss-Markov teoreminin şartlarını değerlendir.
Hata terimlerinin sıfır ortalamalı, sabit varyanslı ve ilişkisiz olması durumunda EKK tahmin edicileri BLUE'dur.
Hangi varsayımların hangi özellikleri sağladığını ayırt etmek gerekir.
3
"En İyi" (Best) teriminin istatistiksel anlamını analiz et.
Minimum varyanslılık özelliği.
Tahmin edicinin hassasiyetini ve doğruluğunu belirleyen temel kriterdir.

Anahtar Kavram

Gauss-Markov Teoremi ve BLUE Özellikleri

Alternatif Yöntem

Eğer şıklarda 'tarafsızlık' ve 'minimum varyans' ifadelerini aynı anda görüyorsanız, bu genellikle BLUE tanımına işaret eder. Varsayım ihlallerinin sonuçlarını hatırlarken: Değişen varyans ve otokorelasyon = Verimsizlik (Varyans sorunu); İçsellik = Yanlılık (Ortalama sorunu) şeklinde kodlayabilirsiniz.
Tahmini Süre:1m 30s
Soru 110Soru

Bir İl Göç İdaresi uzmanı, ilçelerin yıllık net göç alma hızını (YY) modellemek için çoklu doğrusal regresyon analizi kullanmaktadır. Başlangıç modelinde sadece 'ilçedeki organize sanayi bölgesi sayısı' (X1X_1) yer almaktadır. Uzman daha sonra modele 'ilçe merkezinin ortalama rakımı' (X2X_2) değişkenini eklediğinde, standart belirleme katsayısının (R2R^2) 0,650,65'ten 0,660,66'ya yükseldiğini ancak düzeltilmiş belirleme katsayısının (Rˉ2\bar{R}^2) 0,630,63'ten 0,610,61'e düştüğünü hesaplamıştır.

X2X_2 değişkeninin modele eklenmesinin Rˉ2\bar{R}^2 değerini düşürmesinin temel istatistiksel nedeni aşağıdakilerden hangisidir?

Cevabı ve açıklamayı göster

Cevap: X2X_2 değişkeninin YY ile olan kısmi korelasyonunun, modele yeni bir parametre eklenmesinden kaynaklanan serbestlik derecesi kaybını telafi edemeyecek kadar zayıf olması

Cevap

Yeni eklenen değişkenin bağımlı değişkenle olan kısmi korelasyonunun çok zayıf olması ve serbestlik derecesi kaybını karşılayamaması.
Düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2), modele eklenen her yeni bağımsız değişken için serbestlik derecesi üzerinden bir ceza uygular. Standart R2R^2, modele anlamsız dahi olsa yeni bir değişken eklendiğinde artma eğilimindedir. Rˉ2\bar{R}^2'nin artması için, eklenen yeni değişkenin bağımlı değişkenle olan kısmi korelasyonunun (diğer değişkenler sabitken açıklama gücünün) serbestlik derecesindeki bu kaybı telafi edecek kadar yüksek olması gerekir. Olayda Rˉ2\bar{R}^2'nin düşmesi, X2X_2'nin kısmi açıklayıcılık gücünün bu cezayı karşılayamayacak düzeyde zayıf olduğunu gösterir.

Adım Adım Çözüm

1
Standart R2R^2 ile düzeltilmiş R2R^2 (Rˉ2\bar{R}^2) arasındaki formülsel mantık farkını belirlemek.
Standart R2R^2 modele eklenen her değişkende artarken, Rˉ2\bar{R}^2 değişken sayısındaki (kk) artış nedeniyle serbestlik derecesi cezası uygular.
Değerlerin zıt yönde hareket etmesinin matematiksel kökenini kavramak için.
2
Serbestlik derecesi kaybı ile kısmi korelasyon arasındaki dengeyi değerlendirmek.
X2X_2'nin eklenmesi R2R^2'de sadece 0,010,01'lik ufak bir artış yaratmıştır. Bu zayıf açıklayıcılık (düşük kısmi korelasyon), modele yeni bir katsayı eklemenin getirdiği cezayı yenememiş ve Rˉ2\bar{R}^2 düşmüştür.
Rˉ2\bar{R}^2'nin ancak tt-istatistiği mutlak değerce 11'den büyük olduğunda (yeterli kısmi korelasyon) artacağı kuralını uygulamak için.

Anahtar Kavram

Düzeltilmiş Belirleme Katsayısı (Adjusted R-Squared) ve Kısmi Korelasyon
Soru 111Soru

Zaman serisi verileriyle kurulan bir regresyon modelinde hata terimleri arasındaki otokorelasyonun (ardışık bağımlılık) tespiti için çeşitli istatistiksel testler kullanılmaktadır. Bu kapsamda, Breusch-Godfrey (LM) testinin Durbin-Watson (dd) testine göre en temel üstünlüğü aşağıdakilerden hangisidir?

Cevabı ve açıklamayı göster

Cevap: Modelde bağımlı değişkenin gecikmeli değerleri (dinamik modeller) yer aldığında dahi geçerli bir test olması

Cevap

Breusch-Godfrey (LM) testinin en temel üstünlüğü, bağımlı değişkenin gecikmeli değerlerini içeren dinamik modellerde de geçerli olmasıdır.
Breusch-Godfrey (LM) testi, Durbin-Watson testinin aksine modelde bağımlı değişkenin gecikmeli değerlerinin (Yt1,Yt2Y_{t-1}, Y_{t-2} vb.) bağımsız değişken olarak yer aldığı durumlarda geçerli sonuçlar üretir. Ayrıca yüksek dereceli ardışık bağımlılıkları test etme yeteneğine sahiptir.

Adım Adım Çözüm

1
Durbin-Watson testinin kısıtlarını hatırla
Durbin-Watson testi; modelde sabit terim olması, gecikmeli bağımlı değişken bulunmaması ve sadece AR(1) tipi otokorelasyon olması durumunda geçerlidir.
Karşılaştırma yapabilmek için mevcut testin sınırlarını bilmek gerekir.
2
Breusch-Godfrey (LM) testinin özelliklerini analiz et
LM testi, modelde gecikmeli bağımlı değişken olsa bile geçerlidir ve AR(p) veya MA(p) gibi yüksek dereceli süreçleri test edebilir.
Testin esnekliği ve kapsayıcılığı onu modern ekonometrik analizlerde tercih edilir kılar.
3
Seçenekler arasında temel farkı belirle
Dinamik modellerdeki geçerlilik, bu iki test arasındaki en kritik ayrım noktasıdır.
KPSS istatistik sınavlarında genellikle testlerin varsayımları ve birbirlerine göre avantajları sorgulanır.

Anahtar Kavram

Otokorelasyon Tanı Testleri (Durbin-Watson vs. Breusch-Godfrey)

İpuçları

1
Durbin-Watson testinin en büyük kısıtlamasının model yapısıyla (gecikmeli değişkenler) ilgili olduğunu düşünün.

Daha Fazla Pratik

Durbin'in h istatistiğinin hangi durumlarda Durbin-Watson yerine kullanıldığını inceleyin.
Tahmini Süre:1m 30s
Soru 112Soru

Bir kamu kurumu, hizmet binalarının aylık ısınma giderlerini (YY, TL) analiz etmek amacıyla bir regresyon modeli kurmuştur. Modelde bağımsız değişken olarak bina kullanım alanı (XX, m2m^2) ve ısınma türü (Doğalgaz, Kömür, Elektrik) kullanılmıştır. Doğalgaz "baz kategori" olarak belirlenmiş ve kukla (dummy) değişkenler şu şekilde tanımlanmıştır:

* D1=1D_1 = 1 (Isınma türü Kömür ise), 00 (Diğer durumlar)
* D2=1D_2 = 1 (Isınma türü Elektrik ise), 00 (Diğer durumlar)

Tahmin edilen regresyon denklemi şöyledir:
Y^=2500+12,5X+1800D1+4300D2\hat{Y} = 2500 + 12,5X + 1800D_1 + 4300D_2

Buna göre, aynı kullanım alanına sahip binalardan, ısınma türü elektrik olan bir binanın tahmini aylık ısınma gideri, ısınma türü kömür olan bir binadan ortalama ne kadar fazladır?

Cevabı ve açıklamayı göster

Cevap: 2500 TL

Cevap

Aynı kullanım alanına sahip binalar için elektrikli ısınmanın tahmini gideri, kömürlü ısınmadan ortalama 2500 TL fazladır.
Regresyon modelinde kukla değişkenlerin katsayıları, o kategorinin baz kategoriye göre bağımlı değişkendeki ortalama değişimini ifade eder. Elektrik için katsayı 4300, kömür için ise 1800'dür. Her iki katsayı da doğalgaza göre farkı gösterdiğinden, elektrik ile kömür arasındaki farkı bulmak için bu iki katsayı birbirinden çıkarılır (43001800=25004300 - 1800 = 2500).

Adım Adım Çözüm

1
Isınma türlerine göre model denklemlerini özelleştirin.
Doğalgaz (Baz): 2500+12,5X2500 + 12,5X; Kömür: 2500+12,5X+18002500 + 12,5X + 1800; Elektrik: 2500+12,5X+43002500 + 12,5X + 4300
Kukla değişkenlerin 1 ve 0 değerlerini yerlerine koyarak her grup için sabit terimdeki değişimi görmek gerekir.
2
Kömür ve Elektrik grupları arasındaki farkı hesaplayın.
Fark = (2500+12,5X+4300)(2500+12,5X+1800)=43001800=2500(2500 + 12,5X + 4300) - (2500 + 12,5X + 1800) = 4300 - 1800 = 2500
Aynı XX değerine sahip binalar karşılaştırıldığı için alan değişkenleri ve modelin genel sabit terimi birbirini götürür.

Anahtar Kavram

Kukla değişken katsayıları, ilgili kategorinin baz kategoriye göre olan ortalama farkını gösterir; iki farklı kukla kategori arasındaki fark ise katsayıların farkı ile bulunur.

Alternatif Yöntem

Alternatif olarak, kömür için D1=1,D2=0D_1=1, D_2=0 ve elektrik için D1=0,D2=1D_1=0, D_2=1 değerlerini denklemde yerine yazıp çıkan sonuçları birbirinden çıkararak da aynı sonuca ulaşılabilir.
Tahmini Süre:1m 30s
Soru 113Soru

Bir kamu kurumunda personelin hizmet içi eğitim sonundaki "başarı puanı" (YY) ile "eğitim süresi" (X1X_1) ve "hizmet yılı" (X2X_2) arasındaki ilişkiyi incelemek için çoklu doğrusal regresyon analizi yapılmaktadır. Analiz sürecinde, modele personelin "boy uzunluğu" (X3X_3) gibi başarı puanı ile teorik bir ilişkisi bulunmayan bir değişken daha eklenmiştir.

Bu yeni değişkenin (X3X_3) modele eklenmesi sonucunda belirleme katsayısı (R2R^2) ve düzeltilmiş belirleme katsayısı (Rˉ2\bar{R}^2) üzerindeki beklenen etki aşağıdakilerden hangisidir?

Cevabı ve açıklamayı göster

Cevap: R2R^2 değeri matematiksel olarak azalmazken, Rˉ2\bar{R}^2 değeri azalabilir.

Cevap

R2R^2 değerinin matematiksel olarak azalmaması ancak düzeltilmiş belirleme katsayısının (Rˉ2\bar{R}^2) azalabilmesi
Doğru cevap, R2R^2 değerinin matematiksel tanımı gereği modele değişken eklendiğinde asla azalmayacağını, ancak düzeltilmiş R-kare (Rˉ2\bar{R}^2) değerinin serbestlik derecesini dikkate alarak anlamsız değişkenler karşısında düşebileceğini belirtmektedir. X3X_3 (boy uzunluğu) başarı puanı ile ilişkisiz olduğu için modele net bir katkı sağlamazken serbestlik derecesini bir birim azaltır, bu da düzeltilmiş katsayının düşmesine neden olur.

Adım Adım Çözüm

1
Modele değişken eklenmesinin standart belirleme katsayısı (R2R^2) üzerindeki etkisini değerlendirin.
R2R^2 değeri, modele eklenen değişkenin anlamsızlığına bakılmaksızın matematiksel yapısı gereği asla azalmaz; ya sabit kalır ya da çok küçük bir miktar artar.
R2=1(HKT/GKT)R^2 = 1 - (HKT / GKT) formülünde, hata kareler toplamı (HKT) yeni bir değişken eklendiğinde artamaz.
2
Düzeltilmiş belirleme katsayısının (Rˉ2\bar{R}^2) çalışma mekanizmasını inceleyin.
Rˉ2=1[(1R2)n1nk1]\bar{R}^2 = 1 - [(1 - R^2) \frac{n-1}{n-k-1}] formülü gereği, kk (değişken sayısı) arttıkça payda küçülür, bu da ceza terimini büyütür.
Düzeltilmiş R-kare, modeldeki serbestlik derecesi kaybını modele olan katkıyla kıyaslar.
3
Anlamsız değişken (X3X_3) senaryosunu uygulayın.
X3X_3 personelin başarısına katkı sağlamadığından, R2R^2'deki artış çok küçüktür; ancak paydadaki kk artışı Rˉ2\bar{R}^2 değerini aşağı çeker.
Yapay artışın (şansa bağlı), serbestlik derecesi kaybından daha az olması durumunda düzeltilmiş katsayı azalır.

Anahtar Kavram

Belirleme katsayısı ile düzeltilmiş belirleme katsayısı arasındaki temel fark, düzeltilmiş katsayının modele eklenen her yeni değişken için bir 'ceza' (serbestlik derecesi kaybı) uygulamasıdır.
Tahmini Süre:1m 40s
Soru 114Soru

Bir gayrimenkul değerleme uzmanı, bir şehirdeki konutların büyüklükleri (XX, m2m^2) ile aylık kira bedelleri (YY, TL) arasındaki ilişkiyi incelemektedir. 20 konutluk bir örneklem üzerinden yapılan analizde klasik doğrusal regresyon modeli varsayımlarının sağlandığı ve Gauss-Markov teoremine göre en iyi doğrusal tarafsız tahmin edicilerin (BLUE) elde edildiği varsayılmaktadır. Analiz sonucunda elde edilen özet istatistikler şu şekildedir:

İstatistikDeğer
Gözlem sayısı (nn)20
Konut büyüklüğü ortalaması (xˉ\bar{x})100100
Kira bedeli ortalaması (yˉ\bar{y})4.5004.500
(xixˉ)2\sum (x_i - \bar{x})^24.0004.000
(xixˉ)(yiyˉ)\sum (x_i - \bar{x})(y_i - \bar{y})20.00020.000

Buna göre, En Küçük Kareler (EKK) yöntemi ile tahmin edilen basit doğrusal regresyon denklemi aşağıdakilerden hangisidir?

Cevabı ve açıklamayı göster

Cevap: y^=4.000+5x\hat{y} = 4.000 + 5x

Cevap

En Küçük Kareler yöntemi ile tahmin edilen regresyon denklemi y^=4.000+5x\hat{y} = 4.000 + 5x şeklindedir.
Verilen özet istatistiklere göre eğim katsayısı β^1=20.000/4.000=5\hat{\beta}_1 = 20.000 / 4.000 = 5 olarak bulunur. Sabit terim (kesme noktası) ise β^0=4.500(5×100)=4.000\hat{\beta}_0 = 4.500 - (5 \times 100) = 4.000 olarak hesaplanır. Bu durumda tahmin edilen regresyon denklemi y^=4.000+5x\hat{y} = 4.000 + 5x olur.

Adım Adım Çözüm

1
Eğim katsayısının (β^1\hat{\beta}_1) hesaplanması
β^1=(xixˉ)(yiyˉ)(xixˉ)2=20.0004.000=5\hat{\beta}_1 = \frac{\sum (x_i - \bar{x})(y_i - \bar{y})}{\sum (x_i - \bar{x})^2} = \frac{20.000}{4.000} = 5
EKK yönteminde eğim katsayısı, değişkenler arasındaki kovaryansın bağımsız değişkenin varyansına oranlanmasıyla bulunur.
2
Kesme noktası katsayısının (β^0\hat{\beta}_0) hesaplanması
β^0=yˉβ^1xˉ=4.500(5×100)=4.500500=4.000\hat{\beta}_0 = \bar{y} - \hat{\beta}_1 \bar{x} = 4.500 - (5 \times 100) = 4.500 - 500 = 4.000
Regresyon doğrusu ortalamalar noktasından (xˉ,yˉ\bar{x}, \bar{y}) geçtiği için kesme noktası bu ilişki kullanılarak hesaplanır.
3
Tahmin edilen regresyon denkleminin oluşturulması
y^=4.000+5x\hat{y} = 4.000 + 5x
Hesaplanan katsayılar model yapısına yerleştirilir.

Anahtar Kavram

EKK (En Küçük Kareler) Parametre Tahmini
Soru 115Soru

Bir araştırmacı, hanehalkı gelir düzeyinin toplam tüketim harcamaları üzerindeki etkisini incelediği bir doğrusal regresyon modelinde değişen varyans (heteroskedastisite) sorunu olduğunu tespit etmiştir. Bu modelin En Küçük Kareler (EKK) yöntemiyle tahmin edilmesi durumunda, elde edilen katsayı tahmincileri ve istatistiksel anlamlılık testleri hakkında aşağıdakilerden hangisi söylenebilir?

Cevabı ve açıklamayı göster

Cevap: Katsayı tahmincileri sapmasız ve tutarlıdır; ancak artık minimum varyanslı (etkin) değildirler.

Cevap

Katsayı tahmincileri sapmasız ve tutarlı kalmaya devam ederken, etkinlik (minimum varyans) özelliğini kaybederler.
Değişen varyans sorunu varlığında En Küçük Kareler (EKK) tahmincileri hala sapmasız (unbiased) ve tutarlıdır (consistent). Ancak, Gauss-Markov teoreminin 'sabit varyans' varsayımı ihlal edildiği için bu tahminciler artık 'En İyi' (minimum varyanslı/etkin) değildir. Bu durum, EKK tahmincilerinin BLUE özelliğini kaybettiği anlamına gelir.

Adım Adım Çözüm

1
Gauss-Markov varsayımlarının kontrol edilmesi
Değişen varyans (heteroskedastisite), hata terimlerinin varyansının sabit olması (Var(ui)=σ2Var(u_i) = \sigma^2) varsayımının ihlalidir.
EKK tahmincilerinin BLUE (En İyi Doğrusal Sapmasız Tahminci) olabilmesi için tüm Gauss-Markov varsayımlarının sağlanması gerekir.
2
Tahmincilerin özelliklerinin (Sapmasızlık ve Tutarlılık) değerlendirilmesi
EKK tahmincileri (β^ \hat{\beta} ) hala doğrusaldır ve beklenen değerleri gerçek parametre değerlerine eşittir (E(β^)=β E(\hat{\beta}) = \beta ). Ayrıca örneklem hacmi büyüdükçe gerçek değere yakınsarlar.
Sapmasızlık ve tutarlılık varsayımı hata terimlerinin varyans yapısına değil, bağımsız değişkenler ile hata terimi arasındaki ilişkisizliğe bağlıdır.
3
Etkinlik ve Hipotez Testleri analizinin yapılması
Hata varyansı sabit olmadığı için EKK artık en küçük varyansı vermez (etkin değildir). Standart hatalar sapmalı hesaplandığı için tt ve FF istatistikleri yanlış sonuçlar verir.
Varyans formülü σ2 \sigma^2 sabitine dayalı olduğu için, bu değer değiştiğinde standart hatalar güvenilmez hale gelir.

Anahtar Kavram

Değişen Varyansın Teorik Sonuçları

Daha Fazla Pratik

Değişen varyansın varlığında BLUE tahmincileri elde etmek için Ağırlıklı En Küçük Kareler (WLS) yönteminin nasıl uygulandığını inceleyebilirsiniz.
Tahmini Süre:1m 30s
Soru 116Soru

Tarım ve Orman Bakanlığı bünyesinde yürütülen bir projede, belirli bir tarım ürününün verimliliğini etkileyen faktörler araştırılmaktadır. Uzman, n=18n = 18 gözlem kullanarak gübre miktarı (XX) ile hektar başına alınan verim (YY) arasındaki ilişkiyi basit doğrusal regresyon analizi ile modellemiş ve aşağıdaki sonuçları elde etmiştir:

- Eğim katsayısı tahmini: β^1=0,84\hat{\beta}_1 = 0,84
- Katsayının standart hatası: se(β^1)=0,40se(\hat{\beta}_1) = 0,40

Buna göre, α=0,05\alpha = 0,05 anlamlılık düzeyinde eğim katsayısı için oluşturulan %95\%95 güven aralığı ve katsayının anlamlılığına ilişkin hipotez testi (H0:β1=0H_0: \beta_1 = 0 ve H1:β10H_1: \beta_1 \neq 0) sonucu aşağıdakilerin hangisinde doğru verilmiştir? (t0,025;16=2,12t_{0,025; 16} = 2,12)

Cevabı ve açıklamayı göster

Cevap: [0,008;1,688][-0,008; 1,688] ve katsayı istatistiksel olarak anlamlı değildir.

Cevap

Güven aralığı [0,008;1,688][-0,008; 1,688] olup, katsayı istatistiksel olarak anlamlı değildir.
Yapılan hesaplamalarda thesap=2,10t_{hesap} = 2,10 bulunmuştur. Verilen ttablo=2,12t_{tablo} = 2,12 değeri ile karşılaştırıldığında, 2,10<2,122,10 < 2,12 olduğu için eğim katsayısı %5\%5 düzeyinde istatistiksel olarak anlamsızdır. Güven aralığı hesaplandığında ise [0,84±0,848][0,84 \pm 0,848] işleminden [0,008;1,688][-0,008; 1,688] aralığı elde edilir. Bu aralığın sıfırı içermesi, hipotez testi sonucuyla tutarlı olarak katsayının anlamsız olduğunu kanıtlar.

Adım Adım Çözüm

1
Serbestlik derecesini (sd) belirleyin.
sd=nk1=1811=16sd = n - k - 1 = 18 - 1 - 1 = 16
Basit doğrusal regresyonda iki parametre (β0β_0 ve β1β_1) tahmin edildiği için serbestlik derecesi n2n-2 olur.
2
Katsayı için t-testi istatistiğini hesaplayın.
thesap=β^1se(β^1)=0,840,40=2,10t_{hesap} = \frac{\hat{\beta}_1}{se(\hat{\beta}_1)} = \frac{0,84}{0,40} = 2,10
Katsayının anlamlılığı, katsayının kendi standart hatasına bölünmesiyle elde edilen t-değeri ile test edilir.
3
Hesaplanan t-değerini tablo değeri ile karşılaştırın.
2,10<2,12|2,10| < 2,12 olduğu için H0H_0 reddedilemez.
Test istatistiği kritik değerden küçük olduğunda katsayının sıfırdan farklı olduğu (anlamlı olduğu) söylenemez.
4
%95\%95 Güven aralığını hesaplayın.
AltSınır:0,84(2,12×0,40)=0,008Alt Sınır: 0,84 - (2,12 \times 0,40) = -0,008; Üst Sınır: 0,84 + (2,12 \times 0,40) = 1,688$
Güven aralığı formülü: β^1±(tα/2,n2×se(β^1))\hat{\beta}_1 \pm (t_{\alpha/2, n-2} \times se(\hat{\beta}_1))
5
Güven aralığı üzerinden hipotez testi sonucunu doğrulayın.
00 değeri [0,008;1,688][-0,008; 1,688] aralığı içerisinde yer almaktadır.
Güven aralığı sıfırı içeriyorsa, katsayının istatistiksel olarak anlamlı olmadığı sonucuna varılır.

Anahtar Kavram

Güven Aralığı ve Hipotez Testi İkiliği (Duality)

Daha Fazla Pratik

F-testi ve t-testi arasındaki ilişkiyi (F=t2F = t^2) inceleyerek ANOVA tablosu üzerinden katsayı anlamlılığını kontrol edebilirsiniz.
Tahmini Süre:1m 45s
Soru 117Soru

Bir büyükşehir belediyesinin fen işleri daire başkanlığı, yolların bakım çalışmaları kapsamında kullanılan bir iş makinesinin günlük çalışma süresi (XX, saat) ile günlük onarılan yol uzunluğu (YY, km) arasındaki ilişkiyi incelemek amacıyla 8 günlük veriyi analiz etmiştir. Elde edilen özet istatistikler şu şekildedir:

* n=8n = 8
* X=40\sum X = 40
* Y=120\sum Y = 120
* X2=250\sum X^2 = 250
* XY=700\sum XY = 700

Bu verilere göre, En Küçük Kareler (EKK) yöntemiyle tahmin edilen basit doğrusal regresyon denklemi aşağıdakilerden hangisidir?

Cevabı ve açıklamayı göster

Cevap: Y^=5+2X\hat{Y} = 5 + 2X

Cevap

Tahmin edilen regresyon denklemi Y^=5+2X\hat{Y} = 5 + 2X şeklindedir.
Verilen özet istatistikler kullanılarak yapılan hesaplamalarda; eğim katsayısı (β1\beta_1) kovaryansın varyansa oranı olarak 2 bulunur. Kesme noktası (β0\beta_0) ise bağımlı değişkenin ortalamasından, eğim ile bağımsız değişken ortalamasının çarpımının çıkarılmasıyla 5 olarak elde edilir. Bu durum denklemin sabit teriminin 5, eğiminin ise 2 olmasını gerektirir.

Adım Adım Çözüm

1
Değişkenlerin ortalamalarını hesaplayın.
Xˉ=40/8=5\bar{X} = 40 / 8 = 5 ve Yˉ=120/8=15\bar{Y} = 120 / 8 = 15.
Katsayı tahminlerinde ortalamalar temel bileşendir.
2
Kareler toplamı (SxxS_{xx}) ve çarpımlar toplamını (SxyS_{xy}) hesaplayın.
Sxx=250(402/8)=50S_{xx} = 250 - (40^2 / 8) = 50 ve Sxy=700(40×120/8)=100S_{xy} = 700 - (40 \times 120 / 8) = 100.
Eğim katsayısının hesaplanması için bu değerler gereklidir.
3
Eğim katsayısını (β^1\hat{\beta}_1) hesaplayın.
β^1=Sxy/Sxx=100/50=2\hat{\beta}_1 = S_{xy} / S_{xx} = 100 / 50 = 2.
Eğim katsayısı, bağımsız değişkendeki bir birimlik değişimin bağımlı değişken üzerindeki etkisidir.
4
Kesme noktası katsayısını (β^0\hat{\beta}_0) hesaplayın.
β^0=Yˉβ^1Xˉ=15(2×5)=5\hat{\beta}_0 = \bar{Y} - \hat{\beta}_1\bar{X} = 15 - (2 \times 5) = 5.
Kesme noktası, bağımsız değişken sıfır olduğunda bağımlı değişkenin beklenen değeridir.
5
Katsayıları model denklemine yerleştirin.
Y^=5+2X\hat{Y} = 5 + 2X.
Modelin genel formu Y^=β^0+β^1X\hat{Y} = \hat{\beta}_0 + \hat{\beta}_1X şeklindedir.

Anahtar Kavram

En Küçük Kareler (EKK) yöntemi, artık kareler toplamını minimize ederek parametre tahminlerini elde eder. Gauss-Markov teoremi uyarınca, klasik varsayımlar altında bu tahmin ediciler En İyi Doğrusal Tarafsız Tahmin Ediciler (BLUE) özelliğine sahiptir.
Soru 118Soru

Bir sağlık ekonomisti, hastanelerin aylık operasyonel maliyetlerini (YY) açıklamak amacıyla yatak kapasitesi (X1X_1), yatan hasta sayısı (X2X_2) ve ayakta tedavi gören hasta sayısı (X3X_3) bağımsız değişkenlerini kullanarak bir çoklu doğrusal regresyon modeli tahmin etmiştir. Yatak kapasitesi ile yatan hasta sayısı arasında yapısal olarak güçlü bir ilişki olduğundan şüphelenen ekonomist, X2X_2 değişkeni için tolerans (tolerance) değerini 0,050,05 olarak hesaplamıştır.

Bu modele ve çoklu doğrusal bağlantı (multicollinearity) sorununa ilişkin aşağıdaki ifadelerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: X2X_2 değişkeninin Varyans Şişirme Faktörü (VIF) değeri 2020'dir ve bu yüksek bağlantı düzeyi En Küçük Kareler (EKK) tahmin edicilerinin sapmasızlık özelliğini bozmaz ancak katsayı tahminlerinin varyanslarının büyümesine (standart hataların şişmesine) neden olur.

Cevap

Doğru ifade, X2X_2 değişkeni için hesaplanan VIF değerinin 20 olduğunu ve bu durumun EKK tahmin edicilerinin sapmasızlığını bozmadan varyanslarını artıracağını belirten ifadedir.
Varyans Şişirme Faktörü (VIF), tolerans değerinin çarpmaya göre tersidir (VIF=1ToleransVIF = \frac{1}{Tolerans}). Tolerans değeri 0,050,05 olduğunda VIF=20VIF = 20 olarak bulunur. Genellikle VIF >10> 10 olması şiddetli çoklu doğrusal bağlantı sorununa işaret eder. Bu sorunun temel sonucu, En Küçük Kareler (EKK) tahmin edicilerinin varyanslarının büyümesi ve katsayıların standart hatalarının şişmesidir. Ancak bu durum, EKK tahmin edicilerinin beklenen değerini değiştirmediği için sapmasızlık (unbiasedness) özelliği korunur.

Adım Adım Çözüm

1
Varyans Şişirme Faktörü (VIF) değerinin hesaplanması.
VIF=1ToleransVIF = \frac{1}{Tolerans} formülünden VIF=10,05=20VIF = \frac{1}{0,05} = 20 bulunur.
VIF değeri, tolerans değerinin çarpmaya göre tersi alınarak elde edilir.
2
Hesaplanan VIF değerinin yorumlanması ve EKK üzerindeki etkisinin değerlendirilmesi.
VIF değeri 1010'dan büyük olduğu için şiddetli bir çoklu doğrusal bağlantı vardır. Bu durum katsayı varyanslarını büyütür ancak tahmin ediciler sapmasız kalmaya devam eder.
Çoklu doğrusal bağlantı Gauss-Markov varsayımlarından sapmasızlık özelliğini ihlal etmez; yalnızca standart hataların şişmesine yol açar.

Anahtar Kavram

Çoklu Doğrusal Bağlantının (Multicollinearity) Teşhisi ve EKK Tahmin Edicilerine Etkisi
Soru 119Soru

Basit doğrusal regresyon modelinde (Yi=β0+β1Xi+uiY_i = \beta_0 + \beta_1 X_i + u_i), En Küçük Kareler (EKK) tahmin edicilerinin "En İyi Doğrusal Tarafsız Tahmin Edici" (BLUE) özelliğine sahip olması için Gauss-Markov varsayımlarının sağlanması gerekmektedir. Buna göre, Gauss-Markov teoremi çerçevesinde EKK tahmin edicilerinin BLUE özelliğine sahip olması için aşağıdaki varsayımlardan hangisinin sağlanması zorunlu değildir?

Cevabı ve açıklamayı göster

Cevap: Hata terimlerinin normal dağılıma sahip olması (uiN(0,σ2)u_i \sim N(0, \sigma^2))

Cevap

Hata terimlerinin normal dağılıma sahip olması varsayımı, EKK tahmin edicilerinin BLUE olması için zorunlu değildir.
Gauss-Markov teoremi, hata terimlerinin beklenen değerinin sıfır olması, sabit varyanslı olması, otokorelasyon içermemesi ve bağımsız değişkenlerle ilişkisiz olması durumunda EKK tahmin edicilerinin BLUE olduğunu kanıtlar. Hata terimlerinin normal dağılması varsayımı ise BLUE özelliği için değil, parametreler üzerinde t ve F testleri gibi istatistiksel çıkarımlar yapabilmek için gereklidir.

Adım Adım Çözüm

1
Gauss-Markov teoreminin kapsamını belirle.
Teorem; doğrusallık, tarafsızlık ve minimum varyans (etkinlik) özelliklerini inceler.
BLUE özelliğinin hangi varsayımlara dayandığını anlamak için temel teorik çerçeveyi kurmak gerekir.
2
Varsayımları kategorize et.
Hata teriminin ortalamasının 0 olması tarafsızlığı, sabit varyans ve otokorelasyon yokluğu ise minimum varyanslılığı sağlar.
Her bir varsayımın BLUE tanımındaki hangi harfe (L, U, E) karşılık geldiğini ayırt etmek gerekir.
3
Normallik varsayımının işlevini analiz et.
Normallik varsayımı, tahmin edicilerin örnekleme dağılımını belirlemek için Klasik Normal Doğrusal Regresyon Modeli'ne (KNDRM) eklenir.
Normallik olmadan da EKK tahmin edicileri BLUE'dur, ancak güven aralıkları ve hipotez testleri için normallik (veya büyük örneklemde merkezi limit teoremi) şarttır.

Anahtar Kavram

Gauss-Markov Teoremi ve BLUE Özellikleri
Soru 120Soru

Bir kamu kurumu, bölgesel kalkınma projelerinin etkinlik skorlarını (YY) tahmin etmek amacıyla; proje bütçesi (X1X_1), projede görev alan uzman sayısı (X2X_2) ve bölgenin sanayi endeksi (X3X_3) değişkenlerini içeren bir çoklu doğrusal regresyon modeli kurmuştur. Modelden elde edilen genel bulgular şu şekildedir:

- Modelin belirleme katsayısı oldukça yüksektir (R2=0,91R^2 = 0,91).
- FF-istatistiği modelin bütünsel olarak anlamlı olduğunu göstermektedir (p<0,01p < 0,01).
- Değişkenlerin bireysel tt-istatistiklerinin çoğu istatistiksel olarak anlamsız bulunmuştur.

Değişkenlere ait yardımcı regresyon analizlerinden elde edilen tolerans değerleri aşağıdaki tabloda verilmiştir:

Bağımsız DeğişkenTolerans Değeri (1Rj21-R_j^2)
X1X_10,040,04
X2X_20,050,05
X3X_30,800,80

Bu verilere göre, modeldeki çoklu doğrusal bağlantı (multicollinearity) sorunu ve sonuçları ile ilgili aşağıdakilerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: En Küçük Kareler (EKK) tahmincileri sapmasızlık (unbiasedness) özelliğini korumakla birlikte, parametre tahminlerinin varyansları yapay olarak büyüdüğü için tahminciler verimsizleşmektedir.

Cevap

En Küçük Kareler tahmincilerinin sapmasızlık özelliğini koruduğu ancak varyanslarının büyümesi nedeniyle verimsizleştiği ifade edilen seçenek doğrudur.
Çoklu doğrusal bağlantı sorununun varlığında En Küçük Kareler (EKK) tahmincileri 'Sapmasız' olma özelliğini korurlar. Ancak bağımsız değişkenler arasındaki yüksek korelasyon, parametre tahminlerinin varyanslarının ve standart hatalarının yapay olarak büyümesine neden olur. Bu durum, katsayıların istatistiksel olarak anlamsız çıkmasına ve güven aralıklarının aşırı genişlemesine yol açarak modelin etkinliğini (efficiency) bozar. Dolayısıyla doğru olan ifade, tahmincilerin sapmasız kaldığı ancak varyans büyümesi nedeniyle verimsizleştiğidir.

Adım Adım Çözüm

1
Tablodaki tolerans değerlerinden hareketle Varyans Şişme Faktörü (VIF) değerlerini hesaplayın.
VIF(X1)=1/0,04=25VIF(X_1) = 1 / 0,04 = 25; VIF(X2)=1/0,05=20VIF(X_2) = 1 / 0,05 = 20; VIF(X3)=1/0,80=1,25VIF(X_3) = 1 / 0,80 = 1,25.
VIF ve Tolerans arasındaki ilişki VIF=1/ToleransVIF = 1 / Tolerans formülüyle belirlenir.
2
Elde edilen VIF değerlerini eşik değerlerle karşılaştırarak sorunun varlığını teyit edin.
X1X_1 ve X2X_2 değişkenlerinin VIF değerleri 1010 (veya yaygın kabul gören 55) değerinden büyük olduğu için şiddetli çoklu doğrusal bağlantı vardır.
VIF değerinin yüksek olması, ilgili değişkenin varyansının diğer değişkenlerle olan ilişkisi nedeniyle şiştiğini gösterir.
3
Çoklu doğrusal bağlantının En Küçük Kareler (EKK) tahmincileri üzerindeki teorik etkilerini değerlendirin.
EKK tahmincileri hala sapmasızdır (E[β^]=βE[\hat{\beta}] = \beta), ancak varyanslar büyüdüğü için güven aralıkları genişler ve tt-testleri anlamsız çıkar.
Çoklu doğrusal bağlantı varsayımı, tahminlerin doğruluğunu (merkezini) değil, hassasiyetini (yayılımını) etkiler.

Anahtar Kavram

Çoklu doğrusal bağlantı (multicollinearity) durumunda EKK tahmincileri hala doğrusal ve sapmasızdır (BLUE özelliğinin sapmasızlık kısmını korur), ancak varyansları minimum olmadığı için 'en iyi' (etkin) olma özelliğini kaybederler.
ÖncekiSayfa 6 / 11Sonraki
Regresyon Analizi Alıştırma Soruları — KPSS İstatistik — Sayfa 6 | Examkin