Soru

Zorluk: ZorRegresyon Tahminleyicisinin Varyansı ve Etkinliği

Bir pazar araştırması şirketi, çok geniş bir tüketici kitlesinin aylık gıda harcamaları ortalamasını (yy) tahmin etmek istemektedir. Harcamalar ile tüketicilerin aylık gelirleri (xx) arasındaki doğrusal ilişkiden faydalanmak amacıyla regresyon tahminleyicisi kullanılacaktır.

Geçmiş verilere göre, gıda harcamaları ile aylık gelir arasındaki korelasyon katsayısı ρ=0,80\rho = 0,80 olarak hesaplanmıştır.

Şirket, regresyon tahminleyicisi kullanarak n=180n = 180 kişilik bir rastgele örneklem ile belirli bir örnekleme hatasına (varyansa) ulaşmıştır.

Kitle hacminin çok büyük olduğu (sonlu kitle düzeltmesinin ihmal edilebileceği) varsayımı altında, şirket yardımcı değişken kullanmadan yalnızca basit rastgele örnekleme ortalama tahminleyicisi ile aynı tahmin hassasiyetine (aynı varyansa) ulaşmak isteseydi örneklem hacmi kaç olmalıydı?

  1. A
    144
  2. B
    225
  3. C
    300
  4. 500Cevap
  5. E
    900

Cevap

500
Büyük kitlelerde regresyon tahminleyicisinin varyansı, basit rastgele örnekleme varyansının (1ρ2)(1-\rho^2) katı kadardır. Formül olarak Vreg=Vsrs×(1ρ2)V_{reg} = V_{srs} \times (1-\rho^2) şeklinde ifade edilir. Araştırmacının aynı varyans değerine (aynı hassasiyete) ulaşması istendiğinden varyansları eşitlediğimizde, basit rastgele örnekleme için gereken örneklem hacmi nsrs=nreg1ρ2n_{srs} = \frac{n_{reg}}{1-\rho^2} olarak bulunur. Verilen değerler formülde yerine konduğunda nsrs=18010,802=18010,64=1800,36=500n_{srs} = \frac{180}{1 - 0,80^2} = \frac{180}{1 - 0,64} = \frac{180}{0,36} = 500 elde edilir. Bu sonuç, aralarındaki yüksek korelasyondan dolayı yardımcı değişken kullanmanın örneklem hacminden ne kadar büyük bir tasarruf sağladığını göstermektedir.

Adım Adım Çözüm

1
Regresyon tahminleyicisinin varyans formülünü yazmak
Sonlu kitle düzeltmesi (SKD) ihmal edildiğinde regresyon tahminleyicisinin varyansı: V(yˉlr)=Sy2nlr(1ρ2)V(\bar{y}_{lr}) = \frac{S_y^2}{n_{lr}} (1-\rho^2) olarak yazılır.
Yardımcı değişken kullanıldığında örnekleme varyansının korelasyon katsayısına bağlı olarak nasıl azaldığını matematiksel olarak ifade etmek için.
2
Basit rastgele örneklemede ortalama tahminleyicisinin varyansını yazmak
SKD ihmal edildiğinde basit rastgele örnekleme varyansı: V(yˉsrs)=Sy2nsrsV(\bar{y}_{srs}) = \frac{S_y^2}{n_{srs}} şeklindedir.
Karşılaştırma yapılacak diğer tahminleyicinin temel varyans yapısını belirlemek için.
3
İki varyansı birbirine eşitleyerek denklemi kurmak
V(yˉlr)=V(yˉsrs)V(\bar{y}_{lr}) = V(\bar{y}_{srs}) eşitliğinden Sy2180(10,802)=Sy2nsrs\frac{S_y^2}{180} (1 - 0,80^2) = \frac{S_y^2}{n_{srs}} denklemi elde edilir.
Soru metninde istenen 'aynı tahmin hassasiyetine (aynı varyansa) ulaşma' koşulunu matematiksel olarak sağlamak için.
4
Eşitliği çözerek nsrsn_{srs} değerini bulmak
Sy2S_y^2'ler sadeleşir. 10,64180=1nsrs0,36180=1nsrs\frac{1 - 0,64}{180} = \frac{1}{n_{srs}} \Rightarrow \frac{0,36}{180} = \frac{1}{n_{srs}}. Buradan nsrs=1800,36=500n_{srs} = \frac{180}{0,36} = 500 bulunur.
Aynı varyans düzeyini elde etmek için basit rastgele örneklemede ulaşılması gereken minimum örneklem hacmini hesaplamak için.

Anahtar Kavram

Regresyon Tahminleyicisinin Etkinliği ve Varyans Karşılaştırması

Alternatif Yöntem

Tasarım etkisi (Design Effect - deff) kavramı üzerinden de düşünülebilir. Regresyon tahminleyicisinin basit rastgele örneklemeye göre tasarım etkisi deff=1ρ2deff = 1 - \rho^2 olarak kabul edilirse, efektif örneklem hacmi ilişkisi nreg=nsrs×deffn_{reg} = n_{srs} \times deff şeklindedir. Buradan 180=nsrs×(10,64)180 = n_{srs} \times (1 - 0,64) yazılarak doğrudan nsrs=500n_{srs} = 500 sonucuna ulaşılabilir.
Tahmini Süre:2m 0s
Bu soruyu puanla