Nokta Tahmini ve Özellikleri

172 soru

Soru 1Soru

X1,X2,,XnX_1, X_2, \dots, X_n (n>1)(n>1) ortalaması μ\mu ve varyansı σ2\sigma^2 olan bir kitleden çekilmiş bağımsız rastgele örneklem olsun. Kitle varyansının en çok olabilirlik tahmin edicisi (MLE) σ^2=1ni=1n(XiXˉ)2\hat{\sigma}^2 = \frac{1}{n} \sum_{i=1}^n (X_i - \bar{X})^2 eşitliği ile verilmektedir.

Bu tahmin edicinin asimptotik yansızlığı ve özellikleri dikkate alındığında aşağıdaki ifadelerden hangisi kesinlikle doğrudur?

Cevabı ve açıklamayı göster

Cevap: Beklenen değeri E(σ^2)=n1nσ2E(\hat{\sigma}^2) = \frac{n-1}{n}\sigma^2 olup sonlu örneklemlerde yanlıdır, ancak limnE(σ^2)=σ2\lim_{n\to\infty} E(\hat{\sigma}^2) = \sigma^2 olduğundan asimptotik yansızdır.

Cevap

Doğru ifade, tahmin edicinin beklenen değerinin ((n-1)/n)σ² olduğunu, sonlu örneklemde yanlı iken limit durumunda beklenen değerin σ²'ye eşitlenmesi sebebiyle asimptotik yansız olduğunu belirten seçenektir.
Doğru yanıt, en çok olabilirlik varyans tahmin edicisinin matematiksel gerçekliğine tam olarak uygundur. nn paydalı tahmin edicinin beklenen değeri n1nσ2\frac{n-1}{n}\sigma^2 olduğundan sonlu düzeyde yanlıdır. Ancak asimptotik yansızlık tanımı limnE(θ^n)=θ\lim_{n \to \infty} E(\hat{\theta}_n) = \theta şeklindedir ve bu limit alındığında limnn1nσ2=σ2\lim_{n\to\infty} \frac{n-1}{n}\sigma^2 = \sigma^2 eşitliği sağlandığı için tahmin edici asimptotik yansızdır.

Adım Adım Çözüm

1
Verilen varyans tahmin edicisinin (MLE) beklenen değerini matematiksel olarak incele.
E(σ^2)=E(1n(XiXˉ)2)=n1nσ2E(\hat{\sigma}^2) = E\left(\frac{1}{n} \sum (X_i - \bar{X})^2\right) = \frac{n-1}{n}\sigma^2
Örneklem varyansı (S2S^2) paydada n1n-1 bulundurduğunda yansızdır. MLE formülünde ise payda nn olduğu için, yansız varyans değerinin n1n\frac{n-1}{n} katı elde edilir.
2
Sonlu bir nn değeri için yansızlık şartının sağlanıp sağlanmadığını kontrol et.
Yan (Bias) = E(σ^2)σ2=n1nσ2σ2=σ2n0E(\hat{\sigma}^2) - \sigma^2 = \frac{n-1}{n}\sigma^2 - \sigma^2 = -\frac{\sigma^2}{n} \neq 0
Beklenen değer doğrudan parametre σ2\sigma^2'ye eşit çıkmadığı ve aralarında bir yan miktarı bulunduğu için tahmin edici küçük örneklemlerde yanlıdır.
3
Asimptotik yansızlık tanımını uygulamak için örneklem çapı nn sonsuza giderken limit al.
limnE(σ^2)=limnn1nσ2=1σ2=σ2\lim_{n \to \infty} E(\hat{\sigma}^2) = \lim_{n \to \infty} \frac{n-1}{n}\sigma^2 = 1 \cdot \sigma^2 = \sigma^2
Örneklem çapı sonsuza giderken tahmin edicinin beklenen değeri kitle parametresine (σ2\sigma^2) yaklaşmaktadır. Limit tanımı gereği limnBias(σ^2)=0\lim_{n \to \infty} Bias(\hat{\sigma}^2) = 0 olduğu için tahmin edici asimptotik olarak yansızdır.

Anahtar Kavram

Asimptotik Yansızlık (Asymptotic Unbiasedness)
Tahmini Süre:1m 30s
Soru 2Soru

Bir fiziksel sistemdeki parçacıkların hızlarının büyüklüğünü modellemek için kullanılan Maxwell-Boltzmann dağılımının olasılık yoğunluk fonksiyonu, θ>0\theta > 0 olmak üzere,

f(x;θ)=2πx2θ3ex22θ2,x>0f(x; \theta) = \sqrt{\frac{2}{\pi}} \frac{x^2}{\theta^3} e^{-\frac{x^2}{2\theta^2}}, \quad x > 0

şeklinde verilmektedir.
Bu dağılımdan alınan nn birimlik rastgele bir örneklem için bilinmeyen θ\theta parametresinin yansız bir tahmin edicisinin varyansının alabileceği en küçük değer (Cramer-Rao alt sınırı) aşağıdakilerden hangisidir?
(Bilgi: Bu dağılım için E(X2)=3θ2E(X^2) = 3\theta^2 dir.)

Cevabı ve açıklamayı göster

Cevap: θ26n\frac{\theta^2}{6n}

Cevap

Bilinmeyen θ\theta parametresi için Cramer-Rao alt sınırı θ26n\frac{\theta^2}{6n} ifadesidir.
Verilen Maxwell-Boltzmann dağılımının log-olabilirlik fonksiyonunun ikinci türevi hesaplanıp, soruda sağlanan E(X2)=3θ2E(X^2)=3\theta^2 değeri yerine konduğunda, bir gözlem için Fisher bilgisi I1(θ)=6/θ2I_1(\theta) = 6/\theta^2 olarak bulunur. nn gözlemden oluşan rastgele örneklem için Cramer-Rao alt sınırı 1/(nI1(θ))1 / (n \cdot I_1(\theta)) formülüyle hesaplandığından sonuç θ2/(6n)\theta^2 / (6n) olur.

Adım Adım Çözüm

1
Olasılık yoğunluk fonksiyonunun logaritmasını (log-olabilirlik) al.
lnf(x;θ)=ln(2π)+2lnx3lnθx22θ2\ln f(x; \theta) = \ln\left(\sqrt{\frac{2}{\pi}}\right) + 2\ln x - 3\ln\theta - \frac{x^2}{2\theta^2}
Fisher bilgi matrisini bulabilmek için fonksiyonun logaritmasının parametreye göre türevlerine ihtiyaç vardır.
2
Log-olabilirlik fonksiyonunun θ\theta parametresine göre birinci türevini (skor fonksiyonu) hesapla.
θlnf(x;θ)=3θx22(2θ3)=3θ+x2θ3\frac{\partial}{\partial \theta} \ln f(x; \theta) = -\frac{3}{\theta} - \frac{x^2}{2} (-2\theta^{-3}) = -\frac{3}{\theta} + \frac{x^2}{\theta^3}
İkinci türeve ulaşmak için önce birinci türev alınmalıdır.
3
Birinci türevin tekrar θ\theta'ya göre türevini alarak ikinci türevi hesapla.
2θ2lnf(x;θ)=3θ23x2θ4\frac{\partial^2}{\partial \theta^2} \ln f(x; \theta) = \frac{3}{\theta^2} - \frac{3x^2}{\theta^4}
Fisher bilgisi, log-olabilirlik fonksiyonunun ikinci türevinin beklenen değerinin eksi işaretlisi kullanılarak daha kolay hesaplanır.
4
İkinci türevin beklenen değerini eksi ile çarparak tek bir gözlem için Fisher bilgisini (I1(θ)I_1(\theta)) bul.
I1(θ)=E[3θ23X2θ4]=3θ2+3θ4E(X2)I_1(\theta) = -E\left[ \frac{3}{\theta^2} - \frac{3X^2}{\theta^4} \right] = -\frac{3}{\theta^2} + \frac{3}{\theta^4}E(X^2). Verilen E(X2)=3θ2E(X^2)=3\theta^2 yazılırsa: 3θ2+3(3θ2)θ4=3θ2+9θ2=6θ2-\frac{3}{\theta^2} + \frac{3(3\theta^2)}{\theta^4} = -\frac{3}{\theta^2} + \frac{9}{\theta^2} = \frac{6}{\theta^2}
Cramer-Rao alt sınırı formülünün paydasını oluşturan birim Fisher bilgisine ulaşmak.
5
nn çaplı örneklem için CRLB formülünü uygula.
CRLB(θ^)=1nI1(θ)=1n(6/θ2)=θ26nCRLB(\hat{\theta}) = \frac{1}{n \cdot I_1(\theta)} = \frac{1}{n \cdot (6/\theta^2)} = \frac{\theta^2}{6n}
Yansız bir tahmin edicinin minimum varyans sınırını (CRLB) sonuca bağlamak.

Anahtar Kavram

Cramer-Rao Eşitsizliği ve Fisher Bilgisi
Soru 3Soru
Bir araştırmacı, olasılık yoğunluk fonksiyonu
f(x;θ)={2(θx)θ2,0<x<θ0,dig˘er durumlardaf(x; \theta) = \begin{cases} \frac{2(\theta - x)}{\theta^2}, & 0 < x < \theta \\ 0, & \text{diğer durumlarda} \end{cases}
ile verilen dağılımdan nn çaplı X1,X2,,XnX_1, X_2, \dots, X_n rastgele örneklemini çekmiştir. Burada θ>0\theta > 0 bilinmeyen bir parametredir.

Neyman Çarpanlara Ayırma Teoremi kullanıldığında, θ\theta parametresi için en küçük yeterli istatistik (minimal sufficient statistic) aşağıdakilerden hangisidir?

Cevabı ve açıklamayı göster

Cevap: (X(1),X(2),,X(n))\left( X_{(1)}, X_{(2)}, \dots, X_{(n)} \right)

Cevap

Sıra istatistiklerinin tamamını içeren vektör: (X(1),X(2),,X(n))\left( X_{(1)}, X_{(2)}, \dots, X_{(n)} \right)
Olabilirlik fonksiyonu L(θ;x)=2nθ2nI(x(n)<θ)i=1n(θxi)I(x(1)>0)L(\theta; \mathbf{x}) = \frac{2^n}{\theta^{2n}} I(x_{(n)} < \theta) \prod_{i=1}^n (\theta - x_i) I(x_{(1)} > 0) olarak yazılır. Neyman Çarpanlara Ayırma Teoremi uyarınca, θ\theta'yı içeren tüm ifadeler ayrıştırılamaz bir bütün olarak yeterli istatistiği tanımlar. Burada i=1n(θxi)\prod_{i=1}^n (\theta - x_i) ifadesi nn. dereceden bir polinomdur ve açılımı örneklemin tüm çapraz çarpım toplamlarını gerektirir. İki farklı örneklem için olabilirlik oranının θ\theta'dan bağımsız olabilmesi için, bu örneklemlerin sıra istatistiklerinin birebir aynı olması gerekir. Bu nedenle, hiçbir bilgi kaybı yaşanmaması adına (X(1),X(2),,X(n))(X_{(1)}, X_{(2)}, \dots, X_{(n)}) sıra istatistiklerinin tamamı en küçük yeterli istatistiktir.

Adım Adım Çözüm

1
Olabilirlik (likelihood) fonksiyonunu oluşturmak.
L(θ;x)=i=1n2(θxi)θ2I(0<xi<θ)L(\theta; \mathbf{x}) = \prod_{i=1}^n \frac{2(\theta - x_i)}{\theta^2} I(0 < x_i < \theta)
Neyman Çarpanlara Ayırma Teoremi'ni uygulamak için örneklemin ortak dağılım fonksiyonu elde edilmelidir.
2
Gösterge (indicator) fonksiyonunu sıra istatistikleri cinsinden tek bir ifadeye dönüştürmek.
i=1nI(0<xi<θ)=I(x(1)>0)I(x(n)<θ)\prod_{i=1}^n I(0 < x_i < \theta) = I(x_{(1)} > 0) I(x_{(n)} < \theta)
Tanım kümesinin θ\theta'ya bağlı olan sınırlarını matematiksel olarak izole edebilmek için en küçük ve en büyük sıra istatistikleri kullanılır.
3
Olabilirlik fonksiyonunu yeniden düzenleyerek parametreye (θ\theta) bağlı olan ve olmayan kısımları çarpanlarına ayırmak.
L(θ;x)=[2nθ2nI(x(n)<θ)i=1n(θxi)]I(x(1)>0)L(\theta; \mathbf{x}) = \left[ \frac{2^n}{\theta^{2n}} I(x_{(n)} < \theta) \prod_{i=1}^n (\theta - x_i) \right] I(x_{(1)} > 0)
Teoremdeki L=g(T(x),θ)h(x)L = g(T(\mathbf{x}), \theta) \cdot h(\mathbf{x}) formatını sağlamak için verinin θ\theta ile nasıl birleştiği incelenmelidir.
4
g(T,θ)g(T, \theta) fonksiyonundaki i=1n(θxi)\prod_{i=1}^n (\theta - x_i) terimini analiz etmek.
Bu çarpım θ\theta'nın nn. dereceden bir polinomudur. İfadenin açılımı, verilerin ikili, üçlü ve nn'li tüm çapraz çarpımlarını (temel simetrik polinomları) içerir.
Bu ifadenin daha düşük boyutlu bir istatistiğe (örneğin sadece toplama veya sadece maksimum değere) indirgenip indirgenemeyeceğini test etmek.
5
En küçük yeterli istatistiğe karar vermek.
Polinomun tüm katsayılarının bilinmesi, orijinal veri kümesinin (sırası fark etmeksizin) tamamen bilinmesi ile eşdeğer olduğundan, en küçük yeterli istatistik (X(1),X(2),,X(n))(X_{(1)}, X_{(2)}, \dots, X_{(n)}) vektörüdür.
Veri ile parametre arasındaki ilişki hiçbir şekilde tek veya iki boyutlu bir özete indirgenemez, tüm sıra istatistikleri gereklidir.

Anahtar Kavram

Neyman Çarpanlara Ayırma Teoremi ile Polinomik Çarpanlarda Yeterlilik Analizi
Soru 4Soru

İstatistiksel çıkarımda nokta tahmin edicilerin değerlendirilmesinde kullanılan tamlık (completeness) kavramı ve üstel aileler (exponential families), düzgün en küçük varyanslı yansız tahmin edicilerin (UMVUE) elde edilmesinde kritik bir öneme sahiptir.

Buna göre, tahmin edicilerin tamlık özelliği ve olasılık dağılımlarının üstel aile yapıları ile ilgili aşağıdaki ifadelerden hangisi kesinlikle doğrudur?

Cevabı ve açıklamayı göster

Cevap: kk-parametreli bir üstel ailenin doğal (kanonik) parametre uzayı Rk\mathbb{R}^k içerisinde kk-boyutlu açık bir küme içeriyorsa, bu aileden elde edilen ortak kanonik yeterli istatistik aynı zamanda tamdır.

Cevap

Doğru olan ifade, k-parametreli bir üstel ailenin doğal parametre uzayının k-boyutlu açık bir küme barındırması durumunda kanonik istatistiğin tam olduğunu belirten ifadedir.
Üstel aileler teorisinde tamlık için en belirleyici unsur, doğal (kanonik) parametre uzayının boyutudur. Eğer kk parametreli bir üstel ailenin doğal parametre uzayı Rk\mathbb{R}^k içinde kk boyutlu bir açık dikdörtgen (veya açık küme) içeriyorsa, bu dağılım ailesinden elde edilen kanonik ortak yeterli istatistik kesin olarak tamdır (complete). Bu özellik, Laplace dönüşümlerinin tekliği teoreminden elde edilir ve Lehmann-Scheffé teoreminin eksiksiz olarak uygulanabilmesi için yegane temeli oluşturur.

Adım Adım Çözüm

1
Lehmann-Scheffé teoreminin koşullarını gözden geçirmek.
UMVUE elde etmek için kullanılan yeterli istatistiğin sadece yansız veya minimal yeterli olması yetmez, kesinlikle 'tam' (complete) olması zorunludur.
Tamlık özelliği, istatistiğin fonksiyonları arasında sıfır beklentisine sahip başka bir yansız tahmin edicinin bulunmamasını sağlayarak UMVUE'nin benzersizliğini güvence altına alır.
2
Eğrisel üstel ailelerde (curved exponential families) ve destek kümesi parametreye bağlı dağılımlarda yeterlilik ve tamlık durumunu analiz etmek.
Destek kümesi parametreye bağlı olsa da indikatör fonksiyonu ile yeterli istatistik bulunabilir. Ancak N(θ, θ²) gibi eğrisel ailelerde parametre uzayı bir açık küme (alan) oluşturmadığı için tamlık kuralı bozulur.
Boyut daralması, birbirine bağımlı parametrelerin tamlık için gereken integral tekliğini ortadan kaldırmasına yol açar.
3
Üstel aileler için genel tamlık teoremini uygulamak.
Eğer doğal (kanonik) parametre uzayı k-boyutlu gerçel uzayda bir açık dikdörtgen barındırıyorsa, üstel ailenin doğal yeterli istatistikleri her zaman tamdır kuralı doğrulanır.
Bu teorem, çok değişkenli Laplace ve Fourier dönüşümlerinin özellikleri kullanılarak matematiksel olarak ispatlanmıştır ve istatistik teorisinin temel taşlarından biridir.

Anahtar Kavram

Üstel Ailelerde Tamlık Teoremi ve Eğrisel Üstel Aileler
Tahmini Süre:2m 0s
Soru 5Soru
X1,X2,,XnX_1, X_2, \dots, X_n, parametresi λ>0\lambda > 0 olan Poisson dağılımından alınan nn çaplı rastgele bir örneklem olsun. θ=λeλ\theta = \lambda e^{-\lambda} parametresi için başlangıç olarak,
T={1,X1=10,dig˘erT = \begin{cases} 1, & X_1 = 1 \\ 0, & \text{diğer} \end{cases}
şeklinde tanımlanan yansız bir tahmin edici verilmektedir.

Bu dağılım için S=i=1nXiS = \sum_{i=1}^n X_i istatistiğinin λ\lambda için yeterli (ve tam) olduğu bilinmektedir.

Buna göre, Rao-Blackwell teoremi kullanılarak TT tahmin edicisinden elde edilen, θ\theta için minimum varyanslı yansız tahmin edici (UMVUE) aşağıdakilerden hangisidir?

Cevabı ve açıklamayı göster

Cevap: Sn(11n)S1\frac{S}{n} \left(1 - \frac{1}{n}\right)^{S-1}

Cevap

Sn(11n)S1\frac{S}{n} \left(1 - \frac{1}{n}\right)^{S-1}
Rao-Blackwell teoremine göre ϕ(S)=E[TS]\phi(S) = E[T|S] minimum varyanslı yansız tahmin edicidir (UMVUE). TT, X1=1X_1=1 olduğunda 1 değerini alan bir gösterge değişkeni olduğundan E[TS=s]=P(X1=1Xi=s)E[T|S=s] = P(X_1=1 | \sum X_i=s) hesaplanmalıdır. Bu da koşullu olasılık tanımından P(X1=1)P(i=2nXi=s1)/P(i=1nXi=s)P(X_1=1) \cdot P(\sum_{i=2}^n X_i=s-1) / P(\sum_{i=1}^n X_i=s) formülünden elde edilir. İlgili Poisson olasılık fonksiyonları yerine yazılıp, enλe^{-n\lambda} ve λs\lambda^s terimleri ile s!/(s1)!=ss! / (s-1)! = s sadeleştirmeleri yapıldığında sonuç Sn(11n)S1\frac{S}{n} \left(1 - \frac{1}{n}\right)^{S-1} olarak bulunur.

Adım Adım Çözüm

1
Rao-Blackwell tahmin edicisinin koşullu beklenen değer olarak tanımlanmasını yaz.
ϕ(S)=E[TS=s]\phi(S) = E[T | S = s]
Rao-Blackwell teoremine göre yansız bir tahmin edicinin yeterli bir istatistiğe göre koşullu beklenen değeri, varyansı daha düşük veya eşit olan yeni bir yansız tahmin edici üretir.
2
T'nin gösterge (indicator) fonksiyonu olma özelliğini kullanarak beklenen değeri olasılığa çevir.
E[TS=s]=1P(T=1S=s)+0P(T=0S=s)=P(X1=1i=1nXi=s)E[T | S=s] = 1 \cdot P(T=1 | S=s) + 0 \cdot P(T=0 | S=s) = P(X_1=1 | \sum_{i=1}^n X_i = s)
T sadece 1 ve 0 değerlerini aldığından, beklenen değeri doğrudan T=1 olma olasılığına eşittir.
3
Koşullu olasılığı tanımına göre pay ve payda olarak ayır ve bağımsızlık özelliğini kullan.
P(X1=1i=1nXi=s)=P(X1=1 ve i=2nXi=s1)P(i=1nXi=s)P(X_1=1 | \sum_{i=1}^n X_i=s) = \frac{P(X_1=1 \text{ ve } \sum_{i=2}^n X_i=s-1)}{P(\sum_{i=1}^n X_i=s)}
Örneklemdeki gözlemler bağımsızdır. Xi=s\sum X_i = s ve X1=1X_1 = 1 ise, geriye kalan n1n-1 gözlemin toplamı mecburen s1s-1 olmalıdır.
4
İlgili toplamların dağılımlarını belirleyerek olasılık fonksiyonlarını yerine yaz.
X1Poisson(λ)X_1 \sim Poisson(\lambda), i=2nXiPoisson((n1)λ)\sum_{i=2}^n X_i \sim Poisson((n-1)\lambda) ve i=1nXiPoisson(nλ)\sum_{i=1}^n X_i \sim Poisson(n\lambda).
Bağımsız Poisson değişkenlerinin toplamı da Poisson dağılır ve parametreleri toplanır.
5
Formülde dağılımların karşılıklarını koyarak sadeleştirme işlemini gerçekleştir.
(λeλ)((n1)λ)s1e(n1)λ(s1)!(nλ)senλs!\frac{(\lambda e^{-\lambda}) \cdot \frac{((n-1)\lambda)^{s-1} e^{-(n-1)\lambda}}{(s-1)!}}{\frac{(n\lambda)^s e^{-n\lambda}}{s!}}
Koşullu olasılığın tam matematiksel karşılığını hesaplamak için.
6
Pay ve paydadaki üstel terimleri (enλe^{-n\lambda}), λs\lambda^s terimlerini ve faktöriyelleri sadeleştir.
λs(n1)s1/(s1)!nsλs/s!=(n1)s1nss!(s1)!=s(n1)s1ns\frac{\lambda^s (n-1)^{s-1} / (s-1)!}{n^s \lambda^s / s!} = \frac{(n-1)^{s-1}}{n^s} \cdot \frac{s!}{(s-1)!} = \frac{s(n-1)^{s-1}}{n^s}
Sonucu S yeterli istatistiğinin bir fonksiyonu olarak en sade formda yazmak için.
7
Sadeleşen terimi şıklardaki uygun formata dönüştür.
sn(n1)s1ns1=sn(n1n)s1\frac{s}{n} \cdot \frac{(n-1)^{s-1}}{n^{s-1}} = \frac{s}{n} \left(\frac{n-1}{n}\right)^{s-1}. Yani Sn(11n)S1\frac{S}{n} \left(1 - \frac{1}{n}\right)^{S-1}
Nihai UMVUE formülü.

Anahtar Kavram

Rao-Blackwell Teoremi ile UMVUE Bulma
Soru 6Soru

Bir araştırmacı, (0,1)(0, 1) aralığında değerler alan ve olasılık yoğunluk fonksiyonu

f(x;λ)={λxλ1,0<x<10,dig˘er durumlardaf(x; \lambda) = \begin{cases} \lambda x^{\lambda - 1}, & 0 < x < 1 \\ 0, & \text{diğer durumlarda} \end{cases}

olan bir kitleden nn hacimli bir rasgele örneklem (X1,X2,,XnX_1, X_2, \dots, X_n) elde etmiştir (λ>0\lambda > 0).

Buna göre, üstel aile (exponential family) özellikleri dikkate alındığında, λ\lambda parametresi için tam (complete) ve yeterli istatistik aşağıdakilerden hangisidir?

Cevabı ve açıklamayı göster

Cevap: i=1nln(Xi)\sum_{i=1}^n \ln(X_i)

Cevap

Doğru cevap, doğal parametre ile çarpım durumunda olan i=1nln(Xi)\sum_{i=1}^n \ln(X_i) ifadesini içeren seçenektir.
Dağılımın ortak olasılık yoğunluk fonksiyonu üstel aile formunda L(λ;x)=exp(nln(λ)+(λ1)i=1nln(xi))L(\lambda; \mathbf{x}) = \exp\left( n\ln(\lambda) + (\lambda - 1)\sum_{i=1}^n \ln(x_i) \right) olarak yazılabilir. Parametre uzayı λ>0\lambda > 0 geçerli bir açık aralık içerdiğinden, bu dağılım tek parametreli düzenli üstel bir ailedir. Üstel aile teoremine göre, doğal parametre (λ1)(\lambda - 1) ile çarpım durumunda olan istatistik i=1nln(Xi)\sum_{i=1}^n \ln(X_i) tam (complete) ve yeterli istatistiktir.

Adım Adım Çözüm

1
Olasılık yoğunluk fonksiyonunu üstel aile standart formunda (f(x;θ)=exp[c(θ)T(x)+d(θ)+S(x)]f(x;\theta) = \exp[c(\theta)T(x) + d(\theta) + S(x)]) yazmak.
f(x;λ)=λxλ1=exp(ln(λ)+(λ1)ln(x))f(x; \lambda) = \lambda x^{\lambda - 1} = \exp(\ln(\lambda) + (\lambda - 1)\ln(x)) şeklinde ifade edilir.
Üstel ailelere ait tamlık teoremini uygulayabilmek ve yeterli istatistiği belirlemek için fonksiyonun üstel olarak dönüştürülmesi gerekir.
2
nn hacimli örneklem için ortak olasılık yoğunluk fonksiyonunu (olabilirlik fonksiyonunu) oluşturmak.
L(λ;x)=i=1nexp(ln(λ)+(λ1)ln(xi))=exp(nln(λ)+(λ1)i=1nln(xi))L(\lambda; \mathbf{x}) = \prod_{i=1}^n \exp(\ln(\lambda) + (\lambda - 1)\ln(x_i)) = \exp\left( n\ln(\lambda) + (\lambda - 1)\sum_{i=1}^n \ln(x_i) \right) elde edilir.
Örneklem istatistiğini bulmak için tekil dağılımların çarpımı alınarak ortak dağılım elde edilmelidir.
3
Parametre uzayını kontrol ederek tam ve yeterli istatistiği belirlemek.
Parametre uzayı λ>0\lambda > 0 açık bir aralık içerdiğinden ve dağılım düzenli üstel aile üyesi olduğundan, doğal parametre (λ1)(\lambda - 1) ile çarpım durumunda olan istatistik i=1nln(Xi)\sum_{i=1}^n \ln(X_i) tam ve yeterli istatistiktir.
Düzenli üstel aile teoremi gereği, tam ve yeterli istatistik her zaman üstel fonksiyondaki doğal parametrenin katsayısı olan fonksiyondur.

Anahtar Kavram

Düzenli Üstel Ailelerde Tam ve Yeterli İstatistik
Soru 7Soru

Bir kitleden çekilen X1,X2,,XnX_1, X_2, \dots, X_n bağımsız ve aynı dağılımlı (iid) rastgele örnekleminin beklenen değeri E(Xi)=μE(X_i) = \mu ve varyansı 0<Var(Xi)=σ2<0 < Var(X_i) = \sigma^2 < \infty şeklindedir.

Kitle ortalaması μ\mu'yü tahmin etmek amacıyla, örneklem çapı nn \to \infty iken aşağıdaki üç farklı tahmin edici tanımlanmıştır:

I. T1=Xˉn+ln(n)nT_1 = \bar{X}_n + \frac{\ln(n)}{\sqrt{n}}
II. T2=X1+X2+X33T_2 = \frac{X_1 + X_2 + X_3}{3}
III. T3=nn1XˉnT_3 = \frac{n}{n-1} \bar{X}_n

Bu tahmin edicilerin yansızlık (unbiasedness) ve tutarlılık (consistency) özellikleri dikkate alındığında, aşağıda verilen ifadelerden hangisi kesinlikle doğrudur?

Cevabı ve açıklamayı göster

Cevap: T1T_1 yanlı bir tahmin edici olmasına rağmen tutarlıdır; T2T_2 ise yansız bir tahmin edici olmasına karşın tutarsızdır.

Cevap

Verilen tahmin ediciler analiz edildiğinde, T1T_1'in yanlı fakat tutarlı olduğu, T2T_2'nin ise yansız olmasına rağmen tutarsız olduğu görülmektedir.
T1T_1 tahmin edicisi beklenen değerine ln(n)n\frac{\ln(n)}{\sqrt{n}} kadar yan içerdiği için yanlıdır; ancak nn \to \infty iken hem varyansı (σ2n)\left(\frac{\sigma^2}{n}\right) hem de yan miktarı sıfıra yaklaştığı için Hata Kareler Ortalaması (MSE) sıfır olur ve tutarlılık şartını sağlar. Buna karşın T2T_2 tahmin edicisi sadece ilk 3 gözlemi kullandığı için yansız olmasına rağmen varyansı σ23\frac{\sigma^2}{3}'te sabit kalır. Varyansı sıfıra gitmediği için olasılıkta yakınsama gerçekleşmez ve tutarsız bir tahmin edicidir.

Adım Adım Çözüm

1
T1T_1 tahmin edicisinin yansızlık ve tutarlılığını analiz et.
E(T1)=μ+ln(n)nE(T_1) = \mu + \frac{\ln(n)}{\sqrt{n}} olduğundan T1T_1 yanlıdır. Ancak nn \to \infty iken L'Hopital kuralı ile yan miktarı sıfıra yakınsar. Var(T1)=σ2n0Var(T_1) = \frac{\sigma^2}{n} \to 0'dır. Hata Kareler Ortalaması MSE=Var+Bias20MSE = Var + Bias^2 \to 0 olduğu için T1T_1 tutarlıdır.
Bir tahmin edicinin tutarlılığını kanıtlamak için asimptotik olarak hem varyansının hem de yanlılığının karesinin sıfıra gitmesi yeterlidir.
2
T2T_2 tahmin edicisinin yansızlık ve tutarlılığını analiz et.
E(T2)=μ+μ+μ3=μE(T_2) = \frac{\mu+\mu+\mu}{3} = \mu olduğundan yansızdır. Ancak varyansı Var(T2)=σ23Var(T_2) = \frac{\sigma^2}{3} sabittir ve nn \to \infty iken sıfıra gitmez. Bu nedenle olasılıkta kitle ortalamasına yakınsayamaz ve tutarsızdır.
Yansız bir tahmin edicinin tutarlı olabilmesi için varyansının limit durumunda sıfıra eşitlenmesi veya farklı bir yolla Chebyshev eşitsizliğini sağlaması gerekir.
3
T3T_3 tahmin edicisinin özelliklerini değerlendir.
E(T3)=nn1μμE(T_3) = \frac{n}{n-1}\mu \neq \mu olduğundan yanlıdır. Yan miktarı μn10\frac{\mu}{n-1} \to 0'dır. Var(T3)=n(n1)2σ20Var(T_3) = \frac{n}{(n-1)^2}\sigma^2 \to 0 olduğu için MSE0MSE \to 0 olur ve T3T_3 de tutarlıdır.
Tahmin edici yapısındaki katsayıların asimptotik davranışını inceleyerek limit özelliklerini teyit etmek.
4
Seçenekleri elde edilen matematiksel kanıtlarla karşılaştır.
Sadece T1T_1'in yanlı ama tutarlı olduğu ve T2T_2'nin yansız olmasına rağmen tutarsız olduğu ifade edilen seçenek doğru bilgiyi yansıtmaktadır.
Soruda kesinlikle doğru olan yargının tespit edilmesi istenmektedir.

Anahtar Kavram

Hata Kareler Ortalaması (MSE) Yoluyla Tutarlılık ve Yansızlık Analizi
Tahmini Süre:2m 30s
Soru 8Soru

Bir üretim sürecindeki belirli bir bileşenin arıza zamanları, aşağıdaki olasılık yoğunluk fonksiyonuna sahip bir dağılım ile modellenmektedir:

f(x;θ)=xθ1ex/θΓ(θ)θθ,x>0 f(x; \theta) = \frac{x^{\theta-1} e^{-x/\theta}}{\Gamma(\theta) \theta^\theta}, \quad x > 0

Burada θ>0\theta > 0 bilinmeyen bir parametredir. X1,X2,,XnX_1, X_2, \dots, X_n bu dağılımdan alınan nn hacimli bağımsız ve aynı dağılımlı bir rastgele örneklemi göstermektedir.

Bu model bağlamında üstel aile (exponential family) özellikleri, istatistiklerin tamlığı (completeness) ve yansız tahmin edicilerin tekliği (uniqueness) değerlendirildiğinde, aşağıdakilerden hangisi kesinlikle doğrudur?

Cevabı ve açıklamayı göster

Cevap: Bu model eğrisel (curved) bir üstel aile oluşturur; ortak yeterli istatistik T=(i=1nlnXi,i=1nXi)T = \left( \sum_{i=1}^n \ln X_i, \sum_{i=1}^n X_i \right) tam (complete) olmadığı için Lehmann-Scheffe teoremi kullanılarak bu istatistiğe bağlı yansız tahmin edicilerin UMVUE (tek) olduğu doğrudan söylenemez.

Cevap

Doğru seçenek, dağılımın eğrisel (curved) bir üstel aile oluşturduğunu ve T=(i=1nlnXi,i=1nXi)T = \left( \sum_{i=1}^n \ln X_i, \sum_{i=1}^n X_i \right) ortak yeterli istatistiğinin tam olmadığını, dolayısıyla Lehmann-Scheffe teoreminin doğrudan uygulanamayacağını belirten seçenektir.
Verilen dağılım Gamma(\theta, \theta) dağılımıdır. Üstel aile formunda yazıldığında fonksiyon, doğal parametreleri η1=θ1\eta_1 = \theta - 1 ve η2=1/θ\eta_2 = -1/\theta olan iki boyutlu bir yapı sergiler. Ancak bu iki doğal parametre birbirine η2=1/(η1+1)\eta_2 = -1/(\eta_1 + 1) denklemiyle bağlıdır. Doğal parametre uzayı R2\mathbb{R}^2 düzleminde bağımsız olarak hareket edemez, yalnızca bir eğri üzerinde tanımlıdır. Bir üstel ailenin tamlık özelliğine sahip olabilmesi için parametre uzayının açık bir dikdörtgen içermesi gerekir. Bu koşul sağlanmadığı için model 'eğrisel (curved) üstel aile' sınıfına girer ve T=(lnXi,Xi)T = \left( \sum \ln X_i, \sum X_i \right) ortak yeterli istatistiği tam değildir. İstatistik tam olmadığı için, ona bağlı olarak bulunacak herhangi bir yansız tahmin edicinin Lehmann-Scheffe teoremi bağlamında benzersiz (tek) UMVUE olduğu ispatlanamaz.

Adım Adım Çözüm

1
Olasılık yoğunluk fonksiyonunu standart üstel aile formunda yeniden yazın.
f(x;θ)=exp{(θ1)lnx1θxlnΓ(θ)θlnθ}f(x; \theta) = \exp\{ (\theta-1)\ln x - \frac{1}{\theta}x - \ln\Gamma(\theta) - \theta\ln\theta \}
Yeterli istatistikleri ve doğal parametreleri matematiksel olarak kesin bir şekilde belirleyebilmek için dağılımın üstel formda (exponential family) ifade edilmesi gerekir.
2
Doğal parametreleri (η\eta) ve bunlara karşılık gelen yeterli istatistikleri (TT) tanımlayın.
Elde edilen forma göre doğal parametreler η1=θ1\eta_1 = \theta - 1 ve η2=1/θ\eta_2 = -1/\theta'dır. Karşılık gelen ortak yeterli istatistik ise T=(lnXi,Xi)T = \left(\sum \ln X_i, \sum X_i\right) olarak bulunur.
Tamlık özelliğinin sorgulanabilmesi için ortak yeterli istatistiğin ve uzay boyutunun tam olarak tespit edilmesi şarttır.
3
Doğal parametre uzayının R2\mathbb{R}^2'de açık bir alt küme (dikdörtgen) içerip içermediğini analiz edin.
Doğal parametreler arasında η2=1/(η1+1)\eta_2 = -1/(\eta_1 + 1) ilişkisi mevcuttur. Bu nedenle parametre uzayı R2\mathbb{R}^2'de sadece tek boyutlu bir eğri oluşturur ve boyutça açık bir küme içermez.
Bir üstel ailede yeterli istatistiğin tam (complete) olabilmesi için, doğal parametre uzayının ilgili boyutlu uzayda açık bir dikdörtgen içermesi matematiksel bir zorunluluktur.
4
Eğrisel (curved) yapının tamlık ve UMVUE (Düzgün En Küçük Varyanslı Yansız Tahmin Edici) varlığı üzerindeki etkisini değerlendirin.
Açık küme koşulu sağlanmadığından dağılım eğrisel üstel ailedir ve T istatistiği tam değildir. Bu eksiklik, Lehmann-Scheffe teoreminin temel şartını ihlal ettiğinden yansız tahmin edicilerin eşsizliğini (uniqueness) garanti edemez.
Lehmann-Scheffe teoremi, en iyi yansız tahmin edicinin tekliğini kanıtlamak için istatistiğin hem yeterli hem de tam olmasını katı bir şekilde gerektirir.

Anahtar Kavram

Eğrisel Üstel Ailelerde (Curved Exponential Families) Tamlık ve Lehmann-Scheffe Teoremi
Soru 9Soru

X1,X2,,XnX_1, X_2, \dots, X_n rastgele örneklemi, beklenen değeri 00 ve varyansı θ\theta olan normal dağılımdan alınmıştır.

Buna göre, θ\theta parametresinin yansız bir tahmin edicisi için Cramer-Rao alt sınırı (CRLB) aşağıdakilerden hangisidir?

Cevabı ve açıklamayı göster

Cevap: 2θ2n\frac{2\theta^2}{n}

Cevap

Cramer-Rao alt sınırı (CRLB) 2θ2n\frac{2\theta^2}{n} ifadesine eşittir.
Cramer-Rao alt sınırı (CRLB), yansız bir tahmin edicinin varyansının alabileceği en küçük değeri verir ve 1nI(θ)\frac{1}{n \cdot I(\theta)} formülü ile hesaplanır. Burada I(θ)I(\theta), tek bir gözlem için Fisher bilgisidir. N(0,θ)N(0, \theta) dağılımı için log-olabilirlik fonksiyonu lnf(x;θ)=12ln(2π)12ln(θ)x22θ\ln f(x; \theta) = -\frac{1}{2}\ln(2\pi) - \frac{1}{2}\ln(\theta) - \frac{x^2}{2\theta} şeklindedir. θ\theta'ya göre birinci türev 12θ+x22θ2-\frac{1}{2\theta} + \frac{x^2}{2\theta^2} ve ikinci türev 12θ2x2θ3\frac{1}{2\theta^2} - \frac{x^2}{\theta^3} olur. İkinci türevin beklenen değerini alırken E[X2]=θE[X^2] = \theta eşitliği kullanılır ve beklenen değer 12θ2-\frac{1}{2\theta^2} olarak bulunur. Fisher bilgisi I(θ)=12θ2I(\theta) = \frac{1}{2\theta^2} olur. Sonuç olarak CRLB, 1/(n12θ2)=2θ2n1 / \left(n \cdot \frac{1}{2\theta^2}\right) = \frac{2\theta^2}{n} olarak hesaplanır.

Adım Adım Çözüm

1
Normal dağılımın olasılık yoğunluk fonksiyonunu yazıp doğal logaritmasını alma.
lnf(x;θ)=12ln(2π)12ln(θ)x22θ\ln f(x; \theta) = -\frac{1}{2}\ln(2\pi) - \frac{1}{2}\ln(\theta) - \frac{x^2}{2\theta}
Fisher bilgisi, olasılık yoğunluk fonksiyonunun logaritmasının (log-olabilirlik) türevlerine dayanır.
2
Log-olabilirlik fonksiyonunun θ\theta'ya göre birinci ve ikinci türevlerini alma.
Birinci türev: 12θ+x22θ2-\frac{1}{2\theta} + \frac{x^2}{2\theta^2}
İkinci türev: 12θ2x2θ3\frac{1}{2\theta^2} - \frac{x^2}{\theta^3}
Cramer-Rao alt sınırını hesaplamak için ikinci türevin beklenen değeri formülü kullanılır.
3
İkinci türevin beklenen değerini (E[X2]=θE[X^2] = \theta bilgisini kullanarak) hesaplama ve Fisher bilgisini (I(θ)I(\theta)) bulma.
E[12θ2X2θ3]=12θ2θθ3=12θ2E\left[\frac{1}{2\theta^2} - \frac{X^2}{\theta^3}\right] = \frac{1}{2\theta^2} - \frac{\theta}{\theta^3} = -\frac{1}{2\theta^2} olup, I(θ)=E[2θ2lnf(x;θ)]=12θ2I(\theta) = -E\left[ \frac{\partial^2}{\partial \theta^2} \ln f(x; \theta) \right] = \frac{1}{2\theta^2} elde edilir.
Tek bir gözlem için Fisher bilgisi, log-olabilirliğin ikinci türevinin beklenen değerinin eksi işaretlisidir.
4
nn çaplı örneklem için Cramer-Rao alt sınırını hesaplama.
CRLB=1nI(θ)=1n12θ2=2θ2nCRLB = \frac{1}{n \cdot I(\theta)} = \frac{1}{n \cdot \frac{1}{2\theta^2}} = \frac{2\theta^2}{n}
Yansız bir tahmin edicinin varyansının alt sınırı (CRLB), toplam Fisher bilgisinin tersine eşittir.

Anahtar Kavram

Cramer-Rao Eşitsizliği ve Fisher Bilgisi
Soru 10Soru

İstatistiksel çıkarım teorisinde, veri sıkıştırma (data reduction) prensibi gereği bir parametreye yönelik yeterli (sufficient) istatistiğin boyutunun örneklem hacmi nn'den bağımsız olması (sabit boyutlu olması) arzu edilen bir özelliktir. Pitman-Koopman-Darmois teoremine göre, tanım kümesi parametreye bağlı olmayan dağılımlar içinde yalnızca üstel aileye (exponential family) mensup olanlar bu özelliği sağlar. Ayrıca, tanım kümesi parametreye bağlı olan bazı özel dağılımlarda da sabit boyutlu yeterli istatistikler elde edilebilir.

Bir araştırmacı, X1,X2,,XnX_1, X_2, \dots, X_n bağımsız ve aynı dağılımlı rastgele örneklemleri için θ\theta parametresine ait yeterli istatistiği Neyman Çarpanlara Ayırma Teoremi'ni (Neyman Factorization Theorem) kullanarak belirlemek istemektedir.

Buna göre, aşağıda olasılık yoğunluk fonksiyonları verilen dağılımlardan hangisi için araştırmacı, boyutu örneklem hacmi nn'ye bağlı olarak artmayan (sabit boyutlu) bir yeterli istatistik bulamaz?

Cevabı ve açıklamayı göster

Cevap: f(x;θ)=12exθ,<x<,θRf(x; \theta) = \frac{1}{2} e^{-|x-\theta|}, \quad -\infty < x < \infty, \quad \theta \in \mathbb{R}

Cevap

Tanım kümesi parametreye bağlı olmayan ve üstel aile formunda yazılamayan Laplace (Çift Üstel) dağılımının (f(x;θ)=12exθf(x; \theta) = \frac{1}{2} e^{-|x-\theta|}), boyutu örneklem hacminden bağımsız bir yeterli istatistiği bulunamaz. Bu durum için minimal yeterli istatistik, sıra istatistiklerinin (order statistics) tamamıdır.
Çift üstel (Laplace) dağılımında, tanım kümesi θ\theta'dan bağımsız olmasına rağmen dağılım üstel (exponential) aileye ait değildir. Neyman Çarpanlara Ayırma Teoremi uygulandığında, olabilirlik fonksiyonu L(θ)=12nexp(i=1nxiθ)L(\theta) = \frac{1}{2^n} \exp(-\sum_{i=1}^n |x_i - \theta|) şeklini alır. Buradaki xiθ\sum |x_i - \theta| ifadesi, mutlak değerin parçalı doğrusal yapısı nedeniyle, θ\theta'nın ve verinin sabit boyutlu bir fonksiyonu (örneğin xi\sum x_i veya xi\prod x_i gibi) formunda sıkıştırılamaz. θ\theta'nın herhangi bir noktasında bu ifadenin değerini hesaplayabilmek için örneklemdeki tüm veri noktalarının konumunu (sıralamasını) bilmek gerekir. Dolayısıyla, bu dağılım için minimal yeterli istatistik tüm sıra istatistikleri vektörüdür (X(1),X(2),,X(n)X_{(1)}, X_{(2)}, \dots, X_{(n)}). Bu vektörün boyutu nn'dir ve örneklem hacmi büyüdükçe veri sıkıştırması sağlanamaz.

Adım Adım Çözüm

1
Seçeneklerdeki fonksiyonların olabilirlik (likelihood) fonksiyonlarını oluşturarak Neyman Çarpanlara Ayırma Teoremi'ni uygulamak.
Her bir dağılım için L(θ;x)=g(T(x)θ)h(x)L(\theta; \mathbf{x}) = g(T(\mathbf{x})|\theta) \cdot h(\mathbf{x}) ayrıştırması formüle edilir.
Sabit boyutlu yeterli istatistiğin varlığını kontrol etmenin teorik yolu olabilirlik fonksiyonunun nn'den bağımsız bir T(x)T(\mathbf{x}) üzerinden çarpanlara ayrılabilme durumunu incelemektir.
2
Tanım kümesi parametreye bağlı olmayan ve üstel aileye ait fonksiyonları incelemek.
B seçeneğindeki dağılım için L(θ)=θn(xi)θ1L(\theta) = \theta^n (\prod x_i)^{\theta-1}, C seçeneği için L(θ)=θnexp(xi/θ)L(\theta) = \theta^{-n} \exp(-\sum x_i / \theta) elde edilir. Sırasıyla Xi\prod X_i ve Xi\sum X_i boyutu 11 olan yeterli istatistiklerdir.
Üstel ailenin standart formu gereği, boyutu nn'den bağımsız (sabit boyutlu) yeterli istatistikler daima mevcuttur.
3
Tanım kümesi parametreye bağlı olan dağılımları, gösterge (indicator) fonksiyonları yardımıyla incelemek.
D seçeneği için L(θ)=exp(nθxi)I(x(1)>θ)L(\theta) = \exp(n\theta - \sum x_i) I(x_{(1)} > \theta) üzerinden X(1)X_{(1)}; E seçeneği için L(θ)=θnI(x(n)<θ)L(\theta) = \theta^{-n} I(x_{(n)} < \theta) üzerinden X(n)X_{(n)} boyutları 11 olan yeterli istatistikler olarak bulunur.
Tanım kümesinin parametreye bağlı olduğu durumlarda uç değerleri belirten sıra istatistikleri sabit boyutlu yeterli istatistik işlevi görür.
4
Laplace dağılımı için olabilirlik fonksiyonunu çarpanlarına ayırmayı denemek.
L(θ)=12nexp(i=1nxiθ)L(\theta) = \frac{1}{2^n} \exp(-\sum_{i=1}^n |x_i - \theta|) elde edilir. Toplam içindeki mutlak değer fonksiyonunun parçalı yapısı, ifadeyi θ\theta ve xix_i'lerin ayrışabilir, sabit boyutlu bir formuna dönüştürmeyi engeller.
xiθ\sum |x_i - \theta| fonksiyonunu θ\theta'nın herhangi bir değeri için tam olarak hesaplayabilmek adına tüm xix_i değerlerine (veya tüm sıra istatistiklerine) ihtiyaç vardır. Bu nedenle minimal yeterli istatistiğin boyutu nn'dir ve örneklem hacmiyle birlikte artar.

Anahtar Kavram

Neyman Çarpanlara Ayırma Teoremi ve Minimal Yeterli İstatistiğin Boyutluluğu
Soru 11Soru

İstatistiksel çıkarım sürecinde temel yapı taşları olan "parametre", "tahmin edici" (estimator) ve "tahmin" (estimate) kavramları ile bu kavramların matematiksel özellikleri hakkında aşağıda verilen ifadelerden hangisi kesinlikle yanlıştır?

Cevabı ve açıklamayı göster

Cevap: Bir parametreyi tahmin etmek amacıyla kullanılan herhangi bir T(X1,,Xn)T(X_1, \dots, X_n) tahmin edicisinin varyansı, her durumda Hata Kareler Ortalamasına (MSE) eşittir; çünkü örneklem verilerinden hesaplanan bir istatistik doğası gereği sistematik yanlılık (bias) içeremez.

Cevap

Bir tahmin edicisinin varyansının her durumda Hata Kareler Ortalamasına (MSE) eşit olduğunu ve istatistiklerin yanlılık içeremeyeceğini iddia eden ifade yanlıştır.
Doğru cevap olan ifade, tahmin edicilerin varyansı ile Hata Kareler Ortalamasını (MSE) birbirine eşitleyen ve istatistiklerin yanlılık (bias) içeremeyeceğini iddia eden seçenektir. Matematiksel istatistikte bir istatistik (ve dolayısıyla nokta tahmin edicisi), yalnızca örneklem verilerinin bir fonksiyonudur ve kuralı bilinmeyen parametreyi içermez. Ancak bu durum, onun yansız (unbiased) olmasını garanti etmez. Bir tahmin edicinin beklenen değeri ile gerçek parametre değeri arasındaki farka yan (bias) denir. Tahmin edicinin MSE'si, varyansı ile yan miktarının karesinin toplamına (MSE=Var(θ^)+Bias2MSE = Var(\hat{\theta}) + Bias^2) eşittir. Bu nedenle, ancak yansız tahmin ediciler için MSE varyansa eşittir; genel durumda istatistiklerin yan barındıramayacağı önermesi kesinlikle yanlıştır.

Adım Adım Çözüm

1
Tahmin edici (estimator) ve istatistik kavramlarının matematiksel tanımlarını hatırlayın.
İstatistik, sadece örneklem verilerinin bir fonksiyonudur ve bilinmeyen parametre içeremez.
Kavramsal sınırları netleştirmek.
2
İstatistiklerin yanlılık (bias) durumu ile Hata Kareler Ortalaması (MSE) formülünü gözden geçirin.
Bir istatistik yanlılık barındırabilir. MSE formülü şu şekildedir: MSE(θ^)=Var(θ^)+[Bias(θ^)]2MSE(\hat{\theta}) = Var(\hat{\theta}) + [Bias(\hat{\theta})]^2.
Varyans ile MSE arasındaki matematiksel ilişkiyi doğrulamak.
3
Seçeneklerde yer alan iddiaları, istatistik tanımı ve MSE özellikleri bağlamında değerlendirin.
Varyansın her zaman MSE'ye eşit olabilmesi için Bias=0Bias = 0 (yansızlık) olması gerekir; istatistiklerin doğası gereği yan barındıramayacağı tezi teorik olarak yanlıştır.
Yanlış olan önermeyi kesin olarak tespit etmek.

Anahtar Kavram

İstatistik, Nokta Tahmin Edici ve Hata Kareler Ortalaması (MSE) İlişkisi
Soru 12Soru

Bir araştırma merkezinde çalışan istatistikçi, kitle ortalaması olan μ\mu parametresini kestirmek için nn çaplı bağımsız ve aynı dağılımlı rastgele örneklem üzerinden iki farklı istatistik tanımlamıştır (n2n \ge 2). Kitle varyansının σ2\sigma^2 (sonlu ve sıfırdan farklı) olduğu bilinmektedir.

İstatistikçinin tanımladığı kestiriciler şunlardır:
I. μ^1=nn+2Xˉ\hat{\mu}_1 = \frac{n}{n+2} \bar{X}
II. μ^2=25X1+35Xn\hat{\mu}_2 = \frac{2}{5} X_1 + \frac{3}{5} X_n

Bu iki kestiricinin büyük örneklem özellikleri (asimptotik davranışları) ve yansızlık durumları dikkate alındığında, aşağıdaki değerlendirmelerden hangisi istatistiksel olarak kesinlikle doğrudur?

Cevabı ve açıklamayı göster

Cevap: μ^1\hat{\mu}_1 kestiricisi μ\mu için yanlı bir yapıya sahip olmakla birlikte tutarlılık şartını sağlar; μ^2\hat{\mu}_2 kestiricisi ise yansız olmasına karşın tutarlılık özelliğini göstermez.

Cevap

Doğru yanıt, ilk tahmin edicinin yanlı ama tutarlı, ikinci tahmin edicinin ise yansız ama tutarsız olduğunu belirten seçenektir.
İlk kestirici sonlu örneklemde yanlıdır ancak örneklem çapı sonsuza giderken hem taşıdığı yan miktarı hem de varyansı sıfıra asimptotik olarak yakınsar. Bu nedenle Hata Kareler Ortalaması (MSE) limit durumunda sıfır olur ve olasılıkta yakınsama sağlanarak tutarlılık elde edilir. İkinci kestirici ise gözlem değerlerinin sabit bir doğrusal kombinasyonu olduğundan yansızdır; ancak örneklem hacmi ne kadar büyürse büyüsün, içindeki gözlem sayısı sabit kaldığı için varyansı sabit kalır ve sıfıra gitmez. Dolayısıyla büyük örneklemlerde parametre üzerine yığılmaz ve tutarsızdır.

Adım Adım Çözüm

1
μ^1\hat{\mu}_1 kestiricisinin beklenen değerini hesaplayarak yansızlığını incelemek.
E(μ^1)=nn+2E(Xˉ)=nn+2μE(\hat{\mu}_1) = \frac{n}{n+2} E(\bar{X}) = \frac{n}{n+2} \mu bulunur. Beklenen değer μ\mu'ye eşit olmadığından μ^1\hat{\mu}_1 yanlıdır.
Bir kestiricinin beklenen değeri, kitle parametresine eşit değilse kestirici yanlı kabul edilir.
2
μ^1\hat{\mu}_1 kestiricisinin Hata Kareler Ortalaması'nın (MSE) limitini alarak tutarlılığını analiz etmek.
Yan miktarı 2μn+2-\frac{2\mu}{n+2} ve varyansı (nn+2)2σ2n\left(\frac{n}{n+2}\right)^2 \frac{\sigma^2}{n} olarak hesaplanır. nn \to \infty için hem yan miktarı hem de varyans sıfıra yakınsadığından MSE sıfıra gider ve μ^1\hat{\mu}_1 tutarlı olur.
Chebyshev eşitsizliği gereği, Hata Kareler Ortalaması asimptotik olarak sıfıra yakınsayan kestiriciler tutarlıdır.
3
μ^2\hat{\mu}_2 kestiricisinin beklenen değerini hesaplayarak yansızlığını incelemek.
E(μ^2)=25E(X1)+35E(Xn)=25μ+35μ=μE(\hat{\mu}_2) = \frac{2}{5} E(X_1) + \frac{3}{5} E(X_n) = \frac{2}{5}\mu + \frac{3}{5}\mu = \mu elde edilir. Bu durum μ^2\hat{\mu}_2'nin yansız olduğunu gösterir.
Doğrusal kombinasyonun katsayıları toplamı 1 olduğu için istatistiğin beklenen değeri kitle ortalamasına eşittir.
4
μ^2\hat{\mu}_2 kestiricisinin varyansının asimptotik durumunu analiz etmek.
Var(μ^2)=(25)2σ2+(35)2σ2=1325σ2Var(\hat{\mu}_2) = \left(\frac{2}{5}\right)^2 \sigma^2 + \left(\frac{3}{5}\right)^2 \sigma^2 = \frac{13}{25}\sigma^2 bulunur. Örneklem hacmi artsa bile varyans sıfıra yakınsamaz (sabit kalır). Bu sebeple μ^2\hat{\mu}_2 tutarsızdır.
Tutarlı bir kestiricinin sonsuz örneklemde varyansının sönümlenerek sıfıra çökmesi gerekir.

Anahtar Kavram

Yansızlık ve Tutarlılık Kavramlarının Ayrımı (Örneklem Ortalamasının Türevleri)
Soru 13Soru

Bir tarım araştırmasında, belirli bir buğday türünün hastalıklara karşı dayanıklılık süresi (ay cinsinden) XX rassal değişkeni ile modellenmektedir. XX'in olasılık yoğunluk fonksiyonu aşağıdaki gibidir:

f(x;θ)={3x2θ3e(xθ)3,x>00,dig˘er durumlarda f(x; \theta) = \begin{cases} \frac{3x^2}{\theta^3} e^{-\left(\frac{x}{\theta}\right)^3} & , x > 0 \\ 0 & , \text{diğer durumlarda} \end{cases}

Burada θ>0\theta > 0 bilinmeyen bir parametredir ve dağılımın tanım kümesi parametreye bağlı değildir. Lehmann-Scheffe teoremine göre, düzgün en küçük varyanslı yansız tahmin ediciyi (UMVUE) bulabilmek için tam (complete) ve yeterli bir istatistiğe ihtiyaç vardır.

Buna göre, dağılım tek parametreli üstel aile (exponential family) formunda ifade edildiğinde, dağılımın doğal (kanonik) parametresi ve θ\theta için tam ve yeterli istatistiği aşağıdakilerin hangisinde birlikte doğru verilmiştir?

Cevabı ve açıklamayı göster

Cevap: Doğal parametre: 1θ3-\frac{1}{\theta^3} , Tam ve yeterli istatistik: i=1nXi3\sum_{i=1}^{n} X_i^3

Cevap

Doğal parametrenin 1θ3-\frac{1}{\theta^3} ve tam/yeterli istatistiğin i=1nXi3\sum_{i=1}^{n} X_i^3 olduğu seçenek doğru cevaptır.
Verilen dağılımı üstel aile genel formuna (f(x;θ)=h(x)c(θ)exp(w(θ)t(x))f(x; \theta) = h(x)c(\theta)\exp(w(\theta)t(x))) dönüştürdüğümüzde, ifade f(x;θ)=3x2θ3exp(1θ3x3)f(x; \theta) = 3x^2 \cdot \theta^{-3} \cdot \exp\left(-\frac{1}{\theta^3} x^3\right) şeklini alır. Buradan doğal (kanonik) parametrenin w(θ)=1θ3w(\theta) = -\frac{1}{\theta^3} ve birim istatistiğin t(x)=x3t(x) = x^3 olduğu açıkça görülür. Rastgele bir örneklem için yeterli istatistik, birim istatistiklerin toplamı olan i=1nXi3\sum_{i=1}^n X_i^3 olur. Kanonik parametre uzayı (,0)(-\infty, 0) açık bir aralık barındırdığı için, tamlık (completeness) teoremi gereği bu yeterli istatistik aynı zamanda tamdır.

Adım Adım Çözüm

1
Dağılım fonksiyonunu standart üstel aile formatına dönüştürmek.
f(x;θ)=3x21θ3exp(1θ3x3)f(x; \theta) = 3x^2 \cdot \frac{1}{\theta^3} \cdot \exp\left(-\frac{1}{\theta^3}x^3\right)
Üstel ailenin kanonik (doğal) parametresini ve istatistiğini belirleyebilmek için uygun matematiksel formülasyon gereklidir.
2
Üstel aile bileşenlerini eşleştirerek doğal parametreyi ve birim istatistiği belirlemek.
Genel form f(x;θ)=h(x)c(θ)exp(w(θ)t(x))f(x; \theta) = h(x)c(\theta)\exp(w(\theta)t(x)) ile karşılaştırıldığında, doğal parametre w(θ)=1θ3w(\theta) = -\frac{1}{\theta^3} ve birim istatistik t(x)=x3t(x) = x^3 olarak bulunur.
Neyman çarpanlara ayırma teoremine göre istatistiği (t(x)t(x)) ve kanonik parametreyi (w(θ)w(\theta)) tespit etmek için bileşenler ayrıştırılmalıdır.
3
nn çaplı örneklem için ortak yoğunluk fonksiyonunu değerlendirerek yeterli istatistiği bulmak.
Ortak yoğunluk fonksiyonundaki üstel terim exp(1θ3i=1nXi3)\exp\left(-\frac{1}{\theta^3} \sum_{i=1}^n X_i^3\right) olur. Bu durumda yeterli istatistik i=1nXi3\sum_{i=1}^n X_i^3'tür.
Örneklemdeki tüm bağımsız gözlemlerin birleşik bilgisi, birim istatistiklerin toplamı üzerinden ifade edilir.
4
Parametre uzayının tamlık (completeness) koşulunu sağladığını teorik olarak doğrulamak.
Doğal parametre η=1/θ3\eta = -1/\theta^3 için θ>0\theta > 0 olduğundan, parametre uzayı (,0)(-\infty, 0) açık aralığını oluşturur.
Düzenli üstel ailelerde doğal parametre uzayının açık bir aralık içermesi, yeterli istatistiğin aynı zamanda tam (complete) olduğunu garanti eder.

Anahtar Kavram

Üstel Ailelerde Tamlık ve Yeterlilik
Soru 14Soru

X1,X2,,XnX_1, X_2, \dots, X_n beklenen değeri μ\mu ve varyansı σ2\sigma^2 olan normal dağılımdan çekilmiş nn çaplı rastgele bir örneklem olsun. Kitle varyansı σ2\sigma^2 için en çok olabilirlik tahmin edicisi (MLE) olan σ^2=1ni=1n(XiXˉ)2\hat{\sigma}^2 = \frac{1}{n}\sum_{i=1}^n (X_i - \bar{X})^2 istatistiği veriliyor.

Buna göre, σ^2\hat{\sigma}^2 tahmin edicisinin hata kareler ortalaması (MSE) aşağıdakilerden hangisidir?

Cevabı ve açıklamayı göster

Cevap: 2n1n2σ4\frac{2n-1}{n^2}\sigma^4

Cevap

Hata Kareler Ortalaması (MSE), varyans ve yan karesinin toplamı olan 2n1n2σ4\frac{2n-1}{n^2}\sigma^4 ifadesine eşittir.
Hata Kareler Ortalaması (MSE), tahmin edicinin varyansı ile yan miktarının (bias) karesinin toplamı olarak tanımlanır: MSE(θ^)=Var(θ^)+[Bias(θ^)]2MSE(\hat{\theta}) = Var(\hat{\theta}) + [Bias(\hat{\theta})]^2. Verilen en çok olabilirlik tahmin edicisinin varyansı 2(n1)n2σ4\frac{2(n-1)}{n^2}\sigma^4 ve yan miktarı 1nσ2-\frac{1}{n}\sigma^2'dir. Bu iki değer formülde yerine konulup toplandığında 2n2+1n2σ4=2n1n2σ4\frac{2n-2+1}{n^2}\sigma^4 = \frac{2n-1}{n^2}\sigma^4 sonucuna ulaşılır.

Adım Adım Çözüm

1
Tahmin edicinin içinde yer alan toplam istatistiğinin dağılımını belirle.
i=1n(XiXˉ)2σ2χn12\frac{\sum_{i=1}^n (X_i - \bar{X})^2}{\sigma^2} \sim \chi^2_{n-1} dağılımına sahiptir.
Beklenen değer ve varyans hesaplamalarını yapabilmek için ilgili ki-kare dağılımının özelliklerini (Beklenen değer = n-1, Varyans = 2(n-1)) kullanmak gereklidir.
2
Tahmin edicinin beklenen değerini bularak yan (bias) miktarını hesapla.
E[σ^2]=E[σ2nχn12]=σ2n(n1)E[\hat{\sigma}^2] = E[\frac{\sigma^2}{n} \chi^2_{n-1}] = \frac{\sigma^2}{n}(n-1). Yan (Bias) = E[σ^2]σ2=σ2(n1n1)=1nσ2E[\hat{\sigma}^2] - \sigma^2 = \sigma^2(\frac{n-1}{n} - 1) = -\frac{1}{n}\sigma^2 bulunur.
MSE formülünde yer alan Bias² bileşenini elde etmek için yan miktarının bulunması zorunludur.
3
Tahmin edicinin varyansını hesapla.
Var(σ^2)=Var(σ2nχn12)=σ4n2Var(χn12)=σ4n2[2(n1)]=2(n1)n2σ4Var(\hat{\sigma}^2) = Var(\frac{\sigma^2}{n} \chi^2_{n-1}) = \frac{\sigma^4}{n^2} Var(\chi^2_{n-1}) = \frac{\sigma^4}{n^2} [2(n-1)] = \frac{2(n-1)}{n^2}\sigma^4 bulunur.
MSE formülündeki diğer ana bileşen olan varyans değerini elde etmek için.
4
Varyans ve yan miktarının karesini toplayarak MSE'yi elde et.
MSE(σ^2)=Var(σ^2)+[Bias(σ^2)]2=2(n1)n2σ4+(1nσ2)2=2n2n2σ4+1n2σ4=2n1n2σ4MSE(\hat{\sigma}^2) = Var(\hat{\sigma}^2) + [Bias(\hat{\sigma}^2)]^2 = \frac{2(n-1)}{n^2}\sigma^4 + (-\frac{1}{n}\sigma^2)^2 = \frac{2n-2}{n^2}\sigma^4 + \frac{1}{n^2}\sigma^4 = \frac{2n-1}{n^2}\sigma^4.
Hata Kareler Ortalamasının (MSE) matematiksel tanımını tamamlamak için.

Anahtar Kavram

Hata Kareler Ortalamasının (MSE) varyans ve yan (bias) bileşenlerine ayrıştırılması ve Ki-Kare dağılımı özellikleri.
Tahmini Süre:2m 30s
Soru 15Soru

Bir kalite kontrol sürecinde incelenen bir ürünün belirli bir fiziksel ölçüm değeri, ortalaması θ\theta ve varyansı θ2\theta^2 olan normal dağılıma uymaktadır (θ>0\theta > 0). Bu üründen bağımsız olarak rastgele seçilen nn adet gözlem X1,X2,,XnX_1, X_2, \dots, X_n ile gösterilmektedir.

Neyman Çarpanlara Ayırma Teoremi (Neyman Factorization Theorem) dikkate alındığında, bilinmeyen θ\theta parametresi için (minimal) yeterli istatistik aşağıdakilerden hangisidir?

Cevabı ve açıklamayı göster

Cevap: (i=1nXi,i=1nXi2)\left( \sum_{i=1}^n X_i, \sum_{i=1}^n X_i^2 \right)

Cevap

Doğru yanıt, hem doğrusal toplamı hem de kareler toplamını içeren iki boyutlu vektördür.
Neyman Çarpanlara Ayırma Teoremi uygulandığında, olabilirlik fonksiyonu g(T(x);θ)g(T(\mathbf{x}); \theta) ve h(x)h(\mathbf{x}) olarak ikiye ayrılır. Üstel terimin açılımında (xiθ)2=xi22θxi+θ2(x_i - \theta)^2 = x_i^2 - 2\theta x_i + \theta^2 ifadesi yer aldığından, θ\theta'nın üs içerisindeki katsayıları hem Xi\sum X_i hem de Xi2\sum X_i^2 istatistikleriyle çarpım durumundadır. gg fonksiyonu örnekleme sadece bu iki bileşen üzerinden bağlıdır ve bu iki bileşen birleştirilip tek bir istatistiğe indirgenemez. Dolayısıyla, θ\theta için minimal yeterli istatistik iki boyutlu vektördür.

Adım Adım Çözüm

1
Verilen dağılım için ortak olasılık yoğunluk (olabilirlik) fonksiyonunu yazın.
L(θ;x)=i=1n12πθexp((xiθ)22θ2)L(\theta; \mathbf{x}) = \prod_{i=1}^n \frac{1}{\sqrt{2\pi}\theta} \exp\left(-\frac{(x_i - \theta)^2}{2\theta^2}\right)
Neyman Çarpanlara Ayırma Teoremi'ni uygulayabilmek için öncelikle tüm örneklemin ortak dağılım fonksiyonunun kurulması gerekir.
2
Çarpım operatörünü uygulayarak üstel fonksiyon içindeki tam kare ifadeyi açın.
L(θ;x)=(2π)n/2θnexp(12θ2i=1n(xi22θxi+θ2))L(\theta; \mathbf{x}) = (2\pi)^{-n/2} \theta^{-n} \exp\left(-\frac{1}{2\theta^2} \sum_{i=1}^n (x_i^2 - 2\theta x_i + \theta^2)\right)
Üstel ifade içerisindeki toplamın terimlerini ayırmak, örnekleme ait (gözlemlenen) kısımlar ile θ\theta parametresini birbirinden ayırabilmek için kritik bir adımdır.
3
Toplam sembolünü dağıtarak ifadeyi sadeleştirin ve θ\theta'ya bağlı terimleri gruplayın.
L(θ;x)=(2π)n/2θnexp(i=1nxi22θ2+i=1nxiθn2)L(\theta; \mathbf{x}) = (2\pi)^{-n/2} \theta^{-n} \exp\left( -\frac{\sum_{i=1}^n x_i^2}{2\theta^2} + \frac{\sum_{i=1}^n x_i}{\theta} - \frac{n}{2} \right)
Toplama işleminin ayrıştırılması sonucunda gözlemlerin hangi istatistiksel fonksiyonlar üzerinden parametreye bağlandığı açıkça ortaya çıkar.
4
Elde edilen ifadeyi Neyman Çarpanlara Ayırma Teoremi formatına (L(θ;x)=g(T(x);θ)h(x)L(\theta; \mathbf{x}) = g(T(\mathbf{x}); \theta) \cdot h(\mathbf{x})) getirin.
L(θ;x)=[θnen/2exp(xi22θ2+xiθ)]g(T(x);θ)(2π)n/2h(x)L(\theta; \mathbf{x}) = \underbrace{\left[ \theta^{-n} e^{-n/2} \exp\left( -\frac{\sum x_i^2}{2\theta^2} + \frac{\sum x_i}{\theta} \right) \right]}_{g(T(\mathbf{x}); \theta)} \cdot \underbrace{(2\pi)^{-n/2}}_{h(\mathbf{x})}
Teoreme göre, gözlemlere sadece T(x)T(\mathbf{x}) istatistiği aracılığıyla bağlı olan gg fonksiyonu belirlendiğinde, T(x)T(\mathbf{x}) yeterli istatistik kabul edilir.
5
gg fonksiyonu içindeki parametre bağımlılıklarını inceleyerek yeterli istatistiği tanımlayın.
g()g(\cdot) fonksiyonu θ\theta'ya hem xi2\sum x_i^2 hem de xi\sum x_i terimleri üzerinden bağlıdır. Bu nedenle tek parametre olsa dahi yeterli istatistik T(X)=(Xi,Xi2)T(\mathbf{X}) = \left( \sum X_i, \sum X_i^2 \right) olur.
Her iki toplam bileşeni de farklı parametrik fonksiyonlarla (1/(2θ2)-1/(2\theta^2) ve 1/θ1/\theta) çarpıldığından, birbirinden bağımsızdırlar ve daha düşük bir boyuta indirgenemezler.

Anahtar Kavram

Eğri Üstel Ailelerde Yeterli İstatistik (Sufficient Statistics in Curved Exponential Families)

Alternatif Yöntem

Dağılımın kütle fonksiyonunu Çok Parametreli Üstel Aile (Multiparameter Exponential Family) standart formuna dönüştürerek, c(θ)exp(j=1kwj(θ)tj(x))c(\theta)\exp\left(\sum_{j=1}^k w_j(\theta) t_j(x)\right) yapısındaki doğal istatistikleri tj(x)t_j(x) doğrudan okuma yöntemi de aynı sonucu net bir şekilde verecektir.
Tahmini Süre:3m 0s
Soru 16Soru

Bir araştırmacı, ortalaması μ\mu ve varyansı σ2\sigma^2 olan normal dağılıma sahip bir kitleden alınan nn çaplı (n>2n > 2) bir X1,X2,,XnX_1, X_2, \dots, X_n rastgele örneklemini incelemektedir. Bu istatistiksel modelde μ\mu ve σ2\sigma^2 parametrelerinin her ikisi de bilinmemektedir.

Araştırmacı, kitle varyansı σ2\sigma^2'yi tahmin etmek amacıyla aşağıdaki dört farklı fonksiyonu önermiştir:

T1=1ni=1n(XiXˉ)2\cdot \quad T_1 = \frac{1}{n} \sum_{i=1}^n (X_i - \bar{X})^2
T2=1ni=1n(Xiμ)2\cdot \quad T_2 = \frac{1}{n} \sum_{i=1}^n (X_i - \mu)^2
T3=π\cdot \quad T_3 = \pi
T4=X12+Xn2\cdot \quad T_4 = X_1^2 + X_n^2

İstatistiksel çıkarım sürecindeki "parametre", "istatistik" (statistic), "nokta tahmin edicisi" (estimator) ve "tahmin" (estimate) kavramlarının teorik tanımları dikkate alındığında, bu fonksiyonlar hakkında aşağıdakilerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: T1T_1, T3T_3 ve T4T_4 gözlemlenebilir değişkenlerin veya sabitlerin bilinen fonksiyonları olduklarından birer istatistiktir ve teorik olarak birer tahmin edici olabilirler; ancak μ\mu bilinmediği için T2T_2 fonksiyonu bir istatistik değildir ve veriden hesaplanamaz.

Cevap

İstatistik kavramının en temel şartı olan 'bilinmeyen parametre içermeme' kuralını sadece T1, T3 ve T4 fonksiyonları sağladığı, T2 ise bilinmeyen kitle ortalamasını barındırdığı için bir istatistik olmadığı yönündeki ifade doğrudur.
İstatistiksel çıkarımda bir tahmin edici (estimator), gözlemlenebilir rastgele değişkenlerin bir fonksiyonu olan 'istatistik' (statistic) olmak zorundadır. Bir fonksiyonun istatistik sayılabilmesi için formülünde hiçbir bilinmeyen kitle parametresinin bulunmaması gerekir. T2T_2 formülü, bilinmeyen μ\mu parametresini içerdiğinden spesifik bir örneklem üzerinden hesaplanarak sayısal bir 'tahmin' (estimate) değeri üretemez. Diğer tüm fonksiyonlar (T1T_1, T3T_3, T4T_4) bilinmeyen parametre içermediğinden matematiksel olarak istatistik tanımını sağlarlar.

Adım Adım Çözüm

1
Matematiksel istatistikte 'istatistik' (statistic) tanımını hatırla.
İstatistik, örneklem verisinin (ve sabitlerin) T(X1,,Xn)T(X_1, \dots, X_n) şeklinde bir fonksiyonudur ve formülünde kitleye ait hiçbir bilinmeyen parametre bulunamaz.
Bir fonksiyonun nokta tahmin edicisi olabilmesi ve veriden sayısal bir 'tahmin' değeri üretebilmesi için hesaplanabilir olması zorunludur.
2
T1=1n(XiXˉ)2T_1 = \frac{1}{n} \sum (X_i - \bar{X})^2 fonksiyonunu incele.
Sadece gözlemlenen XiX_i değerlerini ve onlardan hesaplanan Xˉ\bar{X}'i içerir. Bilinmeyen parametre yoktur. Geçerli bir istatistiktir.
Tanıma tamamen uyar.
3
T2=1n(Xiμ)2T_2 = \frac{1}{n} \sum (X_i - \mu)^2 fonksiyonunu incele.
Soru metninde μ\mu'nün bilinmediği belirtilmiştir. Formül bilinmeyen μ\mu parametresini içerdiği için veriden sayısal olarak hesaplanamaz. İstatistik değildir.
Bilinmeyen kitle parametresini barındıran fonksiyonlar tahmin edici olamaz.
4
T3=πT_3 = \pi ve T4=X12+Xn2T_4 = X_1^2 + X_n^2 fonksiyonlarını incele.
T3T_3 sadece bir sabittir, T4T_4 ise verinin belirli parçalarını kullanır. Her ikisinde de bilinmeyen parametre yoktur. Geçerli istatistiklerdir.
Bir fonksiyonun istatistik olması için iyi/mantıklı bir tahmin edici olması gerekmez. Sadece hesaplanabilir olması yeterlidir.

Anahtar Kavram

İstatistik, Tahmin Edici ve Tahmin Arasındaki Teorik Farklar
Soru 17Soru

X1,X2,,XnX_1, X_2, \dots, X_n (n>1n > 1) bağımsız ve aynı dağılıma sahip, bilinen σ2\sigma^2 varyanslı ve bilinmeyen μ\mu ortalamalı normal dağılımdan (N(μ,σ2)N(\mu, \sigma^2)) alınan bir rastgele örneklem olsun.

μ3\mu^3 parametresini tahmin etmek amacıyla, başlangıç tahmin edicisi olarak θ^=X133X1σ2\hat{\theta} = X_1^3 - 3X_1\sigma^2 yansız tahmin edicisi öneriliyor.

μ\mu parametresi için yeterli istatistik T=XˉT = \bar{X} (örneklem ortalaması) olduğuna göre, θ^\hat{\theta} tahmin edicisine Rao-Blackwell teoremi uygulanarak elde edilen iyileştirilmiş yansız tahmin edici θ^RB\hat{\theta}_{RB} aşağıdakilerden hangisidir?

Cevabı ve açıklamayı göster

Cevap: Xˉ33σ2nXˉ\bar{X}^3 - \frac{3\sigma^2}{n}\bar{X}

Cevap

Xˉ33σ2nXˉ\bar{X}^3 - \frac{3\sigma^2}{n}\bar{X} ifadesi Rao-Blackwell teoremi kullanılarak elde edilen iyileştirilmiş yansız tahmin edicidir.
Rao-Blackwell teoremine göre aranan tahmin edici E[X133X1σ2Xˉ]E[X_1^3 - 3X_1\sigma^2 | \bar{X}] koşullu beklenen değeridir. T=XˉT = \bar{X} tam (complete) ve yeterli (sufficient) bir istatistik olduğu için, Lehmann-Scheffe teoremi gereği TT'nin yansız olan herhangi bir fonksiyonu UMVUE'dir ve doğrudan Rao-Blackwell sonucuna eşittir. Xˉ\bar{X}'in dağılımı N(μ,σ2/n)N(\mu, \sigma^2/n) olduğundan, 3. momenti E[Xˉ3]=μ3+3μ(σ2/n)E[\bar{X}^3] = \mu^3 + 3\mu(\sigma^2/n) olarak hesaplanır. Buradan μ3\mu^3 yalnız bırakıldığında, yansız tahmin edicinin Xˉ33σ2nXˉ\bar{X}^3 - \frac{3\sigma^2}{n}\bar{X} olduğu görülür.

Adım Adım Çözüm

1
Rao-Blackwell teoreminin prensibini ve yeterli istatistiğin özelliklerini belirleme.
Normal dağılım üstel aileden olduğu için T=XˉT = \bar{X} istatistiği tam (complete) ve yeterlidir.
Lehmann-Scheffe teoremine göre, tam ve yeterli istatistiğin bir fonksiyonu olan yansız tahmin edici eşsizdir ve Rao-Blackwell tahmin edicisine (UMVUE) eşittir.
2
T=XˉT = \bar{X} istatistiğinin dağılımını yazma.
XˉN(μ,σ2/n)\bar{X} \sim N(\mu, \sigma^2/n) dağılımına sahiptir.
Yeterli istatistiğin momentlerini kullanarak yansız bir fonksiyon bulmak için dağılım gereklidir.
3
Xˉ3\bar{X}^3 ifadesinin beklenen değerini hesaplama.
Normal dağılımın moment üreten fonksiyonundan E[Xˉ3]=μ3+3μVar(Xˉ)=μ3+3μ(σ2n)E[\bar{X}^3] = \mu^3 + 3\mu Var(\bar{X}) = \mu^3 + 3\mu\left(\frac{\sigma^2}{n}\right) bulunur.
μ3\mu^3 için yansız bir tahmin edici oluşturmak amacıyla beklenen değer formülünden parametreyi yalnız bırakmalıyız.
4
Denklemden μ3\mu^3 ifadesini çekerek yansız tahmin ediciyi oluşturma.
μ3=E[Xˉ3]3σ2nE[Xˉ]=E[Xˉ33σ2nXˉ]\mu^3 = E[\bar{X}^3] - \frac{3\sigma^2}{n}E[\bar{X}] = E\left[\bar{X}^3 - \frac{3\sigma^2}{n}\bar{X}\right] elde edilir.
Beklenen değerin doğrusallık özelliğinden faydalanılarak, içerdeki ifadenin μ3\mu^3 için yansız olduğu kanıtlanır.

Anahtar Kavram

Rao-Blackwell Teoremi ve Lehmann-Scheffe Teoremi

Alternatif Yöntem

Koşullu beklenen değerin doğrudan hesaplanması yoluyla da sonuca ulaşılabilir. X1X_1 ve Xˉ\bar{X} ortak normal dağılıma sahiptir. Koşullu dağılım teorisinden X1XˉN(Xˉ,n1nσ2)X_1 | \bar{X} \sim N(\bar{X}, \frac{n-1}{n}\sigma^2) elde edilir. Aranan değer E[X133X1σ2Xˉ]=E[X13Xˉ]3σ2E[X1Xˉ]E[X_1^3 - 3X_1\sigma^2 | \bar{X}] = E[X_1^3 | \bar{X}] - 3\sigma^2E[X_1 | \bar{X}] ifadesidir. Normal dağılımın 3. momentinden E[X13Xˉ]=Xˉ3+3Xˉn1nσ2E[X_1^3 | \bar{X}] = \bar{X}^3 + 3\bar{X}\frac{n-1}{n}\sigma^2 bulunur. İfade yerine konup düzenlendiğinde Xˉ33σ2nXˉ\bar{X}^3 - \frac{3\sigma^2}{n}\bar{X} sonucuna varılır.
Tahmini Süre:3m 0s
Soru 18Soru

Bir fabrikada rastgele seçilen 3 günlük hatalı ürün sayıları X1,X2X_1, X_2 ve X3X_3 olup, bu rastgele değişkenler birbirinden bağımsız ve λ\lambda parametreli Poisson dağılımına sahiptir. λ\lambda parametresini tahmin etmek için aşağıdaki iki yansız tahmin edici önerilmiştir:

T1=X1+X2+X33T_1 = \frac{X_1 + X_2 + X_3}{3}
T2=X1+2X2+X34T_2 = \frac{X_1 + 2X_2 + X_3}{4}

Buna göre, T1T_1 tahmin edicisinin Cramer-Rao alt sınırına göre mutlak etkinliği (e(T1)e(T_1)) ve T1T_1'in T2T_2'ye göre göreli etkinliği (RE(T1,T2)RE(T_1, T_2)) sırasıyla aşağıdakilerden hangisinde doğru verilmiştir?

*(Not: Göreli etkinlik hesaplamasında RE(T1,T2)=Var(T2)Var(T1)RE(T_1, T_2) = \frac{Var(T_2)}{Var(T_1)} eşitliğini kullanınız.)*

Cevabı ve açıklamayı göster

Cevap: e(T1)=1;RE(T1,T2)=98e(T_1) = 1 \quad ; \quad RE(T_1, T_2) = \frac{9}{8}

Cevap

Mutlak etkinlik e(T1)=1e(T_1) = 1 ve göreli etkinlik RE(T1,T2)=98RE(T_1, T_2) = \frac{9}{8} değerlerini içeren seçenektir.
Poisson dağılımı için örneklem ortalaması (T1T_1) tam etkin bir tahmin edicidir, Cramer-Rao alt sınırı ile aynı varyansa (λ/3\lambda/3) sahiptir; bu yüzden mutlak etkinliği 1'dir. T2T_2 tahmin edicisinin varyansı 3λ8\frac{3\lambda}{8} olduğundan, T1T_1'in T2T_2'ye göre göreli etkinliği 3λ/8λ/3=98\frac{3\lambda/8}{\lambda/3} = \frac{9}{8} olmaktadır.

Adım Adım Çözüm

1
XPoisson(λ)X \sim Poisson(\lambda) için E(X)=λE(X) = \lambda ve Var(X)=λVar(X) = \lambda olduğunu belirleyerek tahmin edicilerin varyanslarını hesaplayın.
Var(T1)=19(Var(X1)+Var(X2)+Var(X3))=3λ9=λ3Var(T_1) = \frac{1}{9}(Var(X_1) + Var(X_2) + Var(X_3)) = \frac{3\lambda}{9} = \frac{\lambda}{3}.
Var(T2)=116(Var(X1)+22Var(X2)+Var(X3))=λ+4λ+λ16=6λ16=3λ8Var(T_2) = \frac{1}{16}(Var(X_1) + 2^2 Var(X_2) + Var(X_3)) = \frac{\lambda + 4\lambda + \lambda}{16} = \frac{6\lambda}{16} = \frac{3\lambda}{8}.
Etkinlik hesaplamaları doğrudan tahmin edicilerin varyanslarına dayanmaktadır.
2
Poisson dağılımı için n=3n=3 birimlik örneklemde Cramer-Rao alt sınırını (CRLB) hesaplayın.
Tek bir gözlem için Fisher Bilgisi I(λ)=1λI(\lambda) = \frac{1}{\lambda}'dır. n=3n=3 için In(λ)=3λI_n(\lambda) = \frac{3}{\lambda} olur. Cramer-Rao Alt Sınırı = 1In(λ)=λ3\frac{1}{I_n(\lambda)} = \frac{\lambda}{3}.
Mutlak etkinlik, Cramer-Rao alt sınırının tahmin edicinin varyansına oranı ile bulunur.
3
T1T_1'in mutlak etkinliğini (e(T1)e(T_1)) bulun.
e(T1)=CRLBVar(T1)=λ/3λ/3=1e(T_1) = \frac{CRLB}{Var(T_1)} = \frac{\lambda/3}{\lambda/3} = 1. (T1T_1 en etkin tahmin edicidir).
Mutlak etkinlik formülünün uygulanması gerekmektedir.
4
T1T_1'in T2T_2'ye göre göreli etkinliğini (RE(T1,T2)RE(T_1, T_2)) hesaplayın.
RE(T1,T2)=Var(T2)Var(T1)=3λ/8λ/3=38×31=98RE(T_1, T_2) = \frac{Var(T_2)}{Var(T_1)} = \frac{3\lambda / 8}{\lambda / 3} = \frac{3}{8} \times \frac{3}{1} = \frac{9}{8}.
Göreli etkinlik soruda verilen kurala uygun olarak varyansların oranıyla elde edilir.

Anahtar Kavram

Tahmin Edicilerin Etkinliği ve Varyans Karşılaştırması
Soru 19Soru

X1,X2,,XnX_1, X_2, \dots, X_n bağımsız ve aynı dağılımlı, (0,θ)(0, \theta) aralığında sürekli düzgün (uniform) dağılıma sahip rastgele örneklem olsun. θ\theta parametresinin tahmini için, örneklem maksimumu X(n)=max(X1,X2,,Xn)X_{(n)} = \max(X_1, X_2, \dots, X_n) olmak üzere θ^c=cX(n)\hat{\theta}_c = c \cdot X_{(n)} biçiminde bir tahmin edici sınıfı tanımlanmıştır (c>0c > 0 bir sabit).

Buna göre, Hata Kareler Ortalamasını (MSE) minimum yapan optimal cc değeri için elde edilen minimum MSE değeri aşağıdakilerden hangisidir?

Cevabı ve açıklamayı göster

Cevap: θ2(n+1)2\frac{\theta^2}{(n+1)^2}

Cevap

Hata Kareler Ortalamasını (MSE) minimum yapan değer θ2(n+1)2\frac{\theta^2}{(n+1)^2} formülü ile elde edilir.
Hata Kareler Ortalaması (MSE) hesaplanırken MSE(θ^c)=E[(cX(n)θ)2]MSE(\hat{\theta}_c) = E[(c X_{(n)} - \theta)^2] fonksiyonu oluşturulur. Bu fonksiyonun cc'ye göre türevi alınıp sıfıra eşitlendiğinde MSE'yi minimum yapan katsayının c=n+2n+1c = \frac{n+2}{n+1} olduğu bulunur. Bu optimal katsayı ana denklemde yerine konulduğunda, varyans ile yanlılığın karesinin toplamı en aza iner ve minimum MSE değeri olan θ2(n+1)2\frac{\theta^2}{(n+1)^2} elde edilir.

Adım Adım Çözüm

1
X(n)X_{(n)} istatistiğinin birinci ve ikinci momentlerini belirle.
E[X(n)]=nn+1θE[X_{(n)}] = \frac{n}{n+1}\theta ve E[X(n)2]=nn+2θ2E[X_{(n)}^2] = \frac{n}{n+2}\theta^2
MSE hesabında kullanılacak beklenen değer ve varyans bileşenleri için momentlere ihtiyaç vardır.
2
θ^c=cX(n)\hat{\theta}_c = cX_{(n)} için Hata Kareler Ortalaması (MSE) fonksiyonunu cc'ye bağlı olarak yaz.
MSE(θ^c)=E[(cX(n)θ)2]=c2E[X(n)2]2cθE[X(n)]+θ2=θ2(c2nn+22cnn+1+1)MSE(\hat{\theta}_c) = E[(cX_{(n)} - \theta)^2] = c^2 E[X_{(n)}^2] - 2c\theta E[X_{(n)}] + \theta^2 = \theta^2 \left( c^2 \frac{n}{n+2} - 2c \frac{n}{n+1} + 1 \right)
Optimal cc değerini bulabilmek için MSE'nin bir fonksiyon olarak ifade edilmesi gerekir.
3
MSE fonksiyonunun cc'ye göre türevini alarak sıfıra eşitle ve optimal cc değerini bul.
ddcMSE=θ2(2cnn+22nn+1)=0    c=n+2n+1\frac{d}{dc} MSE = \theta^2 \left( 2c \frac{n}{n+2} - 2 \frac{n}{n+1} \right) = 0 \implies c = \frac{n+2}{n+1}
Bir fonksiyonun minimum noktası, birinci türevinin sıfır olduğu noktadır.
4
Bulunan optimal c=n+2n+1c = \frac{n+2}{n+1} değerini MSE fonksiyonunda yerine koy.
MSEmin=θ2((n+2n+1)2nn+22(n+2n+1)nn+1+1)=θ2(n(n+2)(n+1)22n(n+2)(n+1)2+1)MSE_{min} = \theta^2 \left( \left(\frac{n+2}{n+1}\right)^2 \frac{n}{n+2} - 2\left(\frac{n+2}{n+1}\right) \frac{n}{n+1} + 1 \right) = \theta^2 \left( \frac{n(n+2)}{(n+1)^2} - \frac{2n(n+2)}{(n+1)^2} + 1 \right)
Soruda istenen değer minimum MSE değerinin kendisidir.
5
İfadeyi cebirsel olarak basitleştir.
MSEmin=θ2(1n(n+2)(n+1)2)=θ2(n2+2n+1n22n(n+1)2)=θ2(n+1)2MSE_{min} = \theta^2 \left( 1 - \frac{n(n+2)}{(n+1)^2} \right) = \theta^2 \left( \frac{n^2+2n+1 - n^2-2n}{(n+1)^2} \right) = \frac{\theta^2}{(n+1)^2}
Seçeneklerdeki nihai formata ulaşmak için ortak payda işlemi yapılır.

Anahtar Kavram

Hata Kareler Ortalamasının (MSE) varyans ve yan (bias) dengesi üzerinden optimizasyonu
Soru 20Soru

X1,X2,,XnX_1, X_2, \dots, X_n, parametresi λ>0\lambda > 0 olan Poisson dağılımından alınmış nn (n>1n>1) hacimli rastgele bir örneklem olsun.

Buna göre, kitleden rassal olarak seçilen bir birimin sıfır değerini alma olasılığı olan P(X=0)=eλP(X = 0) = e^{-\lambda} parametrik fonksiyonunun Düzgün En Küçük Varyanslı Yansız Tahmin Edicisi (UMVUE) aşağıdakilerden hangisidir?

Cevabı ve açıklamayı göster

Cevap: (n1n)i=1nXi\left( \frac{n-1}{n} \right)^{\sum_{i=1}^n X_i}

Cevap

eλe^{-\lambda} için Düzgün En Küçük Varyanslı Yansız Tahmin Edici (UMVUE) (n1n)i=1nXi\left( \frac{n-1}{n} \right)^{\sum_{i=1}^n X_i} ifadesidir.
Lehmann-Scheffe teoremine göre, bir parametrenin veya parametrik fonksiyonun UMVUE'si, o fonksiyon için yansız olan bir tahmin edicinin tam ve yeterli istatistiğe göre koşullu beklenen değeri (Rao-Blackwell yöntemi) alınarak bulunur. Poisson dağılımında T=i=1nXiT = \sum_{i=1}^n X_i istatistiği tam ve yeterlidir. W=I(X1=0)W = I(X_1 = 0) yansız tahmin edici olarak seçilip, E[WT=t]E[W | T = t] hesaplandığında sonuç (n1n)T\left( \frac{n-1}{n} \right)^T çıkar. Bu ifade yansızdır ve tam yeterli istatistiğin bir fonksiyonu olduğu için benzersiz (unique) UMVUE'dir.

Adım Adım Çözüm

1
λ\lambda parametresi için tam ve yeterli istatistiği belirlemek.
T=i=1nXiT = \sum_{i=1}^n X_i tam ve yeterli istatistiktir ve dağılımı TPoisson(nλ)T \sim Poisson(n\lambda) şeklindedir.
Lehmann-Scheffe teoremine göre UMVUE, tam ve yeterli istatistiğin bir fonksiyonu olmalıdır.
2
eλe^{-\lambda} için basit bir yansız tahmin edici bulmak.
W=I(X1=0)W = I(X_1 = 0) (yani X1=0X_1 = 0 ise 11, aksi halde 00) alındığında, E[W]=P(X1=0)=eλE[W] = P(X_1 = 0) = e^{-\lambda} olur.
Rao-Blackwelllaştırma işlemi için başlangıç noktası olarak herhangi bir yansız tahmin ediciye ihtiyaç vardır.
3
Rao-Blackwell teoremini uygulayarak koşullu beklenen değeri hesaplamak.
ϕ(T)=E[WT=t]=P(X1=0i=1nXi=t)\phi(T) = E[W | T = t] = P(X_1 = 0 | \sum_{i=1}^n X_i = t) olasılığı hesaplanmalıdır.
Tam ve yeterli istatistiğe göre koşullandırma yapılarak varyans küçültülür.
4
Koşullu olasılık formülünü açmak ve bağımsızlık özelliğini kullanmak.
P(X1=0i=1nXi=t)=P(X1=0)P(i=2nXi=t)P(i=1nXi=t)P(X_1 = 0 | \sum_{i=1}^n X_i = t) = \frac{P(X_1 = 0) \cdot P(\sum_{i=2}^n X_i = t)}{P(\sum_{i=1}^n X_i = t)}
Örneklem birimleri bağımsız olduğundan ortak olasılık çarpım şeklinde yazılabilir.
5
İlgili Poisson olasılıklarını formülde yerine koymak.
eλ[e(n1)λ((n1)λ)t/t!]enλ(nλ)t/t!=enλ((n1)λ)tenλ(nλ)t=(n1)tnt=(n1n)t\frac{e^{-\lambda} \cdot \left[ e^{-(n-1)\lambda} ((n-1)\lambda)^t / t! \right]}{e^{-n\lambda} (n\lambda)^t / t!} = \frac{e^{-n\lambda} ((n-1)\lambda)^t}{e^{-n\lambda} (n\lambda)^t} = \frac{(n-1)^t}{n^t} = \left( \frac{n-1}{n} \right)^t
Olasılıkların oranlanması sonucunda elde edilen ifade sadece yeterli istatistik tt'ye bağlı bir fonksiyon olur.
6
Lehmann-Scheffe teoremi ile sonucu bağlamak.
ϕ(T)=(n1n)i=1nXi\phi(T) = \left( \frac{n-1}{n} \right)^{\sum_{i=1}^n X_i} benzersiz UMVUE'dir.
Bulunan tahmin edici tam ve yeterli istatistiğin bir fonksiyonudur ve yansızdır.

Anahtar Kavram

Poisson dağılımında tam ve yeterli istatistik kullanılarak Rao-Blackwell yöntemi ve Lehmann-Scheffe teoremi ile UMVUE elde edilmesi.
Sayfa 1 / 9Sonraki