Soru

Zorluk: Çok zorYeterlilik (Sufficiency) ve Neyman Çarpanlara Ayırma Teoremi

İstatistiksel çıkarım teorisinde, veri sıkıştırma (data reduction) prensibi gereği bir parametreye yönelik yeterli (sufficient) istatistiğin boyutunun örneklem hacmi nn'den bağımsız olması (sabit boyutlu olması) arzu edilen bir özelliktir. Pitman-Koopman-Darmois teoremine göre, tanım kümesi parametreye bağlı olmayan dağılımlar içinde yalnızca üstel aileye (exponential family) mensup olanlar bu özelliği sağlar. Ayrıca, tanım kümesi parametreye bağlı olan bazı özel dağılımlarda da sabit boyutlu yeterli istatistikler elde edilebilir.

Bir araştırmacı, X1,X2,,XnX_1, X_2, \dots, X_n bağımsız ve aynı dağılımlı rastgele örneklemleri için θ\theta parametresine ait yeterli istatistiği Neyman Çarpanlara Ayırma Teoremi'ni (Neyman Factorization Theorem) kullanarak belirlemek istemektedir.

Buna göre, aşağıda olasılık yoğunluk fonksiyonları verilen dağılımlardan hangisi için araştırmacı, boyutu örneklem hacmi nn'ye bağlı olarak artmayan (sabit boyutlu) bir yeterli istatistik bulamaz?

  1. f(x;θ)=12exθ,<x<,θRf(x; \theta) = \frac{1}{2} e^{-|x-\theta|}, \quad -\infty < x < \infty, \quad \theta \in \mathbb{R}Cevap
  2. B
    f(x;θ)=θxθ1,0<x<1,θ>0f(x; \theta) = \theta x^{\theta-1}, \quad 0 < x < 1, \quad \theta > 0
  3. C
    f(x;θ)=1θex/θ,x>0,θ>0f(x; \theta) = \frac{1}{\theta} e^{-x/\theta}, \quad x > 0, \quad \theta > 0
  4. D
    f(x;θ)=e(xθ),x>θ,θRf(x; \theta) = e^{-(x-\theta)}, \quad x > \theta, \quad \theta \in \mathbb{R}
  5. E
    f(x;θ)=1θ,0<x<θ,θ>0f(x; \theta) = \frac{1}{\theta}, \quad 0 < x < \theta, \quad \theta > 0

Cevap

Tanım kümesi parametreye bağlı olmayan ve üstel aile formunda yazılamayan Laplace (Çift Üstel) dağılımının (f(x;θ)=12exθf(x; \theta) = \frac{1}{2} e^{-|x-\theta|}), boyutu örneklem hacminden bağımsız bir yeterli istatistiği bulunamaz. Bu durum için minimal yeterli istatistik, sıra istatistiklerinin (order statistics) tamamıdır.
Çift üstel (Laplace) dağılımında, tanım kümesi θ\theta'dan bağımsız olmasına rağmen dağılım üstel (exponential) aileye ait değildir. Neyman Çarpanlara Ayırma Teoremi uygulandığında, olabilirlik fonksiyonu L(θ)=12nexp(i=1nxiθ)L(\theta) = \frac{1}{2^n} \exp(-\sum_{i=1}^n |x_i - \theta|) şeklini alır. Buradaki xiθ\sum |x_i - \theta| ifadesi, mutlak değerin parçalı doğrusal yapısı nedeniyle, θ\theta'nın ve verinin sabit boyutlu bir fonksiyonu (örneğin xi\sum x_i veya xi\prod x_i gibi) formunda sıkıştırılamaz. θ\theta'nın herhangi bir noktasında bu ifadenin değerini hesaplayabilmek için örneklemdeki tüm veri noktalarının konumunu (sıralamasını) bilmek gerekir. Dolayısıyla, bu dağılım için minimal yeterli istatistik tüm sıra istatistikleri vektörüdür (X(1),X(2),,X(n)X_{(1)}, X_{(2)}, \dots, X_{(n)}). Bu vektörün boyutu nn'dir ve örneklem hacmi büyüdükçe veri sıkıştırması sağlanamaz.

Adım Adım Çözüm

1
Seçeneklerdeki fonksiyonların olabilirlik (likelihood) fonksiyonlarını oluşturarak Neyman Çarpanlara Ayırma Teoremi'ni uygulamak.
Her bir dağılım için L(θ;x)=g(T(x)θ)h(x)L(\theta; \mathbf{x}) = g(T(\mathbf{x})|\theta) \cdot h(\mathbf{x}) ayrıştırması formüle edilir.
Sabit boyutlu yeterli istatistiğin varlığını kontrol etmenin teorik yolu olabilirlik fonksiyonunun nn'den bağımsız bir T(x)T(\mathbf{x}) üzerinden çarpanlara ayrılabilme durumunu incelemektir.
2
Tanım kümesi parametreye bağlı olmayan ve üstel aileye ait fonksiyonları incelemek.
B seçeneğindeki dağılım için L(θ)=θn(xi)θ1L(\theta) = \theta^n (\prod x_i)^{\theta-1}, C seçeneği için L(θ)=θnexp(xi/θ)L(\theta) = \theta^{-n} \exp(-\sum x_i / \theta) elde edilir. Sırasıyla Xi\prod X_i ve Xi\sum X_i boyutu 11 olan yeterli istatistiklerdir.
Üstel ailenin standart formu gereği, boyutu nn'den bağımsız (sabit boyutlu) yeterli istatistikler daima mevcuttur.
3
Tanım kümesi parametreye bağlı olan dağılımları, gösterge (indicator) fonksiyonları yardımıyla incelemek.
D seçeneği için L(θ)=exp(nθxi)I(x(1)>θ)L(\theta) = \exp(n\theta - \sum x_i) I(x_{(1)} > \theta) üzerinden X(1)X_{(1)}; E seçeneği için L(θ)=θnI(x(n)<θ)L(\theta) = \theta^{-n} I(x_{(n)} < \theta) üzerinden X(n)X_{(n)} boyutları 11 olan yeterli istatistikler olarak bulunur.
Tanım kümesinin parametreye bağlı olduğu durumlarda uç değerleri belirten sıra istatistikleri sabit boyutlu yeterli istatistik işlevi görür.
4
Laplace dağılımı için olabilirlik fonksiyonunu çarpanlarına ayırmayı denemek.
L(θ)=12nexp(i=1nxiθ)L(\theta) = \frac{1}{2^n} \exp(-\sum_{i=1}^n |x_i - \theta|) elde edilir. Toplam içindeki mutlak değer fonksiyonunun parçalı yapısı, ifadeyi θ\theta ve xix_i'lerin ayrışabilir, sabit boyutlu bir formuna dönüştürmeyi engeller.
xiθ\sum |x_i - \theta| fonksiyonunu θ\theta'nın herhangi bir değeri için tam olarak hesaplayabilmek adına tüm xix_i değerlerine (veya tüm sıra istatistiklerine) ihtiyaç vardır. Bu nedenle minimal yeterli istatistiğin boyutu nn'dir ve örneklem hacmiyle birlikte artar.

Anahtar Kavram

Neyman Çarpanlara Ayırma Teoremi ve Minimal Yeterli İstatistiğin Boyutluluğu
Bu soruyu puanla