Tek Örneklem Testleri

134 soru

Soru 121Soru

Bir Tarım ve Orman İl Müdürlüğü, projelendirilen bir ağaçlandırma sahasındaki fidanların dikimden 6 ay sonraki boylarının medyan değerinin 120120 cm olduğunu öne sürmektedir. Bu iddiayı test etmek amacıyla rastgele seçilen 66 fidanın boy ölçümleri (cm cinsinden) sırasıyla aşağıda verilmiştir:

112,128,114,120,131,106112, \quad 128, \quad 114, \quad 120, \quad 131, \quad 106

Buna göre, medyan değerine ilişkin Tek Örneklem Wilcoxon İşaretli Sıra Sayıları Testi'nin uygulanması ve hesaplanan test istatistiği (TT) ile ilgili aşağıdaki ifadelerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: Test istatistiği T=6,5T = 6,5 olarak hesaplanır ve bu testin uygulanabilmesi için ana kütle dağılımının simetrik olması varsayımı gereklidir.

Cevap

Hesaplanan test istatistiğinin T=6,5T = 6,5 olduğu ve testin uygulanabilmesi için ana kütle dağılımının simetrik olması gerektiği ifade edilen seçenek doğrudur.
Veriler medyan test değerinden çıkarıldığında sırasıyla -8, 8, -6, 0, 11, -14 farkları elde edilir. Sıfır olan değer atılır (n=5). Mutlak büyüklüklere göre sıralama (6, 8, 8, 11, 14) yapıldığında sırasıyla 1, 2.5, 2.5, 4, 5 sıra numaraları atanır. Pozitif işaretli sıraların toplamı 2,5+4=6,52,5 + 4 = 6,5, negatif sıraların toplamı ise 1+2,5+5=8,51 + 2,5 + 5 = 8,5'tir. Test istatistiği bu iki değerden küçük olanı yani 6,5 olarak alınır. Ayrıca, Wilcoxon İşaretli Sıra Sayıları Testi, İşaret Testine göre daha güçlüdür çünkü dağılımın simetrik olduğu varsayımına dayanarak sadece işaretleri değil, farkların büyüklüklerini de hesaba katar.

Adım Adım Çözüm

1
Gözlem değerlerinden (XiX_i) iddia edilen medyan değeri (M0=120M_0 = 120) çıkarılarak farklar (did_i) bulunur.
Farklar: -8, +8, -6, 0, +11, -14 olarak elde edilir.
Test istatistiği için verilerin medyana olan uzaklıkları temel alınır.
2
Farkı sıfır olan gözlem veri setinden çıkarılır ve örneklem hacmi güncellenir.
120 değeri için fark 0'dır, çıkarılır. Yeni n=5n = 5 olur. Kalan farklar: -8, +8, -6, +11, -14.
Wilcoxon testinde medyanla aynı olan değerler sıralama işleminin dışında bırakılır.
3
Kalan farkların mutlak değerleri alınır ve küçükten büyüğe sıralanarak sıra numaraları verilir.
Mutlak farklar: 6, 8, 8, 11, 14. Eşit olan '8' değerleri 2. ve 3. sırayı işgal ettiğinden sıra numaralarının ortalaması alınır: (2+3)/2=2,5(2+3)/2 = 2,5.
Sıra numaraları: 1 (6 için), 2,5 (8 için), 2,5 (8 için), 4 (11 için), 5 (14 için).
Farkların büyüklüklerini derecelendirmek ve eşit değerleri (ties) adil dağıtmak için mutlak değere göre bağlı gözlem kuralı uygulanır.
4
Sıra numaraları, ait oldukları başlangıç farklarının orijinal işaretlerine göre gruplanır ve toplanır.
Pozitif farkların sıraları (+8 ve +11): T+=2,5+4=6,5T^+ = 2,5 + 4 = 6,5.
Negatif farkların sıraları (-6, -8, -14): T=1+2,5+5=8,5T^- = 1 + 2,5 + 5 = 8,5.
Test istatistiği, işaretli sıraların toplamlarından elde edilir.
5
Test istatistiği TT değeri belirlenir ve teorik varsayım kontrol edilir.
T=min(T+,T)=min(6,5;8,5)=6,5T = \min(T^+, T^-) = \min(6,5 ; 8,5) = 6,5. Wilcoxon testi, farkların büyüklüğünü dikkate aldığı için ana kütlenin simetrik bir dağılıma sahip olduğunu varsayar.
Tek Örneklem Wilcoxon testi prosedüründe küçük olan sıra toplamı test istatistiği kabul edilir.

Anahtar Kavram

Tek Örneklem Wilcoxon İşaretli Sıra Sayıları Testi istatistiğinin hesaplanması ve dağılım varsayımı
Soru 122Soru

Bir Sosyal Güvenlik Kurumu (SGK) müfettişi, bir işletmenin ardışık 1616 aylık prim ödeme sürelerindeki gecikme gün sayılarını incelemektedir. İnceleme sırasına göre elde edilen aylık gecikme gün sayıları aşağıda verilmiştir:

12,14,15,12,18,20,15,11,15,22,25,14,15,10,19,2112, 14, 15, 12, 18, 20, 15, 11, 15, 22, 25, 14, 15, 10, 19, 21

Müfettiş, gecikme gün sayılarının zaman içinde rastgele bir dağılım gösterip göstermediğini %5\%5 anlamlılık düzeyinde test etmek istemektedir. Bu veri setinin medyan değeri 1515 olarak hesaplanmıştır.

Buna göre, bu hipotezi test etmek için kullanılması gereken en uygun parametrik olmayan test ve bu testin istatistiğini hesaplarken dikkate alınacak birinci tip sembol sayısı (n1n_1, medyan altı), ikinci tip sembol sayısı (n2n_2, medyan üstü) ile dizi sayısı (rr) aşağıdakilerin hangisinde doğru verilmiştir?

Cevabı ve açıklamayı göster

Cevap: Dizi (Rastgelelik) Testi; n1=6n_1=6, n2=6n_2=6, r=6r=6

Cevap

Dizi (Rastgelelik) Testi kullanılmalıdır ve parametreler n1=6n_1=6, n2=6n_2=6, r=6r=6 şeklindedir.
Verilerin belirli bir sıra dahilinde rastgele dizilip dizilmediğini araştırmak için parametrik olmayan en uygun yöntem Dizi (Rastgelelik) Testidir. Medyan kullanılarak yapılan bu testte, medyana (15) eşit olan gözlemler (toplam 4 adet) elenir. Kalan 12 gözlem medyanın altında (A) ve üstünde (Ü) olmasına göre sırasıyla 'A, A, A, Ü, Ü, A, Ü, Ü, A, A, Ü, Ü' şeklinde dizilir. Buradan medyan altı gözlem sayısı n1=6n_1=6, medyan üstü gözlem sayısı n2=6n_2=6 ve sembol değişiklikleriyle oluşan dizi (run) sayısı r=6r=6 olarak hesaplanır.

Adım Adım Çözüm

1
Kullanılacak istatistiksel testin belirlenmesi.
Dizi (Rastgelelik) Testi
Bir dizideki ardışık gözlemlerin zaman veya sıra bazında rastgele dağılıp dağılmadığını incelemek için tek örneklem parametrik olmayan Dizi (Rastgelelik) Testi kullanılır.
2
Medyana göre verilerin sınıflandırılması ve beraberliklerin (ties) ayıklanması.
Medyana tam eşit olan 15 değerleri diziden çıkarılır.
Dizi testinde ölçüm değerleri medyana göre 'altında' veya 'üstünde' olarak ikili koda dönüştürülür. Medyana tam olarak eşit olan gözlemler (bu soruda 15) rastgelelik yönü hakkında bilgi vermediği için analizden çıkarılmalıdır.
3
Kalan gözlemlerin medyan altı (A) ve medyan üstü (Ü) olarak kodlanması.
A, A, A, Ü, Ü, A, Ü, Ü, A, A, Ü, Ü
15 değerleri atıldığında kalan seri: 12(A), 14(A), 12(A), 18(Ü), 20(Ü), 11(A), 22(Ü), 25(Ü), 14(A), 10(A), 19(Ü), 21(Ü) şeklinde kodlanır.
4
Sembol frekanslarının (n1,n2n_1, n_2) ve dizi sayısının (rr) hesaplanması.
n1=6n_1=6, n2=6n_2=6 ve r=6r=6
Toplam 6 adet 'A' ve 6 adet 'Ü' sembolü vardır. Ardışık gruplar (diziler) sayıldığında: (AAA)=1, (ÜÜ)=2, (A)=3, (ÜÜ)=4, (AA)=5, (ÜÜ)=6 olmak üzere toplam 6 dizi (r=6) bulunur.

Anahtar Kavram

Medyana Göre Dizi (Rastgelelik) Testi ve Medyan Beraberlikleri (Ties)
Soru 123Soru

Bir büyükşehir belediyesinde görevli trafik mühendisi, yeni kurulan akıllı sinyalizasyon sistemine sürücülerin tepki sürelerini (milisaniye cinsinden) incelemektedir. Rastgele seçilen n=45n = 45 sürücüden elde edilen verilerin normal dağılıma uygunluğunu test etmek isteyen mühendis, anakütle ortalamasını (μ\mu) ve varyansını (σ2\sigma^2) bilmediği için bu değerleri örneklemden hesapladığı Xˉ\bar{X} ve S2S^2 istatistikleri ile tahmin etmiştir.

Mühendis, örneklemden elde ettiği ampirik birikimli dağılım fonksiyonu ile tahmin edilen parametrelere dayalı teorik normal dağılım fonksiyonu arasındaki maksimum mutlak farkı (DD istatistiğini) hesaplamış; ancak karar aşamasında Lilliefors tablosu yerine standart Kolmogorov-Smirnov (K-S) kritik değerler tablosunu kullanmıştır.

Yapılan bu metodolojik hatanın istatistiksel testin gücü ve hata tipleri üzerindeki etkisi aşağıdakilerden hangisinde doğru ifade edilmiştir?

Cevabı ve açıklamayı göster

Cevap: Hesaplanan test istatistiği yapay olarak küçüleceğinden, standart K-S kritik değerleri kullanıldığında testin gücü düşer ve gerçekte normal dağılmayan veriler için II. Tip Hata yapma olasılığı artar.

Cevap

Hesaplanan test istatistiği yapay olarak küçüleceğinden, standart K-S kritik değerleri kullanıldığında testin gücü düşer ve gerçekte normal dağılmayan veriler için II. Tip Hata yapma olasılığı artar.
Lilliefors testi, standart Kolmogorov-Smirnov testinin anakütle parametreleri (μ\mu ve σ2\sigma^2) bilinmeyip örneklem verisinden tahmin edildiği durumlar için uyarlanmış halidir. Ortalama ve varyans doğrudan veri setinden hesaplandığında, kurulan teorik normal dağılım eğrisi mevcut veriye 'yapay olarak' fazla uyum sağlar. Bunun matematiksel sonucu, ampirik dağılım ile teorik dağılım arasındaki maksimum mutlak farkı ölçen DD istatistiğinin, parametrelerin önceden bilindiği duruma kıyasla daha küçük çıkmasıdır. Standart K-S tablosundaki kritik değerler, bağımsız parametre varsayımıyla hesaplandığı için büyüktür. Yapay olarak küçülmüş bir DD istatistiğini, standart K-S tablosundaki büyük eşik değerleriyle karşılaştırmak, istatistiksel olarak H0H_0 (veriler normal dağılmaktadır) hipotezini reddetmeyi aşırı derecede zorlaştırır. Dolayısıyla, gerçekte normal dağılıma uymayan veriler için bile H0H_0 reddedilemez duruma gelir. Bu da testin gücünün (gerçekte yanlış olan H0H_0'ı reddedebilme yetisi) önemli ölçüde düşmesi ve II. Tip Hata (yanlış H0H_0'ı kabul etme) olasılığının artması anlamına gelir.

Adım Adım Çözüm

1
Standart Kolmogorov-Smirnov testinin parametre varsayımını belirle.
Standart K-S testi, anakütle parametrelerinin (ortalama ve varyans) testten önce kesin olarak bilindiğini varsayar.
Kritik değerler, ampirik dağılım ile tamamen bağımsız bir teorik dağılımın karşılaştırıldığı varsayımıyla türetilmiştir.
2
Parametrelerin örneklemden tahmin edilmesinin DD istatistiğine etkisini analiz et.
Parametreler veriden tahmin edildiğinde (Xˉ\bar{X} ve S2S^2), oluşturulan teorik dağılım veriye 'kendi parametreleri üzerinden' uyarlanır. Bu durum ampirik eğri ile teorik eğriyi birbirine yaklaştırır, maksimum fark olan DD değeri yapay olarak küçülür.
Örneklem, kendi ortalaması etrafında kümelendiği için sapmalar minimize edilir.
3
Küçülmüş DD değerinin standart K-S kritik değerleriyle karşılaştırılmasının sonucunu değerlendir.
Standart K-S kritik değerleri, küçülmüş bir DD değeri için fazla 'büyük' (tutucu) kalır. H0'ı reddetmek için gereken eşik aşılamaz.
Lilliefors düzeltmesinin amacı tam da bu eşiği aşağı çekmektir.
4
H0'ı reddedememenin test gücü ve hata tipleri üzerindeki sonucunu belirle.
Gerçekte normal dağılıma uymayan veriler için bile H0 reddedilemez. Bu durum, yanlış olan H0'ı kabul etme yani II. Tip Hata olasılığını artırır ve testin gücünü (1β1-\beta) düşürür.
Test, dağılımdaki normallikten sapmaları tespit edecek hassasiyeti (gücü) kaybeder.

Anahtar Kavram

Lilliefors Testinde Parametre Tahmininin Etkisi ve II. Tip Hata
Soru 124Soru

Bir Gümrük ve Dış Ticaret Bölge Müdürlüğü, ithalat işlemlerinde tespit edilen usulsüzlük türlerinin dağılımını incelemektedir. Geçmiş yıllardaki denetim raporlarına göre usulsüzlüklerin oransal dağılımı şöyledir:

Usulsüzlük TürüOran (%)
Belge Eksikliği40
Tarife Beyan Hatası40
Menşe Yanıltması16
Kıymet Düşük Beyanı4

Bu yıl rastgele seçilen 5050 usulsüzlük dosyası incelendiğinde; 1818 dosyada belge eksikliği, 2222 dosyada tarife beyan hatası, 55 dosyada menşe yanıltması ve 11 dosyada kıymet düşük beyanı tespit edilmiştir.

(Not: İstatistiksel analizde varsayımların gerektirmesi durumunda, en düşük orana sahip kategoriler kendi aralarında birleştirilmektedir.)

Buna göre, yeni denetim verilerinin geçmiş yıllardaki usulsüzlük dağılımına uyum gösterip göstermediğini test etmek için uygulanacak Ki-Kare Uyum İyiliği Testi'nin hesaplanan istatistik değeri ve serbestlik derecesi (sd) aşağıdakilerden hangisidir?

Cevabı ve açıklamayı göster

Cevap: Test İstatistiği: 2,002,00 ; sd: 22

Cevap

Test istatistiği 2,002,00 ve serbestlik derecesi 22 olarak belirlenir.
Beklenen frekanslardan biri (22) minimum kuralı olan 55'ten küçük olduğu için ilgili kategori kendisinden bir önceki en düşük kategoriyle birleştirilmelidir. Bu işlem sonucunda 44 olan kategori sayısı 33'e düşer ve serbestlik derecesi (313-1) 22 olarak bulunur. Birleştirilmiş verilerle χ2\chi^2 formülü uygulandığında sonuç 2,002,00 çıkmaktadır.

Adım Adım Çözüm

1
Her bir kategori için beklenen frekansların hesaplanması
Belge Eksikliği: 50×0,40=2050 \times 0,40 = 20
Tarife Hatası: 50×0,40=2050 \times 0,40 = 20
Menşe Yanıltması: 50×0,16=850 \times 0,16 = 8
Kıymet Düşük Beyanı: 50×0,04=250 \times 0,04 = 2
Uyum iyiliği testinde gözlenen değerlerle karşılaştırmak üzere toplam örneklem hacmi ile beklenen oranlar çarpılır.
2
Minimum beklenen frekans kuralının kontrolü ve kategorilerin birleştirilmesi
'Kıymet Düşük Beyanı' için beklenen frekans (2<52 < 5) olduğundan, bu kategori 'Menşe Yanıltması' ile birleştirilir. Yeni kategori için Beklenen Frekans =8+2=10= 8 + 2 = 10, Gözlenen Frekans =5+1=6= 5 + 1 = 6 olur. Kategori sayısı (kk) 33'e düşer.
Ki-Kare testinin geçerli olabilmesi için hiçbir hücredeki beklenen frekansın 5'ten küçük olmaması gerekir.
3
Ki-Kare test istatistiğinin hesaplanması
χ2=(1820)220+(2220)220+(610)210=420+420+1610=0,2+0,2+1,6=2,00\chi^2 = \frac{(18-20)^2}{20} + \frac{(22-20)^2}{20} + \frac{(6-10)^2}{10} = \frac{4}{20} + \frac{4}{20} + \frac{16}{10} = 0,2 + 0,2 + 1,6 = 2,00
Test istatistiği, her kategori için (Go¨zlenenBeklenen)2/Beklenen(Gözlenen - Beklenen)^2 / Beklenen formülünün toplamı ile elde edilir.
4
Serbestlik derecesinin (sd) hesaplanması
sd=k1=31=2sd = k - 1 = 3 - 1 = 2
Serbestlik derecesi, birleştirme işleminden sonra kalan aktif kategori sayısının bir eksiği olarak hesaplanır.

Anahtar Kavram

Ki-Kare Uyum İyiliği Testi ve Beklenen Frekans Kuralı
Soru 125Soru

Bir İl Tarım ve Orman Müdürlüğü, bölgedeki seralarda görülen zararlı türlerinin dağılımının geçmiş yıllara ait teorik dağılıma uyup uymadığını Ki-Kare uyum iyiliği testi ile incelemektedir.

Aşağıdaki tabloda, geçmiş verilere dayalı beklenen oranlar ve bölgedeki seralardan rastgele seçilen 8080 adet zararlı örneğinin türlerine göre gözlenen frekansları verilmiştir:

Zararlı TürüBeklenen OranGözlenen Frekans
Beyazsinek%60\%606060
Kırmızı Örümcek%20\%2088
Yaprak Biti%15\%151010
Thrips%5\%522

Buna göre, Ki-Kare uyum iyiliği testinin beklenen frekans varsayımının ihlal edilmemesi için gerekli düzenleme yapıldıktan sonra elde edilecek test istatistiği ve serbestlik derecesi (sd) aşağıdakilerden hangisidir?

Cevabı ve açıklamayı göster

Cevap: Test İstatistiği: 8,008,00 ; Serbestlik Derecesi: 22

Cevap

Test istatistiği değerinin 8,008,00 ve serbestlik derecesinin 22 olduğu seçenektir.
Beklenen frekanslar sırasıyla 48, 16, 12 ve 4 olarak bulunur. Thrips kategorisinin beklenen frekansı (4), 5'ten küçük olduğu için bu kategorinin Yaprak Biti kategorisiyle birleştirilmesi gerekir. Birleştirme sonucu yeni 'Yaprak Biti + Thrips' kategorisinin gözlenen frekansı 12, beklenen frekansı 16 olur. χ2\chi^2 istatistiği hesaplandığında; Beyazsinek için 3,003,00, Kırmızı Örümcek için 4,004,00 ve birleştirilmiş grup için 1,001,00 bulunur, toplam istatistik 8,008,00'dir. Başlangıçta 4 olan kategori sayısı birleştirme ile 3'e düştüğü için serbestlik derecesi (k-1) 31=23-1 = 2 olarak hesaplanır.

Adım Adım Çözüm

1
Her bir zararlı türü için beklenen frekansları (E) hesaplayın. Toplam gözlem sayısı N=80N = 80.
Beyazsinek: 80×0,60=4880 \times 0,60 = 48
Kırmızı Örümcek: 80×0,20=1680 \times 0,20 = 16
Yaprak Biti: 80×0,15=1280 \times 0,15 = 12
Thrips: 80×0,05=480 \times 0,05 = 4
Ki-Kare test istatistiğini hesaplayabilmek için beklenen dağılım oranlarının mutlak frekans değerlerine dönüştürülmesi gerekir.
2
Beklenen frekansların minimum 5 olma varsayımını kontrol edin ve gerekiyorsa düzenleme yapın.
Thrips türünün beklenen frekansı 4<54 < 5'tir. Gözlem gruplarının %25\%25'i (1/4) 5'ten küçük olduğu için bu grup bir üstündeki Yaprak Biti grubuyla birleştirilmelidir.
Ki-Kare testinin geçerli olabilmesi için beklenen frekansların hiçbirinin 1'den küçük olmaması ve frekansı 5'ten küçük olan gözeli oranının %20\%20'yi aşmaması gerekir.
3
Yeni gruplar üzerinden gözlenen (O) ve beklenen (E) frekansları tekrar düzenleyin.
1. Beyazsinek: O=60,E=48O = 60, E = 48
2. Kırmızı Örümcek: O=8,E=16O = 8, E = 16
3. Yaprak Biti + Thrips: O=10+2=12,E=12+4=16O = 10 + 2 = 12, E = 12 + 4 = 16
Birleştirme işlemi sonrası istatistiksel hesaplamalar yeni oluşturulan bu 3 kategori (k=3k=3) üzerinden devam etmelidir.
4
Ki-Kare test istatistiğini hesaplayın: χ2=(OE)2E\chi^2 = \sum \frac{(O - E)^2}{E}
Beyazsinek: (6048)2/48=144/48=3,00(60 - 48)^2 / 48 = 144 / 48 = 3,00
Kırmızı Örümcek: (816)2/16=64/16=4,00(8 - 16)^2 / 16 = 64 / 16 = 4,00
Birleştirilmiş Grup: (1216)2/16=16/16=1,00(12 - 16)^2 / 16 = 16 / 16 = 1,00
Toplam χ2=3,00+4,00+1,00=8,00\chi^2 = 3,00 + 4,00 + 1,00 = 8,00
Gözlenen frekansların beklenen frekanslardan sapmalarının karesi alınarak, her bir sapmanın kendi beklenen frekansına oranlarının toplamı bulunur.
5
Serbestlik derecesini (sd) hesaplayın.
sd=k1=31=2sd = k - 1 = 3 - 1 = 2
Başlangıçta 44 grup varken birleştirme sonrası katsayı hesabı yapılacak grup sayısı 33'e düşmüştür. Tek örneklem testinde dışarıdan tahmin edilen bir parametre yoksa sd = k - 1 olarak bulunur.

Anahtar Kavram

Ki-Kare uyum iyiliği testinde, beklenen frekansı 5'in altında olan kategoriler olduğunda (örneklemin küçük olması durumunda) varsayım ihlalini gidermek için zayıf kategorilerin komşu kategorilerle birleştirilmesi zorunludur. Bu işlem hem test istatistiğinin değerini hem de hesaplamaya girecek kategori sayısını (dolayısıyla serbestlik derecesini) değiştirir.
Soru 126Soru

Bir il sağlık müdürlüğü, belirli bir hastanenin acil servisine gelen günlük travma vakalarının rastgele bir dağılım gösterip göstermediğini incelemektedir. Art arda 1313 gün boyunca kaydedilen vaka sayıları oluş sırasına göre aşağıda verilmiştir:

24,18,29,22,22,15,31,27,22,19,14,35,2224, 18, 29, 22, 22, 15, 31, 27, 22, 19, 14, 35, 22

Bu veriler kullanılarak Dizi (Rastgelelik) Testi uygulanacaktır. Analizde medyan (ortanca) referans alınacak; medyanın üstünde olan değerler birinci grup (n1n_1), altında olan değerler ise ikinci grup (n2n_2) olarak tanımlanacaktır.

Buna göre; analizde kullanılacak birinci grubun eleman sayısı (n1n_1), ikinci grubun eleman sayısı (n2n_2) ve test istatistiği olan dizi sayısı (rr) aşağıdakilerin hangisinde doğru verilmiştir?

Cevabı ve açıklamayı göster

Cevap: n1=5,n2=4,r=7n_1 = 5, \quad n_2 = 4, \quad r = 7

Cevap

n1=5,n2=4,r=7n_1 = 5, \quad n_2 = 4, \quad r = 7 değerlerini içeren seçenektir.
Dizi (Rastgelelik) testinde veriler medyana göre iki gruba ayrılırken, öncelikle medyana (22) eşit olan değerler (dört adet 22) sırayı bozmadan çıkarılmalıdır. Geriye kalan 9 verinin 5'i medyandan büyük (n1=5n_1=5), 4'ü medyandan küçüktür (n2=4n_2=4). İşaretlerin sırası (A, B, A, B, A, A, B, B, A) şeklindedir. Kesintisiz aynı işaretli bloklar sayıldığında 7 farklı blok (dizi) oluştuğu için test istatistiği r=7r=7 olarak bulunur.

Adım Adım Çözüm

1
Veri setinin medyan (ortanca) değerini hesaplamak.
Sıralı veri: 14, 15, 18, 19, 22, 22, 22, 22, 24, 27, 29, 31, 35. N=13 için medyan 7. değer olan 22'dir.
Dizi (Rastgelelik) testinde sürekli veya geniş aralıklı veriler, medyan referans alınarak ikili formata (dichotomous) dönüştürülür.
2
Medyana eşit olan gözlemleri orijinal seriden çıkarmak.
Orijinal serideki dört adet 22 değeri analizden çıkarılır. Orijinal sıradaki yeni veri seti: 24, 18, 29, 15, 31, 27, 19, 14, 35.
Rastgelelik testinin temel kuralı gereği, referans değerine (medyana) tam olarak eşit olan gözlemler diziden kronolojik sırayı bozmadan silinir.
3
Kalan gözlemleri orijinal sırasına göre medyanın üstünde (A) ve altında (B) olarak sınıflandırmak ve grup hacimlerini bulmak.
Sınıflandırma: 24(A), 18(B), 29(A), 15(B), 31(A), 27(A), 19(B), 14(B), 35(A). Toplam A sayısı (n1n_1) = 5, Toplam B sayısı (n2n_2) = 4.
Test istatistiği olan dizi sayısını hesaplayabilmek için verilerin iki kategoriye (A ve B) dönüşmüş sıralaması elde edilmelidir.
4
Benzer işaretli ardışık blokları (dizileri) sayarak r istatistiğini bulmak.
Oluşan diziler: 1inci dizi (A), 2nci dizi (B), 3üncü dizi (A), 4üncü dizi (B), 5inci dizi (A, A), 6ncı dizi (B, B), 7nci dizi (A). Toplam dizi sayısı r=7r = 7.
Birbirini izleyen aynı nitelikteki gözlem grupları birer 'dizi' (run) oluşturur.

Anahtar Kavram

Dizi (Rastgelelik) Testinde Medyana Eşit Değerlerin İşlenmesi
Tahmini Süre:2m 0s
Soru 127Soru

Çevre ve Şehircilik Bakanlığı'na bağlı bir denetim ekibi, bir sanayi bölgesindeki havadaki kükürtdioksit (SO2SO_2) derişimini (ölçü birimi: μg/m3\mu g/m^3) izlemektedir. Bölgede yasal sınır değere uyulduğunu iddia eden fabrika yönetimini denetlemek amacıyla 88 farklı günde rastgele ölçüm yapılmıştır.

Ölçüm sonuçları sırasıyla şu şekildedir: 45,38,40,52,35,48,31,5645, 38, 40, 52, 35, 48, 31, 56

Yasal sınırın aşılıp aşılmadığını kontrol etmek için medyan değerin 40 μg/m340 \ \mu g/m^3 olduğu hipotezi test edilmek istenmektedir. Araştırmacı, bu analizi gerçekleştirmek için Tek Örneklem Wilcoxon İşaretli Sıra Sayıları Testi'ni kullanmaya karar vermiştir.

Buna göre, bu testin uygulanabilmesi için verilerin çekildiği popülasyonla ilgili sağlanması gereken temel varsayım ve hesaplanan test istatistiği (TT) değeri aşağıdakilerin hangisinde birlikte doğru verilmiştir?

Cevabı ve açıklamayı göster

Cevap: Dağılımın medyan etrafında simetrik olması ; T=8,5T = 8,5

Cevap

Testin temel varsayımı dağılımın medyan etrafında simetrik olmasıdır ve test istatistiği T=8,5T = 8,5'tir.
Tek Örneklem Wilcoxon İşaretli Sıra Sayıları Testi'nin kullanılabilmesi için temel varsayım, verilerin çekildiği yığının dağılımının medyan etrafında simetrik olmasıdır. Hesaplama adımında; verilerden 40 çıkarıldığında {5,2,0,12,5,8,9,16}\{5, -2, 0, 12, -5, 8, -9, 16\} farkları bulunur. Sıfır değeri olan fark atılır ve gözlem sayısı 77'ye düşer. Kalan farklar mutlak değerce sıralandığında iki adet 55 değeri (biri pozitif, biri negatif farktan gelen) 2.2. ve 3.3. sıraları alır. Bu bağlı gözlemlere ortalama sıra olan 2,52,5 verilir. Orijinal işareti negatif olan farkların sıra toplamı T=1(mutlak2den)+2,5(mutlak5ten)+5(mutlak9dan)=8,5T^- = 1 (mutlak 2'den) + 2,5 (mutlak -5'ten) + 5 (mutlak -9'dan) = 8,5 bulunur. İşareti pozitif olanların sıra toplamı T+=2,5+6+4+7=19,5T^+ = 2,5 + 6 + 4 + 7 = 19,5 olur. Test istatistiği T=min(T+,T)T = \min(T^+, T^-) formülünden 8,58,5 olarak hesaplanır.

Adım Adım Çözüm

1
Gözlem değerlerinden hipotez edilen medyan değerini (4040) çıkararak DiD_i farklarını hesaplayınız.
4540=545-40=5, 3840=238-40=-2, 4040=040-40=0, 5240=1252-40=12, 3540=535-40=-5, 4840=848-40=8, 3140=931-40=-9, 5640=1656-40=16.
Wilcoxon testinde ilk adım her bir gözlemin test edilen değerden ne kadar saptığını belirlemektir.
2
Farkı sıfır olan gözlemleri analizden çıkarınız ve kalan gözlem sayısını (nn') belirleyiniz.
4040=040-40=0 olan değer çıkarılır. Kalan gözlem sayısı n=7n' = 7 olur.
Farkı tam olarak sıfır olan gözlemler herhangi bir işaret (yön) belirtmediği için analize dahil edilmez.
3
Kalan farkların mutlak değerlerini (Di|D_i|) küçükten büyüğe sıralayınız. Aynı (bağlı) mutlak değerlere ortalama sıra numarasını veriniz.
Mutlak farklar: 2,5,5,8,9,12,162, 5, 5, 8, 9, 12, 16. Sıralamalar: 22 (1. sıra), 55 (2. ve 3. sıra \rightarrow ortalama 2,52,5), 55 (ortalama 2,52,5), 88 (4. sıra), 99 (5. sıra), 1212 (6. sıra), 1616 (7. sıra).
Test istatistiği verinin büyüklük derecesine (sırasına) dayanır; bağlı değerler sıra toplamlarında haksız ağırlık yaratmasın diye ortalama alınır.
4
Orijinal farkların işaretlerini dikkate alarak pozitif (T+T^+) ve negatif (TT^-) farklara karşılık gelen sıra numaralarının toplamını hesaplayınız.
Negatif işaretlilerin sıraları: 2-2 (1), 5-5 (2,5), 9-9 (5) T=1+2,5+5=8,5\rightarrow T^- = 1 + 2,5 + 5 = 8,5. Pozitif işaretlilerin sıraları: +5+5 (2,5), +12+12 (6), +8+8 (4), +16+16 (7) T+=2,5+6+4+7=19,5\rightarrow T^+ = 2,5 + 6 + 4 + 7 = 19,5.
Pozitif ve negatif yönlü sapmaların büyüklük dereceleri ayrı ayrı toplanarak dengesizlik kontrol edilir.
5
Hesaplanan iki değerden daha küçük olanını test istatistiği (TT) olarak belirleyiniz ve testin temel varsayımını tanımlayınız.
T=min(19,5 ; 8,5)=8,5T = \min(19,5 \ ; \ 8,5) = 8,5. Wilcoxon testi sürekli verilerde dağılımın medyan etrafında simetrik olduğunu varsayar.
Standart kural gereği sıfır hipotezi altında min(T+,T)\min(T^+, T^-) test istatistiğidir. Testin gücü için popülasyon dağılımının medyana göre simetrik olması şartı aranır.

Anahtar Kavram

Tek Örneklem Wilcoxon İşaretli Sıra Sayıları Testi: Sıfır farklarının atılması, bağlı (ties) gözlemlerin derecelendirilmesi ve simetriklik varsayımı.
Soru 128Soru

Bir finansal analist, bir hisse senedinin 15 işlem günü boyunca bir önceki güne göre fiyat değişimlerini artış (++) ve azalış (-) olarak şu sırayla not etmiştir:

+,+,,+,,,+,+,,,,+,,+,++, +, -, +, -, -, +, +, -, -, -, +, -, +, +

Analist, bu verilerin rastgele bir süreci takip edip etmediğini %5\%5 (α=005\alpha = 0{}05) anlamlılık düzeyinde Dizi (Rastgelelik) Testi ile incelemek istemektedir. n1=8n_1 = 8 ve n2=7n_2 = 7 için %5\%5 anlamlılık düzeyindeki kritik değerler tablosuna göre alt kritik değer 44, üst kritik değer ise 1313’tür.

Buna göre, hesaplanan dizi sayısı (rr) ve testin sonucu hakkında aşağıdakilerden hangisi doğrudur?

Cevabı ve açıklamayı göster

Cevap: r=9r = 9; verilerin rastgele dağılmadığını söylemek için yeterli kanıt yoktur.

Cevap

Hesaplanan dizi sayısının r=9r = 9 olduğu ve bu değer kritik aralık içinde kaldığı için verilerin rastgele dağılmadığını söylemek için yeterli kanıt bulunmadığı (rastgeleliğin desteklendiği) seçenek doğrudur.
Verilen seride ardışık aynı işaretli gruplar tek tek sayıldığında (2 adet +, 1 adet -, 1 adet +, 2 adet -, 2 adet +, 3 adet -, 1 adet +, 1 adet -, 2 adet +) toplamda 9 dizi (r=9r=9) olduğu görülür. %5 anlamlılık düzeyinde n1=8n_1=8 ve n2=7n_2=7 için kritik değerler 4 ve 13 olarak verildiğine göre; 9 değeri bu iki sınırın arasındadır. Dolayısıyla H0H_0 hipotezi reddedilemez ve verilerin rastgele dağılmadığına dair yeterli kanıt bulunmamaktadır.

Adım Adım Çözüm

1
Serideki işaret değişimlerini takip ederek ardışık aynı sembollerden oluşan grupları (dizileri) belirle.
Diziler: (+,+)(+, +), ()(-), (+)(+), (,)(-, -), (+,+)(+, +), (,,)(-, -, -), (+)(+), ()(-), (+,+)(+, +) şeklindedir.
Dizi (rastgelelik) testinde test istatistiği olan rr değerini bulmak için toplam grup sayısını saymamız gerekir.
2
Toplam dizi sayısını (rr) hesapla.
r=9r = 9.
Belirlenen 9 ayrı grup olduğu için test istatistiği 9 olarak bulunur.
3
Hesaplanan rr değerini verilen kritik değerler (4 ve 13) ile karşılaştır.
4<9<134 < 9 < 13 olduğu görülür.
Dizi testinde, hesaplanan rr değeri alt ve üst kritik değerlerin arasında kalıyorsa H0H_0 (veriler rastgele dağılmıştır) hipotezi reddedilemez.
4
İstatistiksel kararı ver.
H0H_0 reddedilemez; verilerin rastgele dağılmadığını söylemek için yeterli kanıt yoktur.
Gözlenen dizi sayısı, rastgelelik durumunda beklenen sınırlar içerisinde kalmıştır.

Anahtar Kavram

Dizi (Rastgelelik) Testi Karar Kuralı

Alternatif Yöntem

Örneklem büyüklüğü yeterince büyük olsaydı (n1,n2>20n_1, n_2 > 20), normal yaklaşım kullanılarak ZZ istatistiği hesaplanabilirdi. Bu durumda beklenen dizi sayısı E(r)=2n1n2n1+n2+1E(r) = \frac{2n_1n_2}{n_1+n_2} + 1 formülü ile bulunurdu.
Tahmini Süre:1m 30s
Soru 129Soru

Bir klinik psikolog, terapi sürecindeki 35 danışanın kaygı düzeylerinde meydana gelen değişim puanlarının normal dağılım varsayımına uygunluğunu test etmek istemektedir. Bu amaçla yapılan Shapiro-Wilk testi sonucunda elde edilen bulgular aşağıdaki tabloda özetlenmiştir:

Testİstatistik (WW)Örneklem Hacmi (nn)Anlamlılık (pp)
Shapiro-Wilk0,9120,91235350,0240,024

Anlamlılık düzeyi α=0,05\alpha = 0,05 olarak kabul edildiğinde; bu test sonucuna göre araştırmacının dağılımın normalliği hakkında varacağı karar ve analiz sürecinde izlemesi gereken bilimsel yol aşağıdakilerden hangisidir?

Cevabı ve açıklamayı göster

Cevap: Hesaplanan pp değeri anlamlılık düzeyinden küçük olduğu için veriler normal dağılım göstermemektedir; bu nedenle analizde parametrik olmayan test yöntemleri tercih edilmelidir.

Cevap

Hesaplanan pp değerinin anlamlılık düzeyinden küçük olması nedeniyle yokluk hipotezi reddedilir, verilerin normal dağılım göstermediği sonucuna varılır ve parametrik olmayan yöntemlerin kullanılması gerekir.
Shapiro-Wilk testinde yokluk hipotezi (H0H_0) verilerin normal dağıldığını belirtir. Elde edilen p=0,024p = 0,024 değeri, belirlenen α=0,05\alpha = 0,05 düzeyinden küçük olduğu için H0H_0 hipotezi reddedilir. Bu durum, verilerin normal dağılım göstermediğini kanıtlar. Dağılımın normal olmadığı durumlarda, parametrik testlerin varsayımı karşılanmadığı için analizlere parametrik olmayan (non-parametrik) yöntemlerle devam edilmelidir.

Adım Adım Çözüm

1
Hipotezlerin kurulması
H0H_0: Veriler normal dağılım göstermektedir; H1H_1: Veriler normal dağılım göstermemektedir.
Normallik testlerinde temel varsayım (yokluk hipotezi) her zaman dağılımın normal olduğudur.
2
Anlamlılık değeri ile sınır değerin karşılaştırılması
p=0,024<α=0,05p = 0,024 < \alpha = 0,05
Hesaplanan p değerinin seçilen anlamlılık düzeyinden (alpha) küçük olup olmadığı kontrol edilir.
3
İstatistiksel kararın verilmesi ve yöntemin belirlenmesi
H0H_0 reddedilir; veriler normal dağılmamaktadır ve parametrik olmayan (non-parametrik) testler seçilmelidir.
P değeri alpha'dan küçük olduğunda H0 reddedilir. Normallik varsayımı ihlal edildiği için parametrik testler yerine non-parametrik testler kullanılır.

Anahtar Kavram

Shapiro-Wilk testi hipotez yorumlama ve p-değeri analizi
Soru 130Soru

Bir kamu kurumunda çalışan personelin hizmet içi eğitim sınavından aldıkları puanların normal dağılıma uygunluğunu belirlemek amacıyla "Tek Örneklem Kolmogorov-Smirnov Testi" uygulanmaktadır. Bu testin sonucunda elde edilen DD test istatistiği aşağıdakilerden hangisini ifade etmektedir?

Cevabı ve açıklamayı göster

Cevap: Gözlenen birikimli dağılım fonksiyonu ile teorik birikimli dağılım fonksiyonu arasındaki maksimum mutlak farkı

Cevap

Hesaplanan test istatistiği, gözlenen birikimli dağılım fonksiyonu ile teorik birikimli dağılım fonksiyonu arasındaki maksimum mutlak farkı ifade eder.
Doğru cevapta belirtilen ifade, Kolmogorov-Smirnov test istatistiği olan DD'nin matematiksel tanımıdır. Bu test, örneklem dağılımının (ampirik CDF) teorik dağılımdan (örneğin Normal CDF) en fazla ne kadar saptığını "maksimum mutlak fark" üzerinden ölçer. Eğer bu fark (D değeri) kritik değerden büyükse, verilerin o dağılıma uygun olmadığı sonucuna varılır.

Adım Adım Çözüm

1
Hipotezleri kurun
H0H_0: Veriler belirtilen dağılıma (örn. Normal) uygundur; H1H_1: Veriler belirtilen dağılıma uygun değildir.
Testin amacını ve karşılaştırılacak dağılımları belirlemek için gereklidir.
2
Birikimli dağılımları karşılaştırın
Gözlenen (ampirik) birikimli dağılım Sn(x)S_n(x) ile teorik birikimli dağılım F0(x)F_0(x) her bir nokta için farkları hesaplanır.
Test istatistiği olan DD değerinin temel bileşenlerini oluşturmak içindir.
3
DD istatistiğini belirleyin
D=maxSn(x)F0(x)D = \max |S_n(x) - F_0(x)|
Kolmogorov-Smirnov testinin temel mantığı, iki fonksiyon arasındaki en büyük sapmanın (maksimum mutlak fark) istatistiksel anlamlılığını test etmektir.

Anahtar Kavram

Tek Örneklem Kolmogorov-Smirnov testinde DD istatistiği, gözlenen ve beklenen birikimli dağılımlar arasındaki dikey yöndeki en büyük mesafedir.

İpuçları

1
Kolmogorov-Smirnov testi, verilerin birikimli (kumülatif) dağılımlarını karşılaştırır.
2
DD harfi genellikle 'Distance' (Mesafe) kelimesini çağrıştırır ve iki grafik arasındaki farkı temsil eder.

Daha Fazla Pratik

K-S testinin özellikle sürekli değişkenler için Ki-kare testinden daha güçlü olduğunu ve verileri gruplandırmaya gerek duymadığını unutmayın.
Tahmini Süre:45s
Soru 131Soru

Bir araştırmacı, örneklem hacminin küçük (n=30n=30) olması nedeniyle verilerin normal dağılıma uygunluğunu denetlemek için Kolmogorov-Smirnov testi yerine Shapiro-Wilk testini tercih etmiştir. Bu istatistiksel sınama sürecinde kurulan yokluk hipotezi (H0H_0) aşağıdakilerden hangisidir?

Cevabı ve açıklamayı göster

Cevap: Veriler normal dağılım göstermektedir.

Cevap

Yokluk hipotezi, verilerin normal dağılım gösterdiğini ifade eden seçenektir.
Shapiro-Wilk testi, bir veri setinin normal dağılıma sahip olup olmadığını test etmek için kullanılır. İstatistiksel olarak bu testin yokluk hipotezi (H0H_0), verilerin normal dağılım gösteren bir kitleden geldiğini savunur. Eğer hesaplanan pp değeri anlamlılık düzeyinden (α=0,05\alpha=0,05) büyükse, bu yokluk hipotezi reddedilemez ve verilerin normal dağıldığı kabul edilir.

Adım Adım Çözüm

1
Testin amacını belirleme
Shapiro-Wilk testi bir normallik testidir.
Soruda verilerin normal dağılıma uygunluğunun denetlendiği belirtilmiştir.
2
İstatistiksel hipotezlerin yapısını hatırlama
Normallik testlerinde yokluk hipotezi (H0H_0) her zaman 'fark yoktur' veya 'dağılım uygundur' şeklinde kurulur.
İstatistiksel sınamalarda temel varsayım, gözlenen dağılımın teorik dağılım ile örtüştüğüdür.
3
Doğru hipotez ifadesini seçme
H0H_0: Veriler normal dağılım göstermektedir.
Shapiro-Wilk testinin standart yokluk hipotezi budur.

Anahtar Kavram

Shapiro-Wilk testinde yokluk hipotezi (H0H_0), verilerin normal dağılım gösterdiğini; alternatif hipotez (H1H_1) ise göstermediğini belirtir.
Soru 132Soru

Bir kamu kurumunun stratejik veri analizi biriminde görev yapan 15 uzman üzerinde yeni nesil bir siber güvenlik (oltalama) testi uygulanmıştır. Kurum politikasına göre, bu birimdeki uzmanların testte başarısız olma (oltalamaya düşme) olasılığının (pp) en fazla %10\%10 olduğu varsayılmaktadır. Yapılan habersiz test sonucunda, 15 uzmandan 4'ünün başarısız olduğu tespit edilmiştir.

Birim yöneticisi, başarısızlık oranının istatistiksel olarak %10\%10'dan anlamlı derecede daha yüksek olup olmadığını %5\%5 anlamlılık düzeyinde test etmek istemektedir.

Bu hipotezin testi için veri yapısı ve varsayımlar dikkate alındığında, seçilmesi gereken en uygun test yöntemi ve bu teste ait anlamlılık (p-değeri) hesaplama mantığı aşağıdakilerden hangisinde doğru verilmiştir?

Cevabı ve açıklamayı göster

Cevap: Örneklem büyüklüğü normal yaklaşım için gereken np05np_0 \geq 5 koşulunu sağlamadığından tam Binom testi uygulanmalı ve p-değeri, sağ kuyruk olasılığını ifade eden x=415(15x)(0,10)x(0,90)15x\sum_{x=4}^{15} \binom{15}{x} (0,10)^x (0,90)^{15-x} formülü ile hesaplanmalıdır.

Cevap

Tam Binom testi uygulanmalı ve p-değeri sağ kuyruk olasılığını veren kümülatif formül ile hesaplanmalıdır.
Beklenen olay sayısı np0=15×0,10=1,5np_0 = 15 \times 0,10 = 1,5'tir. Bu değer 5'ten küçük olduğu için Merkezi Limit Teoremi'ne dayalı normal yaklaşım (Z-oran testi) kullanılamaz; kesin olasılıkları veren tam Binom testi uygulanmalıdır. Araştırmacının amacı oranın %10'dan daha yüksek olup olmadığını sınamak (H1:p>0,10H_1: p > 0,10) olduğundan sağ kuyruk testi yapılmalıdır. Sağ kuyruk testlerinde p-değeri, gözlenen değerden (4) başlayarak alabileceği maksimum değere (15) kadar olan Binom olasılıklarının toplamı ile hesaplanır.

Adım Adım Çözüm

1
Senaryodaki parametreleri belirle.
Örneklem hacmi n=15n = 15, başarı (oltalamaya düşme) olasılığı p0=0,10p_0 = 0,10 ve gözlenen başarısız uzman sayısı x=4x = 4.
Uygulanacak testin varsayımlarını kontrol etmek ve test istatistiğini oluşturmak için parametrelerin tanımlanması gerekir.
2
Normal yaklaşım varsayımını (np05np_0 \geq 5 ve nq05nq_0 \geq 5) kontrol et.
np0=15×0,10=1,5np_0 = 15 \times 0,10 = 1,5 bulunur. 1,5<51,5 < 5 olduğu için normal yaklaşım koşulu sağlanmamaktadır.
Test seçiminde (Binom vs Z-testi) beklenen frekansların yeterliliği belirleyicidir.
3
Hipotez yönünü belirle ve doğru p-değeri mantığını kur.
Soru 'daha yüksek olup olmadığını' sorduğu için H1:p>0,10H_1: p > 0,10 kurulur. Bu sağ kuyruklu bir testtir.
P-değerinin hangi yönde (sağ, sol veya çift) kümülatif olarak toplanacağını belirlemek içindir.
4
Matematiksel formülü oluştur.
Kesin (exact) Binom testi p-değeri: P(X4)=x=415(15x)(0,10)x(0,90)15xP(X \geq 4) = \sum_{x=4}^{15} \binom{15}{x} (0,10)^x (0,90)^{15-x} şeklinde ifade edilir.
Sağ kuyruk testinde p-değeri, gözlenen değere eşit ve ondan daha aşırı (büyük) olayların olasılıklarının toplamıdır.

Anahtar Kavram

Binom Testi Varsayımları ve Kesin (Exact) p-değeri Hesaplama
Soru 133Soru

Bir büyükşehir belediyesi Çevre Koruma ve Kontrol Dairesi Başkanlığı, belirli bir sanayi bölgesindeki günlük partikül madde (PM10PM_{10}) hava kirliliği seviyesinin rastgele bir dizilim gösterip göstermediğini incelemektedir. Bu amaçla, ardışık 1515 gün boyunca ölçülen PM10PM_{10} değerleri (μg/m3\mu g/m^3) kayıt sırasına göre aşağıda verilmiştir:

24, 18, 14, 20, 25, 28, 19, 20, 16, 12, 22, 20, 26, 21, 1724,\ 18,\ 14,\ 20,\ 25,\ 28,\ 19,\ 20,\ 16,\ 12,\ 22,\ 20,\ 26,\ 21,\ 17

Araştırmacı, serinin rastgeleliğini test etmek için medyana (ortancaya) göre Dizi (Rastgelelik) Testi uygulayacaktır.

Buna göre, analizde kullanılacak **dizi sayısı (rr) ve beklenen dizi sayısı (μr\mu_r)** aşağıdakilerin hangisinde doğru verilmiştir?

Cevabı ve açıklamayı göster

Cevap: r=6r = 6, μr=7\mu_r = 7

Cevap

Doğru yanıt, dizi sayısının (rr) 6 ve beklenen dizi sayısının (μr\mu_r) 7 olarak hesaplandığı seçenektir.
Veri setinin medyanı 20'dir. Dizi (rastgelelik) testinde medyana eşit olan değerler (3 adet 20) seriden çıkarılmalıdır. Kalan 12 veri sırasıyla medyanın üstünde (Ü) ve altında (A) olma durumlarına göre işaretlendiğinde: Ü, A, A, Ü, Ü, A, A, A, Ü, Ü, Ü, A şeklinde ardışık 6 dizi (r=6) oluşur. Medyanın üstünde olan verilerin sayısı n1=6 ve altında olanların sayısı n2=6'dır. Beklenen dizi sayısı formülü olan μr=2n1n2n1+n2+1\mu_r = \frac{2n_1n_2}{n_1+n_2} + 1 kullanıldığında, μr=7\mu_r = 7 olarak bulunur.

Adım Adım Çözüm

1
Veri setinin medyan (ortanca) değerinin hesaplanması.
Veriler küçükten büyüğe sıralandığında (12, 14, 16, 17, 18, 19, 20, 20, 20, 21, 22, 24, 25, 26, 28) 15 gözlemin tam ortasındaki 8. değer olan 20, medyan olarak bulunur.
Dizi testi, verilerin medyana göre konumlarına (altında veya üstünde) dayalı olarak uygulanır.
2
Medyana eşit olan değerlerin seriden çıkarılması ve kalan verilerin sınıflandırılması.
Orijinal serideki 20 değerleri (3 adet) analizden çıkarılır. Kalan 12 veri sırasıyla medyanın üstünde (Ü) ve altında (A) olma durumlarına göre işaretlendiğinde şu dizilim elde edilir: Ü, A, A, Ü, Ü, A, A, A, Ü, Ü, Ü, A.
Dizi testinde medyana eşit olan (farkı sıfır olan) gözlemler istatistiksel analizden dışlanmalı ve n hacmi buna göre küçültülmelidir.
3
Dizi sayısının (r) ve grup hacimlerinin (n1, n2) belirlenmesi.
İşaret değişimleri gruplandırıldığında 6 farklı dizi (r = 6) tespit edilir (1:Ü, 2:AA, 3:ÜÜ, 4:AAA, 5:ÜÜÜ, 6:A). Üstünde olanların toplam sayısı n1 = 6, altında olanların toplam sayısı n2 = 6 olarak bulunur.
Beklenen dizi sayısını (μ_r) hesaplamak için toplam dizi sayısına ve her bir kategorinin frekansına (n1, n2) ihtiyaç vardır.
4
Beklenen dizi sayısının (μ_r) hesaplanması.
Formülde değerler yerine konulduğunda: μ_r = [ (2 × 6 × 6) / (6 + 6) ] + 1 = (72 / 12) + 1 = 6 + 1 = 7 olarak hesaplanır.
Rastgelelik testinde yokluk hipotezi altındaki ortalama (beklenen) dizi sayısını bulmak için formül kullanılır.

Anahtar Kavram

Dizi (Rastgelelik) Testinde medyana eşit gözlemlerin dışlanması ve parametrelerin doğru hesaplanması
Soru 134Soru

Sürekli bir rassal değişkenin normal dağılıma uygunluğunu test eden bir araştırmacı, kitleye ait beklenti (ortalama) ve varyans değerlerini bilmediği için bu parametreleri elde ettiği örneklem verisinden tahmin etmiştir. Araştırmacı, en büyük mutlak sapma test istatistiğini (DD) doğru bir şekilde hesapladıktan sonra karar aşamasında Lilliefors tablosu yerine yanlışlıkla parametrelerin bilindiği durumlar için geçerli olan standart Kolmogorov-Smirnov (K-S) kritik değerler tablosunu kullanmıştır.

Bu metodolojik hatanın, kurulan normallik testinin (Sıfır hipotezi H0H_0: Veriler normal dağılımdan gelmektedir) hata tipleri ve istatistiksel gücü üzerindeki kesin etkisi aşağıdakilerden hangisinde doğru verilmiştir?

Cevabı ve açıklamayı göster

Cevap: Standart K-S tablosundaki kritik değerler Lilliefors tablosundakilerden daha büyük olduğu için H0H_0 hipotezini reddetmek zorlaşır; bu da Tip II hata yapma olasılığını artırır ve testin gücünü düşürür.

Cevap

Standart K-S tablosundaki kritik değerler Lilliefors tablosundakilerden daha büyük olduğu için H0 hipotezini reddetmek zorlaşır; bu da Tip II hata yapma olasılığını artırır ve testin gücünü düşürür.
Doğru seçenekte belirtildiği gibi, parametrelerin örneklemden tahmin edilmesi, ampirik veriler ile teorik dağılım arasındaki mesafenin (DD) yapay olarak daha küçük çıkmasına neden olur. Bu durumu telafi etmek için Lilliefors tablosu, standart K-S tablosuna kıyasla daha küçük kritik değerler içerir. Eğer bir araştırmacı tahmin edilmiş parametrelerle standart K-S tablosunu kullanırsa, aşılması gereken eşik (kritik değer) olması gerekenden yüksek kalır. Kritik değerin yüksek olması sıfır hipotezinin reddedilmesini çok zorlaştırır. Bunun sonucunda yanlış bir sıfır hipotezinin kabul edilme riski olan Tip II hata (β\beta) artar ve testin gücü (1β1-\beta) azalır.

Adım Adım Çözüm

1
Parametrelerin tahmin edilmesinin test istatistiği (DD) üzerindeki matematiksel etkisini belirleme
Parametreler örneklemden tahmin edildiğinde, veriler kendi örneklem ortalaması ve varyansına göre değerlendirildiğinden, ampirik fonksiyon ile normal dağılım fonksiyonu birbirine daha yakın görünür.
Örneklem tahmin edicileri veri setinin merkezine ve yayılımına tam oturduğu için yapay bir uyum (artificial fit) ortaya çıkar ve hesaplanan D sapma değerleri teorik duruma göre daha küçük çıkar.
2
Hesaplanan test istatistiğine karşılık gelen kritik tablo değerlerini karşılaştırma
Sapmalar yapay olarak küçüldüğü için, tipik α\alpha (örneğin 0.050.05) anlamlılık seviyelerini korumak amacıyla Lilliefors kritik değerleri, standart K-S kritik değerlerinden daha küçük olarak hesaplanmıştır.
Tip I hatayı sabit tutabilmek için kritik eşik de test istatistiği ile aynı oranda küçültülmelidir.
3
Araştırmacının standart K-S tablosunu kullanmasının hipotez kararına etkisini analiz etme
Araştırmacı daha küçük olması gereken Lilliefors kritik değeri yerine daha büyük olan standart K-S değerini kullanmıştır. Bu durum H0H_0'ı reddetmek için aşılması gereken eşiği gereğinden fazla yükseltir.
Büyük bir kritik değer kullanmak, testin çok muhafazakar davranmasına yol açar; red bölgesi daralır.
4
Daralan red bölgesinin Tip I, Tip II hatalar ve istatistiksel güç (Power) üzerindeki sonuçlarını belirleme
Gerçekleşen Tip I hata olasılığı hedeflenen α\alpha'dan daha küçük olur. Yanlış olan bir H0H_0'ı reddetme ihtimali azaldığı için Tip II hata (β\beta) olasılığı artar ve buna bağlı olarak testin gücü (1β1-\beta) düşer.
Testin gücü yanlış sıfır hipotezini doğru şekilde reddedebilme yeteneğidir; reddetme zorlaştıkça güç azalır.

Anahtar Kavram

Lilliefors testinde parametre tahmininin test istatistiğine etkisi ve kritik değerlerin güce yansıması
ÖncekiSayfa 7 / 7
Tek Örneklem Testleri Alıştırma Soruları — KPSS İstatistik — Sayfa 7 | Examkin