Question

Difficulty: Hardİki Gruplu Diskriminant Analizi (Fisher'in Doğrusal Ayırma Fonksiyonu)

Bir veri bilimci, iki farklı coğrafi bölgeden toplanan n1=45n_1 = 45 ve n2=35n_2 = 35 hacimli örneklemler üzerinden, ait oldukları lokasyonları tahmin etmek amacıyla Fisher tarafından geliştirilen iki gruplu doğrusal diskriminant fonksiyonunu modellemektedir.

Ön analizlerde uygulanan Box's M testi sonucunda "kitle varyans-kovaryans matrisleri homojendir" (H0:Σ1=Σ2=ΣH_0: \Sigma_1 = \Sigma_2 = \Sigma) hipotezi reddedilememiştir.

Bu çok değişkenli yöntemin matematiksel formülasyonu, dayandığı varsayımlar ve sınıflandırma mantığı dikkate alındığında aşağıdakilerden hangisi doğrudur?

  1. A
    Eğer Box's M testinin p-değeri 0.05'ten küçük bulunsaydı, varyans-kovaryans matrislerinin eşitliği bozulacağından örneklem büyüklükleri göz ardı edilerek matrislerin doğrudan aritmetik ortalaması (Spool=S1+S22S_{pool} = \frac{S_1 + S_2}{2}) alınmalı ve ortak matris bu şekilde oluşturularak doğrusal yaklaşıma devam edilmeliydi.
  2. Katsayılar vektörü (aa), her iki grubun örneklem büyüklükleri ve serbestlik dereceleri ile ağırlıklandırılmış ortak (havuzlanmış) kovaryans matrisinin tersi alınarak ortalama vektörleri farkı ile çarpılması (a=Spool1(Xˉ1Xˉ2)a = S_{pool}^{-1}(\bar{X}_1 - \bar{X}_2)) yoluyla elde edilir; yeni atamalar ise hesaplanan bu skorların bir kesim noktasıyla kıyaslanmasıyla gerçekleştirilir.Answer
  3. C
    Yöntemin matematiksel altyapısı gereği, modeldeki bağımlı (hedef) değişkenin mutlaka sürekli bir ölçekle ölçülmüş olması zorunluyken, sınıflandırmada kullanılacak yordayıcı (bağımsız) değişkenlerin kategorik veya kesikli yapıda olması gerekmektedir.
  4. D
    Sınıflandırma matrisi üzerinden beklenen hata oranı tahmin edilirken, grupların ana kütledeki öncelik olasılıkları (prior probabilities) hesaba katılmaksızın sadece doğru sınıflandırılan (köşegen üzerindeki) birimlerin oranlanması teorik olarak yeterli kabul edilir.
  5. E
    Modelin genel geçerliliğini ve grupların ayrışma düzeyini gösteren Wilks' Lambda (Λ\Lambda) istatistiği hesaplandığında, ortaya çıkan değerin teorik üst sınır olan 1'e yaklaşması modelin sınıflandırma yeteneğinin mükemmel olduğunu kanıtlar.

Answer

Doğrusal ayırma katsayılarının serbestlik dereceleriyle ağırlıklandırılmış havuzlanmış matris kullanılarak hesaplandığını ve sınıflandırmanın kesim noktasına göre yapıldığını belirten seçenek.
Fisher'in önerdiği doğrusal ayırma fonksiyonunda (LDF), iki grubun kitle varyans-kovaryans matrislerinin eşit olduğu varsayıldığında, her iki grubun varyans matrisleri, örneklem büyüklüklerinin serbestlik derecelerine göre ağırlıklandırılarak ortak (havuzlanmış) matris elde edilir. Fonksiyonun katsayıları a=Spool1(Xˉ1Xˉ2)a = S_{pool}^{-1}(\bar{X}_1 - \bar{X}_2) olarak tespit edilir. Hesaplanan her bir Y=aXY = a'X skoru, grupların ortalama skorlarının tam orta noktası (veya öncelik olasılıklarına göre ağırlıklandırılmış noktası) olan bir kesim noktası (cut-off) değerine göre sınıflandırılır. Bu seçenekteki ifade bütünüyle doğru bir teorik tanımdır.

Step-by-Step Solution

1
Değişkenlerin yapısal varsayımlarını değerlendirmek.
Diskriminant analizinde bağımlı değişken kategorik (sınıf etiketleri), bağımsız değişkenler ise sürekli olmalıdır.
Bağımlı değişkenin sürekli olması gerektiğini öne süren ifade temel varsayımlara aykırıdır.
2
Box's M testi sonucunu ve hatalı havuzlama yaklaşımını analiz etmek.
Homojenlik varsayımı ihlal edilirse (p < 0.05), LDF yerine karesel diskriminant (QDA) uygulanmalıdır. Hatalı biçimde örneklem büyüklüklerini göz ardı eden basit aritmetik ortalama (Spool=S1+S22S_{pool} = \frac{S_1 + S_2}{2}) kullanılamaz.
Bu yüzden Box's M testinin anlamlı çıkması durumunda LDF'ye hatalı bir havuzlama ile devam edileceğini söyleyen ifade yanlıştır.
3
Wilks' Lambda (Λ\Lambda) yorumunu incelemek.
Wilks' Lambda değerinin sıfıra yaklaşması yüksek ayırma gücünü, 1'e yaklaşması ise zayıf ayırma gücünü ifade eder.
1'e yaklaşmanın mükemmel sınıflandırma anlamına geldiğini belirten seçenek ters bir yorum içermektedir.
4
Sınıflandırma matrisi ve beklenen hata hesaplamasını incelemek.
Sınıflandırma oranları belirlenirken ve kesim noktası atanırken mutlaka öncelik olasılıkları (prior probabilities) gözetilmelidir.
Öncelik olasılıklarının dikkate alınmaması gerektiği ifadesi yanlıştır.
5
Fisher'in doğrusal fonksiyonunu formüle etmek.
Homojen matris varsayımı altında, grupların örneklem büyüklükleriyle (ni1n_i - 1) orantılı hesaplanan SpoolS_{pool} havuzlanmış matrisi alınır ve a=Spool1(Xˉ1Xˉ2)a = S_{pool}^{-1}(\bar{X}_1 - \bar{X}_2) denklemiyle fonksiyon ağırlıkları bulunur. Yeni gözlem bu fonksiyonda yerine konur ve skor bir kesim noktasıyla (m) karşılaştırılır.
Bu önerme Fisher LDF yönteminin matematiksel altyapısını eksiksiz ve doğru biçimde aktarmaktadır.

Key Concept

Fisher Doğrusal Ayırma Fonksiyonu Formülasyonu ve Varsayımları
Estimated Time:2m 0s
Rate this question