Diskriminant (Ayırma) Analizi
85 soru
Bir kamu politikasının etkilerini değerlendirmek üzere, ilçe belediyesi çevre yönetimi performanslarına göre 'A Sınıfı', 'B Sınıfı', 'C Sınıfı' ve 'D Sınıfı' olmak üzere bağımlı kategoriye ayrılmıştır. Sınıflandırmayı açıklamak için her bir belediyeye ait; bütçe büyüklüğü, yeşil alan oranı, atık geri dönüşüm tonajı, hava kalitesi indeksi, kişi başı su tüketimi ve gürültü kirliliği düzeyi olmak üzere toplam bağımsız değişken kullanılarak çok gruplu diskriminant analizi uygulanmıştır.
Analiz sonucunda, sınıflandırma matrisinde köşegen üzerinde yer alan (doğru sınıflandırılan) gözlem sayılarının toplamı olarak bulunmuştur. Ayrıca, türetilen birinci diskriminant fonksiyonu için Wilks' Lambda () değeri olarak hesaplanırken, sonuncu diskriminant fonksiyonu için bu değer olarak elde edilmiştir.
Bu analizin sonuçlarına ilişkin aşağıdaki değerlendirmelerden hangisi kesinlikle doğrudur?
Bir genetik araştırmacısı, üç farklı hastalığın gen ekspresyon profilleri arasındaki ayrımı modellemek için 15 farklı genin ifade düzeyleri üzerinden adım adım (stepwise) diskriminant analizi uygulamaktadır. Başlangıçta hiçbir genin modelde olmadığı bu analizde, her adımda değişkenlerin modele dahil edilmesi ve modelden çıkarılması süreci belirli istatistiksel kriterlere göre yürütülmektedir.
Bu araştırmada uygulanan değişken seçimi ve değerlendirme kriterleriyle ilgili aşağıdaki ifadelerden hangisi doğrudur?
Bir sağlık uzmanı, sürekli bir ölçekle ölçülmüş çeşitli fizyolojik verileri (kan basıncı, kolesterol seviyesi, vücut kitle indeksi vb.) kullanarak hastaları hastalık ilerleme durumlarına göre 'Düşük Risk', 'Orta Risk' ve 'Yüksek Risk' olmak üzere önceden tanımlanmış üç gruba ayırmak amacıyla Diskriminant (Ayırma) Analizi uygulamayı planlamaktadır.
Buna göre, uzmanın kullanacağı analiz yönteminin yapısı ve temel varsayımları ile ilgili aşağıdaki ifadelerden hangisi doğrudur?
Kamu personel alımlarında adayların liyakat durumlarını nesnel ölçütlerle değerlendirmek amacıyla, adayların 'Mülakat', 'Yazılı Sınav' ve 'Uygulama Testi' puanlarından oluşan çok değişkenli veri seti kullanılarak İki Gruplu Diskriminant Analizi (Fisher'in Doğrusal Ayırma Fonksiyonu) gerçekleştirilecektir. Adaylar, önceden belirlenmiş olan 'Atanmaya Hak Kazananlar' ve 'Atanamayanlar' olmak üzere iki kategoriye sınıflandırılacaktır.
Analizin varsayımları, modelin elde edilişi ve ayırma katsayılarının hesaplanması süreci göz önüne alındığında, aşağıdaki ifadelerden hangisi istatistiksel olarak doğrudur?
Bir elektronik parça üretim tesisinde, üretilen mikroçipler kalite kontrol sürecinden geçirilerek "Uygun" () ve "Kusurlu" () olmak üzere iki sınıfa ayrılmaktadır.
Geçmiş verilere göre, üretim bandından çıkan parçaların %80'inin uygun, %20'sinin ise kusurlu olduğu bilinmektedir (, ).
Kalite kontrol sisteminin performansını test etmek amacıyla rastgele seçilen 200 parça incelenmiş ve aşağıdaki sınıflandırma matrisi (karmaşıklık matrisi) elde edilmiştir:
| Gerçek Durum | Tahmin Edilen: (Uygun) | Tahmin Edilen: (Kusurlu) | Toplam |
|---|---|---|---|
| ** (Uygun)** | 135 | 15 | 150 |
| ** (Kusurlu)** | 10 | 40 | 50 |
Bir uygun parçanın yanlışlıkla kusurlu olarak sınıflandırılmasının maliyeti , kusurlu bir parçanın yanlışlıkla uygun olarak sınıflandırılmasının maliyeti ise olarak belirlenmiştir.
Buna göre, bu kalite kontrol sistemine ait tahmini Beklenen Yanlış Sınıflandırma Maliyeti (ECM) kaç TL'dir?
Bir kamu kurumu insan kaynakları dairesi, uzman yardımcılığı kadrosuna başvuran adayları yazılı sınav, sözlü mülakat ve yabancı dil yeterlilik puanlarına göre "Atanmaya Hak Kazananlar", "Yedek Liste" ve "Başarısız" şeklinde üç gruba ayırmak için Diskriminant (Ayırma) Analizi kullanmayı planlamaktadır.
Bu analizin amacı ve temel varsayımları dikkate alındığında, aşağıdaki ifadelerden hangisi doğrudur?
Bir e-ticaret şirketi, müşterilerinin tekrar alışveriş yapma eğilimlerini incelemek amacıyla diskriminant analizi uygulamaktadır. Müşteriler, "Tekrar Alışveriş Yapanlar" () ve "Tekrar Alışveriş Yapmayanlar" () olarak iki gruba ayrılmıştır.
Şirketin müşteri tabanına göre, rastgele seçilen bir müşterinin tekrar alışveriş yapma öncel olasılığı , yapmama öncel olasılığı ise 'tir.
Analiz sonucunda elde edilen sınıflandırma (karmaşıklık) matrisi aşağıda verilmiştir:
| Gerçek Grup | 'e Atanan | 'ye Atanan | Toplam |
|---|---|---|---|
Buna göre, öncel olasılıklar dikkate alındığında bu sınıflandırma kuralı için beklenen hata oranı kaçtır?
Bir tarımsal araştırma enstitüsünde görevli bir uzman, tarım arazilerini verimlilik düzeylerine göre (yüksek, orta, düşük) sınıflandırmak amacıyla diskriminant analizi uygulamaktadır. Sınıflandırmada kullanılacak üç farklı toprak bileşeni (: Azot, : Fosfor, : Potasyum) için tek değişkenli ayırma güçleri incelenmiş ve her bir değişken için hesaplanan Wilks' Lambda () istatistikleri sırasıyla , ve olarak bulunmuştur. Ayrıca, bileşenine göre yüksek ve düşük verimli araziler arasındaki Mahalanobis uzaklığı (), bileşenine göre hesaplanan uzaklıktan anlamlı derecede daha büyük çıkmıştır.
Verilen bu bilgilere göre, değişkenlerin ayırma güçleri ve diskriminant analizinin sonuçları ile ilgili aşağıdaki ifadelerden hangisi kesinlikle doğrudur?
Bir siber güvenlik uzmanı, kurumsal ağ üzerindeki siber saldırı girişimlerini ağ trafiğinin özelliklerine göre sınıflandırmak istemektedir. Uzman, olayları "Zararsız", "Düşük Tehdit", "Orta Tehdit", "Yüksek Tehdit" ve "Kritik Tehdit" olmak üzere gruba ayırmıştır. Bu grupları birbirinden en iyi şekilde ayırabilmek için paket boyutu ve gecikme süresi gibi farklı bağımsız sürekli değişken kullanılarak "Çok Gruplu Diskriminant Analizi" yapılacaktır.
Buna göre, uygulanacak analiz ve sonuçların yorumlanmasıyla ilgili aşağıdaki ifadelerden hangisi istatistiksel olarak doğrudur?
Bir tıbbi araştırma ekibi, hastaları üç farklı nörolojik bozukluk teşhisi (Tip A, Tip B, Tip C) altında sınıflandırmak amacıyla beyin omurilik sıvısındaki (BOS) dört farklı biyobelirteç seviyesini ölçerek diskriminant (ayırma) analizi uygulamaktadır. Araştırmacılar, analizde kullanmak üzere iki farklı biyobelirteç alt kümesini (Model I ve Model II) değerlendirmiştir.
Yapılan analizler sonucunda, gruplar içi kareler ve çarpımlar matrisi () ile toplam kareler ve çarpımlar matrisi () kullanılarak Wilks' Lambda () istatistikleri elde edilmiştir. Model I için , Model II için ise olarak hesaplanmıştır. Ayrıca, Model II kullanılarak elde edilen gruplar arası Mahalanobis uzaklıkları () incelendiğinde, en büyük uzaklık değerinin Tip A ile Tip B hastalık grupları arasında olduğu tespit edilmiştir.
Bu araştırma bulguları ve diskriminant analizinde ayırma gücünün değerlendirilmesi ilkeleri dikkate alındığında, aşağıdaki ifadelerden hangisi doğrudur?
Bir eğitim denetmeni, ülke genelindeki liseleri kurumsal kapasitelerine göre "A-Üstün", "B-Standart", "C-Destek Gerektiren" ve "D-Kritik" olmak üzere farklı kategoriye ayırmayı hedeflemektedir. Bu amaçla liselere ait bütçe yeterliliği, öğrenci-öğretmen oranı, laboratuvar sayısı, devamsızlık oranı ve mezuniyet not ortalamasını içeren farklı nicel gösterge üzerinden çok gruplu diskriminant analizi gerçekleştirmiştir.
Analiz sonucunda türetilen diskriminant fonksiyonlarına ilişkin Wilks' Lambda değerleri sırasıyla (), () ve () olarak hesaplanmıştır. Ayrıca kurulan modelin sınıflandırma matrisinde (hata matrisi) esas köşegen üzerindeki elemanların toplamı , köşegen dışında yer alan elemanların toplamı ise olarak raporlanmıştır.
Buna göre, gerçekleştirilen analiz ve modelin performansı hakkında aşağıdaki ifadelerden hangisi kesinlikle doğrudur?
Bir kalkınma ajansı, yetki alanındaki ilçeleri ekonomik faaliyet yoğunluklarına göre "Tarım", "Sanayi" ve "Hizmet" merkezleri olarak üç gruba ayırmak amacıyla diskriminant (ayırma) analizi uygulamıştır. Bağımsız değişkenler olarak : Nitelikli İşgücü Endeksi, : Altyapı Yatırımları Endeksi ve : Enerji Tüketimi Endeksi kullanılmıştır. Analiz sonucunda elde edilen ilk iki diskriminant fonksiyonuna ( ve ) ait istatistikler aşağıdaki tabloda verilmiştir:
| İstatistik / Katsayı | Fonksiyonu | Fonksiyonu |
|---|---|---|
| Wilks' | 0,25 | 0,80 |
| Açıklanan Varyans Oranı | %88 | %12 |
| Standartlaştırılmamış Katsayılar | ||
| Sabit Terim | ||
| 0,4 | 0,1 | |
| 0,3 | ||
| 0,2 | 0,4 | |
| Standartlaştırılmış Katsayılar | ||
| 0,35 | 0,20 | |
| 0,45 | ||
| 0,50 | 0,60 |
Ayrıca, yeni değerlendirilen bir ilçenin ham endeks değerleri , ve olarak ölçülmüştür.
Buna göre, analiz sonuçlarının değerlendirilmesi ve söz konusu ilçenin birinci diskriminant skorunun () hesaplanmasıyla ilgili aşağıdaki ifadelerden hangisi doğrudur?
Bir ulusal siber güvenlik merkezi, ağ trafiği günlüklerini diskriminant analizi kullanarak "Normal Trafik" () ve "Siber Saldırı" () olarak iki gruba ayırmaktadır. Geçmiş verilere göre sisteme gelen bir trafiğin normal olma olasılığı (öncel olasılık) , siber saldırı olma olasılığı ise 'dur.
Sınıflandırma hatalarının maliyetleri incelendiğinde; siber saldırının normal trafik olarak sınıflandırılmasının maliyeti birim, normal trafiğin siber saldırı olarak sınıflandırılmasının maliyeti ise birim olarak belirlenmiştir.
Geliştirilen ayırma fonksiyonunun performansını değerlendirmek için elde edilen sınıflandırma matrisi aşağıda verilmiştir:
| Gerçek Durum | Olarak Sınıflandırılan | Olarak Sınıflandırılan | Toplam |
|---|---|---|---|
| (Normal) | 270 | 30 | 300 |
| (Saldırı) | 40 | 160 | 200 |
Buna göre, bu sınıflandırma kuralı için hesaplanan Beklenen Yanlış Sınıflandırma Maliyeti (ECM - Expected Cost of Misclassification) tahmini değeri aşağıdakilerden hangisidir?
Bir finansal risk analisti, kredi başvurusunda bulunan müşterileri 'Düşük Riskli', 'Orta Riskli' ve 'Yüksek Riskli' olmak üzere üç gruba ayırmak amacıyla diskriminant (ayırma) analizi uygulamaktadır. Analist, modele bağımsız değişken olarak dahil etmeyi planladığı dört farklı sayısal özelliğin () grupları ayırma gücünü tek tek değerlendirmiştir. Yapılan ön analizler sonucunda bu değişkenlere ilişkin hesaplanan Wilks' Lambda () değerleri aşağıda verilmiştir:
- değişkeni için
- değişkeni için
- değişkeni için
- değişkeni için
Buna göre, grupları birbirinden ayırma gücü en yüksek olan değişken hangisidir ve bu durumun teorik gerekçesi aşağıdakilerden hangisinde doğru ifade edilmiştir?
Bir meteoroloji enstitüsünde görevli bir veri bilimci, gün sonu hava durumunu "Açık", "Bulutlu" ve "Yağışlı" olmak üzere üç farklı kategoriye ayırmak amacıyla 10 farklı atmosferik ölçüm değişkenini kullanarak bir sınıflandırma modeli kurmak istemektedir. Değişken sayısını optimize etmek için analize adım adım (stepwise) diskriminant analizi uygulanmıştır.
Analiz sürecinde modele birinci adımda "Bağıl Nem", ikinci adımda "Rüzgâr Hızı" ve üçüncü adımda "Hava Basıncı" dâhil edilmiştir. Ancak dördüncü adıma gelindiğinde, algoritma daha önce modele girmiş olan "Rüzgâr Hızı" değişkenini modelden çıkarmıştır.
Buna göre, adım adım diskriminant analizinde "Rüzgâr Hızı" değişkeninin dördüncü adımda modelden çıkarılmasının temel istatistiksel gerekçesi ve bu işlemin modelin **Wilks' Lambda () istatistiği** üzerindeki beklenen etkisi aşağıdakilerin hangisinde doğru açıklanmıştır?
Ticaret Bakanlığına bağlı bir bölge gümrük müdürlüğünde görevli risk analisti, gümrükten geçen ticari kargoları geçmiş denetim verilerine dayanarak "Rutin İşlem", "Fiziki Kontrol" ve "Detaylı İnceleme" olmak üzere üç ayrı kategoriye ayırmak istemektedir. Analist, bu sınıflandırma işlemi için kargonun ağırlığı, hacmi ve beyan edilen faturadaki birim değeri gibi sayısal değişkenleri baz alan bir Diskriminant (Ayırma) Analizi modeli kurmayı planlamaktadır.
Bu analizin temel amacı, varsayımları ve değerlendirme kriterleri dikkate alındığında aşağıdaki ifadelerden hangisi doğrudur?
Bir gümrük muhafaza müdürlüğünde, ülkeye giriş yapan ticari kargolar risk profillerine göre diskriminant analizi kullanılarak (Risksiz Kargo) ve (Riskli Kargo) olmak üzere iki gruba ayrılmaktadır. Geçmiş veriler üzerinden oluşturulan sınıflandırma modelinin performansını değerlendirmek amacıyla toplam adet kargo incelenmiş ve aşağıdaki sınıflandırma (karmaşıklık) matrisi elde edilmiştir:
| Gerçek Durum | (Risksiz) Olarak Sınıflandırılan | (Riskli) Olarak Sınıflandırılan | Toplam |
|---|---|---|---|
| ** (Risksiz)** | |||
| ** (Riskli)** |
Buna göre, gerçekte riskli olan bir kargonun modele göre risksiz olarak sınıflandırılma olasılığı ile modelin Görünür Hata Oranı (APER) sırasıyla aşağıdakilerden hangisidir?
Bir İl Sağlık Müdürlüğü, sorumluluk alanındaki ilçeleri demografik ve çevresel risk faktörlerine göre 'Düşük Riskli', 'Orta Riskli' ve 'Yüksek Riskli' olmak üzere üç sınıfa ayırmak için diskriminant (ayırma) analizi yapmaktadır.
Analizde bağımsız değişken olarak üç temel gösterge belirlenmiştir:
- : Yıllık ortalama partikül madde miktarı
- : Bin kişi başına düşen hastane yatağı sayısı
- : Nüfus yoğunluğu
Araştırmacı, her bir değişkenin ayırma gücünü test etmek için değişkenleri modele tek tek dahil ettiğinde aşağıdaki Wilks' Lambda () istatistiklerini elde etmiştir:
- için
- için
- için
Tüm değişkenlerin eş zamanlı olarak modele eklendiği durumda ise genel modelin Wilks' Lambda değeri olarak hesaplanmıştır.
Bu bulgulara göre, yapılan analizle ilgili aşağıdaki ifadelerden hangisi kesinlikle doğrudur?
Bir insan kaynakları uzmanı, çalışanların performans düzeylerini "Düşük", "Orta" ve "Yüksek" olmak üzere üç gruba ayırmak amacıyla çeşitli psikometrik test puanları, iletişim becerisi ve problem çözme hızı gibi 12 farklı bağımsız değişken kullanarak bir model kurmak istemektedir. Uzman, değişkenler arasında çoklu bağlantı (multicollinearity) olabileceğini düşünerek, ayrım gücüne en fazla katkı sağlayan değişkenleri belirlemek için Adım Adım (Stepwise) Diskriminant Analizi yöntemini kullanmaya karar vermiştir.
Buna göre, analizin "ileri seçme" (forward selection) aşamasında modele yeni bir değişkenin eklenmesi sürecinde aşağıdaki kriterlerden hangisi temel alınır?
Bir ulaşım mühendisi, karayolu ağındaki kavşakları kaza risk düzeylerine göre farklı kategoriye (Düşük, Orta, Yüksek) ayırmak amacıyla, kavşakların fiziksel ve trafik akım özelliklerini yansıtan bağımsız değişken kullanarak çok gruplu diskriminant analizi uygulamıştır.
Analiz sonucunda hesaplanan Wilks' Lambda () istatistiği bulunmuştur. Elde edilen sınıflandırma matrisinde, kavşakların tahmin edilen ve gerçek risk grupları karşılaştırıldığında esas köşegen üzerinde yer alan (doğru sınıflandırılmış) gözlem sayıları sırasıyla , ve olarak elde edilmiştir. Analize dahil edilen toplam kavşak sayısı ise 'dür.
Bu analiz modeline ilişkin aşağıdaki değerlendirmelerden hangisi doğrudur?