Diskriminant (Ayırma) Analizi
85 soru
Bir Çevre, Şehircilik ve İklim Değişikliği Bakanlığı projesinde, illerdeki hava kalitesi istasyonlarından alınan veriler kullanılarak bölgeler "Riskli" () ve "Risksiz" () olarak iki gruba ayrılmak istenmektedir. Kurulan diskriminant fonksiyonunun performansını değerlendirmek üzere bölgeden oluşan bir eğitim veri seti kullanılarak aşağıdaki sınıflandırma matrisi elde edilmiştir:
| Gerçek Durum | 'e Atanan (Riskli) | 'ye Atanan (Risksiz) | Toplam |
|---|---|---|---|
| ** (Riskli)** | |||
| ** (Risksiz)** |
Araştırmacılar, geçmiş yıllara ait kapsamlı verilere dayanarak ülke genelinde bir bölgenin gerçekten riskli olma olasılığını (öncelikli olasılık) ve risksiz olma olasılığını olarak belirlemişlerdir.
Buna göre, elde edilen diskriminant fonksiyonu için hesaplanan beklenen hata oranı kaçtır?
Orman Genel Müdürlüğü, ormanlık alanları meteorolojik ve topoğrafik özelliklerine göre "Yangın Riski Düşük" () ve "Yangın Riski Yüksek" () olmak üzere iki gruba ayırmak için bir diskriminant fonksiyonu geliştirmiştir.
Geçmiş yıllara ait verilere göre bir bölgenin grubuna ait olma önsel olasılığı ve grubuna ait olma önsel olasılığı olarak belirlenmiştir.
Riskli bir alanı () risksiz () olarak yanlış sınıflandırmanın maliyeti (), risksiz bir alanı () riskli () olarak yanlış sınıflandırmanın maliyetinin () 4 katıdır. Yani 'dir.
Geliştirilen sınıflandırma modelinin 300 farklı ormanlık alan üzerindeki test sonuçlarına göre oluşturulan sınıflandırma matrisi aşağıda verilmiştir:
| Gerçek Durum | Olarak Sınıflandırılan | Olarak Sınıflandırılan | Toplam |
|---|---|---|---|
| (Risksiz) | 140 | 60 | 200 |
| (Riskli) | 20 | 80 | 100 |
Buna göre, bu sınıflandırma kuralı için "Beklenen Yanlış Sınıflandırma Maliyeti (ECM)" değeri, maliyeti cinsinden aşağıdakilerden hangisidir?
Bir tarım uzmanı, farklı buğday çeşidini birbirinden ayırmak amacıyla, buğday tanelerinden elde edilen farklı fizikokimyasal özelliği kullanarak çok gruplu diskriminant analizi uygulamıştır. Toplam buğday tanesinin incelendiği bu çalışmada, elde edilen sınıflandırma matrisinin esas köşegeni üzerindeki elemanların toplamı olarak bulunmuştur. Ayrıca, modele ilişkin elde edilen ilk iki diskriminant fonksiyonunun Wilks' (Lambda) değerleri sırasıyla ve olarak hesaplanmıştır.
Bu analiz sonuçlarına ve diskriminant analizinin teorik yapısına göre aşağıdaki ifadelerden hangisi doğrudur?
Bir siber güvenlik uzmanı, ağ trafiğini 'Normal', 'DDoS Saldırısı' ve 'Zararlı Yazılım İletişimi' olmak üzere üç farklı sınıfa ayırmak amacıyla diskriminant (ayırma) analizi uygulamaktadır. Uzman, analize dahil ettiği dört farklı sürekli ağ trafik değişkeninin () ayırma gücünü tek tek değerlendirmiş ve her bir değişken için aşağıdaki Wilks' Lambda () istatistiklerini hesaplamıştır:
* değişkeni için
* değişkeni için
* değişkeni için
* değişkeni için
Uzman ayrıca, gruplar arası ayırımın genel düzeyini değerlendirmek için sınıf merkezleri arasındaki Mahalanobis uzaklıklarını () incelemektedir.
Buna göre, elde edilen istatistiklerin yorumlanmasıyla ilgili aşağıdaki ifadelerden hangisi doğrudur?
Bir iklim bilimci, bir bölgedeki mikroklima alanlarını sıcaklık, nem, rüzgar hızı, bitki örtüsü yoğunluğu ve toprak nemi olmak üzere farklı değişkene dayanarak "Kurak", "Yarı Kurak", "Ilıman" ve "Nemli" olmak üzere farklı gruba ayırmak için çok gruplu diskriminant analizi uygulamıştır.
Analiz sonucunda modelin genel Wilks' Lambda değeri () olarak hesaplanmış ve sınıflandırma matrisinde incelenen toplam bölgeden 'ı kendi orijinal grubuna doğru şekilde atanmıştır.
Buna göre, kurulan modelle ilgili aşağıdaki ifadelerden hangisi doğrudur?
Bir çevre mühendisi, su havzalarının kirlilik seviyelerini (Temiz, Az Kirlenmiş, Çok Kirlenmiş) sınıflandırmak amacıyla 8 farklı kimyasal ölçüm üzerinden adım adım (stepwise) diskriminant analizi uygulamaktadır. Analizin bir aşamasında modele ve değişkenleri dâhil edilmiş olup, bu modelin Wilks' Lambda değeri olarak hesaplanmıştır.
Bir sonraki adımda, modele dâhil edilmeye aday ve değişkenleri için şu sonuçlar elde edilmiştir:
- Modele sadece eklendiğinde yeni Wilks' Lambda değeri olmaktadır.
- Modele sadece eklendiğinde yeni Wilks' Lambda değeri olmaktadır.
Ayrıca, yeni bir değişken modele alındıktan sonra yapılan geriye dönük önem kontrolünde, daha önce modele dâhil edilmiş olan değişkeninin ayrım gücüne sağladığı kısmi katkıyı test eden (F-to-remove) istatistiği, belirlenen kritik tolerans değerinin altına inmiştir.
Bu bilgilere ve adım adım diskriminant analizinin değişken seçimi kriterlerine göre, araştırmacının izlemesi gereken istatistiksel prosedür aşağıdakilerden hangisinde doğru ifade edilmiştir?
Bir eğitim bilimleri araştırmacısı, üniversite öğrencilerinin yerleştikleri bölümleri (Eşit Ağırlık, Sayısal, Sözel) temel alarak, dört farklı bilişsel yetenek testinden () alınan puanların ayırma gücünü incelemek amacıyla diskriminant (ayırma) analizi uygulamıştır.
Her bir yetenek testinin grupları ayırma gücünü bağımsız olarak değerlendirmek için hesaplanan Wilks' Lambda () değerleri aşağıda verilmiştir:
Araştırmacı ayrıca bölümlerin ağırlık merkezleri (sentroidleri) arasındaki Mahalanobis uzaklıklarını () hesaplamış ve en yüksek uzaklığın , en düşük uzaklığın ise olduğunu belirlemiştir.
Buna göre, analiz sonuçlarının yorumlanması ile ilgili aşağıdaki ifadelerden hangisi doğrudur?
Bir insan kaynakları uzmanı, işe başvuran adayları "İşe Alınmalı", "Yedek Listeye Alınmalı" ve "Reddedilmeli" olmak üzere üç gruba ayırmak amacıyla diskriminant analizi uygulamıştır. Analizde bağımsız değişken olarak adayların "Genel yetenek sınav puanı ()", "Mülakat puanı ()" ve "Mesleki deneyim süresi ()" kullanılmıştır.
Analiz sonucunda elde edilen ilk iki diskriminant fonksiyonuna ait standartlaştırılmış katsayılar ve Wilks' Lambda () istatistikleri aşağıdaki tabloda verilmiştir:
| Değişken / İstatistik | 1. Fonksiyon () | 2. Fonksiyon () |
|---|---|---|
| (Genel Yetenek) | 0,82 | -0,35 |
| (Mülakat) | 0,55 | 0,78 |
| (Deneyim) | -0,18 | 0,65 |
| Wilks' Lambda () | 0,15 | 0,72 |
Bu analiz sonuçları ve diskriminant analizinin teorik yapısı dikkate alındığında, aşağıdaki ifadelerden hangisi doğrudur?
Bir e-ticaret platformunun veri bilimcisi, müşterileri satın alma davranışlarına göre "Sadık", "Potansiyel", "Riskli" ve "Kayıp" olmak üzere farklı segmente ayırmak istemektedir. Bu amaçla, müşterilerin platformdaki hareketlerini yansıtan farklı sürekli değişken (ziyaret sıklığı, ortalama sepet tutarı, sepette bekleme süresi vb.) kullanılarak Çok Gruplu Diskriminant Analizi uygulanmıştır.
Analiz sonucunda Wilks' Lambda değeri () olarak hesaplanmış ve oluşturulan sınıflandırma matrisinde toplam müşteriden 'ünün başlangıçtaki gerçek segmenti ile modelin atadığı segmentin birbiriyle eşleştiği görülmüştür.
Buna göre, yapılan analiz ile ilgili aşağıdaki ifadelerden hangisi doğrudur?
Bir sivil havacılık otoritesi, uçuş verilerini kullanarak uçuşları "Güvenli Uçuş" () ve "Riskli Uçuş" () olmak üzere iki sınıfa ayırmak için bir diskriminant fonksiyonu geliştirmiştir. Geliştirilen model, toplam 500 uçuşluk bir test veri setine uygulanmış ve aşağıdaki sınıflandırma matrisi elde edilmiştir:
| Gerçek Sınıf | Olarak Sınıflandırılan | Olarak Sınıflandırılan | Toplam |
|---|---|---|---|
| (Güvenli) | 360 | 40 | 400 |
| (Riskli) | 15 | 85 | 100 |
Havacılık otoritesinin geçmiş verilerine göre, genel uçuş trafiği içinde bir uçuşun güvenli olma olasılığı (öncel olasılık) ve riskli olma olasılığı 'dur.
Güvenli bir uçuşu riskli olarak sınıflandırmanın maliyeti birim, riskli bir uçuşu güvenli olarak sınıflandırmanın maliyeti ise birim olarak belirlenmiştir.
Buna göre, bu sınıflandırma kuralı için Beklenen Hata Maliyeti (Expected Cost of Misclassification - ECM) aşağıdakilerden hangisidir?
Bir şehir bölge planlamacısı, bir büyükşehirdeki mahalleleri sosyoekonomik gelişmişlik düzeylerine göre "Düşük", "Orta-Düşük", "Orta-Yüksek" ve "Yüksek" olmak üzere farklı gruba ayırmak amacıyla Çok Gruplu Diskriminant Analizi uygulamıştır. Bu analizde, her mahalle için eğitim seviyesi, sağlık altyapısı, kişi başına düşen yeşil alan, ulaşım erişilebilirliği, hanehalkı büyüklüğü ve ortalama gelir düzeyi olmak üzere farklı sürekli değişken kullanılmıştır.
Analiz sonucunda modelin genel Wilks' Lambda değeri olarak hesaplanmıştır. Ayrıca oluşturulan sınıflandırma matrisine göre, analize dahil edilen toplam mahalleden 'i ait oldukları gruplara doğru bir şekilde atanmıştır.
Buna göre; modelden elde edilebilecek maksimum diskriminant fonksiyonu sayısı, Wilks' Lambda istatistiğinin yorumu ve analiz sonucunda elde edilen doğru sınıflandırma oranı (hit ratio) aşağıdakilerin hangisinde sırasıyla doğru verilmiştir?
Bir gıda kalite kontrol laboratuvarında görevli bir araştırmacı, zeytinyağı örneklerini üretildikleri coğrafi bölgelere (Ege, Marmara, Akdeniz) göre sınıflandırmak istemektedir. Bu amaçla 12 farklı yağ asidi bileşeninin ölçüm değerlerini kullanarak Adım Adım (Stepwise) Diskriminant Analizi uygulamaktadır.
Analizin değişken seçimi aşamasında, modele henüz girmemiş olan değişkenlerin modele dâhil edilme ve modeldeki mevcut değişkenlerin çıkarılma durumları algoritmik olarak değerlendirilmektedir.
Buna göre, araştırmacının adım adım diskriminant analizinde değişkenleri modele dâhil etme (F-to-enter) ve modelden çıkarma (F-to-remove) süreciyle ilgili aşağıdaki ifadelerden hangisi doğrudur?
Bir büyükşehir belediyesine bağlı su ve kanalizasyon idaresi, yeraltı su boru hatlarından alınan basınç ve akış sensörü verilerini kullanarak hatları (Sağlam) ve (Arızalı/Sızıntılı) olmak üzere iki sınıfa ayırmak için bir diskriminant fonksiyonu oluşturmuştur. Rassal olarak seçilen boru hattı üzerinde yapılan analiz sonucunda aşağıdaki sınıflandırma matrisi (karmaşıklık matrisi) elde edilmiştir:
| Gerçek Durum | 'e Atanan | 'ye Atanan | Toplam |
|---|---|---|---|
| (Sağlam) | 270 | 30 | 300 |
| (Arızalı) | 15 | 85 | 100 |
Buna göre, kurulan diskriminant fonksiyonunun Görünür Hata Oranı (Apparent Error Rate - APER) aşağıdakilerden hangisidir?
Tarım ve Orman Bakanlığına bağlı bir zirai araştırma enstitüsü uzmanı, yetiştirilen bir buğday türünün kalite sınıflarını (I. Sınıf, II. Sınıf ve III. Sınıf) tahmin edebilmek amacıyla bir istatistiksel model kurmayı planlamaktadır. Uzman, modelini oluştururken her bir buğday numunesinden elde ettiği protein oranı, nem miktarı ve gluten indeksi gibi metrik ölçümleri bağımsız değişkenler olarak kullanacaktır.
Bu amaçla diskriminant (ayırma) analizi kullanmaya karar veren uzman için, analizin temel varsayımları ve değişken özellikleri bağlamında aşağıdaki ifadelerden hangisi doğrudur?
Bir büyükşehir belediyesi ulaşım planlama birimi, şehirdeki kavşakları kaza risklerine göre "Yüksek Riskli", "Orta Riskli" ve "Düşük Riskli" olarak üç gruba ayırmak amacıyla çoklu diskriminant (ayırma) analizi uygulamaktadır.
Analizde bağımsız değişken olarak şunlar kullanılmıştır:
- : Günlük ortalama araç geçiş sayısı
- : Kavşaktaki sinyalizasyon faz sayısı
- : Yaya geçidi yoğunluk indeksi
- : Kavşağa bağlanan şerit sayısı
Analiz sonucunda elde edilen birinci diskriminant fonksiyonu () için istatistikler şu şekildedir:
- Fonksiyonun Wilks' (Lambda) değeri: ()
- Standartlaştırılmış diskriminant katsayıları (Ağırlıklar): , , ,
- Yapı matrisi (Structure matrix) korelasyonları (Yükler): , , ,
Bu bulgulara göre, analizin sonuçları hakkında yapılan aşağıdaki değerlendirmelerden hangisi istatistiksel olarak doğrudur?
Bir kamu kurumunda belediyelerin "Finansal Sürdürülebilirlik" düzeylerini (Yüksek, Orta, Düşük) sınıflandırmak amacıyla yürütülen bir araştırmada adım adım (stepwise) diskriminant analizi uygulanmaktadır. Analizin belirli bir adımında, henüz modele dâhil edilmemiş üç aday değişkenin istatistikleri aşağıdaki tabloda sunulmuştur:
| Değişken | Kısmi Değeri | Wilks' Lambda |
|---|---|---|
Analiz için belirlenen giriş eşiği () olduğuna göre, bu adımda modele dâhil edilecek değişken ve seçim kriteri aşağıdakilerden hangisidir?
Bir araştırmacı, hanehalklarını "Yüksek Tüketim" ve "Düşük Tüketim" gruplarına ayırmak amacıyla iki değişkenli bir diskriminant analizi uygulamıştır. Analiz sonucunda elde edilen katsayılar aşağıdaki tabloda sunulmuştur:
| Katsayı Türü | (Aylık Gelir) | (Eğitim Süresi) | Sabit Terim |
|---|---|---|---|
| Ham Katsayılar | |||
| Standartlaştırılmış Katsayılar | - |
değişkeni TL cinsinden aylık geliri, değişkeni ise yıl cinsinden eğitim süresini temsil etmektedir. ve değerlerine sahip bir hanehalkı için elde edilecek diskriminant skoru ve değişkenlerin grupları ayırmadaki göreli önemi hakkında aşağıdakilerden hangisi doğrudur?
Bir banka, kredi başvurularını "Düşük Risk" () ve "Yüksek Risk" () olarak iki gruba ayırmak için diskriminant analizi kullanmaktadır. Başvuru sahiplerinin 'inin düşük riskli, 'unun ise yüksek riskli olduğu bilinmektedir. Yapılan analiz sonucunda, düşük riskli bir başvurunun hatalı olarak yüksek riskli grupta sınıflandırılma olasılığı ; yüksek riskli bir başvurunun ise hatalı olarak düşük riskli grupta sınıflandırılma olasılığı olarak belirlenmiştir. Buna göre, bu sınıflandırma kuralı için toplam beklenen hata oranı (expected error rate) kaçtır?
Bir veri bilimci, iki farklı coğrafi bölgeden toplanan ve hacimli örneklemler üzerinden, ait oldukları lokasyonları tahmin etmek amacıyla Fisher tarafından geliştirilen iki gruplu doğrusal diskriminant fonksiyonunu modellemektedir.
Ön analizlerde uygulanan Box's M testi sonucunda "kitle varyans-kovaryans matrisleri homojendir" () hipotezi reddedilememiştir.
Bu çok değişkenli yöntemin matematiksel formülasyonu, dayandığı varsayımlar ve sınıflandırma mantığı dikkate alındığında aşağıdakilerden hangisi doğrudur?
Bir bankanın kredi risk birimi, yeni kredi başvurularını "Düşük Riskli" ve "Yüksek Riskli" şeklinde iki gruba ayırmak amacıyla adım adım (stepwise) diskriminant analizi yöntemiyle bir model oluşturmaktadır. Analizin başlangıç aşamasında, modele dâhil edilmemiş dört potansiyel tahmin değişkeninin tek başlarına modele girmeleri durumunda hesaplanan Wilks' Lambda () değerleri şu şekildedir:
| Değişken | Wilks' Lambda () |
|---|---|
| (Aylık Gelir) | |
| (Mevcut Borç Tutarı) | |
| (Kredi Kayıt Bürosu Skoru) | |
| (Müşteri Yaşı) |
İstatistiksel olarak modele dâhil edilme kriterlerinin (F-to-enter) tüm değişkenler için sağlandığı varsayıldığında, bu adımda modele dâhil edilmesi gereken ilk değişken aşağıdakilerden hangisidir?