Kümeleme Analizi
56 soru
Bir çevre mühendisi, dört farklı gölden () aldığı su numunelerinin kirlilik düzeylerini sınıflandırmak için hiyerarşik kümeleme analizi uygulamaktadır. Başlangıç uzaklık matrisi aşağıda verilmiştir:
| **** | ||||
| **** | ||||
| **** | ||||
| **** |
İlk aşamada birbirine en yakın olan ve numuneleri birleştirilerek kümesi oluşturulmuştur.
Mühendis, analizin devamında kümeler arası uzaklığı belirlerken 'zincirleme (chaining) etkisinden kaçınan ve genellikle sıkı (kompakt), küresel kümeler üretme eğiliminde olan' yöntemi kullanmaya karar vermiştir.
Buna göre, belirtilen yöntemin kullanılması durumunda analizin ikinci adımında hangi kümeler (veya numuneler) birleştirilir ve bu birleşme hangi uzaklık seviyesinde gerçekleşir?
Bir finansal analist, borsada işlem gören şirketleri bilanço özelliklerine ve kârlılık oranlarına göre homojen alt gruplara ayırmak amacıyla yığılmalı (agglomeratif) hiyerarşik kümeleme analizi uygulamaktadır. Analist, birleştirme aşamasında kümeler arası uzaklığı uç noktalar veya ortalamalar üzerinden tanımlamak yerine; her adımda bir araya geldiğinde küme içi hata kareler toplamındaki (Error Sum of Squares) artışı en küçük (minimum) yapacak iki kümeyi birleştiren algoritmayı tercih etmiştir.
Buna göre, analistin kullandığı kümeleme yöntemi aşağıdakilerden hangisidir?
Bir araştırmacı, K-Ortalamalar (K-Means) algoritmasını kullanarak sismik olayları sınıflandırmayı amaçlamaktadır. Analizde "Odak Derinliği" () ve "Açığa Çıkan Enerji" () olmak üzere iki sürekli değişken kullanılmaktadır. Veri setinin tamamı üzerinden hesaplanan standart sapmalar sırasıyla ve olarak elde edilmiştir.
Algoritmanın başlangıç aşamasında, veri setinde yer alan üç gözlem noktası , ve olarak belirlenmiştir. Araştırmacı, ilk iterasyon için başlangıç küme merkezlerini ve olarak atamıştır.
Buna göre, Öklid uzaklığı kullanılarak yapılacak ilk kümeleme adımında noktasının atanacağı küme ile ilgili, veri setinin ham haliyle kullanılması ve Z-skoru ile standartlaştırılarak kullanılması durumlarındaki matematiksel sonuçlar aşağıdakilerin hangisinde sırasıyla doğru verilmiştir?
Bir araştırmacı, dört farklı ilin (K, L, M, N) sosyoekonomik gelişmişlik düzeylerini sınıflandırmak amacıyla hiyerarşik kümeleme analizi uygulamaktadır. İller arasındaki uzaklıkları gösteren matris aşağıda verilmiştir:
| İl | K | L | M | N |
|---|---|---|---|---|
| K | 0 | 2 | 10 | 8 |
| L | 2 | 0 | 4 | 6 |
| M | 10 | 4 | 0 | 3 |
| N | 8 | 6 | 3 | 0 |
Araştırmacı, analizinde tek bağlantı (en yakın komşu) yöntemini kullanmaktadır.
Buna göre, hiyerarşik kümelemenin ilk adımında oluşturulan yeni küme ile M ili arasındaki uzaklık değeri aşağıdakilerden hangisidir?
Bir pazar araştırmacısı, beş farklı müşteri segmentinin () davranışsal özelliklerindeki benzerlikleri incelemek için hiyerarşik kümeleme algoritmalarından "tek bağlantı (en yakın komşu)" yöntemini uygulamaktadır. Bu segmentlere ait başlangıç uzaklık matrisi aşağıda verilmiştir:
| **** | 0 | ||||
| **** | 5 | 0 | |||
| **** | 8 | 7 | 0 | ||
| **** | 6 | 9 | 3 | 0 | |
| **** | 7 | 4 | 5 | 8 | 0 |
Buna göre, algoritmada ilk birleşme adımı sonucunda oluşan yeni küme ile segmenti arasındaki uzaklık değeri kaçtır?
Bir araştırmacı, farklı ölçüm birimlerine sahip sürekli değişkenlerden oluşan bir veri setini K-Ortalamalar (K-Means) algoritması ile kümelere ayırmak istemektedir. Gözlemlerin merkezlere atanması aşamasında uzaklık ölçüsü olarak Öklid (Euclidean) uzaklığı tercih edilmiştir. Değişkenler herhangi bir standartlaştırma işlemine tabi tutulmadan (ham verilerle) analize dâhil edilmiştir. Araştırmacı, veri setindeki olası uç değerlerin (outliers) küme merkezlerini (centroid) aşırı derecede saptırmasını önlemek düşüncesiyle algoritmada bir modifikasyon yapmış; her iterasyon sonundaki merkez güncelleme adımında, ilgili kümeye düşen gözlemlerin aritmetik ortalaması yerine medyan (ortanca) değerini yeni merkez olarak belirlemiştir.
Buna göre, veri setinin yapısı ve yapılan bu modifikasyonun K-Ortalamalar algoritması üzerindeki etkisiyle ilgili aşağıdakilerden hangisi kesinlikle doğrudur?
Bir insan kaynakları uzmanı, dört farklı adayın () yetkinlik testlerinden aldıkları puanlara dayalı uzaklık matrisini kullanarak hiyerarşik kümeleme yapmaktadır. Adaylar arasındaki Öklid uzaklıklarını gösteren matris aşağıda verilmiştir:
| Aday | ||||
|---|---|---|---|---|
| **** | 0 | 2 | 5 | 8 |
| **** | 2 | 0 | 6 | 9 |
| **** | 5 | 6 | 0 | 7 |
| **** | 8 | 9 | 7 | 0 |
Uzman, analizinde tam bağlantı (en uzak komşu) yöntemini kullanmaktadır. Kümeleme işleminin ilk aşamasında en yakın iki aday birleştirilerek bir küme oluşturulmuştur.
Buna göre, hiyerarşik kümelemenin ikinci aşamasında hangi adaylar veya kümeler birleştirilir ve bu birleşme hangi uzaklık değerinde gerçekleşir?
Bir çevre mühendisi, 5 farklı sanayi bölgesinin () hava kirliliği emisyon profillerini sınıflandırmak amacıyla hiyerarşik kümeleme analizi uygulamaktadır. Bu bölgeler için hesaplanan uzaklık matrisinin alt üçgensel kısmı aşağıda verilmiştir:
(Satır ve sütunlar sırasıyla bölgelerini temsil etmektedir.)
Bu analizde tek bağlantı (en yakın komşu) yöntemi kullanıldığına göre, birinci birleştirme adımı tamamlandıktan sonra, yeni oluşan küme ile bölgesi arasındaki uzaklık değeri aşağıdakilerden hangisi olur?
Araştırmacı, birimden oluşan çok değişkenli bir veri setinde hiyerarşik kümeleme analizi uygulamak istemektedir. Literatür taraması sonucunda Merkezcil (Centroid) yöntem ile Ward yöntemini incelemiş ve her iki yöntemin de kümeleri birleştirirken küme ağırlık merkezlerini (centroid) temel aldığını fark etmiştir.
Buna göre, Ward yönteminin istatistiksel ve geometrik özellikleri ile Merkezcil yöntemden ayrılan yönleri dikkate alındığında, aşağıdaki ifadelerden hangisi yanlıştır?
Bir il sağlık müdürlüğü, idari yetki alanındaki dört kamu hastanesini (H1, H2, H3, H4) altyapı kapasitelerine göre hiyerarşik olarak kümelemek istemektedir. Hastaneler arası başlangıç uzaklıklarını gösteren alt üçgensel matris aşağıda verilmiştir:
| H1 | H2 | H3 | |
|---|---|---|---|
| H2 | 14 | ||
| H3 | 20 | 6 | |
| H4 | 28 | 22 | 18 |
Bu veriler kullanılarak Ağırlıklandırılmamış Ortalama Bağlantı (UPGMA) yöntemiyle kümeleme işlemi gerçekleştirilecektir.
Buna göre, ilk adımda birbirine en yakın olan iki hastane birleştirildikten sonra, oluşan yeni kümenin H1 ve H4 hastanelerine olan uzaklık değerleri sırasıyla aşağıdakilerden hangisidir?
Bir veri bilimci, müşteri segmentasyonu analizi kapsamında yığılmalı (agglomerative) hiyerarşik kümeleme algoritmalarından Ward yöntemini kullanmaktadır. Algoritmanın belirli bir adımında, birleştirilmek üzere aday olan iki farklı küme çifti ( ve ) değerlendirilmektedir.
- ** çifti:** (eleman sayısı ) ve (eleman sayısı ) kümelerinden oluşmaktadır. Bu iki kümenin ağırlık merkezleri (sentroidleri) arasındaki Öklid uzaklığı birimdir.
- ** çifti:** (eleman sayısı ) ve (eleman sayısı ) kümelerinden oluşmaktadır. Bu iki kümenin ağırlık merkezleri arasındaki Öklid uzaklığı birimdir.
Ward yönteminin temel amacı ve birleştirme kriteri dikkate alındığında, algoritmanın bu adımında hangi çiftin seçileceği ve bu seçime dayanak oluşturan hata kareler toplamındaki (ESS) artış miktarı aşağıdakilerin hangisinde doğru verilmiştir?
İstatistiksel kümeleme algoritmaları, kümelerin birbirine olan uzaklıklarını veya benzerliklerini tanımlarken farklı matematiksel kriterler kullanır. Hiyerarşik bir teknik olan Ward yöntemi, diğer bağlantı (linkage) algoritmalarından büyük ölçüde farklılaşarak doğrudan varyans tabanlı bir optimizasyon süreci yürütür.
Buna göre, Ward yönteminin temel küme birleştirme mekanizması ile ilgili aşağıdaki ifadelerden hangisi doğrudur?
Bir Halk Sağlığı Kurumu uzmanı, 81 ili sağlık profillerine göre gruplamak amacıyla -Ortalamalar (-Means) kümeleme analizi uygulayacaktır. Analizde kullanılacak iki temel değişken şunlardır:
- Yıllık kişi başı sağlık harcaması (1.000 TL ile 50.000 TL arasında değişen değerler)
- Yüz bin kişide görülen belirli bir kronik hastalık vaka sayısı (1 ile 50 arasında değişen değerler)
Uzman, algoritmada uzaklık ölçüsü olarak Öklid (Euclidean) uzaklığını kullanmaya karar vermiş, ancak değişkenleri herhangi bir standartlaştırma (ölçeklendirme) işlemine tabi tutmadan ham halleriyle analize dâhil etmiştir.
Buna göre, verilerin standartlaştırılmamasının analiz sonuçları üzerindeki temel etkisi aşağıdakilerden hangisidir?
Hiyerarşik kümeleme analizi algoritmalarından Ward yöntemi (minimum varyans yöntemi) ile gerçekleştirilen bir işlemde, algoritmanın herhangi bir adımında ağırlık merkezleri (centroid) birbirine geometrik olarak en yakın olan ve kümelerini birleştirmek yerine, ağırlık merkezleri arasındaki karesel Öklid uzaklığı nispeten daha büyük olan ve kümelerini birleştirdiği tespit edilmiştir.
Buna göre, Ward yönteminin bu birleştirme tercihini yapmasının temel matematiksel gerekçesi aşağıdakilerden hangisidir?
Araştırmacının kullandığı bu bağlantı yöntemi ve veri setinde kümeler arasında köprü (bridge) görevi gören gözlemler bulunduğunda, bu yöntemin yol açması beklenen tipik yapısal sorun aşağıdakilerin hangisinde sırasıyla doğru verilmiştir?
İki değişkenli ( ve ) bir veri setinden elde edilen örneklem ortalama vektörü ve varyans-kovaryans matrisi olarak verilmiştir.
Bu veri setinde yer alan ve gözlem vektörlerinin ortalama vektörüne (orijine) olan Öklid uzaklıkları sırasıyla ve , Mahalanobis uzaklıkları ise ve ile gösterilmektedir.
Buna göre, bu iki gözlemin uzaklık değerleri arasındaki ilişkiler aşağıdakilerin hangisinde doğru verilmiştir?
Bir veri bilimci, e-ticaret platformundaki 6 farklı kullanıcı profilini () davranışsal metrikler üzerinden gruplamak için hiyerarşik kümeleme analizi algoritmalarından Tek Bağlantı (En Yakın Komşu) yöntemini tercih etmiştir.
Analizin ilerleyen bir aşamasında algoritmik süreç şu durumu üretmiştir:
- Oluşan kümeler: ve
- Henüz hiçbir kümeye atanmamış tekil gözlem:
Kullanıcı profilleri arasındaki başlangıç Öklid uzaklık matrisinden alınan bazı değerler aşağıda verilmiştir:
- ,
- ,
- ,
- 'nın kümesindeki elemanlara olan uzaklıkları sırasıyla: , ,
Verilen bu kesit bilgisine göre, algoritmanın bir sonraki iterasyonda kullanacağı ve güncel küme uzaklıkları sırasıyla aşağıdakilerden hangisidir?
Bir kamu kurumunun insan kaynakları analisti, çalışanları "Aylık Gelir (TL)" ve "Performans Puanı (1-100)" olmak üzere iki nicel değişken üzerinden gruplandırmak için -Ortalamalar (-Means) algoritmasını kullanacaktır. Aylık gelir değişkeni ile TL aralığında, performans puanı ise ile aralığında değerler almaktadır. Analist, veri setindeki değişkenlere herhangi bir standartlaştırma (ölçeklendirme) işlemi uygulamadan, uzaklık ölçüsü olarak Öklid bağıntısını seçerek algoritmayı çalıştırmıştır.
Algoritmanın bir aşamasında, kümesinin mevcut merkez noktası (sentroidi) olarak hesaplanmış olup bu kümede çalışan bulunmaktadır. Bir sonraki iterasyonda, aylık geliri TL ve performans puanı olan yeni bir çalışan daha kümesine dahil edilmiş, mevcut çalışanlardan hiçbiri kümeden ayrılmamıştır.
Buna göre, analizde standartlaştırma yapılmamasının yaratacağı kavramsal sonuç ve kümesinin güncellenmiş merkez noktası aşağıdakilerin hangisinde birlikte doğru verilmiştir?
Bir araştırmacı, çok boyutlu sürekli değişkenlerden oluşan bir veri seti üzerinde yığılmalı (agglomerative) hiyerarşik kümeleme analizi yapmaktadır. Araştırmacı, analizinde hem Ward yöntemini hem de Merkezcil (Centroid) yöntemi uygulamış ve her iki yönteme ait dendrogramları karşılaştırmıştır. İnceleme sonucunda, Merkezcil yönteme ait dendrogramda bazı birleştirme adımlarında 'tersine dönme' (inversion / dendrogram dallarının aşağı doğru uzaması) problemi yaşandığını, Ward yönteminde ise birleşme uzaklıklarının her iterasyonda monoton olarak arttığını ve tersine dönme durumunun kesinlikle oluşmadığını gözlemlemiştir.
Bilindiği üzere, her iki yöntem de temel olarak kümelerin ağırlık merkezleri (centroid) üzerinden işlem yapmaktadır.
Buna göre, Ward yönteminde Merkezcil yöntemden farklı olarak tersine dönme (inversion) probleminin hiçbir zaman ortaya çıkmamasının temel matematiksel nedeni aşağıdakilerden hangisidir?
Bir Kalkınma Ajansı uzmanı, bölgeleri "Yatırım Teşvik Tutarı (milyon TL)" ve "İşsizlik Oranı Değişimi (yüzde)" değişkenlerini kullanarak -Ortalamalar (-Means) yöntemiyle kümelemektedir. Yatırım tutarları ile arasında değişirken, işsizlik oranı değişimi ile arasındadır. Uzman, verileri standartlaştırmadan Öklid uzaklığı kullanarak analizi tamamladığında elde edilen kümelerin yapısı hakkında aşağıdakilerden hangisi söylenebilir?