Kümeleme Analizi
56 questions
Çok değişkenli istatistiksel analizde hiyerarşik kümeleme algoritmalarından biri olan ortalama bağlantı (average linkage) yönteminin, Ağırlıklandırılmamış (UPGMA) ve Ağırlıklandırılmış (WPGMA) olmak üzere iki farklı versiyonu bulunmaktadır.
Bu iki yöntem arasındaki temel kavramsal fark aşağıdakilerden hangisinde doğru olarak ifade edilmiştir?
Bir araştırmacı, bir bankanın müşterilerini profillerine göre segmentlere ayırmak için "Aylık Harcama Tutarı" (TL cinsinden, ortalama ) ve "Müşteri Olunan Yıl Sayısı" (Yıl cinsinden, ortalama ) değişkenlerini kullanarak K-Ortalamalar (K-Means) kümeleme analizi yapmıştır. Araştırmacı, her iki değişkeni de veri setindeki ham (dönüştürülmemiş) değerleriyle analize dahil etmiş ve uzaklık ölçüsü olarak Öklid (Euclidean) uzaklığını kullanmıştır.
Bu analiz süreciyle ilgili aşağıdaki istatistiksel değerlendirmelerden hangisi doğrudur?
Bir ziraat mühendisi, 120 farklı tarım arazisini toprak özelliklerine göre sınıflandırmak amacıyla iki değişken üzerinden K-Ortalamalar (K-Means) kümeleme analizi uygulamaktadır:
: Topraktaki azot oranı (Yüzde cinsinden, ile arası değerler)
: Yıllık metrekare başına düşen yağış miktarı (Milimetre cinsinden, ile arası değerler)
Mühendis, uzaklık ölçüsü olarak Öklid (Euclidean) uzaklığını seçmiş, küme sayısını olarak belirlemiş ve başlangıç merkezlerini (centroid) rastgele atayarak algoritmayı ham veriler (ölçeklendirilmemiş veri) üzerinden iteratif olarak çalıştırmıştır.
Bu algoritmanın matematiksel işleyiş mekanizması ve değişkenlerin yapısal özellikleri dikkate alındığında, yapılan analiz süreciyle ilgili aşağıdaki ifadelerden hangisi kesinlikle doğrudur?
Bir e-ticaret şirketi, müşteri kitlelerini bölütlemek amacıyla "Yıllık Toplam Harcama Tutarı (TL)" (değer aralığı: - ) ve "Yıllık Sipariş Sayısı" (değer aralığı: - ) değişkenlerini kullanarak -Ortalamalar (-Means) kümeleme analizi uygulamak istemektedir.
Veri setine herhangi bir dönüşüm veya standartlaştırma işlemi uygulanmadan, doğrudan Öklid uzaklığı kullanılarak analiz gerçekleştirildiğinde elde edilecek sonuçlarla ilgili aşağıdakilerden hangisi kesinlikle söylenebilir?
Bir pazar araştırmasında 7 farklı müşteri profilinin (M1, M2, M3, M4, M5, M6, M7) benzerlikleri üzerinden birleştirici (agglomerative) hiyerarşik kümeleme analizi yapılmış ve aşağıdaki birleştirme mesafelerine (linkage distance) sahip tablo elde edilmiştir:
| Aşama | Birleşen Kümeler | Birleştirme Mesafesi (d) |
|---|---|---|
| 1 | M1, M2 | |
| 2 | M4, M5 | |
| 3 | M6, M7 | |
| 4 | (M4, M5) ile M3 | |
| 5 | (M1, M2) ile (M6, M7) | |
| 6 | (M1, M2, M6, M7) ile (M3, M4, M5) |
Araştırmacı ilk olarak dendrogramı uzaklık ekseninde noktasından yatay bir çizgi ile keserek kümeleri ayırmıştır. Daha sonra, kümeleme analizinin durdurma kuralı olarak bağlantı mesafelerindeki 'en büyük mesafe sıçraması (maximum jump/gap)' kuralını dikkate alarak optimum küme sayısına karar vermiştir.
Buna göre, araştırmacının kesim noktasında elde ettiği küme sayısı ile en büyük mesafe sıçraması kuralına göre belirlediği optimum küme sayısı sırasıyla aşağıdakilerden hangisidir?
Aşağıdaki tabloda dört gözleme (, , ve ) ait uzaklık matrisi verilmiştir:
| Gözlem | 1 | 2 | 3 | 4 |
|---|---|---|---|---|
| 1 | ||||
| 2 | ||||
| 3 | ||||
| 4 |
Hiyerarşik kümeleme analizi uygulanan bu veri setinde, ilk adımda birbirine en yakın olan ve numaralı gözlemler birleştirilerek kümesi oluşturulmuştur.
Buna göre, tam bağlantı (en uzak komşu) yöntemi kullanılarak analize devam edildiğinde, ikinci adımda hangi gözlemler veya kümeler, hangi uzaklık seviyesinde birleştirilir?
Aşağıda 5 farklı gözlem birimi (A, B, C, D, E) için hesaplanmış Öklid uzaklık matrisi verilmiştir:
(Matris simetrik olup, satır ve sütunlar sırasıyla A, B, C, D ve E gözlemlerini temsil etmektedir.)
Bu veri seti üzerinde tek bağlantı (en yakın komşu - single linkage) yöntemi kullanılarak hiyerarşik kümeleme analizi yapıldığında, tüm gözlemlerin tek bir küme altında toplandığı son adımda (iki ana kümenin birleştiği adım) hesaplanan birleşme uzaklığı kaçtır ve bu algoritmanın doğasından kaynaklanan, literatürde sıkça eleştirilen temel yapısal sorun aşağıdakilerden hangisinde doğru verilmiştir?
Bir büyükşehir belediyesi, kentsel planlama stratejilerini belirlemek amacıyla ilçesindeki 85 farklı mahalleyi sosyoekonomik ve altyapı özelliklerine göre gruplamak istemektedir. Araştırmacı bu amaçla iki değişken tanımlamıştır:
* : Mahalledeki toplam park ve yeşil alan sayısı (0 ile 25 arasında değişmektedir).
* : Mahalle sakinlerinin yıllık ortalama hanehalkı geliri ( TL ile TL arasında değişmektedir).
Araştırmacı, bu ham veri seti üzerinden doğrudan Öklid uzaklığı ölçüsünü kullanarak için K-Ortalamalar (K-Means) kümeleme algoritmasını çalıştırmış ve mahalleleri 4 kümeye ayırmıştır.
Araştırmacının uyguladığı bu kümeleme analizi prosedürü ve elde edeceği sonuçlar hakkında aşağıdakilerden hangisi söylenebilir?
Kümeleme analizinde gözlemler veya değişkenler arasındaki benzerlik ve uzaklıkların hesaplanması aşamasında çeşitli metrikler ve katsayılar kullanılmaktadır.
Buna göre, uzaklık ve benzerlik ölçüleri ile ilgili aşağıdaki ifadelerden hangisi yanlıştır?
Çok değişkenli veri analizinde, birimi birbirine benzer alt gruplara ayırmak için yığılmalı (agglomeratif) hiyerarşik kümeleme yöntemleri sıklıkla kullanılır. Bu yöntemlerden biri olan Ward yöntemi, uzaklık matrislerini kullanan klasik bağlantı (linkage) algoritmalarından farklı olarak varyans analizine dayalı bir teorik temele sahiptir.
Buna göre, Ward yönteminin algoritma mantığı ve ürettiği kümelerin geometrik yapısı hakkında aşağıdaki ifadelerden hangisi doğrudur?
Aşağıdaki tabloda dört gözlem (A, B, C, D) arasındaki başlangıç uzaklık matrisi verilmiştir:
| Gözlem | A | B | C | D |
|---|---|---|---|---|
| A | 0 | 2 | 6 | 12 |
| B | 2 | 0 | 4 | 6 |
| C | 6 | 4 | 0 | 15 |
| D | 12 | 6 | 15 | 0 |
Hiyerarşik kümeleme analizinde ağırlıklandırılmamış ortalama bağlantı (UPGMA) yöntemi kullanılmaktadır. Analizin ilk aşamasında birbirine en yakın olan A ve B gözlemleri birleştirilerek kümesi oluşturulmuştur. Daha sonra, kümesi ile C gözlemi birleştirilerek kümesi elde edilmiştir.
Buna göre, yeni oluşan kümesi ile D gözlemi arasındaki uzaklık değeri aşağıdakilerden hangisidir?
Bir araştırmacı, ve gözlemleri üzerinde hiyerarşik kümeleme analizi uygulamaktadır. Gözlemler arasındaki başlangıç uzaklık matrisi (Öklid uzaklıkları) aşağıda verilmiştir:
| Gözlem | ||||
|---|---|---|---|---|
| 0 | 2 | 10 | 18 | |
| 2 | 0 | 14 | 22 | |
| 10 | 14 | 0 | 8 | |
| 18 | 22 | 8 | 0 |
Araştırmacı analiz sürecinde ilk olarak birbirine en yakın olan ve 'yi birleştirerek kümesini oluşturmuştur. Bir sonraki aşamada ise kümesi ile gözlemini birleştirerek kümesini elde etmiştir.
Kümeleme işleminin son adımında, kümesi ile gözlemi arasındaki uzaklık Ortalama Bağlantı (UPGMA - Ağırlıklandırılmamış Aritmetik Ortalama) yöntemi kullanılarak hesaplanacaktır.
Buna göre, kümesi ile gözlemi arasındaki uzaklık kaç birimdir?
Çok değişkenli istatistiksel analizde yığılmalı (agglomeratif) hiyerarşik kümeleme yöntemleri, birleştirilecek kümelerin arasındaki uzaklığın (veya benzerliğin) nasıl tanımlandığına göre birbirinden ayrılır. Bir veri bilimci, elindeki sürekli değişkenlerden oluşan veri setini kullanarak homojen alt gruplar elde etmek istemekte ve bu amaçla Ward Yöntemi'ni kullanmaya karar vermektedir.
Buna göre, Ward Yöntemi'nin dayandığı temel optimizasyon ölçütü ve bu yöntemin Tek Bağlantı (Single Linkage) ve Tam Bağlantı (Complete Linkage) gibi geleneksel yöntemlerden ayrılan teorik yapısı aşağıdakilerin hangisinde doğru açıklanmıştır?
Bir bölge kalkınma ajansı uzmanı, ilçeleri sosyoekonomik gelişmişlik göstergelerine göre sınıflandırmak için hiyerarşik kümeleme analizi uygulamaktadır. Uzman, kümeler arası uzaklığı hesaplarken tek tek gözlemler arasındaki en kısa mesafeyi dikkate alan yaklaşımın yaratabileceği zincirleme (chaining) etkisinden veya en uzun mesafeyi temel alan yaklaşımın aykırı değerlere olan aşırı hassasiyetinden kaçınmak istemektedir. Bunun yerine, her adımda birleştirilecek iki kümenin, toplam küme içi hata kareler toplamındaki () artışı en aza indirecek şekilde seçilmesi prensibine dayanan algoritmayı kullanmaya karar vermiştir.
Buna göre, uzmanın uygulamasında tercih ettiği kümeleme yöntemi aşağıdakilerden hangisidir?
Aşağıdaki tabloda bir hiyerarşik kümeleme analizi uygulamasında yer alan , ve kümeleri arasındaki uzaklık matrisi ve bu kümelerin içerdiği gözlem sayıları () verilmiştir:
| Küme | |||
|---|---|---|---|
| **** | |||
| **** | |||
| **** |
Analizin bu adımında, aralarındaki uzaklık en küçük olan ve kümeleri birleştirilerek yeni bir kümesi oluşturulmuştur.
Buna göre, yeni oluşan kümesi ile kümesi arasındaki uzaklık, sırasıyla Ağırlıklandırılmamış Ortalama Bağlantı (UPGMA) ve Ağırlıklandırılmış Ortalama Bağlantı (WPGMA) yöntemlerine göre hesaplandığında aşağıdaki değer çiftlerinden hangisi elde edilir?
Bir kamu kurumu, illeri sosyo-ekonomik gelişmişlik endekslerine göre hiyerarşik olarak kümelemektedir. Analizin bir aşamasında ve olmak üzere iki küme elde edilmiştir. Bu iki kümedeki iller arasındaki uzaklık değerleri aşağıda verilmiştir:
Araştırmacı, kümeleri birleştirirken 'Tam Bağlantı (En Uzak Komşu)' yöntemini kullanmayı tercih etmiştir.
Buna göre, ve kümeleri arasındaki uzaklık değeri ile araştırmacının bu yöntemi tercih ettiğinde ulaşması beklenen küme yapısının özelliği aşağıdakilerin hangisinde birlikte doğru verilmiştir?
Bir e-ticaret platformu, iki müşterisinin (X ve Y) sekiz farklı ürün kategorisindeki satın alma durumlarını "1: Satın aldı", "0: Satın almadı" olarak kodlamış ve aşağıdaki ikili (binary) vektörleri elde etmiştir:
Bu iki müşteri arasındaki satın alma alışkanlığı benzerliği incelenirken, tüm durumları dikkate alan "Basit Eşleşme (Simple Matching) Katsayısı" ve her ikisinin de satın almadığı (0-0 eşleşmeleri) kategorileri dışlayan "Jaccard Benzerlik Katsayısı" ayrı ayrı hesaplanmıştır.
Buna göre, hesaplanan bu iki benzerlik katsayısı arasındaki farkın mutlak değeri kaçtır?
Bir gıda mühendisi, dört farklı zeytinyağı numunesini () kimyasal özelliklerine ait Öklid uzaklıklarına göre hiyerarşik olarak kümelemek istemektedir. Numuneler arasındaki uzaklık matrisi aşağıda verilmiştir:
| **** | ||||
| **** | ||||
| **** | ||||
| **** |
Analizde ilk adımda birbirine en yakın olan ve numuneleri birleştirilerek birinci küme olan oluşturulmuştur.
Araştırmacı kümeleme işlemine Tam Bağlantı (En Uzak Komşu) yöntemini kullanarak devam ettiğine göre, ikinci adımda gerçekleşecek birleşme işlemi ve birleşme uzaklık değeri aşağıdakilerden hangisidir?
Bir endüstri mühendisi, üretim hattından çıkan parçaları iki temel kalite kriterine göre gruplamak amacıyla K-Ortalamalar (K-Means) algoritmasını kullanmaktadır. Bu kriterler; (mikron cinsinden yüzey pürüzlülüğü, varyansı ) ve (Pascal cinsinden basınca dayanıklılık, varyansı ) olarak belirlenmiştir. Mühendis, analiz öncesinde veri setinde herhangi bir standardizasyon (ölçeklendirme) işlemi yapmadan, uzaklık ölçüsü olarak Öklid uzaklığını kullanarak algoritmayı çalıştırmıştır.
Bu durumun K-Ortalamalar algoritmasının optimizasyon süreci ve elde edilecek kümeler üzerindeki matematiksel etkisi aşağıdakilerden hangisinde doğru ifade edilmiştir?
Bir bölge kalkınma ajansı, dört farklı yatırım sektörünün () risk profillerini değerlendirmek için hiyerarşik kümeleme analizi uygulamaktadır. Bu sektörler arasındaki uzaklık matrisi aşağıdaki tabloda verilmiştir:
| Sektör | ||||
|---|---|---|---|---|
Analizde tam bağlantı (en uzak komşu) yöntemi kullanılmaktadır. Algoritmanın ilk adımında birbirine en yakın iki sektör tek bir küme haline getirildiğine göre, bu yeni oluşan küme ile sektörü arasındaki uzaklık kaç birim olarak hesaplanır?