Kümeleme Analizi

56 questions

Question 1Question

Çok değişkenli istatistiksel analizde hiyerarşik kümeleme algoritmalarından biri olan ortalama bağlantı (average linkage) yönteminin, Ağırlıklandırılmamış (UPGMA) ve Ağırlıklandırılmış (WPGMA) olmak üzere iki farklı versiyonu bulunmaktadır.

Bu iki yöntem arasındaki temel kavramsal fark aşağıdakilerden hangisinde doğru olarak ifade edilmiştir?

Show answer & explanation

Answer: UPGMA yönteminde hesaplamalara katılan her bir gözlem birimine eşit ağırlık verilirken, WPGMA yönteminde içerdiği gözlem sayısından bağımsız olarak birleşen her bir kümeye eşit ağırlık verilir.

Answer

UPGMA yönteminde hesaplamalara katılan her bir gözlem birimine eşit ağırlık verilirken, WPGMA yönteminde içerdiği gözlem sayısından bağımsız olarak birleşen her bir kümeye eşit ağırlık verilir.
Ortalama bağlantı algoritmalarında, UPGMA (Unweighted) başlangıçtaki veri setinde yer alan her bir gözleme eşit ağırlık verilmesini hedefler. Bu nedenle kümeler birleşirken uzaklıklar, kümelerin sahip olduğu gözlem sayılarıyla orantılı (ağırlıklı) olarak hesaplanır ve böylece her bir bireysel gözlemin ağırlığı korunur. WPGMA (Weighted) ise kümelerin boyutlarını (gözlem sayılarını) göz ardı eder ve birleşen iki kümeye, boyutları ne olursa olsun eşit ağırlık verir. Doğru seçenek bu farkı tam ve eksiksiz bir şekilde özetlemektedir.

Step-by-Step Solution

1
UPGMA (Unweighted Pair Group Method with Arithmetic Mean) yönteminin temel prensibini tanımlama.
UPGMA, yeni bir küme ile diğer kümeler arasındaki uzaklığı hesaplarken, kümelerin içerdiği gözlem sayılarını dikkate alarak orantılı bir hesaplama yapar. Böylece başlangıçtaki her bir gözlem birimi sonuca eşit oranda (ağırlıklandırılmamış şekilde) etki eder.
Yöntemin adındaki 'ağırlıklandırılmamış' kelimesinin neyi ifade ettiğini netleştirmek için.
2
WPGMA (Weighted Pair Group Method with Arithmetic Mean) yönteminin temel prensibini tanımlama.
WPGMA, birleşen iki kümenin yeni uzaklıklarını hesaplarken kümelerin büyüklüklerini (içerdikleri gözlem sayılarını) dikkate almaz. Her iki alt kümeye yarı yarıya (eşit) ağırlık verir.
WPGMA'nın 'ağırlıklandırılmış' olmasının kümeler açısından ne anlama geldiğini göstermek için.
3
Seçenekleri analiz ederek bu kavramsal farkı doğru veren ifadeyi belirleme.
UPGMA'nın gözlemlere eşit ağırlık verdiği, WPGMA'nın ise gözlem sayısını yok sayarak kümelere eşit ağırlık verdiği seçeneğin doğru olduğu tespit edilir.
Teorik bilginin seçeneklerle eşleştirilmesi için.

Key Concept

Ortalama bağlantı yöntemleri alt türleri (UPGMA ve WPGMA) arasındaki ağırlıklandırma felsefesi.
Question 2Question

Bir araştırmacı, bir bankanın müşterilerini profillerine göre segmentlere ayırmak için "Aylık Harcama Tutarı" (TL cinsinden, ortalama 15.00015.000) ve "Müşteri Olunan Yıl Sayısı" (Yıl cinsinden, ortalama 88) değişkenlerini kullanarak K-Ortalamalar (K-Means) kümeleme analizi yapmıştır. Araştırmacı, her iki değişkeni de veri setindeki ham (dönüştürülmemiş) değerleriyle analize dahil etmiş ve uzaklık ölçüsü olarak Öklid (Euclidean) uzaklığını kullanmıştır.

Bu analiz süreciyle ilgili aşağıdaki istatistiksel değerlendirmelerden hangisi doğrudur?

Show answer & explanation

Answer: Aylık harcama tutarının varyansı ve değer aralığı çok daha büyük olacağı için uzaklık hesaplamalarını domine edecektir; bu nedenle analize başlamadan önce değişkenler standartlaştırılmalıdır.

Answer

Uzaklık hesaplamalarında varyansı büyük olan değişkenin sonucu domine etmemesi için analize başlamadan önce değişkenlerin standartlaştırılması gerektiği ifade eden seçenektir.
K-Ortalamalar algoritması nesneler arasındaki benzerlikleri Öklid gibi uzaklık metrikleri ile hesaplar. Eğer analizde kullanılan değişkenlerin birimleri ve varyansları birbirinden çok farklıysa (örneğin biri binli değerler, diğeri tek haneli değerler alıyorsa), büyük sayılarla ifade edilen değişken matematiksel olarak uzaklık değerini ve küme merkezlerini (centroid) domine eder. İkinci değişkenin kümeleme üzerine etkisi neredeyse kaybolur. Bu istatistiksel problemi önlemek ve değişkenlere eşit ağırlık verebilmek için analize başlanmadan önce her bir değişkenin standartlaştırılması (örneğin ZZ skoruna dönüştürülmesi) zorunludur.

Step-by-Step Solution

1
Verilen analiz yöntemini ve parametrelerini belirle
Yöntem: K-Ortalamalar (K-Means), Uzaklık ölçüsü: Öklid (Euclidean), Kullanılan veriler: Ham (farklı birimlerde ve varyanslarda).
Uygulanan metodolojinin varsayımlarını test etmek için veri yapısını ve kullanılan algoritmik yaklaşımı tanımlamak gereklidir.
2
K-Ortalamalar yönteminde Öklid uzaklığının özelliklerini değerlendir
Öklid uzaklığı değişkenlerin değer büyüklüklerinden ve birimlerinden doğrudan etkilenir.
Algoritmanın uzaklık matrisi oluşturma ve küme merkezini (centroid) güncelleme mantığını anlamak için bu işlem zorunludur.
3
Değişkenler arasındaki birim/varyans farklılığının algoritma üzerindeki etkisini tespit et
Aylık Harcama Tutarı (binli sayılar) ile Müşteri Olunan Yıl Sayısı (tek haneli sayılar) ham halleriyle hesaplandığında, toplam Öklid uzaklığı neredeyse tamamen Harcama Tutarı tarafından belirlenir.
Boyutların birbiri üzerindeki ağırlığını ve olası hataları (dominasyon etkisini) tespit etmek.
4
İstatistiksel çözümü belirle
Farklı varyanslara ve ölçeklere sahip değişkenlerin eşit ağırlıkla değerlendirilebilmesi için değişkenler ZZ dağılımına dönüştürülerek (ortalama 00, varyans 11) standartlaştırılmalıdır.
Uzaklık temelli çok değişkenli analizlerde ölçeklendirme problemi bu şekilde çözülür.

Key Concept

K-Ortalamalar analizinde veri standartlaştırmasının önemi
Question 3Question

Bir ziraat mühendisi, 120 farklı tarım arazisini toprak özelliklerine göre sınıflandırmak amacıyla iki değişken üzerinden K-Ortalamalar (K-Means) kümeleme analizi uygulamaktadır:

X1X_1: Topraktaki azot oranı (Yüzde cinsinden, 0.10.1 ile 0.50.5 arası değerler)
X2X_2: Yıllık metrekare başına düşen yağış miktarı (Milimetre cinsinden, 400400 ile 12001200 arası değerler)

Mühendis, uzaklık ölçüsü olarak Öklid (Euclidean) uzaklığını seçmiş, küme sayısını k=4k=4 olarak belirlemiş ve başlangıç merkezlerini (centroid) rastgele atayarak algoritmayı ham veriler (ölçeklendirilmemiş veri) üzerinden iteratif olarak çalıştırmıştır.

Bu algoritmanın matematiksel işleyiş mekanizması ve değişkenlerin yapısal özellikleri dikkate alındığında, yapılan analiz süreciyle ilgili aşağıdaki ifadelerden hangisi kesinlikle doğrudur?

Show answer & explanation

Answer: Öklid uzaklığı hesaplamasında (xi2cj2)2(x_{i2} - c_{j2})^2 terimi, (xi1cj1)2(x_{i1} - c_{j1})^2 terimine kıyasla çok daha büyük sonuçlar vereceği için kümeleme yapısı neredeyse tamamen yağış miktarı (X2X_2) tarafından belirlenecektir; bu durumu önlemek için analiz öncesinde veriler standartlaştırılmalıdır.

Answer

Öklid uzaklığı kullanıldığında, karesel farklardan dolayı değer aralığı çok daha geniş olan yağış miktarı (X2X_2) hesaplamayı domine edecektir. Bu yanlılığın önüne geçmek için analize başlamadan önce her iki değişkenin standartlaştırılması gerekir.
K-Ortalamalar (K-Means) algoritması, kümeleme işlemini gözlemler ile küme merkezleri arasındaki uzaklıkları (genellikle Öklid uzaklığını) minimize ederek yapar. Öklid uzaklığı hesaplanırken değişkenler arasındaki farkların karesi alınır. Verilen senaryoda yağış miktarı (X2X_2) 4001200400-1200 aralığında değerler alırken, azot oranı (X1X_1) 0.10.50.1-0.5 aralığındadır. Bu durumda (X2C2)2(X_2 - C_2)^2 ifadesinden gelecek binlerce birimlik değerler, (X1C1)2(X_1 - C_1)^2 ifadesinden gelecek 0.010.01 gibi çok küçük değerleri matematiksel olarak yutar. Algoritma sanki sadece yağış miktarı verisi varmış gibi çalışır. Bu istatistiksel yanılgıyı önlemenin tek yolu, analizden önce verileri standartlaştırmaktır (örneğin Z-skoruna dönüştürmek).

Step-by-Step Solution

1
K-Ortalamalar yönteminde uzaklık hesaplama formülünü incelemek
Öklid uzaklığı formülü: d=(xi1cj1)2+(xi2cj2)2d = \sqrt{(x_{i1} - c_{j1})^2 + (x_{i2} - c_{j2})^2}
Algoritmanın kümeleri ayırırken hangi matematiksel metodu temel aldığını belirlemek.
2
Verilen değişkenlerin değer aralıklarını ve formüldeki etkilerini karşılaştırmak
X1X_1 (Azot) farkları 0.10.1 ile 0.50.5 arasında değişirken karesi çok küçük bir ondalık sayı üretir. X2X_2 (Yağış) farkları ise yüzlerce birim olup karesi on binlerce birim büyüklüğünde değerler üretir.
Farklı ölçüm birimlerinin (yüzde vs. milimetre) karesel uzaklık üzerindeki asimetrik etkisini tespit etmek.
3
Bu asimetrik etkinin kümeleme sonucuna yansımasını ve çözüm yolunu belirlemek
Mesafe hesaplamasında X1X_1'in etkisi matematiksel olarak kaybolur ve kümeler sadece X2X_2'ye göre oluşur. Çözüm, her iki değişkeni ortalaması 00, varyansı 11 olacak şekilde standartlaştırmaktır (Z-skoru).
K-Ortalamalar algoritmasının ölçekten bağımsız çalışabilmesi için standartlaştırma varsayımının zorunluluğunu ortaya koymak.

Key Concept

Ölçeklendirme Etkisi ve Uzaklık Metrikleri
Question 4Question

Bir e-ticaret şirketi, müşteri kitlelerini bölütlemek amacıyla "Yıllık Toplam Harcama Tutarı (TL)" (değer aralığı: 5.0005.000 - 250.000250.000) ve "Yıllık Sipariş Sayısı" (değer aralığı: 11 - 5050) değişkenlerini kullanarak KK-Ortalamalar (KK-Means) kümeleme analizi uygulamak istemektedir.

Veri setine herhangi bir dönüşüm veya standartlaştırma işlemi uygulanmadan, doğrudan Öklid uzaklığı kullanılarak analiz gerçekleştirildiğinde elde edilecek sonuçlarla ilgili aşağıdakilerden hangisi kesinlikle söylenebilir?

Show answer & explanation

Answer: Oluşacak kümeler büyük ölçüde harcama tutarı değişkeni tarafından domine edilecek ve sipariş sayısının kümelerin ayrışmasına olan katkısı yok denecek kadar az olacaktır.

Answer

Standartlaştırma yapılmadığında, değer aralığı ve varyansı çok daha büyük olan harcama tutarı değişkeninin uzaklık hesaplamasını ve dolayısıyla kümeleme sonucunu tamamen domine edeceği ifadesi kesinlikle doğrudur.
Veri setindeki değişkenler farklı ölçüm birimlerine veya çok farklı değer aralıklarına sahip olduğunda, sayısal olarak büyük değerler alan değişkenin varyansı uzaklık (özellikle Öklid uzaklığı) hesaplamasında baskın hale gelir. Bu durum, değer aralığı küçük olan değişkenin analizdeki ağırlığını pratik olarak sıfıra indirir. Standartlaştırma (örneğin Z-skoru dönüşümü) yapılmadığında harcama tutarı kümelemeyi tek başına belirler.

Step-by-Step Solution

1
Öklid uzaklığı formülündeki bileşenlerin etkisini incelemek.
İki müşteri arasındaki Öklid uzaklığı d=Δx2+Δy2d = \sqrt{\Delta x^2 + \Delta y^2} formülüyle hesaplanır.
Her bir değişkenin genel uzaklık değerine sayısal katkısını matematiksel olarak görmek.
2
Verilen iki değişkenin değer aralıklarını ve fark büyüklüklerini karşılaştırmak.
Harcama tutarındaki (Δx\Delta x) farklılıklar on binler mertebesinde iken, sipariş sayısındaki (Δy\Delta y) farklılıklar en fazla onlar basamağındadır.
Hangi değişkenin uzaklık formülünde daha büyük sayısal değerler üreteceğini tespit etmek.
3
Standartlaştırmanın olmamasının algoritma üzerindeki etkisini değerlendirmek.
Sipariş sayısı küme merkezlerine olan mesafelerin belirlenmesinde etkisiz eleman gibi davranacak, atama işlemleri neredeyse sadece harcama tutarlarına göre gerçekleşecektir.
Ölçeklendirme eksikliğinin kümeleme analizinin nihai başarısına ve yapısına etkisini sonuçlandırmak.

Key Concept

Ölçeklendirme ve Öklid Uzaklığı Hassasiyeti
Question 5Question

Bir pazar araştırmasında 7 farklı müşteri profilinin (M1, M2, M3, M4, M5, M6, M7) benzerlikleri üzerinden birleştirici (agglomerative) hiyerarşik kümeleme analizi yapılmış ve aşağıdaki birleştirme mesafelerine (linkage distance) sahip tablo elde edilmiştir:

AşamaBirleşen KümelerBirleştirme Mesafesi (d)
1M1, M222
2M4, M533
3M6, M755
4(M4, M5) ile M377
5(M1, M2) ile (M6, M7)99
6(M1, M2, M6, M7) ile (M3, M4, M5)2020

Araştırmacı ilk olarak dendrogramı uzaklık ekseninde d=6d = 6 noktasından yatay bir çizgi ile keserek kümeleri ayırmıştır. Daha sonra, kümeleme analizinin durdurma kuralı olarak bağlantı mesafelerindeki 'en büyük mesafe sıçraması (maximum jump/gap)' kuralını dikkate alarak optimum küme sayısına karar vermiştir.

Buna göre, araştırmacının d=6d = 6 kesim noktasında elde ettiği küme sayısı ile en büyük mesafe sıçraması kuralına göre belirlediği optimum küme sayısı sırasıyla aşağıdakilerden hangisidir?

Show answer & explanation

Answer: 4 ve 2

Answer

4 ve 2
Dendrogram d=6d=6 noktasında kesildiğinde; d=2d=2'de birleşen M1-M2, d=3d=3'te birleşen M4-M5 ve d=5d=5'te birleşen M6-M7 ayrı ayrı birer kümedir. M3 ise henüz d=7d=7'ye ulaşılmadığı için tek başınadır. Böylece toplam 4 küme {M1,M2}, {M4,M5}, {M6,M7}, {M3} oluşur. En büyük mesafe sıçraması kuralı için aşamalar arası farklara bakılır: 209=1120-9 = 11 en büyük farktır. Bu durum d=9d=9 ile d=20d=20 aralığındadır. Bu uzun daldan kesim yapıldığında dendrogramda 2 ana dal (2 küme) kalır.

Step-by-Step Solution

1
d=6d=6 kesim noktasındaki durumu analiz etme
d=6d=6 mesafesinden önce gerçekleşen birleşmeler: (M1,M2) d=2'de, (M4,M5) d=3'te, (M6,M7) d=5'te. Henüz birleşmeyen tek gözlem M3'tür.
Yatay bir kesim, o mesafeden daha küçük uzaklıklarda birleşmiş olan düğümleri bir arada, daha büyük mesafede birleşecek olanları ise ayrı tutar.
2
d=6d=6'daki küme sayısını belirleme
Oluşan kümeler: {M1, M2}, {M4, M5}, {M6, M7} ve tek başına kalan {M3}. Toplam küme sayısı 4'tür.
Birleştirici yöntem alttan üste doğru çalıştığı için, d=6d=6 anında elde edilen birbirinden bağımsız dal sayısı 4'tür.
3
Birleştirme mesafeleri arasındaki sıçramaları (farkları) hesaplama
Farklar: 32=13-2=1, 53=25-3=2, 75=27-5=2, 97=29-7=2, 209=1120-9=11.
En büyük mesafe sıçraması kuralı, kümeler arası heterojenliğin en keskin arttığı noktayı bulmayı gerektirir.
4
Optimum küme sayısını belirleme
En büyük sıçrama 209=1120-9=11 birimdir. Bu devasa sıçrama, dendrogramda d=9d=9 ile d=20d=20 arasında en uzun dalı oluşturur. Bu sıçrama meydana gelmeden hemen önceki aşamada (d=9) 2 küme bulunmaktadır: {M1,M2,M6,M7} ve {M3,M4,M5}.
Dendrogram, birleşme mesafesinin en dik arttığı uzun daldan kesilerek optimum heterojenlik/homojenlik dengesi yakalanır. Bu kesim 2 küme verir.

Key Concept

Hiyerarşik Kümelemede Dendrogram Kesimi ve Küme Sayısı Belirleme
Estimated Time:2m 0s
Question 6Question

Aşağıdaki tabloda dört gözleme (11, 22, 33 ve 44) ait uzaklık matrisi verilmiştir:

Gözlem1234
100223399
22200881010
333880066
49910106600

Hiyerarşik kümeleme analizi uygulanan bu veri setinde, ilk adımda birbirine en yakın olan 11 ve 22 numaralı gözlemler birleştirilerek (1,2)(1, 2) kümesi oluşturulmuştur.

Buna göre, tam bağlantı (en uzak komşu) yöntemi kullanılarak analize devam edildiğinde, ikinci adımda hangi gözlemler veya kümeler, hangi uzaklık seviyesinde birleştirilir?

Show answer & explanation

Answer: 33 ve 44 numaralı gözlemler, 66 uzaklığında

Answer

33 ve 44 numaralı gözlemler, 66 uzaklığında
Tam bağlantı (en uzak komşu) yönteminde iki küme arasındaki uzaklık, elemanları arasındaki maksimum uzaklık alınarak bulunur. Buna göre yeni oluşan (1,2)(1, 2) kümesi ile diğer gözlemler arasındaki uzaklıklar hesaplandığında; d((1,2),3)=max(3,8)=8d((1, 2), 3) = \max(3, 8) = 8 ve d((1,2),4)=max(9,10)=10d((1, 2), 4) = \max(9, 10) = 10 elde edilir. Kalan 33 ve 44 numaralı gözlemler arasındaki uzaklık ise doğrudan başlangıç matrisinden 66 olarak okunur. Hiyerarşik kümeleme algoritmaları, kümeler arası uzaklıklar hangi bağlantı yöntemiyle belirlenirse belirlensin, daima güncel matristeki en küçük değere sahip olanları birleştirir. Bulunan uzaklıklar (88, 1010 ve 66) arasından en küçüğü 66 olduğundan, ikinci adımda 33 ve 44 numaralı gözlemler 66 uzaklığında birleştirilir.

Step-by-Step Solution

1
Yeni oluşturulan (1,2)(1, 2) kümesi ile geriye kalan 33 ve 44 numaralı gözlemler arasındaki uzaklıkların 'tam bağlantı' yöntemine göre hesaplanması.
d((1,2),3)=max(d13,d23)=max(3,8)=8d((1, 2), 3) = \max(d_{13}, d_{23}) = \max(3, 8) = 8 ve d((1,2),4)=max(d14,d24)=max(9,10)=10d((1, 2), 4) = \max(d_{14}, d_{24}) = \max(9, 10) = 10 olarak bulunur.
Tam bağlantı (en uzak komşu) yönteminde iki küme arasındaki uzaklık, bu kümelerin elemanları arasındaki en büyük uzaklık değeri olarak tanımlanır.
2
İkinci adım için güncellenmiş uzaklık değerlerinin belirlenmesi.
Gözden geçirilmiş uzaklıklar: (1,2)(1, 2) ile 33 arası uzaklık 88, (1,2)(1, 2) ile 44 arası uzaklık 1010, 33 ile 44 arası uzaklık ise ilk matriste verilen 66'dır.
Sonraki adımda hangi elemanların birleştirileceğini görmek için tüm olası eşleşmelerin uzaklıkları bilinmelidir.
3
Güncellenmiş uzaklıklar arasından en küçük olanın bulunması ve birleştirme işleminin yapılması.
Uzaklık değerleri (88, 1010 ve 66) içinden en küçük olanı 66'dır. Bu değer 33 ve 44 numaralı gözlemler arasında olduğu için ikinci adımda bu iki gözlem 66 uzaklığında birleştirilir.
Hiyerarşik kümeleme algoritmaları (uzaklıklar hangi bağlantı yöntemiyle hesaplanırsa hesaplansın) daima matristeki en küçük uzaklığa sahip olan çifti birleştirerek ilerler.

Key Concept

Tam Bağlantı (En Uzak Komşu) Yöntemi ile Uzaklık Hesaplama ve Küme Birleştirme
Question 7Question

Aşağıda 5 farklı gözlem birimi (A, B, C, D, E) için hesaplanmış Öklid uzaklık matrisi verilmiştir:

[026109205986504510940398530] \begin{bmatrix} 0 & 2 & 6 & 10 & 9 \\ 2 & 0 & 5 & 9 & 8 \\ 6 & 5 & 0 & 4 & 5 \\ 10 & 9 & 4 & 0 & 3 \\ 9 & 8 & 5 & 3 & 0 \end{bmatrix}

(Matris simetrik olup, satır ve sütunlar sırasıyla A, B, C, D ve E gözlemlerini temsil etmektedir.)

Bu veri seti üzerinde tek bağlantı (en yakın komşu - single linkage) yöntemi kullanılarak hiyerarşik kümeleme analizi yapıldığında, tüm gözlemlerin tek bir küme altında toplandığı son adımda (iki ana kümenin birleştiği adım) hesaplanan birleşme uzaklığı kaçtır ve bu algoritmanın doğasından kaynaklanan, literatürde sıkça eleştirilen temel yapısal sorun aşağıdakilerden hangisinde doğru verilmiştir?

Show answer & explanation

Answer: Son birleşme uzaklığı 5'tir; temel sorun kümelerin zincirleme (chaining) eğilimi göstererek ipliksi bir yapıya uzamasıdır.

Answer

Son birleşme uzaklığı 5'tir ve yöntemin temel sorunu kümelerin zincirleme (chaining) eğilimi göstermesidir.
Verilen uzaklık matrisinde adım adım tek bağlantı yöntemi uygulandığında; önce (A,B) 2'de, sonra (D,E) 3'te, ardından C ve (D,E) 4'te birleşir. Son aşamada (A,B) kümesi ile (C,D,E) kümesi arasındaki minimum uzaklık B ve C arasındaki 5 birimlik mesafe üzerinden gerçekleşir. Bu algoritmanın karakteristik dezavantajı kümelerin köprü noktalarla 'zincirleme' şeklinde uzamasıdır.

Step-by-Step Solution

1
Matristeki en küçük uzaklık tespit edilerek ilk küme oluşturulur.
Sıfır dışındaki en küçük uzaklık d(A,B)=2d(A,B) = 2'dir. A ve B birleştirilerek (A,B) kümesi oluşturulur.
Hiyerarşik kümelemede her zaman birbirine en yakın iki eleman veya küme ilk önce birleştirilir.
2
Kalan öğeler arasındaki en küçük uzaklık tespit edilir ve yeni birleştirme yapılır.
d(D,E)=3d(D,E) = 3 olduğundan D ve E gözlemleri birleştirilerek (D,E) kümesi oluşturulur.
Sıradaki en küçük mesafe 3'tür ve (A,B) kümesinden bağımsızdır.
3
Aktif kümeler olan (A,B), C ve (D,E) arasındaki tek bağlantı (minimum) uzaklıkları hesaplanır.
C ile (D,E) arasındaki uzaklık min(d(C,D),d(C,E))=min(4,5)=4\min(d(C,D), d(C,E)) = \min(4,5) = 4'tür. C, (D,E) ile birleşerek (C,D,E) kümesini oluşturur.
Diğer alternatif mesafe olan C ile (A,B) arası min(6,5)=5\min(6,5) = 5'tir. 4 < 5 olduğu için C, (D,E) kümesine katılır.
4
Kalan iki ana küme olan (A,B) ve (C,D,E) arasındaki en kısa uzaklık hesaplanarak son birleştirme yapılır.
Tüm kombinasyonlar içerisindeki en küçük değer d(B,C)=5d(B,C) = 5'tir. İki ana küme 5 uzaklık seviyesinde birleşir.
Tek bağlantı yönteminde iki küme arasındaki mesafe, birbirlerine en yakın iki elemanlarının mesafesi olarak tanımlanır.
5
Tek bağlantı algoritmasının literatürde eleştirilen temel yapısal sorunu tanımlanır.
Bu algoritma kümeleri yalnızca birer köprü (en yakın eleman) üzerinden birleştirdiği için, uzamsal olarak kümeler ipliksi bir yapıya bürünerek uzar. Buna 'zincirleme (chaining) etkisi' denir.
Bu durum, birbirine hiç benzemeyen iki ucun sırf aralarında bir köprü var diye aynı kümede yer almasına sebep olur.

Key Concept

Tek Bağlantı Yönteminde Uzaklık Hesaplama ve Zincirleme Etkisi
Estimated Time:2m 30s
Question 8Question

Bir büyükşehir belediyesi, kentsel planlama stratejilerini belirlemek amacıyla ilçesindeki 85 farklı mahalleyi sosyoekonomik ve altyapı özelliklerine göre gruplamak istemektedir. Araştırmacı bu amaçla iki değişken tanımlamıştır:

* X1X_1: Mahalledeki toplam park ve yeşil alan sayısı (0 ile 25 arasında değişmektedir).
* X2X_2: Mahalle sakinlerinin yıllık ortalama hanehalkı geliri (250.000250.000 TL ile 850.000850.000 TL arasında değişmektedir).

Araştırmacı, bu ham veri seti üzerinden doğrudan Öklid uzaklığı ölçüsünü kullanarak k=4k=4 için K-Ortalamalar (K-Means) kümeleme algoritmasını çalıştırmış ve mahalleleri 4 kümeye ayırmıştır.

Araştırmacının uyguladığı bu kümeleme analizi prosedürü ve elde edeceği sonuçlar hakkında aşağıdakilerden hangisi söylenebilir?

Show answer & explanation

Answer: Analiz öncesinde standardizasyon yapılmadığı için, varyansı çok daha büyük olan gelir değişkeni uzaklık hesaplamasını domine edecek ve kümeler neredeyse tamamen gelire göre oluşacaktır.

Answer

Analiz öncesinde standardizasyon yapılmadığı için, varyansı çok daha büyük olan gelir değişkeni uzaklık hesaplamasını domine edecek ve kümeler neredeyse tamamen gelire göre oluşacaktır.
Doğru seçenek, Öklid uzaklığı kullanan mesafe temelli algoritmalarda (K-Ortalamalar gibi) değişkenlerin birimlerinin ve değer aralıklarının doğrudan sonuca etki ettiği gerçeğini yansıtmaktadır. Gelir değişkeni yüz binler basamağındayken, park sayısı onlar basamağındadır. Formül gereği farkların karesi alındığında, gelir değişkenindeki küçük bir değişim bile park sayısındaki en büyük değişimden matematiksel olarak çok daha ağır basacaktır. Bu nedenle, kümeler mahallelerin park sayısından bağımsız olarak, sadece gelir düzeyine göre şekillenecektir. Bu sorunu aşmak için analize başlamadan önce her iki değişkenin ortalaması 0, varyansı 1 olacak şekilde standartlaştırılması (z-değerlerine dönüştürülmesi) gereklidir.

Step-by-Step Solution

1
K-Ortalamalar algoritmasında Öklid uzaklığının formülünü ve davranışını incelemek.
İki nokta arasındaki Öklid uzaklığı d(x,y)=(xiyi)2d(x, y) = \sqrt{\sum (x_i - y_i)^2} formülü ile hesaplanır.
Uzaklık ölçüsünün hesaplama mantığını anlamak, değişkenlerin sonuca etkisini değerlendirmek için gereklidir.
2
Verilen iki değişkenin değer aralıklarını ve uzaklık formülündeki kare alma işleminin etkisini karşılaştırmak.
X1X_1 (park sayısı) için farkların karesi en fazla birkaç yüz (örn. (250)2=625(25-0)^2 = 625) olurken, X2X_2 (gelir) için farkların karesi milyarlarca (örn. (850000250000)2=360.000.000.000(850000-250000)^2 = 360.000.000.000) değerini alacaktır.
Değişkenlerin varyans ve aralık farklarının matematiksel olarak uzaklık değerini nasıl yönlendirdiğini sayısal olarak görmek.
3
Ham verilerle yapılan kümeleme işleminin sonucunu yorumlamak.
Toplam uzaklık hesaplamasında X1X_1 değişkeninin katkısı, X2X_2 değişkeninin yanında ihmal edilebilir düzeyde kalacaktır. Algoritma fiilen sadece gelir (X2X_2) değişkenini dikkate alarak kümeleme yapacaktır.
Problemi tespit edip, standardizasyon (Z-skoruna dönüştürme vb.) işleminin neden zorunlu olduğu sonucuna varmak.

Key Concept

Ölçeklendirme (Standardizasyon) ve Uzaklık Ölçüleri Arasındaki İlişki
Question 9Question

Kümeleme analizinde gözlemler veya değişkenler arasındaki benzerlik ve uzaklıkların hesaplanması aşamasında çeşitli metrikler ve katsayılar kullanılmaktadır.

Buna göre, uzaklık ve benzerlik ölçüleri ile ilgili aşağıdaki ifadelerden hangisi yanlıştır?

Show answer & explanation

Answer: Asimetrik ikili (binary) verilerin analizinde kullanılan Dice katsayısı, Jaccard katsayısına kıyasla ortak özellikleri (1-1) iki kat ağırlıklandırırken, Basit Eşleşme (SMC) katsayısında olduğu gibi ortak yokluk (0-0) durumlarını da benzerlik hesaplamasına dâhil eder.

Answer

Dice katsayısının ortak yokluk (0-0) durumlarını benzerlik hesaplamasına dâhil ettiğini iddia eden ifade yanlıştır.
Dice katsayısının hesaplanma formülü SDice=2a2a+b+cS_{Dice} = \frac{2a}{2a + b + c} şeklindedir. Burada aa her iki gözlemde de özelliğin var olmasını (1-1), bb ve cc ise uyumsuzlukları (1-0 ve 0-1) ifade eder. Formülden de açıkça görüleceği üzere, her iki gözlemde de özelliğin bulunmaması durumunu temsil eden dd (0-0 eşleşmeleri) parametresi Dice katsayısında Jaccard katsayısında olduğu gibi tamamen dışlanmıştır. Ortak yoklukları (0-0) hesaba katan ölçü Basit Eşleşme (SMC) katsayısıdır. Bu sebeple Dice katsayısının ortak yoklukları dâhil ettiğini belirten seçenek yanlıştır.

Step-by-Step Solution

1
İkili (binary) veri yapılarında kullanılan 2x2 çapraz tablodaki hücrelerin anlamlarını belirle.
aa: 1-1 (ortak varlık), bb: 1-0, cc: 0-1, dd: 0-0 (ortak yokluk).
Benzerlik katsayılarının formülleri bu dört temel eşleşme durumu üzerinden inşa edilir.
2
Seçeneklerde bahsi geçen Basit Eşleşme (SMC), Jaccard ve Dice katsayılarının formüllerini ve dd (0-0) hücresine yaklaşımlarını incele.
SMC=a+da+b+c+dSMC = \frac{a+d}{a+b+c+d} (0-0'ı içerir). Jaccard=aa+b+cJaccard = \frac{a}{a+b+c} (0-0'ı dışlar). Dice=2a2a+b+cDice = \frac{2a}{2a+b+c} (0-0'ı dışlar).
Her bir katsayının simetrik veya asimetrik verilerdeki davranışı doğrudan bu formüllere dayanır.
3
Yanlış olan ifadeyi içeren seçeneği tespit et.
Dice katsayısının 1-1 eşleşmelerini iki kat ağırlıklandırdığı bilgisi doğru olsa da, ortak yoklukları (0-0) hesaba kattığı bilgisi kesinlikle yanlıştır.
Dice katsayısının formülünde ve mantığında dd değeri yer almaz.
4
Diğer seçeneklerdeki kavramların (Öklid'in varyans hassasiyeti, Mahalanobis'in özellikleri ve metrik uzay kuralları) doğruluğunu teyit et.
Öklid uzaklığı standartlaştırma gerektirir, Mahalanobis kovaryansı hesaba katar ve metrik özellikler (simetri, üçgen eşitsizliği vb.) zorunludur. Diğer ifadeler doğrudur.
Sorunun bütünlüğünü ve çeldiricilerin kavramsal tutarlılığını doğrulamak için gereklidir.

Key Concept

İkili Verilerde Benzerlik Ölçüleri ve Uzaklık Metriklerinin Özellikleri
Estimated Time:1m 30s
Question 10Question

Çok değişkenli veri analizinde, nn birimi birbirine benzer alt gruplara ayırmak için yığılmalı (agglomeratif) hiyerarşik kümeleme yöntemleri sıklıkla kullanılır. Bu yöntemlerden biri olan Ward yöntemi, uzaklık matrislerini kullanan klasik bağlantı (linkage) algoritmalarından farklı olarak varyans analizine dayalı bir teorik temele sahiptir.

Buna göre, Ward yönteminin algoritma mantığı ve ürettiği kümelerin geometrik yapısı hakkında aşağıdaki ifadelerden hangisi doğrudur?

Show answer & explanation

Answer: Her adımda, birleştirildiğinde küme içi hata kareler toplamındaki (ESS) artışı en aza indirecek iki kümeyi birleştirir ve genellikle küresel (spherical) yapıda, birbirine yakın büyüklükte kümeler üretme eğilimindedir.

Answer

Ward yöntemi, küme içi hata kareler toplamındaki artışı minimize eden ve küresel kümeler oluşturan yöntemdir.
Ward yöntemi, hiyerarşik kümelemede varyans analizi prensibini kullanan tek klasik algoritmadır. Her adımda tüm olası küme birleşimleri için küme içi hata kareler toplamı (ESS) yeniden hesaplanır ve toplam ESS'yi en az artıracak ikili birleştirilir. Bu istatistiksel yaklaşım, yöntemin doğası gereği yoğun, küresel (spherical) ve birbirine yakın hacimde kümeler bulma eğilimini ortaya çıkarır.

Step-by-Step Solution

1
Ward yönteminin birleştirme kriterini tanımla.
Ward yöntemi, her adımda küme içi hata kareler toplamını (Error Sum of Squares - ESS) hesaplar ve bu değerdeki artışı en aza indirecek iki kümeyi birleştirir.
Yöntemin varyans analizine dayalı temel matematiksel işleyişini belirlemek için.
2
Yöntemin uzaklık ölçütü ve aykırı değerlere duyarlılığını değerlendir.
Hata kareler toplamı hesabı karesel Öklid uzaklıklarını gerektirir. Bu karesel yapı, yöntemi aykırı değerlere karşı son derece duyarlı hale getirir.
Hatalı seçeneklerdeki (Manhattan/dirençlilik) iddiaları çürütmek için.
3
Oluşan kümelerin geometrik yapısını incele.
Kapsamlı varyans minimizasyonu, yöntemin genellikle küresel (spherical) formda ve kabaca eşit büyüklükte kümeler üretmesini sağlar.
Yöntemin ayırt edici görsel/geometrik sonucunu tanımlamak için.
4
Diğer bağlantı yöntemleriyle karşılaştırma yap.
Tek bağlantı zincirleme yapar, tam bağlantı maksimum uzaklığı dikkate alır. Ward ise sadece varyans artışını (matrisin izini) baz alır.
Seçeneklerdeki çeldiricileri doğru eşleştirmek ve elemek için.

Key Concept

Ward Yönteminin Varyans Temelli İşleyişi
Question 11Question

Aşağıdaki tabloda dört gözlem (A, B, C, D) arasındaki başlangıç uzaklık matrisi verilmiştir:

GözlemABCD
A02612
B2046
C64015
D126150

Hiyerarşik kümeleme analizinde ağırlıklandırılmamış ortalama bağlantı (UPGMA) yöntemi kullanılmaktadır. Analizin ilk aşamasında birbirine en yakın olan A ve B gözlemleri birleştirilerek K1={A,B}K_1 = \{A, B\} kümesi oluşturulmuştur. Daha sonra, K1K_1 kümesi ile C gözlemi birleştirilerek K2={A,B,C}K_2 = \{A, B, C\} kümesi elde edilmiştir.

Buna göre, yeni oluşan K2K_2 kümesi ile D gözlemi arasındaki uzaklık değeri aşağıdakilerden hangisidir?

Show answer & explanation

Answer: 11

Answer

Yeni oluşan K2 kümesi ile D gözlemi arasındaki uzaklık değeri 11'dir.
Ağırlıklandırılmamış ortalama bağlantı (UPGMA) yönteminde, oluşan yeni bir küme ile başka bir küme/gözlem arasındaki uzaklık, orijinal gözlem çiftlerinin birbirine olan uzaklıklarının aritmetik ortalamasıdır. K2K_2 kümesi A, B ve C gözlemlerinden oluşmaktadır. Bu gözlemlerin D gözlemine olan uzaklıkları tablodan sırasıyla 12, 6 ve 15 olarak okunur. Ortalama bağlantı gereği bu üç değer toplanıp 3'e bölünür: 12+6+153=333=11\frac{12 + 6 + 15}{3} = \frac{33}{3} = 11. Alternatif olarak küme büyüklükleri formülüyle hesaplandığında; d(K2,D)=23d(K1,D)+13d(C,D)=23(9)+13(15)=6+5=11d(K_2, D) = \frac{2}{3}d(K_1, D) + \frac{1}{3}d(C, D) = \frac{2}{3}(9) + \frac{1}{3}(15) = 6 + 5 = 11 aynı sonucu verir.

Step-by-Step Solution

1
Ağırlıklandırılmamış ortalama bağlantı (UPGMA) yönteminin kuralını belirleme
Yeni bir kümenin dışarıdaki bir gözleme olan uzaklığının, kümeyi oluşturan orijinal gözlemlerin dışarıdaki gözleme olan uzaklıklarının basit aritmetik ortalaması olduğu hatırlanır.
UPGMA yöntemi, küme büyüklüklerini (gözlem sayılarını) dikkate alarak başlangıçtaki gözlemlere eşit ağırlık verir.
2
K2 kümesini oluşturan gözlemleri ve D gözlemine olan bireysel uzaklıklarını tespit etme
K2={A,B,C}K_2 = \{A, B, C\} kümesindeki elemanların D gözlemine olan uzaklıkları sırasıyla 12, 6 ve 15 olarak tablodan bulunur.
Uzaklıkları ortalamaya dahil etmek için her bir gözlemin D ile olan eşleşmesi gereklidir.
3
Uzaklıkların aritmetik ortalamasını hesaplama
d(K2,D)=12+6+153=333=11d(K_2, D) = \frac{12 + 6 + 15}{3} = \frac{33}{3} = 11 bulunur.
Üç orijinal gözlem olduğu için toplam uzaklık 3'e bölünerek doğru UPGMA uzaklığı elde edilir.

Key Concept

Ortalama Bağlantı (UPGMA) Yöntemi ile Kümeler Arası Uzaklık Hesaplama
Question 12Question

Bir araştırmacı, X,Y,ZX, Y, Z ve WW gözlemleri üzerinde hiyerarşik kümeleme analizi uygulamaktadır. Gözlemler arasındaki başlangıç uzaklık matrisi (Öklid uzaklıkları) aşağıda verilmiştir:

GözlemXXYYZZWW
XX021018
YY201422
ZZ101408
WW182280

Araştırmacı analiz sürecinde ilk olarak birbirine en yakın olan XX ve YY'yi birleştirerek K1={X,Y}K_1 = \{X, Y\} kümesini oluşturmuştur. Bir sonraki aşamada ise K1K_1 kümesi ile ZZ gözlemini birleştirerek K2={X,Y,Z}K_2 = \{X, Y, Z\} kümesini elde etmiştir.

Kümeleme işleminin son adımında, K2K_2 kümesi ile WW gözlemi arasındaki uzaklık Ortalama Bağlantı (UPGMA - Ağırlıklandırılmamış Aritmetik Ortalama) yöntemi kullanılarak hesaplanacaktır.

Buna göre, K2K_2 kümesi ile WW gözlemi arasındaki uzaklık kaç birimdir?

Show answer & explanation

Answer: 16

Answer

16
Ortalama bağlantı (UPGMA - Ağırlıklandırılmamış Aritmetik Ortalama) yönteminde, bir kümenin diğerine olan uzaklığı, bu kümelerdeki tüm gözlem çiftleri arasındaki uzaklıkların aritmetik ortalamasıdır. K2={X,Y,Z}K_2 = \{X, Y, Z\} kümesinin WW gözlemine uzaklığı hesaplanırken, WW'nin XX, YY ve ZZ ile olan tüm uzaklıkları toplanıp 3'e bölünmelidir. Formül uygulanırsa: d(X,W)+d(Y,W)+d(Z,W)3=18+22+83=483=16\frac{d(X,W) + d(Y,W) + d(Z,W)}{3} = \frac{18 + 22 + 8}{3} = \frac{48}{3} = 16 birim olarak bulunur. (Not: WPGMA kullanılsaydı ağırlıklandırma farkından dolayı sonuç 14 çıkardı).

Step-by-Step Solution

1
K2K_2 kümesinin elemanlarının ve karşılaştırılacak hedefin belirlenmesi
K2={X,Y,Z}K_2 = \{X, Y, Z\} kümesi ile WW gözlemi arasındaki eşleşmeler tespit edilir.
Uzaklık hesaplamasında hangi ikili eşleşmelerin kullanılacağını netleştirmek için.
2
Matris üzerinden K2K_2'deki her bir gözlemin WW ile olan uzaklıklarının okunması
d(X,W)=18d(X,W) = 18, d(Y,W)=22d(Y,W) = 22, d(Z,W)=8d(Z,W) = 8 olarak bulunur.
UPGMA formülünde yer alan pay (toplam uzaklık) değerini oluşturmak için.
3
UPGMA formülüne göre aritmetik ortalamanın hesaplanması
(18+22+8)/3=48/3=16(18 + 22 + 8) / 3 = 48 / 3 = 16 birim bulunur.
Ağırlıklandırılmamış Ortalama Bağlantı yönteminde tüm gözlemlerin eşit ağırlığa sahip olması gerektiği için doğrudan eleman sayısına bölünür.

Key Concept

Hiyerarşik Kümeleme Analizinde Ağırlıklandırılmamış Ortalama Bağlantı (UPGMA)
Question 13Question

Çok değişkenli istatistiksel analizde yığılmalı (agglomeratif) hiyerarşik kümeleme yöntemleri, birleştirilecek kümelerin arasındaki uzaklığın (veya benzerliğin) nasıl tanımlandığına göre birbirinden ayrılır. Bir veri bilimci, elindeki sürekli değişkenlerden oluşan veri setini kullanarak homojen alt gruplar elde etmek istemekte ve bu amaçla Ward Yöntemi'ni kullanmaya karar vermektedir.

Buna göre, Ward Yöntemi'nin dayandığı temel optimizasyon ölçütü ve bu yöntemin Tek Bağlantı (Single Linkage) ve Tam Bağlantı (Complete Linkage) gibi geleneksel yöntemlerden ayrılan teorik yapısı aşağıdakilerin hangisinde doğru açıklanmıştır?

Show answer & explanation

Answer: İki kümenin birleştirilmesi kararını, birleşme sonrası oluşacak yeni kümenin hata kareler toplamındaki (ESSESS) artışın minimum yapılmasına dayandırır; geleneksel yöntemler belirli gözlem çiftleri arasındaki uzaklıkları temel alırken, Ward yöntemi varyans analizi (ANOVA) yaklaşımına benzer şekilde küme içi varyansı minimize etmeyi amaçlar.

Answer

Ward yöntemi, iki kümenin birleştirilmesi kararını, birleşme sonrası oluşacak yeni kümenin hata kareler toplamındaki (ESS) artışın minimum yapılmasına dayandırır ve küme içi varyansı minimize etmeyi amaçlar.
Ward yöntemi, hiyerarşik kümeleme algoritmaları içinde varyans analizi (ANOVA) yaklaşımını kullanan yegane yöntemdir. Diğer yığılmalı hiyerarşik yöntemler kümeler arasındaki mesafeyi tanımlamak için spesifik veri noktalarını (en yakın komşu, en uzak komşu veya ortalama) kullanırken, Ward yöntemi birleşmenin sistemin genel homojenliğine olan etkisine odaklanır. Herhangi iki küme birleştirildiğinde, yeni oluşan kümenin içindeki gözlemlerin hata kareler toplamında (ESSESS) zorunlu bir artış olur. Ward yöntemi, her adımda bu artışı (bilgi kaybını) minimum yapan iki kümeyi birleştirerek olabildiğince homojen alt gruplar elde etmeyi garanti eder.

Step-by-Step Solution

1
Ward yönteminin optimizasyon kriterini belirleme
Yöntem, her adımda küme içi hata kareler toplamındaki (ESSESS) artışı minimize eder.
Bilgi kaybını en aza indirmek ve homojen kümeler elde etmek için.
2
Diğer yöntemlerle karşılaştırma yapma
Tek ve Tam bağlantı gibi yöntemler doğrudan geometrik uzaklıkları (en yakın/en uzak komşu) dikkate alırken, Ward varyans analizi (ANOVA) benzeri bir yaklaşım kullanır.
Ward yönteminin teorik farkını ortaya koymak için.
3
Seçenekleri eleme
En uzak mesafe (Tam Bağlantı), ortalama mesafe (Ortalama Bağlantı), Mahalanobis optimizasyonu ve dendrogram kesim noktası ifadeleri elenir.
Hatalı veya farklı kümeleme/uzaklık kavramlarına ait oldukları için.

Key Concept

Ward Yönteminin temel prensibi ve küme içi hata kareler toplamı (ESS) minimizasyonu.

Alternative Method

Öklid uzaklık matrisi üzerinden Ward yönteminin formülasyonu çalışılırken, varyans hesaplaması yapmak yerine Lance-Williams güncelleme formülünde Ward parametrelerinin nasıl yerleştirildiğini inceleyerek yöntemin işleyişini matematiksel olarak daha hızlı kavrayabilirsiniz.
Estimated Time:1m 30s
Question 14Question

Bir bölge kalkınma ajansı uzmanı, ilçeleri sosyoekonomik gelişmişlik göstergelerine göre sınıflandırmak için hiyerarşik kümeleme analizi uygulamaktadır. Uzman, kümeler arası uzaklığı hesaplarken tek tek gözlemler arasındaki en kısa mesafeyi dikkate alan yaklaşımın yaratabileceği zincirleme (chaining) etkisinden veya en uzun mesafeyi temel alan yaklaşımın aykırı değerlere olan aşırı hassasiyetinden kaçınmak istemektedir. Bunun yerine, her adımda birleştirilecek iki kümenin, toplam küme içi hata kareler toplamındaki (ESSESS) artışı en aza indirecek şekilde seçilmesi prensibine dayanan algoritmayı kullanmaya karar vermiştir.

Buna göre, uzmanın uygulamasında tercih ettiği kümeleme yöntemi aşağıdakilerden hangisidir?

Show answer & explanation

Answer: Ward yöntemi

Answer

Ward yöntemi, küme içi hata kareler toplamındaki (ESS) artışı minimize etmeye dayanan algoritmadır.
Doğru yanıt olan Ward yöntemi, yığılmalı hiyerarşik kümeleme analizinde varyans temelli bir yaklaşımdır. Her adımda, olası tüm küme birleşimleri değerlendirilir ve küme içi hata kareler toplamında (ESSESS - Error Sum of Squares) en az artışa neden olan iki küme birleştirilir. Bu sayede, oluşan kümelerin içsel olarak yüksek derecede homojen olması sağlanır.

Step-by-Step Solution

1
Soru metnindeki birleştirme kriterini belirle.
Araştırmacının, her birleştirme aşamasında 'toplam küme içi hata kareler toplamındaki (ESSESS) artışı en aza indiren' algoritmayı aradığı tespit edilir.
Hiyerarşik kümeleme yöntemleri, kümeleri hangi uzaklık veya benzerlik kriterine göre birleştirecekleri noktasında birbirinden ayrılır.
2
Diğer yöntemlerin dezavantajları ile eşleşen özellikleri ele.
Metinde bahsedilen zincirleme etkisine (chaining) yol açan yöntem 'Tek bağlantı', aykırı değerlere hassas olan yöntem ise 'Tam bağlantı' yöntemidir.
Soru metni bu yöntemlerin neden tercih edilmediğini açıklayarak analistin aradığı yöntemin ayırt edici özelliğini vurgulamaktadır.
3
Kriter ile doğru yöntemi eşleştir.
Küme içi varyansı (veya hata kareler toplamı olan ESSESS'yi) minimum yapacak kümeleri birleştirme mantığına dayanan algoritmanın Ward yöntemi olduğu sonucuna varılır.
Ward yönteminin matematiksel amacı, oluşan kümelerin kendi içlerinde maksimum homojenliğe sahip olmasını sağlamaktır.

Key Concept

Ward Yöntemi ve Hata Kareler Toplamı (ESS) Minimizasyonu
Question 15Question

Aşağıdaki tabloda bir hiyerarşik kümeleme analizi uygulamasında yer alan AA, BB ve CC kümeleri arasındaki uzaklık matrisi ve bu kümelerin içerdiği gözlem sayıları (nn) verilmiştir:

KümeA (n=4)A \ (n=4)B (n=1)B \ (n=1)C (n=3)C \ (n=3)
**A (n=4)A \ (n=4)**00881212
**B (n=1)B \ (n=1)**88003232
**C (n=3)C \ (n=3)**1212323200

Analizin bu adımında, aralarındaki uzaklık en küçük olan AA ve BB kümeleri birleştirilerek yeni bir (AB)(A \cup B) kümesi oluşturulmuştur.

Buna göre, yeni oluşan (AB)(A \cup B) kümesi ile CC kümesi arasındaki uzaklık, sırasıyla Ağırlıklandırılmamış Ortalama Bağlantı (UPGMA) ve Ağırlıklandırılmış Ortalama Bağlantı (WPGMA) yöntemlerine göre hesaplandığında aşağıdaki değer çiftlerinden hangisi elde edilir?

Show answer & explanation

Answer: 16 ve 22

Answer

Yeni küme ile C kümesi arasındaki uzaklık UPGMA yöntemi ile 16, WPGMA yöntemi ile 22 olarak hesaplanır.
Doğru seçenekte, UPGMA için kümelerin eleman sayıları formüle dahil edilmiş (4/5×12+1/5×32=164/5 \times 12 + 1/5 \times 32 = 16) ve WPGMA için kümelerin büyüklüğüne bakılmaksızın basit aritmetik ortalama (12/2+32/2=2212/2 + 32/2 = 22) alınarak hesaplama eksiksiz yapılmıştır.

Step-by-Step Solution

1
Birleşen kümeleri ve özelliklerini belirleme
AA ve BB kümeleri birleşerek (AB)(A \cup B) kümesini oluşturmuştur. nA=4n_A = 4, nB=1n_B = 1. C kümesine uzaklıkları tablodan d(A,C)=12d(A,C) = 12 ve d(B,C)=32d(B,C) = 32 olarak okunur.
Bağlantı algoritmalarında kullanılacak başlangıç parametrelerini matristen doğru çekmek hesaplamanın ilk adımıdır.
2
UPGMA (Ağırlıklandırılmamış Ortalama Bağlantı) değerini hesaplama
dUPGMA=nAnA+nBd(A,C)+nBnA+nBd(B,C)=45(12)+15(32)=9.6+6.4=16d_{UPGMA} = \frac{n_A}{n_A+n_B} d(A,C) + \frac{n_B}{n_A+n_B} d(B,C) = \frac{4}{5}(12) + \frac{1}{5}(32) = 9.6 + 6.4 = 16.
UPGMA yönteminde orijinal gözlemlerin eşit ağırlığa sahip olması amaçlandığı için, kümeler birleştirilirken eleman sayıları dikkate alınarak ağırlıklı ortalama alınır.
3
WPGMA (Ağırlıklandırılmış Ortalama Bağlantı) değerini hesaplama
dWPGMA=12d(A,C)+12d(B,C)=12+322=22d_{WPGMA} = \frac{1}{2} d(A,C) + \frac{1}{2} d(B,C) = \frac{12 + 32}{2} = 22.
WPGMA yönteminde eleman sayısına bakılmaksızın kümeler eşit ağırlığa (0.5) sahip olacak şekilde basit aritmetik ortalama alınır (böylece küçük kümedeki elemanlar dolaylı olarak daha yüksek ağırlık kazanır).
4
Elde edilen sonuçları sırasıyla eşleştirme
UPGMA için 16, WPGMA için 22 değerleri elde edilmiştir.
Soru kökünde istenen sıraya uygun şekilde sonuçlar tespit edilir.

Key Concept

Hiyerarşik Kümeleme Analizinde UPGMA ve WPGMA Yöntemlerinin Karşılaştırılması
Question 16Question

Bir kamu kurumu, illeri sosyo-ekonomik gelişmişlik endekslerine göre hiyerarşik olarak kümelemektedir. Analizin bir aşamasında A={I1,I2}A = \{I_1, I_2\} ve B={I3,I4,I5}B = \{I_3, I_4, I_5\} olmak üzere iki küme elde edilmiştir. Bu iki kümedeki iller arasındaki uzaklık değerleri aşağıda verilmiştir:

d(I1,I3)=12d(I_1, I_3) = 12
d(I1,I4)=18d(I_1, I_4) = 18
d(I1,I5)=14d(I_1, I_5) = 14
d(I2,I3)=9d(I_2, I_3) = 9
d(I2,I4)=15d(I_2, I_4) = 15
d(I2,I5)=22d(I_2, I_5) = 22

Araştırmacı, kümeleri birleştirirken 'Tam Bağlantı (En Uzak Komşu)' yöntemini kullanmayı tercih etmiştir.

Buna göre, AA ve BB kümeleri arasındaki uzaklık değeri ile araştırmacının bu yöntemi tercih ettiğinde ulaşması beklenen küme yapısının özelliği aşağıdakilerin hangisinde birlikte doğru verilmiştir?

Show answer & explanation

Answer: 2222 ; Sıkı (kompakt) ve küresel yapıda kümeler üretme eğilimi

Answer

2222 ; Sıkı (kompakt) ve küresel yapıda kümeler üretme eğilimi
Tam Bağlantı (En Uzak Komşu) yönteminde iki küme arasındaki uzaklık, kümelerin elemanları arasındaki en uzak mesafeye eşittir. Verilen {12,18,14,9,15,22}\{12, 18, 14, 9, 15, 22\} değerleri içindeki maksimum uzaklık 2222'dir. Ayrıca bu yöntem, algoritmik doğası gereği yeni katılımları zorlaştırdığı için kümelerin uzayıp gitmesini (zincirleme etkisini) engeller ve kompakt, küresel yapıda kümeler oluşturur.

Step-by-Step Solution

1
Tam bağlantı (en uzak komşu) yönteminin uzaklık tanımını hatırlamak.
d(A,B)=max{d(i,j):iA,jB}d(A, B) = \max \{ d(i, j) : i \in A, j \in B \} formülü geçerlidir.
Yöntem, iki küme arasındaki uzaklığı, bu kümelerin elemanları arasındaki en büyük (maksimum) uzaklık olarak tanımlar.
2
Verilen uzaklıklar arasından en büyük değeri bulmak.
Verilen değerler {12,18,14,9,15,22}\{12, 18, 14, 9, 15, 22\} şeklindedir. max(12,18,14,9,15,22)=22\max(12, 18, 14, 9, 15, 22) = 22 bulunur.
Kümeler birleştirilirken aralarındaki en uzak mesafeli elemanlar (I2 ve I5) temel alınır.
3
Tam bağlantı yönteminin küme yapısına etkisini (geometrik eğilimini) belirlemek.
Yöntem zincirleme (chaining) etkisinden kaçınarak birbirine benzer çaptaki, sıkı (kompakt) ve küresel kümeler oluşturma eğilimindedir.
Kümeye yeni bir elemanın/kümenin katılması için mevcut kümedeki tüm elemanlara (en uzaktakine bile) yakın olması şartı aranır.

Key Concept

Tam Bağlantı Yönteminde Uzaklık Hesaplama ve Küme Geometrisi
Question 17Question

Bir e-ticaret platformu, iki müşterisinin (X ve Y) sekiz farklı ürün kategorisindeki satın alma durumlarını "1: Satın aldı", "0: Satın almadı" olarak kodlamış ve aşağıdaki ikili (binary) vektörleri elde etmiştir:

X=[1,1,1,1,0,0,0,0]X = [1, 1, 1, 1, 0, 0, 0, 0]
Y=[1,1,1,0,1,0,0,0]Y = [1, 1, 1, 0, 1, 0, 0, 0]

Bu iki müşteri arasındaki satın alma alışkanlığı benzerliği incelenirken, tüm durumları dikkate alan "Basit Eşleşme (Simple Matching) Katsayısı" ve her ikisinin de satın almadığı (0-0 eşleşmeleri) kategorileri dışlayan "Jaccard Benzerlik Katsayısı" ayrı ayrı hesaplanmıştır.

Buna göre, hesaplanan bu iki benzerlik katsayısı arasındaki farkın mutlak değeri kaçtır?

Show answer & explanation

Answer: 0,150,15

Answer

İki benzerlik katsayısı arasındaki farkın mutlak değeri 0,150,15'tir.
Verilen iki vektör incelendiğinde; her ikisinde de 1 olan özellik sayısı a=3a=3, sadece X'te 1 olan b=1b=1, sadece Y'de 1 olan c=1c=1 ve her ikisinde de 0 olan d=3d=3 olarak sayılır. Basit Eşleşme katsayısı (a+d)/p(a+d)/p formülü ile (3+3)/8=0,75(3+3)/8 = 0,75 bulunur. 0-0 durumlarını dışlayan Jaccard katsayısı ise a/(a+b+c)a/(a+b+c) formülü ile 3/5=0,603/5 = 0,60 hesaplanır. Bu iki benzerlik değeri arasındaki farkın mutlak değeri 0,750,60=0,15|0,75 - 0,60| = 0,15 olarak elde edilir.

Step-by-Step Solution

1
Vektörlerdeki eşleşme ve eşleşmeme (a, b, c, d) frekanslarını belirle.
Her ikisinde de 1 olanlar (a) = 3, yalnızca X'te 1 olanlar (b) = 1, yalnızca Y'de 1 olanlar (c) = 1, her ikisinde de 0 olanlar (d) = 3 bulunur. Toplam değişken sayısı p=8p = 8'dir.
İkili veri benzerlik katsayılarının tümü bu dört temel frekansa dayalı olarak hesaplanır.
2
Basit Eşleşme (Simple Matching) katsayısını hesapla.
SSM=a+da+b+c+d=3+38=68=0,75S_{SM} = \frac{a+d}{a+b+c+d} = \frac{3+3}{8} = \frac{6}{8} = 0,75 olarak bulunur.
Basit eşleşme katsayısı, 0-0 eşleşmeleri dahil tüm ortak durumları toplam değişken sayısına oranlar.
3
Jaccard Benzerlik katsayısını hesapla.
SJ=aa+b+c=33+1+1=35=0,60S_J = \frac{a}{a+b+c} = \frac{3}{3+1+1} = \frac{3}{5} = 0,60 olarak bulunur.
Jaccard katsayısı, özelliğin her iki gözlemde de bulunmadığı (0-0) durumları analizin dışında tutar.
4
İki katsayı arasındaki farkın mutlak değerini bul.
0,750,60=0,15|0,75 - 0,60| = 0,15 elde edilir.
Soruda hesaplanan iki benzerlik değerinin arasındaki mutlak fark istenmektedir.

Key Concept

İkili (Binary) Verilerde Benzerlik Ölçüleri
Question 18Question

Bir gıda mühendisi, dört farklı zeytinyağı numunesini (Z1,Z2,Z3,Z4Z_1, Z_2, Z_3, Z_4) kimyasal özelliklerine ait Öklid uzaklıklarına göre hiyerarşik olarak kümelemek istemektedir. Numuneler arasındaki uzaklık matrisi aşağıda verilmiştir:

Z1Z_1Z2Z_2Z3Z_3Z4Z_4
**Z1Z_1**00226699
**Z2Z_2**22003377
**Z3Z_3**66330055
**Z4Z_4**99775500

Analizde ilk adımda birbirine en yakın olan Z1Z_1 ve Z2Z_2 numuneleri birleştirilerek birinci küme olan (Z1,Z2)(Z_1, Z_2) oluşturulmuştur.

Araştırmacı kümeleme işlemine Tam Bağlantı (En Uzak Komşu) yöntemini kullanarak devam ettiğine göre, ikinci adımda gerçekleşecek birleşme işlemi ve birleşme uzaklık değeri aşağıdakilerden hangisidir?

Show answer & explanation

Answer: Z3Z_3 ve Z4Z_4 numuneleri birleşir, uzaklık 55 olur.

Answer

İkinci adımda Z3Z_3 ve Z4Z_4 numuneleri birleşir ve birleşme uzaklığı 55 olur.
Hiyerarşik kümeleme algoritmalarında ilk adım tamamlandıktan sonra güncellenmiş yeni bir uzaklık matrisi elde edilir. Tam Bağlantı (En Uzak Komşu) yönteminde (Z1,Z2)(Z_1, Z_2) kümesinin Z3Z_3'e olan uzaklığı max(6,3)=6\max(6, 3) = 6; Z4Z_4'e olan uzaklığı ise max(9,7)=9\max(9, 7) = 9 olarak hesaplanır. Z3Z_3 ve Z4Z_4 arasındaki mevcut uzaklık ise 55'tir. Yeni durumdaki potansiyel birleşme uzaklıkları {6,9,5}\{6, 9, 5\} şeklindedir. Kümeleme prensibi gereği her zaman bu değerlerden en küçük olanı seçilerek yeni küme oluşturulur. Bu nedenle Z3Z_3 ve Z4Z_4 numuneleri, en küçük uzaklık değeri olan 55 noktasında birleştirilir.

Step-by-Step Solution

1
İlk adımda birleşen (Z1,Z2)(Z_1, Z_2) kümesinin diğer numunelere (Z3Z_3 ve Z4Z_4) olan uzaklıklarını Tam Bağlantı (Maksimum) yöntemine göre hesapla.
d(Z1,Z2),Z3=max(dZ1,Z3,dZ2,Z3)=max(6,3)=6d_{(Z_1,Z_2), Z_3} = \max(d_{Z_1,Z_3}, d_{Z_2,Z_3}) = \max(6, 3) = 6 ve d(Z1,Z2),Z4=max(dZ1,Z4,dZ2,Z4)=max(9,7)=9d_{(Z_1,Z_2), Z_4} = \max(d_{Z_1,Z_4}, d_{Z_2,Z_4}) = \max(9, 7) = 9 değerleri bulunur.
Tam Bağlantı (En Uzak Komşu) yönteminde, yeni oluşan bir kümenin dışarıdaki bir gözleme uzaklığı, küme içindeki elemanların o gözleme olan uzaklıklarının en büyüğü (maksimumu) olarak tanımlanır.
2
Daha önce birleşmemiş numuneler arasındaki uzaklığı kontrol et.
Z3Z_3 ve Z4Z_4 arasındaki uzaklık matristen okunur: dZ3,Z4=5d_{Z_3,Z_4} = 5.
Yeni adımda birleştirilecek en yakın çifti bulmak için matriste kalan tüm ikili uzaklıkların bilinmesi gerekir.
3
Elde edilen yeni uzaklık değerleri içerisinden en küçük olanı (minimum) seçerek ikinci birleşmeyi gerçekleştir.
Eldeki uzaklıklar (6,9,56, 9, 5) içerisindeki en küçük değer 55'tir. Bu değer Z3Z_3 ile Z4Z_4 arasında olduğundan, bu iki numune 55 birim uzaklıkta birleşir.
Hiyerarşik kümeleme algoritmalarında uzaklık hesaplama yöntemi (Tam, Tek, Ortalama vb.) ne olursa olsun, her adımda birbirine en yakın olan (en küçük uzaklığa sahip) iki küme/gözlem birleştirilir.

Key Concept

Tam Bağlantı Yöntemiyle Hiyerarşik Kümelemede Uzaklık Matrisi Güncellemesi
Estimated Time:1m 30s
Question 19Question

Bir endüstri mühendisi, üretim hattından çıkan parçaları iki temel kalite kriterine göre gruplamak amacıyla K-Ortalamalar (K-Means) algoritmasını kullanmaktadır. Bu kriterler; X1X_1 (mikron cinsinden yüzey pürüzlülüğü, varyansı σ12=4\sigma^2_1 = 4) ve X2X_2 (Pascal cinsinden basınca dayanıklılık, varyansı σ22=1.6×108\sigma^2_2 = 1.6 \times 10^8) olarak belirlenmiştir. Mühendis, analiz öncesinde veri setinde herhangi bir standardizasyon (ölçeklendirme) işlemi yapmadan, uzaklık ölçüsü olarak Öklid uzaklığını kullanarak algoritmayı çalıştırmıştır.

Bu durumun K-Ortalamalar algoritmasının optimizasyon süreci ve elde edilecek kümeler üzerindeki matematiksel etkisi aşağıdakilerden hangisinde doğru ifade edilmiştir?

Show answer & explanation

Answer: Grup içi hata kareler toplamı (WCSS) minimize edilirken X2X_2 değişkenindeki büyük sayısal farklar Öklid uzaklığını domine edeceğinden, algoritmik olarak X1X_1 değişkeninin kümeleme yapısına katkısı neredeyse sıfırlanır ve kümeler temel olarak X2X_2 ekseninde şekillenir.

Answer

Standardize edilmemiş K-Ortalamalar uygulamasında büyük varyansa sahip değişkenin, uzaklık hesaplamasında diğer değişkeni baskılayıp kümeleri tamamen kendi ekseninde oluşturacağını belirten seçenek doğrudur.
K-Ortalamalar (K-Means) algoritması, gözlemlerin küme merkezlerine (centroid) atanmasında genellikle Öklid uzaklığını kullanır. Öklid uzaklığı formülü gereği, veri setindeki değişkenlerin farklı ölçüm birimlerine veya çok farklı varyanslara sahip olması durumunda, sayısal olarak büyük olan (büyük varyanslı) değişken toplam mesafe değerini domine eder. Soru senaryosunda X2X_2'nin varyansı 1.6×1081.6 \times 10^8, X1X_1'in varyansı ise 44'tür. Bu durumda uzaklık hesaplamasında X1X_1'in değerleri matematiksel olarak bir gürültü seviyesine iner ve algoritma sadece Grup İçi Hata Kareler Toplamını (WCSS) minimize etmeye çalışırken tamamen X2X_2'nin sayısal farklılıklarına odaklanır. Bu nedenle, değişkenlerin standartlaştırılmaması X1X_1'in analizdeki ağırlığını yok eder.

Step-by-Step Solution

1
K-Ortalamalar algoritmasında mesafe ölçümü için kullanılan fonksiyonu tanımla.
Öklid uzaklığı, d(i,j)=k=1p(xikxjk)2d(i,j) = \sqrt{\sum_{k=1}^{p} (x_{ik} - x_{jk})^2} formülü ile hesaplanır.
Uzaklık temelli algoritmaların değişken metriklerinden (ölçeklerinden) nasıl etkilendiğini görmek için fonksiyona odaklanmak gerekir.
2
Değişkenlerin varyansları arasındaki farkın formül üzerindeki etkisini incele.
X2X_2 değişkenindeki ortalama karesel farklar 10810^8 mertebesindeyken, X1X_1 değişkenindeki farklar tek haneli sayılar seviyesindedir.
Toplama işleminde devasa sayılar ile çok küçük sayıların bir araya gelmesi, küçük sayıların toplam üzerindeki marjinal etkisini sıfıra yaklaştırır.
3
Algoritmanın optimizasyon hedefi (Grup İçi Hata Kareler Toplamı - WCSS) açısından sonucu değerlendir.
WCSS minimize edilirken, iterasyonlar ve merkez (centroid) güncellemeleri yalnızca X2X_2 eksenindeki varyansı daraltmaya odaklanacaktır. X1X_1 değişkeninin örüntüsü küme oluşumunu etkileyemez.
Standartlaştırma (Z-skoru vb.) yapılmadığında, algoritma değişkenlerin taşıdığı istatistiksel bilgi değerini değil, salt sayısal büyüklüklerini dikkate alır.

Key Concept

K-Ortalamalar algoritmasında değişken ölçeklendirmesi ve Öklid uzaklığı geometrisi
Estimated Time:2m 30s
Question 20Question

Bir bölge kalkınma ajansı, dört farklı yatırım sektörünün (S1,S2,S3,S4S_1, S_2, S_3, S_4) risk profillerini değerlendirmek için hiyerarşik kümeleme analizi uygulamaktadır. Bu sektörler arasındaki uzaklık matrisi aşağıdaki tabloda verilmiştir:

SektörS1S_1S2S_2S3S_3S4S_4
S1S_100121225253838
S2S_212120018183030
S3S_325251818001515
S4S_438383030151500

Analizde tam bağlantı (en uzak komşu) yöntemi kullanılmaktadır. Algoritmanın ilk adımında birbirine en yakın iki sektör tek bir küme haline getirildiğine göre, bu yeni oluşan küme ile S3S_3 sektörü arasındaki uzaklık kaç birim olarak hesaplanır?

Show answer & explanation

Answer: 2525

Answer

Yeni küme ile S3S_3 sektörü arasındaki uzaklık 2525 birimdir.
Hiyerarşik kümeleme analizinde ilk adım, en küçük uzaklığa sahip olan S1S_1 ve S2S_2 gözlemlerinin (uzaklık = 1212) birleştirilmesidir. Tam bağlantı (en uzak komşu) yönteminde, yeni oluşturulan kümenin dışarıdaki bir gözlemle (veya kümeyle) olan uzaklığı, ilgili elemanlar arasındaki maksimum uzaklık dikkate alınarak bulunur. Buna göre, (S1,S2)(S_1, S_2) kümesi ile S3S_3 arasındaki uzaklık max(d(S1,S3),d(S2,S3))\max(d(S_1, S_3), d(S_2, S_3)) formülüyle hesaplanır. Tablodan değerler yerine konduğunda max(25,18)=25\max(25, 18) = 25 birim olarak bulunur.

Step-by-Step Solution

1
Uzaklık matrisindeki en küçük değeri bularak ilk birleşecek kümeleri belirleme.
Matristeki en küçük değer d(S1,S2)=12d(S_1, S_2) = 12'dir. İlk adımda S1S_1 ve S2S_2 birleşerek (S1,S2)(S_1, S_2) kümesini oluşturur.
Hiyerarşik kümeleme algoritmaları her zaman aralarındaki uzaklık en az olan (en çok benzeyen) iki gözlemi veya kümeyi birleştirerek başlar.
2
Yeni oluşan (S1,S2)(S_1, S_2) kümesi ile S3S_3 sektörü arasındaki uzaklığı tam bağlantı yöntemine göre hesaplama.
d((S1,S2),S3)=max(d(S1,S3),d(S2,S3))d((S_1, S_2), S_3) = \max(d(S_1, S_3), d(S_2, S_3)) formülü uygulanır.
Tam bağlantı (en uzak komşu) yönteminde, iki küme arasındaki uzaklık, bu kümelerin elemanları arasındaki en büyük (maksimum) uzaklık olarak tanımlanır.
3
Matristeki karşılık gelen değerleri formülde yerine koyma.
max(25,18)=25\max(25, 18) = 25 değeri elde edilir.
Matristen d(S1,S3)=25d(S_1, S_3) = 25 ve d(S2,S3)=18d(S_2, S_3) = 18 değerleri okunarak bu iki değerin maksimumu seçilir.

Key Concept

Tam Bağlantı (En Uzak Komşu) Yönteminde Uzaklık Hesaplaması
Estimated Time:1m 0s
Page 1 / 3Next
Kümeleme Analizi Practice Questions — KPSS İstatistik | Examkin