Kümeleme Analizi

56 questions

Question 41Question

Afet ve Acil Durum Yönetimi Başkanlığı (AFAD), olası bir afet durumunda lojistik desteği optimize etmek amacıyla dört farklı ildeki (I1,I2,I3,I4I_1, I_2, I_3, I_4) destek merkezlerini hiyerarşik kümeleme analizi ile gruplandırmayı planlamaktadır. Bu merkezler arasındaki karayolu uzaklıkları (km cinsinden) aşağıdaki tabloda verilmiştir:

I1I_1I2I_2I3I_3I4I_4
**I1I_1**0122835
**I2I_2**1201024
**I3I_3**2810015
**I4I_4**3524150

Analiz sürecinde gruplandırma için Tek Bağlantı (En Yakın Komşu) yöntemi kullanılacaktır.

Buna göre, ilk birleştirme işlemi tamamlandıktan sonraki ikinci adımda hangi kümeler birleştirilecek ve bu birleşme işlemi hangi uzaklık seviyesinde gerçekleşecektir?

Show answer & explanation

Answer: I1I_1 ile (I2,I3)(I_2, I_3) kümeleri, 12 km12\text{ km} seviyesinde

Answer

İkinci adımda I1I_1 ile (I2,I3)(I_2, I_3) kümeleri birleştirilir ve bu birleşme 12 km12\text{ km} seviyesinde gerçekleşir.
Tek bağlantı yönteminde kümeler arası uzaklık formülü D(A,B)=min(d(x,y))D(A, B) = \min(d(x, y)) şeklindedir. İlk birleşen küme en kısa mesafeye sahip olan I2I_2 ve I3I_3 (10 km10\text{ km}) merkezleridir. Oluşan (I2,I3)(I_2, I_3) kümesinin I1I_1'e uzaklığı min(12,28)=12\min(12, 28) = 12, I4I_4'e uzaklığı ise min(24,15)=15\min(24, 15) = 15 olarak hesaplanır. Geriye kalan I1I_1 ile I4I_4 arasındaki mesafe 3535'tir. Yeni matristeki en küçük değer 1212 olduğundan, ikinci adımda I1I_1 ile (I2,I3)(I_2, I_3) kümeleri 12 km12\text{ km} seviyesinde birleştirilir.

Step-by-Step Solution

1
Başlangıç uzaklık matrisindeki en küçük değeri bularak ilk kümeyi oluşturun.
Matristeki en küçük değer d(I2,I3)=10d(I_2, I_3) = 10'dur. Dolayısıyla ilk adımda I2I_2 ve I3I_3 birleşerek (I2,I3)(I_2, I_3) kümesini oluşturur.
Hiyerarşik yığışımlı kümelemede her adımda birbirine en yakın iki gözlem veya küme birleştirilir.
2
Tek bağlantı (En Yakın Komşu) formülünü kullanarak yeni küme (I2,I3)(I_2, I_3) ile diğer noktalar (I1I_1 ve I4I_4) arasındaki uzaklıkları hesaplayın.
d((I2,I3),I1)=min(d(I2,I1),d(I3,I1))=min(12,28)=12d((I_2, I_3), I_1) = \min(d(I_2, I_1), d(I_3, I_1)) = \min(12, 28) = 12.
d((I2,I3),I4)=min(d(I2,I4),d(I3,I4))=min(24,15)=15d((I_2, I_3), I_4) = \min(d(I_2, I_4), d(I_3, I_4)) = \min(24, 15) = 15.
Tek bağlantı yönteminde bir kümenin başka bir nokta veya kümeye olan uzaklığı, elemanlar arasındaki olası tüm uzaklıkların en küçüğü olarak tanımlanır.
3
Güncellenmiş 3×33\times3 uzaklık matrisini oluşturun ve yeni matristeki en küçük değeri belirleyin.
Matriste elemanlar arası uzaklıklar: (I1)(I_1) ile (I2,I3)(I_2, I_3) arası 1212, (I2,I3)(I_2, I_3) ile (I4)(I_4) arası 1515, ve (I1)(I_1) ile (I4)(I_4) arası 3535'tir. En küçük değer 1212'dir.
İkinci birleştirme adımı, güncel matriste birbirine en yakın olan (en küçük uzaklığa sahip) iki grubun birleştirilmesiyle gerçekleşir.
4
En küçük değere karşılık gelen kümeleri ve birleşme seviyesini ifade edin.
İkinci adımda I1I_1 ile (I2,I3)(I_2, I_3) kümeleri 12 km12\text{ km} uzaklık seviyesinde birleşir.
Mesafe ölçütlerine göre en optimal ikinci birleşme noktası burasıdır.

Key Concept

Tek Bağlantı (En Yakın Komşu) Uzaklık Hesaplaması
Estimated Time:1m 30s
Question 42Question

Bir araştırmacı, belediyelerin sosyo-ekonomik yapılarını analiz etmek amacıyla "Yıllık Toplam Bütçe (milyon TL)" ve "Hizmet Veren Kütüphane Sayısı" değişkenlerini kullanarak KK-Ortalamalar (KK-Means) kümeleme analizi yapmaktadır. Veri setinde bütçe değerleri 1010 ile 500500 (milyon TL) arasında geniş bir aralıkta değişirken, kütüphane sayıları 11 ile 88 arasında küçük değerler almaktadır. Analiz sürecinde uzaklık ölçütü olarak Öklid uzaklığı (Euclidean distance) tercih edilmiştir.

Değişkenler üzerinde herhangi bir standartlaştırma veya ölçeklendirme işlemi yapılmadan analize başlanması durumunda, algoritmanın davranışı ve elde edilecek sonuçlar hakkında aşağıdakilerden hangisi doğrudur?

Show answer & explanation

Answer: Sayısal değerleri çok daha büyük olan yıllık bütçe değişkeni uzaklık hesaplamalarını domine eder ve kümelerin oluşumunda kütüphane sayısının etkisi ihmal edilebilir düzeye iner.

Answer

Sayısal değerleri daha büyük olan değişkenin uzaklık hesaplamalarını domine etmesi nedeniyle kütüphane sayısının kümeleme üzerindeki etkisi ihmal edilebilir düzeye iner.
K-Ortalamalar algoritması Öklid uzaklığını kullandığı için değişkenlerin büyüklüklerine karşı çok duyarlıdır. Bütçe gibi milyonluk değerler alan bir değişkenin farklarının karesi, kütüphane sayısı gibi küçük değerler alan bir değişkenin etkisini matematiksel olarak yok sayacak kadar büyüktür. Bu durum, belediyelerin sadece bütçelerine göre gruplanmasına, kütüphane sayılarının ise gruplamada hiçbir rol oynamamasına neden olur.

Step-by-Step Solution

1
Öklid uzaklık formülünü inceleyin.
d(x,y)=(x1y1)2+(x2y2)2d(x, y) = \sqrt{(x_1 - y_1)^2 + (x_2 - y_2)^2}
K-Ortalamalar algoritmasının temelinde yatan uzaklık hesaplama mantığını anlamak için gereklidir.
2
Değişken ölçeklerini karşılaştırın.
Bütçe farkları yüzlerle (1002=10.000100^2 = 10.000), kütüphane farkları birimlerle (12=11^2 = 1) ifade edilmektedir.
Hangi değişkenin toplam uzaklık değerini daha fazla etkileyeceğini belirlemek için farkların kareleri kıyaslanır.
3
Ölçeklendirmenin önemini yorumlayın.
Büyük sayısal değerlere sahip değişkenlerin analizi domine ettiği sonucuna varılır.
Eşit ağırlıklı bir kümeleme için değişkenlerin standartlaştırılması (z-skoru vb.) gerektiği sonucuna ulaşılır.

Key Concept

K-Ortalamalar Analizinde Ölçek Duyarlılığı

Hints

1
Öklid uzaklığı formülündeki farkların karelerini düşünün.
2
500500 ile 1010 arasındaki farkın karesi mi yoksa 88 ile 11 arasındaki farkın karesi mi sonucu daha çok etkiler?

Practice More

Değişkenlerin Z-skoru dönüşümü yapılarak analize dahil edilmesinin sonuçları nasıl değiştireceğini araştırınız.
Estimated Time:1m 30s
Question 43Question

Bir kamu denetçisi, 4 farklı kamu kurumunun (K1,K2,K3,K4K_1, K_2, K_3, K_4) dijital dönüşüm süreçlerine ilişkin performans göstergeleri arasındaki Öklid uzaklıklarını aşağıdaki matris ile belirlemiştir:

K1K_1K2K_2K3K_3K4K_4
K1K_10033881212
K2K_23300771111
K3K_388770099
K4K_4121211119900

Hiyerarşik kümeleme analizinde "Tam Bağlantı" (En Uzak Komşu) yöntemi kullanıldığına göre, ilk aşamada K1K_1 ve K2K_2 kurumları birleşerek bir küme oluşturduktan sonra, ikinci aşamada hangi kurumlar veya kümeler birleşir ve bu birleşme hangi uzaklık değerinde gerçekleşir?

Show answer & explanation

Answer: {K_1, K_2} kümesi ile K_3 kurumu birleşir, uzaklık 8

Answer

İkinci aşamada {K_1, K_2} kümesi ile K_3 kurumu, tam bağlantı prensibine göre hesaplanan 8 uzaklık değerinde birleşir.
Tam Bağlantı (Complete Linkage) kuralına göre, {K1,K2}\{K_1, K_2\} kümesinin K3K_3 kurumuna olan uzaklığı max(d(K1,K3),d(K2,K3))\max(d(K_1, K_3), d(K_2, K_3)) olarak hesaplanır. Matrise bakıldığında bu değer max(8,7)=8\max(8, 7) = 8 olarak bulunur. Diğer alternatif birleşme olan K3K4K_3-K_4 uzaklığı ise 99'dur. 8<98 < 9 olduğu için ikinci adımda {K1,K2}\{K_1, K_2\} ile K3K_3 birleşmelidir.

Step-by-Step Solution

1
İlk birleşmeyi ve yeni kümeyi belirle.
d(K1,K2)=3d(K_1, K_2) = 3 en küçük uzaklık olduğu için ilk olarak {K1,K2}\{K_1, K_2\} kümesi oluşur.
Hiyerarşik kümelemede her zaman en küçük uzaklığa sahip birimler birleşir.
2
Tam Bağlantı (Complete Linkage) yöntemine göre yeni kümenin diğer birimlerle olan uzaklıklarını hesapla.
d({K1,K2},K3)=max(d(K1,K3),d(K2,K3))=max(8,7)=8d(\{K_1, K_2\}, K_3) = \max(d(K_1, K_3), d(K_2, K_3)) = \max(8, 7) = 8. d({K1,K2},K4)=max(d(K1,K4),d(K2,K4))=max(12,11)=12d(\{K_1, K_2\}, K_4) = \max(d(K_1, K_4), d(K_2, K_4)) = \max(12, 11) = 12.
Tam Bağlantı yöntemi, kümeler arası uzaklığı belirlerken birimler arasındaki 'en uzak' (maksimum) mesafeyi temel alır.
3
Güncellenmiş uzaklık matrisi üzerinden bir sonraki birleşmeyi seç.
Adaylar: d({K1,K2},K3)=8d(\{K_1, K_2\}, K_3) = 8, d({K1,K2},K4)=12d(\{K_1, K_2\}, K_4) = 12, d(K3,K4)=9d(K_3, K_4) = 9. Minimum değer 88 olduğundan {K1,K2}\{K_1, K_2\} ile K3K_3 birleşir.
İkinci aşamada da güncellenmiş matristeki en küçük uzaklık birleşme kriteridir.

Key Concept

Tam Bağlantı (Complete Linkage) yöntemi, iki küme arasındaki uzaklığı, bu kümelerin elemanları arasındaki tüm ikili uzaklıkların en büyüğü (maksimumu) olarak tanımlar.

Hints

1
Tam Bağlantı yönteminde, bir küme ile bir birim arasındaki yeni uzaklık hesaplanırken mevcut tüm ikili uzaklıkların en büyüğü seçilir.
2
{K_1, K_2} kümesinin K_3'e uzaklığı için max(d(K1,K3), d(K2,K3)) ve K_4'e uzaklığı için max(d(K1,K4), d(K2,K4)) değerlerini bulun.

Practice More

Tam bağlantı yönteminin, tek bağlantı yönteminin aksine daha sıkı (kompakt) ve küresel kümeler oluşturma eğiliminde olduğunu unutmayın.
Estimated Time:2m 0s
Question 44Question

Bir arkeolog, kazı alanındaki dört farklı bölgeden (B1,B2,B3,B4B_1, B_2, B_3, B_4) elde edilen buluntuların benzerliklerini incelemek için hiyerarşik kümeleme analizi yapmaktadır. Bölgeler arasındaki Öklid uzaklık matrisi aşağıda verilmiştir:

B1B_1B2B_2B3B_3B4B_4
B1B_10121520
B2B_21201018
B3B_3151008
B4B_4201880

Buna göre, Tek Bağlantı (Single Linkage) yöntemi kullanılarak yapılan analizde ilk küme oluştuktan sonra, bu küme ile B1B_1 gözlemi arasındaki uzaklık değeri kaçtır?

Show answer & explanation

Answer: 15

Answer

Tek Bağlantı yöntemine göre B1B_1 ile {B3,B4}\{B_3, B_4\} kümesi arasındaki uzaklık 15 birimdir.
Doğru yanıt olan 15 değeri, Tek Bağlantı (Single Linkage) yönteminin temel prensibi olan 'en yakın komşu' kuralına dayanır. İlk adımda B3B_3 ve B4B_4 gözlemleri 8 birimlik en küçük uzaklıkla birleşir. B1B_1 gözleminin bu yeni kümeye olan uzaklığı hesaplanırken, B1B_1'in küme içindeki her bir elemana (B3B_3 ve B4B_4) olan uzaklıkları karşılaştırılır ve min(15,20)=15\min(15, 20) = 15 değeri seçilir.

Step-by-Step Solution

1
Matristeki en küçük uzaklık değerini bularak ilk birleşecek gözlemleri belirleyin.
d(B3,B4)=8d(B_3, B_4) = 8 birim olduğundan ilk olarak B3B_3 ve B4B_4 birleşerek bir küme oluşturur.
Hiyerarşik kümelemede işlemler en yakın (en küçük uzaklığa sahip) birimlerin birleştirilmesiyle başlar.
2
Tek Bağlantı (Single Linkage) yöntemi kuralını uygulayın.
d(B1,{B3,B4})=min(d(B1,B3),d(B1,B4))d(B_1, \{B_3, B_4\}) = \min(d(B_1, B_3), d(B_1, B_4)) formülü kullanılır.
Tek bağlantı yöntemi, bir gözlemin bir kümeye olan uzaklığını, o gözlemin küme üyelerine olan en kısa mesafesi olarak tanımlar.
3
Matristeki değerleri yerine koyarak hesaplamayı tamamlayın.
min(15,20)=15\min(15, 20) = 15 sonucuna ulaşılır.
B1B_1 ile B3B_3 arası 15, B1B_1 ile B4B_4 arası 20 birimdir; en küçüğü 15'tir.

Key Concept

Tek Bağlantı (En Yakın Komşu) yöntemi, iki küme veya bir gözlem ile bir küme arasındaki mesafeyi, aradaki en kısa (minimum) ikili uzaklık olarak belirler.

Alternative Method

Zincirleme (chaining) etkisini kontrol etmek için dendrogramın her adımında birleşme mesafelerinin monoton olarak arttığı gözlemlenebilir. İlk adımda 8 mesafesinde birleşen kümeye en yakın adayın B2B_2 (mesafe 10) olduğu görülmektedir.
Estimated Time:1m 30s
Question 45Question

Sanayi ve Teknoloji Bakanlığı tarafından yürütülen bir projede, teknoloji geliştirme bölgelerindeki firmalar benzerliklerine göre gruplandırılmak istenmektedir. Analizde 'Yıllık Alınan Patent Sayısı' (5505 - 50 adet arası) ve 'Yıllık Net Satış Hasılatı' (2.000.000450.000.0002.000.000 - 450.000 .000 TL arası) değişkenleri kullanılarak KK-Ortalamalar (KK-Means) kümeleme analizi uygulanacaktır. Uzaklık ölçüsü olarak Öklid uzaklığının kullanıldığı bu analizde, verilerin standartlaştırılmadan (z-skoru vb.) işleme alınması durumunda aşağıdakilerden hangisinin gerçekleşmesi beklenir?

Show answer & explanation

Answer: Kümeleme sonuçları ve küme merkezlerinin konumu neredeyse tamamen 'Yıllık Net Satış Hasılatı' değişkeni tarafından domine edilir.

Answer

Kümeleme sonuçlarının ve merkezlerin neredeyse tamamen yıllık net satış hasılatı değişkeni tarafından domine edilmesi beklenir.
Satış hasılatı değişkeninin değer aralığı (skalası), patent sayısı değişkeninden milyonlarca kat daha büyüktür. Öklid uzaklığı formülü karesel farkların toplamına dayandığı için, hasılat değişkenindeki küçük bir yüzdelik değişim bile patent sayısındaki maksimum değişimden çok daha büyük bir uzaklık değeri yaratır. Bu durum, algoritmanın kümeleri oluştururken sadece hasılat farklarını dikkate almasına neden olur.

Step-by-Step Solution

1
Değişkenlerin ölçeklerini karşılaştırın.
Patent sayısı (onluk mertebe) ile satış hasılatı (milyonluk mertebe) arasında çok büyük bir ölçek farkı vardır.
Uzaklık temelli algoritmalarda değişkenlerin büyüklük mertebeleri analizi doğrudan etkiler.
2
Öklid uzaklığı formülünü analiz edin.
d(x,c)=(xpatentcpatent)2+(xhasılatchasılat)2d(x, c) = \sqrt{(x_{patent} - c_{patent})^2 + (x_{hasılat} - c_{hasılat})^2}
Hasılat kısmındaki karesel farklar (101410^{14} mertebesinde olabilir), patent kısmındaki karesel farkları (10310^3 mertebesinde) tamamen gölgede bırakır.
3
Standartlaştırma yapılmamasının sonucunu yorumlayın.
Analiz aslında tek bir değişken üzerinden yapılıyormuş gibi sonuç üretir.
Büyük varyansa sahip değişken, uzaklık hesaplamasını domine ederek diğer değişkenin bilgi içeriğini etkisizleştirir.

Key Concept

Öklid Uzaklığında Ölçek Duyarlılığı ve Standartlaştırma İhtiyacı
Estimated Time:1m 30s
Question 46Question

Hiyerarşik kümeleme analizi yöntemlerinden biri olan Ward yöntemi, birleştirme işlemi sırasında kümelerin içsel homojenliğini maksimize etmeyi amaçlayan bir yaklaşım sergiler. Bu yöntemde, her adımda birleştirilecek iki küme seçilirken, birleşme sonucunda veri setinin toplam varyansındaki değişim dikkate alınır.

Buna göre, Ward yöntemi uygulanırken her iterasyonda birleştirilecek küme çiftinin belirlenmesinde kullanılan temel kriter aşağıdakilerden hangisidir?

Show answer & explanation

Answer: Küme içi hata kareler toplamındaki (ESS) artışın minimize edilmesi

Answer

Küme içi hata kareler toplamındaki (ESS) artışın minimize edilmesi
Ward yönteminin temel mantığı, kümeleme işlemi sırasında bilgi kaybını (varyans artışını) minimize etmektir. Her adımda, birleştirilmeleri durumunda küme içi hata kareler toplamında (ESS) en az artışa neden olacak olan iki küme bir araya getirilir. Bu durum, ortaya çıkan kümelerin kendi içlerinde olabildiğince homojen kalmasını sağlar.

Step-by-Step Solution

1
Yöntemin tanımını analiz etme
Ward yöntemi 'Minimum Varyans Yöntemi' olarak da bilinir.
Hiyerarşik kümeleme yöntemlerini birbirinden ayıran temel fark, kümeler arası uzaklık veya birleşme kriteridir.
2
Matematiksel kriteri belirleme
ESS (Error Sum of Squares) değeri, bir kümedeki her birimin küme merkezine olan karesel uzaklıklarının toplamıdır: ESS=i=1n(xixˉ)2ESS = \sum_{i=1}^n (x_i - \bar{x})^2.
Yöntemin amacı, kümelerin birleştirilmesi sonucunda küme içi heterojenliğin (varyansın) mümkün olduğunca az artmasını sağlamaktır.
3
Birleşme kararını değerlendirme
İki küme (CiC_i ve CjC_j) birleştirildiğinde oluşan yeni hata kareler toplamı ile eski toplamlar arasındaki fark (ΔESSij\Delta ESS_{ij}) hesaplanır.
Algoritma, tüm olası ikili birleşmeler arasında bu farkı en küçük kılan çifti seçer.

Key Concept

Ward Yöntemi ve ESS Minimizasyonu

Practice More

Ward yönteminin Lance-Williams dönüşüm formülündeki katsayılarını inceleyerek diğer yöntemlerle olan matematiksel ilişkisini araştırabilirsiniz.
Estimated Time:1m 30s
Question 47Question

Bir enerji dağıtım şirketi, müşterilerini 'Aylık Ortalama Elektrik Tüketimi' (200200-15001500 kWh arası) ve 'Evdeki Beyaz Eşya Sayısı' (22-88 adet arası) değişkenlerini kullanarak KK-Ortalamalar (KK-Means) yöntemiyle benzer özellik gösteren gruplara ayırmak istemektedir. Analiz sırasında değişkenlerin ham değerleri kullanılmış ve kümeleme sonuçlarının neredeyse tamamen elektrik tüketimi değişkenine göre şekillendiği, beyaz eşya sayısının ise sonuçlar üzerinde bir etkisinin olmadığı gözlemlenmiştir.

Bu analizde her iki değişkenin de kümeleme sonuçlarına dengeli bir şekilde katkı sağlaması için uygulanması gereken temel işlem aşağıdakilerden hangisidir?

Show answer & explanation

Answer: Değişkenlerin standartlaştırılarak (örneğin z-skoru dönüşümü) birim etkisinden arındırılması

Answer

Kümeleme sonuçlarının dengelenmesi için değişkenlerin standartlaştırılarak birim etkisinden arındırılması gerekmektedir.
K-Ortalamalar yöntemi, birimler arasındaki benzerliği Öklid uzaklığı ile ölçer. Eğer bir değişken (kWh gibi) diğerinden (adet gibi) sayısal olarak çok daha büyükse, hesaplanan uzaklık kareleri toplamında bu değişken baskın hale gelir. Değişkenlerin standartlaştırılması (z-skoru dönüşümü), tüm değişkenleri aynı ölçeğe getirerek her birinin analize hak ettiği ağırlıkla katılmasını sağlar.

Step-by-Step Solution

1
Değişken aralıklarını kontrol et
Elektrik tüketimi (200200-15001500) ile beyaz eşya sayısı (22-88) arasında çok büyük bir sayısal mertebe farkı olduğu tespit edilir.
K-Ortalamalar yönteminde kullanılan Öklid uzaklığı, koordinatlar arasındaki farkların karelerine dayandığı için büyük değerli değişkenler uzaklık sonucunu domine eder.
2
Ölçekleme yöntemi seç
z-skoru standartlaştırması veya Min-Max ölçekleme gibi bir yöntem belirlenir.
Değişkenlerin ortalamasını 00 ve standart sapmasını 11 yaparak (z-skoru) onları birimsiz ve karşılaştırılabilir hale getirmek amaçlanır.
3
Standardizasyon sonrası analizi tekrarla
Her iki değişkenin de benzer sayısal aralıklarda (örneğin 3-3 ile +3+3 arası) yer alması sağlanır.
Böylece her iki değişken de uzaklık hesaplamasında eşit ağırlığa sahip olur ve kümeleme sonuçları daha sağlıklı hale gelir.

Key Concept

K-Ortalamalar Yönteminde Ölçek Hassasiyeti

Hints

1
K-Ortalamalar yöntemi birimler arasındaki mesafeyi ölçmek için Öklid uzaklığını kullanır.
2
Bir değişkenin değerleri binlerle ifade edilirken diğeri bir haneli sayılarla ifade ediliyorsa, farkın karesini aldığınızda hangi sayı daha büyük bir etki yaratır?

Practice More

Standartlaştırma sonrasında elde edilen küme merkezlerinin yorumlanabilmesi için tekrar orijinal birimlere (un-standardization) dönüştürülmesi gerektiğini unutmayın.
Estimated Time:45s
Question 48Question

Bir bankanın veri analitiği birimi, kredi kartı müşterilerini segmentlere ayırmak için KK-Ortalamalar (KK-Means) yöntemini kullanmaktadır. Analiz kapsamında, değişkenlerin ölçekleri birbirinden farklı olduğu için veriler önceden standartlaştırılmıştır. Standartlaştırılmış "Harcama Çeşitliliği Skoru" (X1X_1) ve "Ödeme Sadakati Skoru" (X2X_2) değişkenlerine göre belirlenen iki küme merkezi şu şekildedir:

- 1.1. Küme Merkezi (M1M_1): (1,1)(1, 1)
- 2.2. Küme Merkezi (M2M_2): (10,13)(10, 13)

Gözlem değerleri (4,5)(4, 5) olan yeni bir müşterinin, Öklid uzaklığı (Euclidean distanceEuclidean\ distance) kriterine göre hangi kümeye atanması uygun görülür?

Show answer & explanation

Answer: 1.1. Küme; çünkü M1M_1 merkezine olan Öklid uzaklığı (55 birim), M2M_2 merkezine olan uzaklıktan (1010 birim) daha küçüktür.

Answer

Yeni müşteri 1.1. kümeye atanmalıdır; çünkü bu kümenin merkezine olan Öklid uzaklığı 55 birim olup, diğer kümenin merkezine olan uzaklıktan (1010 birim) daha küçüktür.
Doğru cevap, müşterinin birinci merkeze olan uzaklığının 55 birim olduğunu ve bu mesafenin ikinci merkeze olan 1010 birimlik uzaklıktan daha kısa olduğu için atamanın birinci kümeye yapılması gerektiğini ifade eden seçenektir. Algoritmanın temel prensibi, her veri noktasını kendisine en yakın merkezin temsil ettiği kümeye dahil etmektir.

Step-by-Step Solution

1
Müşterinin birinci küme merkezine (M1M_1) olan uzaklığı hesaplanır.
d(P,M1)=(41)2+(51)2=32+42=9+16=5d(P, M_1) = \sqrt{(4-1)^2 + (5-1)^2} = \sqrt{3^2 + 4^2} = \sqrt{9+16} = 5
İki nokta arasındaki kuş uçuşu mesafeyi (Öklid) bulmak için koordinat farklarının kareleri toplamının karekökü alınır.
2
Müşterinin ikinci küme merkezine (M2M_2) olan uzaklığı hesaplanır.
d(P,M2)=(410)2+(513)2=(6)2+(8)2=36+64=10d(P, M_2) = \sqrt{(4-10)^2 + (5-13)^2} = \sqrt{(-6)^2 + (-8)^2} = \sqrt{36+64} = 10
Aynı uzaklık formülü ikinci merkez noktası için de uygulanır.
3
Hesaplanan uzaklıklar karşılaştırılır.
5<105 < 10 olduğundan M1M_1 merkezi daha yakındır.
KK-Ortalamalar algoritmasının atama adımında (assignment step), her gözlem kendisine en yakın olan küme merkezine atanır.

Key Concept

KK-Ortalamalar yönteminde atama işlemi, gözlem ile küme merkezleri arasındaki en küçük Öklid uzaklığına göre yapılır.

Alternative Method

Hesaplama yapmadan görsel olarak incelendiğinde; (4,5)(4, 5) noktası, (1,1)(1, 1) noktasına (10,13)(10, 13) noktasına göre çok daha yakındır (koordinat değerlerinin yakınlığına bakarak tahmin edilebilir).
Estimated Time:1m 30s
Question 49Question

Bir spor analisti, futbolcuları "Toplam Gol Sayısı" (00-2020 arası) ve "Toplam Koşu Mesafesi" (90.00090.000-110.000110.000 metre arası) değişkenlerine göre KK-Ortalamalar (KK-Means) yöntemiyle gruplandırmak istemektedir. Bu veriler standartlaştırılmadan doğrudan Öklid uzaklığı kullanılarak analize dahil edildiğinde ortaya çıkabilecek en temel sorun aşağıdakilerden hangisidir?

Show answer & explanation

Answer: Koşu mesafesi değişkeninin sayısal değerlerinin büyüklüğü nedeniyle kümeleme sonuçlarını domine etmesi

Answer

Koşu mesafesi değişkeninin sayısal değerlerinin büyüklüğü nedeniyle kümeleme sonuçlarını domine etmesi
K-Ortalamalar yönteminde birimler arası benzerlik Öklid uzaklığı ile ölçülür. Toplam koşu mesafesi gibi sayısal aralığı çok geniş olan bir değişken (90.00090.000-110.000110.000), toplam gol sayısı gibi dar aralıklı (00-2020) bir değişkene göre uzaklık değerini çok daha fazla etkiler. Bu durum, algoritmanın sadece koşu mesafesine odaklanmasına ve gol sayısını görmezden gelmesine neden olur.

Step-by-Step Solution

1
Değişkenlerin değer aralıklarını karşılaştırın.
Gol sayısı 00-2020 aralığında iken, Koşu Mesafesi 90.00090.000-110.000110.000 aralığındadır.
Uzaklık temelli algoritmalarda değişkenlerin ölçek farklılıklarını tespit etmek için gereklidir.
2
Öklid uzaklığı formülündeki etkisini analiz edin.
Koşu mesafesindeki binlerce birimlik fark, gol sayısındaki birkaç birimlik farkı matematiksel olarak etkisiz kılar.
Öklid uzaklığı karelerin toplamı üzerinden hesaplandığı için büyük farklar sonucu domine eder.
3
Standartlaştırma gerekliliğini değerlendirin.
Değişkenlerin benzer bir ağırlığa sahip olması için analizden önce standartlaştırılmaları (örneğin z-skoruna dönüştürülmeleri) gerekir.
Her iki değişkenin de kümeleme sonucuna adil şekilde katkı sağlamasını garantilemek için.

Key Concept

Ölçek Duyarlılığı ve Standartlaştırma
Question 50Question

Hiyerarşik kümeleme yöntemlerinden Ortalama Bağlantı (Average Linkage - UPGMA) yöntemi kullanılarak bir veri seti analiz edilmektedir. AA, BB ve CC gözlemleri arasındaki başlangıç uzaklık matrisi aşağıda sunulmuştur:

AABBCC
AA00
BB5500
CC1212181800

Analizin ilk aşamasında AA ve BB gözlemleri birleşerek bir küme oluşturduğuna göre; ortalama bağlantı yöntemine göre yeni oluşan {A,B}\{A, B\} kümesi ile CC gözlemi arasındaki uzaklık değeri kaçtır?

Show answer & explanation

Answer: 15

Answer

Ortalama bağlantı yöntemine göre {A,B}\{A, B\} kümesi ile CC gözlemi arasındaki uzaklık 15'tir.
Ortalama bağlantı (UPGMA) yöntemi, bir küme ile bir gözlem (veya başka bir küme) arasındaki uzaklığı hesaplarken, tüm olası ikili kombinasyonların uzaklıklarının ortalamasını alır. Burada {A,B}\{A, B\} kümesi ile CC gözlemi arasındaki uzaklık d({A,B},C)=d(A,C)+d(B,C)2d(\{A, B\}, C) = \frac{d(A, C) + d(B, C)}{2} formülüyle hesaplanır. Matristen alınan değerlerle 12+182=15\frac{12 + 18}{2} = 15 sonucuna ulaşılır.

Step-by-Step Solution

1
CC gözleminin kümedeki her bir elemanla olan uzaklıklarını matristen belirleyin.
d(A,C)=12d(A, C) = 12 ve d(B,C)=18d(B, C) = 18 olarak bulunur.
Ortalama bağlantı yöntemi tüm eleman çiftleri arasındaki uzaklıkların bilgisini gerektirir.
2
Belirlenen uzaklıkların aritmetik ortalamasını hesaplayın.
12+182=15\frac{12 + 18}{2} = 15
UPGMA yönteminde kümeler arası uzaklık, elemanlar arası uzaklıkların ortalamasıdır.

Key Concept

Ortalama Bağlantı (UPGMA) Hesaplaması
Question 51Question

Yığılmalı (agglomerative) hiyerarşik kümeleme yöntemlerinden biri olan Ward yöntemi, kümeleme sürecinde diğer bağlantı yöntemlerinden farklı bir birleşme kriteri kullanır. Buna göre Ward yönteminde, her bir adımda hangi iki kümenin birleştirileceğine karar verilirken aşağıdakilerden hangisi temel kriter olarak kullanılır?

Show answer & explanation

Answer: Kümelerin birleşmesi sonucunda küme içi hata kareler toplamında (ESSESS) meydana gelecek artışın minimize edilmesi

Answer

Ward yöntemi, kümelerin birleşmesi sonucu toplam küme içi hata kareler toplamında (ESSESS) oluşacak artışı minimize eden küme çiftini seçer.
Ward yöntemi, minimum varyans kriterini kullanarak her adımda toplam küme içi hata kareler toplamındaki (ESSESS) artışı en az seviyede tutacak küme birleşimini gerçekleştirir. Bu sayede birbirine en benzer (homojen) birimler bir araya getirilmiş olur.

Step-by-Step Solution

1
Ward yönteminin matematiksel amacını tanımla.
Ward yöntemi, küme içi homojenliği maksimize etmeyi amaçlayan bir minimum varyans yöntemidir.
Yöntemin temel felsefesi, kümeleri birleştirirken veri setindeki toplam değişkenliğin (hata kareler toplamı) mümkün olduğunca az artmasını sağlamaktır.
2
Birleşme kriterini formüle et.
ESS=i=1n(xixˉ)2ESS = \sum_{i=1}^{n} (x_i - \bar{x})^2 ifadesindeki artış hesaplanır.
Her adımda, birleşme sonrası yeni kümenin ESSESS değeri ile eski iki kümenin ESSESS değerleri toplamı arasındaki fark (ΔESS\Delta ESS) en küçük olan çift birleştirilir.

Key Concept

Ward yöntemi (minimum varyans kriteri), hiyerarşik kümelemede kümelerin içsel tutarlılığını korumak için hata kareler toplamındaki (ESSESS) artışı minimize eder.
Estimated Time:45s
Question 52Question

Hiyerarşik kümeleme analizinde ortalama bağlantı (average linkage) yöntemi kullanılarak bir veri seti incelenmektedir. İki ayrı küme olan K1={x1,x2}K_1 = \{x_1, x_2\} ve K2={x3}K_2 = \{x_3\} arasındaki ikili uzaklık değerleri d(x1,x3)=6d(x_1, x_3) = 6 birim ve d(x2,x3)=10d(x_2, x_3) = 10 birim olarak hesaplanmıştır. Buna göre, ortalama bağlantı yöntemine göre K1K_1 ve K2K_2 kümeleri arasındaki uzaklık değeri kaç birimdir?

Show answer & explanation

Answer: 8

Answer

İki küme arasındaki uzaklık, elemanlar arası tüm mesafelerin aritmetik ortalaması olan 8 birimdir.
Ortalama bağlantı yöntemi (UPGMA), bir K1K_1 kümesi ile bir K2K_2 kümesi arasındaki uzaklığı, bu iki kümenin elemanları arasındaki tüm ikili uzaklıkların aritmetik ortalaması olarak tanımlar. Soruda K1K_1 kümesinde iki, K2K_2 kümesinde bir eleman bulunduğundan toplamda 2×1=22 \times 1 = 2 adet uzaklık değeri mevcuttur. Bu değerlerin (6 ve 10) ortalaması alındığında sonuç 8 olarak bulunur.

Step-by-Step Solution

1
Kümeler arasındaki tüm ikili (pairwise) uzaklıkları belirleyin.
d(x1,x3)=6d(x_1, x_3) = 6 ve d(x2,x3)=10d(x_2, x_3) = 10 uzaklıkları verilmiştir.
Ortalama bağlantı yöntemi (UPGMA), her bir kümedeki eleman çiftlerinin tamamını hesaba katar.
2
Belirlenen uzaklıkların aritmetik ortalamasını hesaplayın.
D(K1,K2)=6+102=8D(K_1, K_2) = \frac{6 + 10}{2} = 8
Yöntemin tanımı gereği, kümeler arası uzaklık tüm kombinasyonların ortalamasıdır.

Key Concept

Ortalama Bağlantı (Average Linkage - UPGMA) Yöntemi
Question 53Question

Bir insan kaynakları uzmanı, dört farklı adayın (P1,P2,P3,P4P_1, P_2, P_3, P_4) yetkinlik testleri sonuçlarına dayanarak aralarındaki Öklid uzaklık matrisini aşağıdaki gibi oluşturmuştur:

P1P_1P2P_2P3P_3P4P_4
P1P_104,26,58,0
P2P_24,205,13,8
P3P_36,55,107,2
P4P_48,03,87,20

Hiyerarşik kümeleme analizinde tek bağlantı (en yakın komşu) yöntemi kullanıldığında, ilk aşamada hangi iki aday birleşerek yeni bir küme oluşturur?

Show answer & explanation

Answer: P2P_2 ve P4P_4

Answer

İkinci ve dördüncü adayların (P2P_2 ve P4P_4) birleşmesi
Tek bağlantı (en yakın komşu) yöntemi, her adımda aralarındaki uzaklık en az olan birimleri veya kümeleri birleştirir. Verilen 4×44 \times 4 uzaklık matrisinde, adaylar arasındaki tüm ikili kombinasyonlar incelendiğinde, en küçük uzaklık değerinin 3,8 olduğu görülmektedir. Bu değer, ikinci aday (P2P_2) ile dördüncü aday (P4P_4) arasındaki mesafeyi temsil ettiğinden, ilk kümeleşme bu iki aday arasında gerçekleşir.

Step-by-Step Solution

1
Uzaklık matrisinin köşegen dışı (off-diagonal) elemanlarının taranması
Matristeki tüm ikili uzaklıklar: 4,2; 6,5; 8,0; 5,1; 3,8; 7,2
İlk birleşmeyi belirlemek için en yakın birimleri bulmak gerekir.
2
Minimum uzaklık değerinin belirlenmesi
min(dij)=3,8\min(d_{ij}) = 3,8
Tek bağlantı yöntemi, en küçük uzaklığa sahip birimleri birleştirir.
3
Minimum uzaklığa karşılık gelen birim çiftinin tespit edilmesi
3,8 değeri P2P_2 satırı ve P4P_4 sütununun kesişimindedir.
Matris simetrik olduğu için d(P2,P4)=d(P4,P2)=3,8d(P_2, P_4) = d(P_4, P_2) = 3,8 olduğu görülür.

Key Concept

Tek Bağlantı (Single Linkage) yöntemi, hiyerarşik kümelemede birimler veya kümeler arasındaki mesafeyi 'en yakın iki nokta arasındaki minimum uzaklık' olarak tanımlar.

Practice More

İlk birleşmeden sonra matrisin nasıl güncelleneceğini ve 'zincirleme etkisi' kavramını inceleyebilirsiniz.
Estimated Time:45s
Question 54Question

Bir araştırmacı, dört farklı kütüphanenin (K1,K2,K3,K4K_1, K_2, K_3, K_4) kitap koleksiyonu benzerliklerini incelemek amacıyla hiyerarşik kümeleme analizi yapmaktadır. Kütüphaneler arasındaki Öklid uzaklıkları matrisi aşağıda verilmiştir:

K1K_1K2K_2K3K_3K4K_4
K1K_10258
K2K_22067
K3K_35604
K4K_48740

Analizin ilk adımında birbirine en yakın iki kütüphane olan K1K_1 ve K2K_2 birleştirilerek {K1,K2}\{K_1, K_2\} kümesi oluşturulmuştur. Buna göre; tam bağlantı (en uzak komşu) yöntemi kullanıldığında, {K1,K2}\{K_1, K_2\} kümesi ile K3K_3 kütüphanesi arasındaki yeni uzaklık değeri aşağıdakilerden hangisidir?

Show answer & explanation

Answer: 6

Answer

Yeni uzaklık değeri 6 olur.
Tam bağlantı (en uzak komşu) yönteminde, bir küme ile başka bir gözlem veya küme arasındaki uzaklık, bu grupların elemanları arasındaki ikili mesafelerin en büyüğü (maksimumu) olarak tanımlanır. Soruya göre {K1,K2}\{K_1, K_2\} kümesi ile K3K_3 kütüphanesi arasındaki mesafeler d(K1,K3)=5d(K_1, K_3)=5 ve d(K2,K3)=6d(K_2, K_3)=6 olarak verilmiştir. Bu iki değerden büyük olan 6 olduğu için yeni uzaklık değeri bu olur.

Step-by-Step Solution

1
Küme elemanları ile hedef gözlem arasındaki bireysel uzaklıkları matristen bulun.
d(K1,K3)=5d(K_1, K_3) = 5 ve d(K2,K3)=6d(K_2, K_3) = 6
Yeni küme uzaklığını hesaplamak için kümenin tüm üyelerinin hedef gözleme olan mesafeleri belirlenmelidir.
2
Tam bağlantı (complete linkage) kuralına göre maksimum değeri seçin.
D({K1,K2},K3)=max(5,6)=6D(\{K_1, K_2\}, K_3) = \max(5, 6) = 6
Tam bağlantı (en uzak komşu) yöntemi, iki grup arasındaki uzaklık olarak grupların elemanları arasındaki en büyük mesafeyi baz alır.

Key Concept

Tam bağlantı yönteminde küme uzaklığı, elemanlar arasındaki maksimum mesafedir.
Estimated Time:45s
Question 55Question

Bir araştırmacı, müşterilerini harcama alışkanlıkları ve demografik özelliklerine göre homojen segmentlere ayırmak için hiyerarşik kümeleme analizi gerçekleştirecektir. Çalışmada, geleneksel bağlama (linkage) algoritmaları yerine varyans analizi felsefesine dayanan ve küme içi kareler toplamındaki (ESS) artışı minimize etmeyi hedefleyen Ward Yöntemi (Ward's Method) tercih edilmiştir.

Bu algoritmanın teorik altyapısı ve veri setlerini bölütleme eğilimleri dikkate alındığında, yöntemle ilgili olarak aşağıda verilen ifadelerden hangisi kesinlikle doğrudur?

Show answer & explanation

Answer: Birleştirilecek grupların seçiminde, ağırlık merkezleri (sentroidler) arasındaki karesel uzaklığı kümelerin eleman sayılarıyla ağırlıklandıran bir ölçüt kullanır ve çoğunlukla eşit büyüklükte, küresel (spherical) kümeler üretmeye yatkındır.

Answer

Doğru cevap, Ward yönteminin sentroidler arası uzaklığı küme büyüklükleriyle ağırlıklandırdığını ve küresel yapılar oluşturduğunu belirten ifadedir.
Ward yöntemi, hiyerarşik kümeleme algoritmaları arasında varyans analizi mantığına dayanan tek yaklaşımdır. İki kümenin birleşmesiyle meydana gelen küme içi kareler toplamı (ESS) artışını minimize etmeyi amaçlar. İki küme birleştirildiğinde oluşacak ESS artışı, kümelerin ağırlık merkezleri (sentroidleri) arasındaki karesel uzaklığın, kümelerin eleman sayılarından hesaplanan nAnBnA+nB\frac{n_A \cdot n_B}{n_A + n_B} ağırlık faktörü ile çarpılmasıyla elde edilir. Bu özellik, yöntemin genellikle varyansı küçük, birbirine yakın eleman sayısına sahip (hacimce dengeli) ve uzamsal olarak küresel (spherical) yapıda kümeler üretmesine neden olur.

Step-by-Step Solution

1
Ward yönteminin birleştirme kriterini matematiksel olarak analiz etme
Yöntemin, iki kümenin sentroidleri arasındaki karesel uzaklığı doğrudan değil, nAnBnA+nB\frac{n_A \cdot n_B}{n_A + n_B} ağırlığı (eleman sayılarına dayalı) ile çarparak hesapladığı belirlenir.
Yöntemin varyans analizi (ANOVA) temelli yapısını ve Hata Kareler Toplamı (ESS) artış hesabını anlamak, doğru eşleşmeyi bulmanın temelidir.
2
Yöntemin küme yapılarına ve aykırı değerlere olan etkisini değerlendirme
Varyans artışını minimize etme çabası ve uzaklıkların karesinin kullanılması nedeniyle, sistemin doğal olarak birbirine yakın eleman sayısına sahip küresel (spherical) kümeler üretmeye meyilli olduğu ve aykırı değerlere karşı hassas olduğu tespit edilir.
Uzaklık ölçütü formülasyonu kadar, yöntemin veriyi yapısal olarak nasıl şekillendirdiğini bilmek de ileri düzey soruları çözmek için gereklidir.
3
Diğer hiyerarşik bağlantı yöntemlerinin özelliklerini yansıtan yanlış önermeleri eleme
Tam bağlantı (en uzak komşu) prensipleri, kümeler arası kareler toplamını minimize etme mantık hatası, sadece kategorik veri zorunluluğu varsayımı ve sentroid mutlak uzaklık karmaşası içeren seçenekler elenir.
Çeldiriciler, diğer hiyerarşik algoritmaların spesifik özelliklerini veya temel istatistiksel varsayımların kasıtlı olarak ters çevrilmiş hallerini barındırmaktadır.

Key Concept

Ward Yönteminde ESS (Hata Kareler Toplamı) Minimizasyonu ve Geometrik Eğilimler
Question 56Question

Aşağıdaki tabloda X1X_1, X2X_2, X3X_3 ve X4X_4 gözlemleri arasındaki başlangıç uzaklık matrisi verilmiştir:

X1X_1X2X_2X3X_3X4X_4
X1X_10044881010
X2X_24400661212
X3X_38866001414
X4X_410101212141400

Bu veri seti üzerinde Ortalama Bağlantı (UPGMA - Unweighted Pair-Group Method using Arithmetic Averages) yöntemi kullanılarak hiyerarşik kümeleme analizi yapılacaktır.
Analizin birinci adımında, birbirine en yakın olan X1X_1 ve X2X_2 gözlemleri birleştirilerek K1=(X1,X2)K_1 = (X_1, X_2) kümesi oluşturulmuştur.
Analizin ikinci adımında ise K1K_1 kümesi ile X3X_3 gözlemi birleştirilerek K2=(X1,X2,X3)K_2 = (X_1, X_2, X_3) kümesi elde edilmiştir.

Buna göre, Ortalama Bağlantı (UPGMA) yöntemi kullanıldığında, yeni oluşan K2K_2 kümesi ile analize henüz dahil edilmemiş X4X_4 gözlemi arasındaki uzaklık (d(K2,X4)d(K_2, X_4)) kaç birim olarak hesaplanır?

Show answer & explanation

Answer: 12

Answer

Yeni oluşan K2 kümesi ile X4 gözlemi arasındaki uzaklık 12 birimdir.
Ortalama Bağlantı (UPGMA) yönteminde, yeni oluşturulan bir kümenin dışarıdaki bir gözleme/kümeye olan uzaklığı, birleşen kümelerin içindeki tüm eleman çiftlerinin uzaklıklarının aritmetik ortalamasıdır. K2K_2 kümesi X1,X2X_1, X_2 ve X3X_3 olmak üzere 33 elemandan oluşmaktadır. Bu kümenin X4X_4 gözlemine uzaklığı: d(X1,X4)+d(X2,X4)+d(X3,X4)3=10+12+143=363=12\frac{d(X_1, X_4) + d(X_2, X_4) + d(X_3, X_4)}{3} = \frac{10 + 12 + 14}{3} = \frac{36}{3} = 12 birim olarak hesaplanır. (Not: Lance-Williams formülü ile adım adım hesaplandığında da ilk birleşimden d(K1,X4)=11d(K_1, X_4) = 11 gelir. İkinci birleşimde K1'in 2 elemanı, X3'ün 1 elemanı olduğundan d(K2,X4)=23(11)+13(14)=12d(K_2, X_4) = \frac{2}{3}(11) + \frac{1}{3}(14) = 12 elde edilir.)

Step-by-Step Solution

1
K2 kümesini oluşturan temel gözlemlerin X4'e olan orijinal uzaklıklarının matristen belirlenmesi.
d(X1, X4) = 10, d(X2, X4) = 12, d(X3, X4) = 14
UPGMA yönteminde, iki küme arasındaki uzaklık hesaplanırken bu kümeleri oluşturan en alt düzeydeki bireysel gözlemlerin ikili uzaklıkları temel alınır.
2
Orijinal ikili uzaklıkların aritmetik ortalamasının hesaplanması.
d(K2, X4) = (10 + 12 + 14) / 3 = 36 / 3 = 12
UPGMA (Aritmetik Ortalamalı Ağırlıklandırılmamış Çift Grupları) yöntemi, orijinal her bir gözleme eşit ağırlık verir. Bu nedenle K2'deki 3 elemanın X4'e olan uzaklıklarının basit ortalaması alınır.

Key Concept

Ortalama Bağlantı (UPGMA) yönteminde uzaklık güncelleme prensibi
PreviousPage 3 / 3
Kümeleme Analizi Practice Questions — KPSS İstatistik — Page 3 | Examkin