Question

Difficulty: HardK-Ortalamalar (K-Means) Yöntemi

Bir endüstri mühendisi, üretim hattından çıkan parçaları iki temel kalite kriterine göre gruplamak amacıyla K-Ortalamalar (K-Means) algoritmasını kullanmaktadır. Bu kriterler; X1X_1 (mikron cinsinden yüzey pürüzlülüğü, varyansı σ12=4\sigma^2_1 = 4) ve X2X_2 (Pascal cinsinden basınca dayanıklılık, varyansı σ22=1.6×108\sigma^2_2 = 1.6 \times 10^8) olarak belirlenmiştir. Mühendis, analiz öncesinde veri setinde herhangi bir standardizasyon (ölçeklendirme) işlemi yapmadan, uzaklık ölçüsü olarak Öklid uzaklığını kullanarak algoritmayı çalıştırmıştır.

Bu durumun K-Ortalamalar algoritmasının optimizasyon süreci ve elde edilecek kümeler üzerindeki matematiksel etkisi aşağıdakilerden hangisinde doğru ifade edilmiştir?

  1. Grup içi hata kareler toplamı (WCSS) minimize edilirken X2X_2 değişkenindeki büyük sayısal farklar Öklid uzaklığını domine edeceğinden, algoritmik olarak X1X_1 değişkeninin kümeleme yapısına katkısı neredeyse sıfırlanır ve kümeler temel olarak X2X_2 ekseninde şekillenir.Answer
  2. B
    Standardizasyon eksikliği, algoritmanın iterasyonlarında tek bağlantı (single linkage) prosedürünün baskın hale gelmesine neden olur ve zincirleme (chaining) etkisi yaratarak aykırı gözlemlerin tamamının uzun bir küme oluşturmasına yol açar.
  3. C
    Sürekli ve farklı ölçekli veri tipleri kullanıldığı için, algoritma her bir iterasyonda merkez (centroid) hesaplarken Öklid uzaklığı yerine veri tipine daha uygun olan kategorik benzerlik matrislerini kullanmak zorunda kalır.
  4. D
    X1X_1 ve X2X_2 arasındaki devasa varyans farkı, K-Ortalamalar analizinin temel varsayımı olan bağımlı hedef değişkenin varyans homojenliğini bozarak, analiz sonucunda elde edilecek sınıflandırma hata oranını geçersiz kılar.
  5. E
    Ölçek farklılıklarından kaynaklanan sapmalar, iterasyonlar sonucunda elde edilecek dendrogram grafiğindeki bağ mesafelerini yapay olarak uzatacağından, optimum küme sayısının belirlenmesi için kesim hattının daha alt seviyelerden çizilmesini gerektirir.

Answer

Standardize edilmemiş K-Ortalamalar uygulamasında büyük varyansa sahip değişkenin, uzaklık hesaplamasında diğer değişkeni baskılayıp kümeleri tamamen kendi ekseninde oluşturacağını belirten seçenek doğrudur.
K-Ortalamalar (K-Means) algoritması, gözlemlerin küme merkezlerine (centroid) atanmasında genellikle Öklid uzaklığını kullanır. Öklid uzaklığı formülü gereği, veri setindeki değişkenlerin farklı ölçüm birimlerine veya çok farklı varyanslara sahip olması durumunda, sayısal olarak büyük olan (büyük varyanslı) değişken toplam mesafe değerini domine eder. Soru senaryosunda X2X_2'nin varyansı 1.6×1081.6 \times 10^8, X1X_1'in varyansı ise 44'tür. Bu durumda uzaklık hesaplamasında X1X_1'in değerleri matematiksel olarak bir gürültü seviyesine iner ve algoritma sadece Grup İçi Hata Kareler Toplamını (WCSS) minimize etmeye çalışırken tamamen X2X_2'nin sayısal farklılıklarına odaklanır. Bu nedenle, değişkenlerin standartlaştırılmaması X1X_1'in analizdeki ağırlığını yok eder.

Step-by-Step Solution

1
K-Ortalamalar algoritmasında mesafe ölçümü için kullanılan fonksiyonu tanımla.
Öklid uzaklığı, d(i,j)=k=1p(xikxjk)2d(i,j) = \sqrt{\sum_{k=1}^{p} (x_{ik} - x_{jk})^2} formülü ile hesaplanır.
Uzaklık temelli algoritmaların değişken metriklerinden (ölçeklerinden) nasıl etkilendiğini görmek için fonksiyona odaklanmak gerekir.
2
Değişkenlerin varyansları arasındaki farkın formül üzerindeki etkisini incele.
X2X_2 değişkenindeki ortalama karesel farklar 10810^8 mertebesindeyken, X1X_1 değişkenindeki farklar tek haneli sayılar seviyesindedir.
Toplama işleminde devasa sayılar ile çok küçük sayıların bir araya gelmesi, küçük sayıların toplam üzerindeki marjinal etkisini sıfıra yaklaştırır.
3
Algoritmanın optimizasyon hedefi (Grup İçi Hata Kareler Toplamı - WCSS) açısından sonucu değerlendir.
WCSS minimize edilirken, iterasyonlar ve merkez (centroid) güncellemeleri yalnızca X2X_2 eksenindeki varyansı daraltmaya odaklanacaktır. X1X_1 değişkeninin örüntüsü küme oluşumunu etkileyemez.
Standartlaştırma (Z-skoru vb.) yapılmadığında, algoritma değişkenlerin taşıdığı istatistiksel bilgi değerini değil, salt sayısal büyüklüklerini dikkate alır.

Key Concept

K-Ortalamalar algoritmasında değişken ölçeklendirmesi ve Öklid uzaklığı geometrisi
Estimated Time:2m 30s
Rate this question