Question

Difficulty: HardK-Ortalamalar (K-Means) Yöntemi

Bir ziraat mühendisi, 120 farklı tarım arazisini toprak özelliklerine göre sınıflandırmak amacıyla iki değişken üzerinden K-Ortalamalar (K-Means) kümeleme analizi uygulamaktadır:

X1X_1: Topraktaki azot oranı (Yüzde cinsinden, 0.10.1 ile 0.50.5 arası değerler)
X2X_2: Yıllık metrekare başına düşen yağış miktarı (Milimetre cinsinden, 400400 ile 12001200 arası değerler)

Mühendis, uzaklık ölçüsü olarak Öklid (Euclidean) uzaklığını seçmiş, küme sayısını k=4k=4 olarak belirlemiş ve başlangıç merkezlerini (centroid) rastgele atayarak algoritmayı ham veriler (ölçeklendirilmemiş veri) üzerinden iteratif olarak çalıştırmıştır.

Bu algoritmanın matematiksel işleyiş mekanizması ve değişkenlerin yapısal özellikleri dikkate alındığında, yapılan analiz süreciyle ilgili aşağıdaki ifadelerden hangisi kesinlikle doğrudur?

  1. A
    Algoritmanın her iterasyonunda küme merkezleri, o kümeye atanan gözlemlerin aritmetik ortalaması yerine kümeye son katılan en uzak noktanın (outlier) koordinatları alınarak güncellendiği için değişkenlerin varyans farklılıkları analiz sonucunu etkilemez.
  2. B
    Veri setinde X2X_2 değişkeninin değer aralığı ve varyansı çok daha geniş olduğu için, algoritma bu değişkeni otomatik olarak bağımlı (hedef) değişken kabul eder ve kümeleri X1X_1'in X2X_2'yi açıklama gücüne göre optimize eder.
  3. C
    Öklid uzaklığı yerine Manhattan (Şehir Bloğu) uzaklığı tercih edilseydi, mutlak değer işlemi sayesinde büyük varyanslı X2X_2 değişkeninin baskınlığı matematiksel olarak ortadan kalkacak ve verileri standartlaştırmaya gerek kalmayacaktı.
  4. Öklid uzaklığı hesaplamasında (xi2cj2)2(x_{i2} - c_{j2})^2 terimi, (xi1cj1)2(x_{i1} - c_{j1})^2 terimine kıyasla çok daha büyük sonuçlar vereceği için kümeleme yapısı neredeyse tamamen yağış miktarı (X2X_2) tarafından belirlenecektir; bu durumu önlemek için analiz öncesinde veriler standartlaştırılmalıdır.Answer
  5. E
    Ham verilerin doğrudan kullanılması, algoritmanın her adımda uzaklık matrisini yeniden hesaplayarak tek bağlantı (single linkage) stratejisiyle zincirleme kümeleme yapmasına neden olur ve bu sayede küçük varyanslı X1X_1 değişkeninin etkisi korunur.

Answer

Öklid uzaklığı kullanıldığında, karesel farklardan dolayı değer aralığı çok daha geniş olan yağış miktarı (X2X_2) hesaplamayı domine edecektir. Bu yanlılığın önüne geçmek için analize başlamadan önce her iki değişkenin standartlaştırılması gerekir.
K-Ortalamalar (K-Means) algoritması, kümeleme işlemini gözlemler ile küme merkezleri arasındaki uzaklıkları (genellikle Öklid uzaklığını) minimize ederek yapar. Öklid uzaklığı hesaplanırken değişkenler arasındaki farkların karesi alınır. Verilen senaryoda yağış miktarı (X2X_2) 4001200400-1200 aralığında değerler alırken, azot oranı (X1X_1) 0.10.50.1-0.5 aralığındadır. Bu durumda (X2C2)2(X_2 - C_2)^2 ifadesinden gelecek binlerce birimlik değerler, (X1C1)2(X_1 - C_1)^2 ifadesinden gelecek 0.010.01 gibi çok küçük değerleri matematiksel olarak yutar. Algoritma sanki sadece yağış miktarı verisi varmış gibi çalışır. Bu istatistiksel yanılgıyı önlemenin tek yolu, analizden önce verileri standartlaştırmaktır (örneğin Z-skoruna dönüştürmek).

Step-by-Step Solution

1
K-Ortalamalar yönteminde uzaklık hesaplama formülünü incelemek
Öklid uzaklığı formülü: d=(xi1cj1)2+(xi2cj2)2d = \sqrt{(x_{i1} - c_{j1})^2 + (x_{i2} - c_{j2})^2}
Algoritmanın kümeleri ayırırken hangi matematiksel metodu temel aldığını belirlemek.
2
Verilen değişkenlerin değer aralıklarını ve formüldeki etkilerini karşılaştırmak
X1X_1 (Azot) farkları 0.10.1 ile 0.50.5 arasında değişirken karesi çok küçük bir ondalık sayı üretir. X2X_2 (Yağış) farkları ise yüzlerce birim olup karesi on binlerce birim büyüklüğünde değerler üretir.
Farklı ölçüm birimlerinin (yüzde vs. milimetre) karesel uzaklık üzerindeki asimetrik etkisini tespit etmek.
3
Bu asimetrik etkinin kümeleme sonucuna yansımasını ve çözüm yolunu belirlemek
Mesafe hesaplamasında X1X_1'in etkisi matematiksel olarak kaybolur ve kümeler sadece X2X_2'ye göre oluşur. Çözüm, her iki değişkeni ortalaması 00, varyansı 11 olacak şekilde standartlaştırmaktır (Z-skoru).
K-Ortalamalar algoritmasının ölçekten bağımsız çalışabilmesi için standartlaştırma varsayımının zorunluluğunu ortaya koymak.

Key Concept

Ölçeklendirme Etkisi ve Uzaklık Metrikleri
Rate this question