Bir endüstri mühendisi, üretim hattından çıkan parçaları iki temel kalite kriterine göre gruplamak amacıyla K-Ortalamalar (K-Means) algoritmasını kullanmaktadır. Bu kriterler; (mikron cinsinden yüzey pürüzlülüğü, varyansı ) ve (Pascal cinsinden basınca dayanıklılık, varyansı ) olarak belirlenmiştir. Mühendis, analiz öncesinde veri setinde herhangi bir standardizasyon (ölçeklendirme) işlemi yapmadan, uzaklık ölçüsü olarak Öklid uzaklığını kullanarak algoritmayı çalıştırmıştır.
Bu durumun K-Ortalamalar algoritmasının optimizasyon süreci ve elde edilecek kümeler üzerindeki matematiksel etkisi aşağıdakilerden hangisinde doğru ifade edilmiştir?
- Grup içi hata kareler toplamı (WCSS) minimize edilirken değişkenindeki büyük sayısal farklar Öklid uzaklığını domine edeceğinden, algoritmik olarak değişkeninin kümeleme yapısına katkısı neredeyse sıfırlanır ve kümeler temel olarak ekseninde şekillenir.Answer
- BStandardizasyon eksikliği, algoritmanın iterasyonlarında tek bağlantı (single linkage) prosedürünün baskın hale gelmesine neden olur ve zincirleme (chaining) etkisi yaratarak aykırı gözlemlerin tamamının uzun bir küme oluşturmasına yol açar.
- CSürekli ve farklı ölçekli veri tipleri kullanıldığı için, algoritma her bir iterasyonda merkez (centroid) hesaplarken Öklid uzaklığı yerine veri tipine daha uygun olan kategorik benzerlik matrislerini kullanmak zorunda kalır.
- Dve arasındaki devasa varyans farkı, K-Ortalamalar analizinin temel varsayımı olan bağımlı hedef değişkenin varyans homojenliğini bozarak, analiz sonucunda elde edilecek sınıflandırma hata oranını geçersiz kılar.
- EÖlçek farklılıklarından kaynaklanan sapmalar, iterasyonlar sonucunda elde edilecek dendrogram grafiğindeki bağ mesafelerini yapay olarak uzatacağından, optimum küme sayısının belirlenmesi için kesim hattının daha alt seviyelerden çizilmesini gerektirir.
Answer
Standardize edilmemiş K-Ortalamalar uygulamasında büyük varyansa sahip değişkenin, uzaklık hesaplamasında diğer değişkeni baskılayıp kümeleri tamamen kendi ekseninde oluşturacağını belirten seçenek doğrudur.
K-Ortalamalar (K-Means) algoritması, gözlemlerin küme merkezlerine (centroid) atanmasında genellikle Öklid uzaklığını kullanır. Öklid uzaklığı formülü gereği, veri setindeki değişkenlerin farklı ölçüm birimlerine veya çok farklı varyanslara sahip olması durumunda, sayısal olarak büyük olan (büyük varyanslı) değişken toplam mesafe değerini domine eder. Soru senaryosunda 'nin varyansı , 'in varyansı ise 'tür. Bu durumda uzaklık hesaplamasında 'in değerleri matematiksel olarak bir gürültü seviyesine iner ve algoritma sadece Grup İçi Hata Kareler Toplamını (WCSS) minimize etmeye çalışırken tamamen 'nin sayısal farklılıklarına odaklanır. Bu nedenle, değişkenlerin standartlaştırılmaması 'in analizdeki ağırlığını yok eder.
Step-by-Step Solution
Key Concept
K-Ortalamalar algoritmasında değişken ölçeklendirmesi ve Öklid uzaklığı geometrisi
Estimated Time:2m 30s