Question

Difficulty: MediumK-Ortalamalar (K-Means) Yöntemi

Bir araştırmacı, bir bankanın müşterilerini profillerine göre segmentlere ayırmak için "Aylık Harcama Tutarı" (TL cinsinden, ortalama 15.00015.000) ve "Müşteri Olunan Yıl Sayısı" (Yıl cinsinden, ortalama 88) değişkenlerini kullanarak K-Ortalamalar (K-Means) kümeleme analizi yapmıştır. Araştırmacı, her iki değişkeni de veri setindeki ham (dönüştürülmemiş) değerleriyle analize dahil etmiş ve uzaklık ölçüsü olarak Öklid (Euclidean) uzaklığını kullanmıştır.

Bu analiz süreciyle ilgili aşağıdaki istatistiksel değerlendirmelerden hangisi doğrudur?

  1. A
    Değişkenlerin ölçüm birimleri farklı olduğu için Öklid uzaklığı kullanılamaz; bu tür sürekli değişkenlerde kümeleme için Jaccard benzerlik katsayısı seçilmelidir.
  2. Aylık harcama tutarının varyansı ve değer aralığı çok daha büyük olacağı için uzaklık hesaplamalarını domine edecektir; bu nedenle analize başlamadan önce değişkenler standartlaştırılmalıdır.Answer
  3. C
    Ham verilerin kullanılması, algoritmanın küme merkezlerini (centroid) her iterasyonda varyansı düşük olan değişkene doğru hatalı güncellemesine yol açarak yakınsamayı (convergence) engeller.
  4. D
    Kümeleme analizinde farklı birimlerde ölçülen ham verilerin bir arada kullanılması, tek bağlantı (single linkage) sorununa yol açarak kümelerin zincir şeklinde uzamasına neden olur.
  5. E
    Müşterilerin profilleri önceden tam olarak bilinmeyen sayısal bir yapıya sahip olduğundan, modeli kurmak için K-Ortalamalar yerine doğrudan Diskriminant (Ayırma) analizi uygulanmalıdır.

Answer

Uzaklık hesaplamalarında varyansı büyük olan değişkenin sonucu domine etmemesi için analize başlamadan önce değişkenlerin standartlaştırılması gerektiği ifade eden seçenektir.
K-Ortalamalar algoritması nesneler arasındaki benzerlikleri Öklid gibi uzaklık metrikleri ile hesaplar. Eğer analizde kullanılan değişkenlerin birimleri ve varyansları birbirinden çok farklıysa (örneğin biri binli değerler, diğeri tek haneli değerler alıyorsa), büyük sayılarla ifade edilen değişken matematiksel olarak uzaklık değerini ve küme merkezlerini (centroid) domine eder. İkinci değişkenin kümeleme üzerine etkisi neredeyse kaybolur. Bu istatistiksel problemi önlemek ve değişkenlere eşit ağırlık verebilmek için analize başlanmadan önce her bir değişkenin standartlaştırılması (örneğin ZZ skoruna dönüştürülmesi) zorunludur.

Step-by-Step Solution

1
Verilen analiz yöntemini ve parametrelerini belirle
Yöntem: K-Ortalamalar (K-Means), Uzaklık ölçüsü: Öklid (Euclidean), Kullanılan veriler: Ham (farklı birimlerde ve varyanslarda).
Uygulanan metodolojinin varsayımlarını test etmek için veri yapısını ve kullanılan algoritmik yaklaşımı tanımlamak gereklidir.
2
K-Ortalamalar yönteminde Öklid uzaklığının özelliklerini değerlendir
Öklid uzaklığı değişkenlerin değer büyüklüklerinden ve birimlerinden doğrudan etkilenir.
Algoritmanın uzaklık matrisi oluşturma ve küme merkezini (centroid) güncelleme mantığını anlamak için bu işlem zorunludur.
3
Değişkenler arasındaki birim/varyans farklılığının algoritma üzerindeki etkisini tespit et
Aylık Harcama Tutarı (binli sayılar) ile Müşteri Olunan Yıl Sayısı (tek haneli sayılar) ham halleriyle hesaplandığında, toplam Öklid uzaklığı neredeyse tamamen Harcama Tutarı tarafından belirlenir.
Boyutların birbiri üzerindeki ağırlığını ve olası hataları (dominasyon etkisini) tespit etmek.
4
İstatistiksel çözümü belirle
Farklı varyanslara ve ölçeklere sahip değişkenlerin eşit ağırlıkla değerlendirilebilmesi için değişkenler ZZ dağılımına dönüştürülerek (ortalama 00, varyans 11) standartlaştırılmalıdır.
Uzaklık temelli çok değişkenli analizlerde ölçeklendirme problemi bu şekilde çözülür.

Key Concept

K-Ortalamalar analizinde veri standartlaştırmasının önemi
Rate this question