Bir araştırmacı, bir bankanın müşterilerini profillerine göre segmentlere ayırmak için "Aylık Harcama Tutarı" (TL cinsinden, ortalama ) ve "Müşteri Olunan Yıl Sayısı" (Yıl cinsinden, ortalama ) değişkenlerini kullanarak K-Ortalamalar (K-Means) kümeleme analizi yapmıştır. Araştırmacı, her iki değişkeni de veri setindeki ham (dönüştürülmemiş) değerleriyle analize dahil etmiş ve uzaklık ölçüsü olarak Öklid (Euclidean) uzaklığını kullanmıştır.
Bu analiz süreciyle ilgili aşağıdaki istatistiksel değerlendirmelerden hangisi doğrudur?
- ADeğişkenlerin ölçüm birimleri farklı olduğu için Öklid uzaklığı kullanılamaz; bu tür sürekli değişkenlerde kümeleme için Jaccard benzerlik katsayısı seçilmelidir.
- Aylık harcama tutarının varyansı ve değer aralığı çok daha büyük olacağı için uzaklık hesaplamalarını domine edecektir; bu nedenle analize başlamadan önce değişkenler standartlaştırılmalıdır.Answer
- CHam verilerin kullanılması, algoritmanın küme merkezlerini (centroid) her iterasyonda varyansı düşük olan değişkene doğru hatalı güncellemesine yol açarak yakınsamayı (convergence) engeller.
- DKümeleme analizinde farklı birimlerde ölçülen ham verilerin bir arada kullanılması, tek bağlantı (single linkage) sorununa yol açarak kümelerin zincir şeklinde uzamasına neden olur.
- EMüşterilerin profilleri önceden tam olarak bilinmeyen sayısal bir yapıya sahip olduğundan, modeli kurmak için K-Ortalamalar yerine doğrudan Diskriminant (Ayırma) analizi uygulanmalıdır.
Answer
Uzaklık hesaplamalarında varyansı büyük olan değişkenin sonucu domine etmemesi için analize başlamadan önce değişkenlerin standartlaştırılması gerektiği ifade eden seçenektir.
K-Ortalamalar algoritması nesneler arasındaki benzerlikleri Öklid gibi uzaklık metrikleri ile hesaplar. Eğer analizde kullanılan değişkenlerin birimleri ve varyansları birbirinden çok farklıysa (örneğin biri binli değerler, diğeri tek haneli değerler alıyorsa), büyük sayılarla ifade edilen değişken matematiksel olarak uzaklık değerini ve küme merkezlerini (centroid) domine eder. İkinci değişkenin kümeleme üzerine etkisi neredeyse kaybolur. Bu istatistiksel problemi önlemek ve değişkenlere eşit ağırlık verebilmek için analize başlanmadan önce her bir değişkenin standartlaştırılması (örneğin skoruna dönüştürülmesi) zorunludur.
Step-by-Step Solution
Key Concept
K-Ortalamalar analizinde veri standartlaştırmasının önemi