Bir büyükşehir belediyesi, kentsel planlama stratejilerini belirlemek amacıyla ilçesindeki 85 farklı mahalleyi sosyoekonomik ve altyapı özelliklerine göre gruplamak istemektedir. Araştırmacı bu amaçla iki değişken tanımlamıştır:
* : Mahalledeki toplam park ve yeşil alan sayısı (0 ile 25 arasında değişmektedir).
* : Mahalle sakinlerinin yıllık ortalama hanehalkı geliri ( TL ile TL arasında değişmektedir).
Araştırmacı, bu ham veri seti üzerinden doğrudan Öklid uzaklığı ölçüsünü kullanarak için K-Ortalamalar (K-Means) kümeleme algoritmasını çalıştırmış ve mahalleleri 4 kümeye ayırmıştır.
Araştırmacının uyguladığı bu kümeleme analizi prosedürü ve elde edeceği sonuçlar hakkında aşağıdakilerden hangisi söylenebilir?
- Analiz öncesinde standardizasyon yapılmadığı için, varyansı çok daha büyük olan gelir değişkeni uzaklık hesaplamasını domine edecek ve kümeler neredeyse tamamen gelire göre oluşacaktır.Cevap
- BKümeleme işleminin istatistiksel olarak geçerli sayılabilmesi için, modele analiz öncesinde mahallelerin mevcut gelişmişlik seviyesini gösteren kategorik bir bağımlı değişken eklenmelidir.
- CDeğişkenlerin ölçüm birimlerinin farklı olması sonucu etkilemez; çünkü algoritma her iterasyonda küme içi hata kareler toplamını minimize ederken varyans farklılıklarını otomatik olarak dengeler.
- DSürekli verilerin kullanıldığı ve birim farklılıklarının olduğu bu tür veri setlerinde, Öklid uzaklığı yerine her zaman Jaccard veya Basit Eşleşme (Simple Matching) katsayıları tercih edilmelidir.
- EK-Ortalamalar yöntemi hiyerarşik bir algoritma temelinde çalıştığı için, analizden önce verilerle bir dendrogram çizilip optimum kesim noktasının görsel olarak belirlenmesi zorunludur.
Cevap
Analiz öncesinde standardizasyon yapılmadığı için, varyansı çok daha büyük olan gelir değişkeni uzaklık hesaplamasını domine edecek ve kümeler neredeyse tamamen gelire göre oluşacaktır.
Doğru seçenek, Öklid uzaklığı kullanan mesafe temelli algoritmalarda (K-Ortalamalar gibi) değişkenlerin birimlerinin ve değer aralıklarının doğrudan sonuca etki ettiği gerçeğini yansıtmaktadır. Gelir değişkeni yüz binler basamağındayken, park sayısı onlar basamağındadır. Formül gereği farkların karesi alındığında, gelir değişkenindeki küçük bir değişim bile park sayısındaki en büyük değişimden matematiksel olarak çok daha ağır basacaktır. Bu nedenle, kümeler mahallelerin park sayısından bağımsız olarak, sadece gelir düzeyine göre şekillenecektir. Bu sorunu aşmak için analize başlamadan önce her iki değişkenin ortalaması 0, varyansı 1 olacak şekilde standartlaştırılması (z-değerlerine dönüştürülmesi) gereklidir.
Adım Adım Çözüm
Anahtar Kavram
Ölçeklendirme (Standardizasyon) ve Uzaklık Ölçüleri Arasındaki İlişki