Question

Difficulty: MediumK-Ortalamalar (K-Means) Yöntemi

Sanayi ve Teknoloji Bakanlığı tarafından yürütülen bir projede, teknoloji geliştirme bölgelerindeki firmalar benzerliklerine göre gruplandırılmak istenmektedir. Analizde 'Yıllık Alınan Patent Sayısı' (5505 - 50 adet arası) ve 'Yıllık Net Satış Hasılatı' (2.000.000450.000.0002.000.000 - 450.000 .000 TL arası) değişkenleri kullanılarak KK-Ortalamalar (KK-Means) kümeleme analizi uygulanacaktır. Uzaklık ölçüsü olarak Öklid uzaklığının kullanıldığı bu analizde, verilerin standartlaştırılmadan (z-skoru vb.) işleme alınması durumunda aşağıdakilerden hangisinin gerçekleşmesi beklenir?

  1. Kümeleme sonuçları ve küme merkezlerinin konumu neredeyse tamamen 'Yıllık Net Satış Hasılatı' değişkeni tarafından domine edilir.Answer
  2. B
    Birim değeri daha küçük olan 'Yıllık Alınan Patent Sayısı' değişkeni, analizde daha yüksek ağırlığa sahip olur.
  3. C
    Öklid uzaklığı birimden bağımsız (scale-invariant) bir ölçü olduğu için standartlaştırma yapılmaması sonuçları etkilemez.
  4. D
    Analizin geçerli olabilmesi için satış hasılatı değişkeninin mutlaka sürekli değil, kategorik bir yapıya dönüştürülmesi gerekir.
  5. E
    Algoritma, değişkenler arasındaki varyans farklarını otomatik olarak dengeleyerek her iki değişkene eşit önem atar.

Answer

Kümeleme sonuçlarının ve merkezlerin neredeyse tamamen yıllık net satış hasılatı değişkeni tarafından domine edilmesi beklenir.
Satış hasılatı değişkeninin değer aralığı (skalası), patent sayısı değişkeninden milyonlarca kat daha büyüktür. Öklid uzaklığı formülü karesel farkların toplamına dayandığı için, hasılat değişkenindeki küçük bir yüzdelik değişim bile patent sayısındaki maksimum değişimden çok daha büyük bir uzaklık değeri yaratır. Bu durum, algoritmanın kümeleri oluştururken sadece hasılat farklarını dikkate almasına neden olur.

Step-by-Step Solution

1
Değişkenlerin ölçeklerini karşılaştırın.
Patent sayısı (onluk mertebe) ile satış hasılatı (milyonluk mertebe) arasında çok büyük bir ölçek farkı vardır.
Uzaklık temelli algoritmalarda değişkenlerin büyüklük mertebeleri analizi doğrudan etkiler.
2
Öklid uzaklığı formülünü analiz edin.
d(x,c)=(xpatentcpatent)2+(xhasılatchasılat)2d(x, c) = \sqrt{(x_{patent} - c_{patent})^2 + (x_{hasılat} - c_{hasılat})^2}
Hasılat kısmındaki karesel farklar (101410^{14} mertebesinde olabilir), patent kısmındaki karesel farkları (10310^3 mertebesinde) tamamen gölgede bırakır.
3
Standartlaştırma yapılmamasının sonucunu yorumlayın.
Analiz aslında tek bir değişken üzerinden yapılıyormuş gibi sonuç üretir.
Büyük varyansa sahip değişken, uzaklık hesaplamasını domine ederek diğer değişkenin bilgi içeriğini etkisizleştirir.

Key Concept

Öklid Uzaklığında Ölçek Duyarlılığı ve Standartlaştırma İhtiyacı
Estimated Time:1m 30s
Rate this question