Bir araştırmacı, K-Ortalamalar (K-Means) algoritmasını kullanarak sismik olayları sınıflandırmayı amaçlamaktadır. Analizde "Odak Derinliği" () ve "Açığa Çıkan Enerji" () olmak üzere iki sürekli değişken kullanılmaktadır. Veri setinin tamamı üzerinden hesaplanan standart sapmalar sırasıyla ve olarak elde edilmiştir.
Algoritmanın başlangıç aşamasında, veri setinde yer alan üç gözlem noktası , ve olarak belirlenmiştir. Araştırmacı, ilk iterasyon için başlangıç küme merkezlerini ve olarak atamıştır.
Buna göre, Öklid uzaklığı kullanılarak yapılacak ilk kümeleme adımında noktasının atanacağı küme ile ilgili, veri setinin ham haliyle kullanılması ve Z-skoru ile standartlaştırılarak kullanılması durumlarındaki matematiksel sonuçlar aşağıdakilerin hangisinde sırasıyla doğru verilmiştir?
- Veriler standartlaştırılmadığında değişkeni uzaklık hesabını domine ettiği için noktası merkezli kümeye atanır; standartlaştırma yapıldığında ise varyanslar eşitleneceğinden noktası merkezli kümeye atanır.Answer
- BHem standartlaştırılmamış ham verilerle hem de Z-skoru dönüşümü sonrasında noktasının merkezine olan uzaklığı daha kısa çıkacağından, standartlaştırma işlemi atama sonucunu değiştirmez ve nokta her iki durumda da merkezli kümeye atanır.
- CK-Ortalamalar algoritması atama yapabilmek için kategorik bir bağımlı (grup) değişkene ihtiyaç duyduğundan, veriler standartlaştırılsın veya standartlaştırılmasın noktası için uzaklık temelli geçerli bir küme ataması yapılamaz.
- DVeriler standartlaştırılmadığında, değişkenindeki mutlak fark daha küçük olduğu için noktası merkezli kümeye atanır; standartlaştırma uygulandığında ise değişken etkileri sıfırlanacağından merkezli kümeye atanır.
- EStandartlaştırma öncesinde değişkeninin yüksek varyansı noktasını ağırlıklı olarak merkezli kümeye çekerken; standartlaştırma sonrasında tüm değişkenler eşit ağırlığa sahip olacağı için atama rastgele yapılır.