Yüksek boyut düşük örneklem genişliği durumunda sınıflama algoritmalarının performanslarının karşılaştırılması
Tezin Türü: Doktora
Tezin Yürütüldüğü Kurum: Hacettepe Üniversitesi, Sağlık Bilimleri Enstitüsü, Biyoistatistik A.B.D., Türkiye
Tezin Onay Tarihi: 2015
Tezin Dili: Türkçe
Öğrenci: ÜLGER AYDOĞAN CULHA
Asıl Danışman (Eş Danışmanlı Tezler İçin): ERDEM KARABULUT
Özet:Günümüzde özellikle genetik, biyoinformatik, tıbbi görüntüleme gibi alanlarda her bir gözleme ait binlerce özelliğin/niteliğin aynı anda ölçülmesine imkan veren teknolojiler oldukça popülerdir. Bu ise "Yüksek Boyut Düşük Örneklem Genişlikli (YBDÖG) Düzenler" olarak adlandırılan farklı bir veri yapısını karşımıza çıkarmakta olup, klasik istatistiksel yöntemlerle bu verilerin analizinde bir takım zorluklar yaşanmaktadır. Yüksek boyutlu verilerin sınıflandırılmasında farklı üstünlüklere sahip farklı makine öğrenmesi yöntemlerinin düşük örneklem genişliği söz konusu olduğunda performanslarındaki değişim ya da yanlılık eğilimleri ise dikkate alınmamaktadır. Bu çalışma ile YBDÖG veri setlerinde Destek Vektör Makineleri (DVM), Uzaklık Ağırlıklı Ayırma (UAA), Random Forest (RForest), Random Ferns (RFerns) ve Naive Bayes (NB) algoritmalarının sınıflama performanslarının karşılaştırılması amaçlanmıştır. Benzetim teknikleri kullanılarak boyut, örneklem genişliği, korelasyon yapısı, gürültü oranı ve prevalans açısından farklı karakteristiklere sahip yapay veri setleri üretilmiştir. Her bir senaryonun 1000 kez tekrarı ile sınıflama performanslarına ilişkin ortalama değerler hesaplanmıştır. Çalışma sonucunda dengeli dağılım durumunda UAA yönteminin diğerlerinden daha iyi performansa sahip olduğu görülmüştür. Diğer taraftan RFerns yöntemi düşük gözlem sayısında diğer yöntemlere göre daha başarılı sonuçlar ortaya koymuştur. Tüm yöntemlerin dengesiz dağılım durumunda klasik veri yapılarında olduğu kadar yüksek başarı sağlamadığı da görülmüştür.