Yüksek boyut düşük örneklem genişliği durumunda sınıflama algoritmalarının performanslarının karşılaştırılması


Tezin Türü: Doktora

Tezin Yürütüldüğü Kurum: Hacettepe Üniversitesi, Sağlık Bilimleri Enstitüsü, Biyoistatistik A.B.D., Türkiye

Tezin Onay Tarihi: 2015

Tezin Dili: Türkçe

Öğrenci: ÜLGER AYDOĞAN CULHA

Asıl Danışman (Eş Danışmanlı Tezler İçin): ERDEM KARABULUT

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Günümüzde özellikle genetik, biyoinformatik, tıbbi görüntüleme gibi alanlarda her bir gözleme ait binlerce özelliğin/niteliğin aynı anda ölçülmesine imkan veren teknolojiler oldukça popülerdir. Bu ise "Yüksek Boyut Düşük Örneklem Genişlikli (YBDÖG) Düzenler" olarak adlandırılan farklı bir veri yapısını karşımıza çıkarmakta olup, klasik istatistiksel yöntemlerle bu verilerin analizinde bir takım zorluklar yaşanmaktadır. Yüksek boyutlu verilerin sınıflandırılmasında farklı üstünlüklere sahip farklı makine öğrenmesi yöntemlerinin düşük örneklem genişliği söz konusu olduğunda performanslarındaki değişim ya da yanlılık eğilimleri ise dikkate alınmamaktadır. Bu çalışma ile YBDÖG veri setlerinde Destek Vektör Makineleri (DVM), Uzaklık Ağırlıklı Ayırma (UAA), Random Forest (RForest), Random Ferns (RFerns) ve Naive Bayes (NB) algoritmalarının sınıflama performanslarının karşılaştırılması amaçlanmıştır. Benzetim teknikleri kullanılarak boyut, örneklem genişliği, korelasyon yapısı, gürültü oranı ve prevalans açısından farklı karakteristiklere sahip yapay veri setleri üretilmiştir. Her bir senaryonun 1000 kez tekrarı ile sınıflama performanslarına ilişkin ortalama değerler hesaplanmıştır. Çalışma sonucunda dengeli dağılım durumunda UAA yönteminin diğerlerinden daha iyi performansa sahip olduğu görülmüştür. Diğer taraftan RFerns yöntemi düşük gözlem sayısında diğer yöntemlere göre daha başarılı sonuçlar ortaya koymuştur. Tüm yöntemlerin dengesiz dağılım durumunda klasik veri yapılarında olduğu kadar yüksek başarı sağlamadığı da görülmüştür.