Mikroarray gen ekspresyon veri setlerinde random forest ve naıve bayes sınıflama yöntemleri yaklaşımı
Tezin Türü: Yüksek Lisans
Tezin Yürütüldüğü Kurum: Hacettepe Üniversitesi, Sağlık Bilimleri Enstitüsü, Biyoistatistik A.B.D., Türkiye
Tezin Onay Tarihi: 2013
Tezin Dili: Türkçe
Öğrenci: EBRU KORKEM
Asıl Danışman (Eş Danışmanlı Tezler İçin): ERDEM KARABULUT
Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu
Özet:Ebru KORKEM Mikroarray Gen Ekspresyon Veri Setlerinde Random Forest ve Naive Bayes Sınıflama Yöntemleri Yaklaşımı. Hacettepe Üniversitesi Sağlık Bilimleri Enstitüsü, Biyoistatistik Programı Yüksek Lisans Tezi, ANKARA, 2012. Bu tez çalışmasında çeşitli kanser türlerine ilişkin farklı büyüklükteki ve farklı sınıf sayılarındaki veri setleri üzerinde, Random Forest ve Naive Bayes sınıflama yöntemleri karşılaştırılmıştır. İki sınıflama yönteminin de her bir veri seti için ayrı ayrı doğru sınıflama oranları, iki sınıflı veri setlerinde (hasta, sağlam) yöntemlerin başarısını karşılaştırmak için ise duyarlılık, seçicilik, kesinlik, F-ölçütü gibi performans ölçüleri hesaplanmıştır. Ayrıca Random Forest yönteminde her veri seti için önemli genler ?doğru sınıflama oranındaki ortalama azalma? değerlerine göre hesaplanmış ve ilk 10 önemli genin gerçekte de sınıflar arasında farklılık gösterip gösterilmediğine bakılmıştır. Random Forest yönteminde ağaçlardaki en uygun değişken sayısına karar vermek için 5 farklı mtry değeri üzerinde çalışılmış (0.5P, 0.1P, P, 1.2 ?P, ?P ) ve en uygun mtry değerine göre sınıflama yapılmıştır. Random Forest ve Naive Bayes'in kanser veri setleri üzerindeki performansları bu değerlerle karşılaştırılmıştır. Her iki sınıflama yönteminin hem ikili hem de çoklu sınıflama da performansları incelenmiş olup sonuçlarda, iki yöntem arasında fark gözlenmemiştir.Anahtar Kelimeler: Random Forest, Naive Bayes, DNA Mikroarray, Sınıflama