Makine öğrenmesi temelli 16S mikrobiyom verilerinin işlenmesi için iş hattı: Tip 1 diyabet için vaka çalışması


Tezin Türü: Yüksek Lisans

Tezin Yürütüldüğü Kurum: Hacettepe Üniversitesi, Sağlık Bilimleri Enstitüsü, Biyoinformatik A.B.D., Türkiye

Tezin Onay Tarihi: 2025

Tezin Dili: Türkçe

Öğrenci: AÇELYA DALGIÇ

Danışman: İdil Yet

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Vücudun farklı bölgelerinde yaşayan mikroorganizma topluluğu mikrobiyota, bu topluluk ve sahip olduğu genetik materyal mikrobiyomdur. İnsan vücudunda yer alan mikrobiyom ve insan sağlığı arasında yakın bir ilişki bulunmaktadır. Genetik, diyet ve yaş mikrobiyom kompozisyonuna etki etmektedir. Yapılan çalışmalar bağırsak mikrobiyomunun çeşitli hastalıklar ile yakından ilişkili olduğunu tespit etmiştir. Tip 1 Diyabet Mellitus, immün sistemin beta hücrelerini tahrip etmesiyle oluşan insülin eksikliği ile karakterize bir hastalıktır. Yapılan çalışmalar Tip 1 Diyabet Mellitus'un bağırsak mikrobiyomu ile ilişkili olduğunu kanıtlamıştır. Bu tez kapsamında, farklı popülasyonlar ve yaş gruplarını içeren Tip 1 Diyabet Mellitus hastası ve sağlıklı bireylerin gaita örneklerinden izole edilmiş 16S rRNA dizilerinin Makine Öğrenmesi modelleriyle tahmininin iyi bir performansla gerçekleştirilmesine yönelik işlenmesi için bir iş hattı geliştirilmiştir. İtalya ve Çin'de yapılan iki çalışmanın üç farklı açık erişimli veri seti kullanılmıştır. Veriler QIIME2 adlı biyoinformatik aracı ile deblur eklentisi kullanılarak işlenmiş, SILVA Veritabanı kullanılarak taksonomik sınıflandırmaları yapılmıştır. LEfSe testi ile veri setleri arasında farklılık yaratan taksonlar olup olmadığına bakılmış, veri setleri arasında farklılık yaratan 185 takson tespit edilmiştir. Literatür araştırması sonucunda bu taksonlardan bazılarının Tip 1 Diyabet Mellitus ilişkili olduğu tespit edilmiştir. Taksonomik tablonun Makine Öğrenmesi modellerinin performansını düşüren çok boyutlu yapısının engellenmesi, ayrıca verinin hastalık durumunu en iyi temsil edecek biçimde özetlenmesi amaçlanmıştır. Bu amaçla Shannon-Wiener indisi, Simpson indisi ve Bray Curtis Başlıca Koordinatlar Analizi bileşenleri hesaplanmıştır. Modele maksimum bilgi verilmesi için çeşitlilik hesaplamaları Takım, Aile ve Cins taksonomik seviyelerinde gerçekleştirilmiştir. Veri setleri ve yaş bilgisi kategorik olarak modele çeşitlilik indeksleriyle birlikte verilmiştir. Makine Öğrenmesi modelleri olarak Destek Vektörleri, Yapay Sinir Ağları ve Rassal Ormanlar modelleri kullanılmıştır. Özellik öneminin anlaşılması için SHAP değeri hesaplanmıştır. QIIME2 sample-classifier modeli, tez kapsamında kullanılan modellerle kıyaslanmıştır. Modellere K-Katlı Çapraz Doğrulama yapılmıştır. K 10 değerinde Rassal Ormanlar modeli en iyi performans göstermiştir. SHAP değeri hesaplamasında veri seti bilgisi her model için en önemli özellik olarak görülmüştür. Tez kapsamında geliştirilen Rassal Ormanlar ve Destek Vektörleri modelleri, tezde kullanılan verilerle yapılan Tip 1 Diyabet Mellitus tahmininde QIIME2 modeline göre daha başarılı bir performans sergilemiştir.