İngilizce Bilgi Erişimi Veri Kümelerinde Latin-dışı Alfabelerle Yazılmış İçeriğin Analizi


Arslan A.(Yürütücü), Alkılınç A.

Yükseköğretim Kurumları Destekli Proje, BAP Y.Lisans, 2017 - 2019

  • Proje Türü: Yükseköğretim Kurumları Destekli Proje
  • Destek Programı: BAP Y.Lisans
  • Başlama Tarihi: Aralık 2017
  • Bitiş Tarihi: Ekim 2019

Proje Özeti

Bilgi erişimi, büyük koleksiyonlardan bir bilgi ihtiyacını karşılayan yapısal olmayan bir materyali (genellikle dokümanları) bulma işlemidir. Bilgi erişim sistemlerinin başarımını ölçmek, performansları karşılaştırmak için yıllık olarak Text Retrieval Conference (TREC) düzenlenmektedir. TREC organizasyonu tarafından standart veri setleri oluşturulup yayınlanmaktadır. Bu çalışmada ClueWeb09, ClueWeb12 ve Gov2 TREC veri setleri kullanılacaktır. Bu veri setleri İnternetten toplanmış İngilizce web sayfalarından oluşmaktadır. Bu web sayfalarının içeriğinde geçen kelimelerin İngilizce yani Latin alfabesinden oluşması beklenirken bunun dışında birçok alfabede (Japon, Kiril, Yunan, Arap) yazılmış kelime içerikte bulunmaktadır. Çalışmamızın amacı İngilizce veri setlerinde bulunan Latin-dışı alfabelerle yazılmış içeriğin veri seti üzerindeki dağılımı/kapsamını incelenmek ve Latin olmayan kelimelerin ters indekste tutulup tutulmayacağı belirlemektir. Çalışmamızda İngilizce veri setleri üzerinde önce tüm içerik indekslenerek bilgi erişim başarımını ölçeceğiz daha sonra sadece Latin alfabesiyle yazılmış kelimeler indekste tutulup bilgi erişim başarımını ölçerek bu iki değeri birbiri ile karşılaştıracağız. Sonuç olarak iki indeks oluşturmuş olacağız: birincisi yalnızca Latin içeriği içeriyor, ikincisi ise tüm içeriği içeriyor. Böylelikle, indeksleme aşamasında, Latin olmayan içeriğin tutulup tutulmayacağına karar vereceğiz.