Tez
Permanent URI for this collectionhttp://acikerisim.bau.edu.tr:4000/handle/123456789/160
Browse
1 results
Search Results
Item Metin madenciliği ile dokümanlar arasındaki benzerliklerin bulunması(Bahçeşehir Üniversitesi Fen Bilimleri Enstitüsü, 2013-06) Döven, Selçuk; Tunga, M. AlperMetin madenciliği, yapısal olmayan kaynaklar (metin, resim vb.) içinde çeşitli yöntemler kullanarak veriler arasında sınıflandırma ve benzerlik gibi işlemler yapan bir uygulama alanıdır. Bu tezde bahsedilen metin madenciliği ile dokümanlar arasındaki benzerliklerin bulunmasını (örüntü tarama) bir uygulama üzerinde anlatmak için masaüstü uygulaması geliştirilmiştir. Uygulama, yalnızca algoritmaların çalışma mantığını gösterecek şekilde basit yapı olarak değil gerçek uygulamalar yapabilecek kapsamlı bir şekilde oluşturulmuştur. Uygulamayı diğer tez uygulamalarından ayıran özelliği, yalnızca iki doküman arasında değil kullanıcının ihtiyacına göre n sayıda doküman arasındaki benzerliklerin karşılaştırılmasını yapılabilmesidir. Uygulamaya yüklenen bir doküman içerisinde bulunan her cümlenin diğer dokümanlar içerisinde bulunan tüm cümleler ile benzerlik hesaplaması yapılmaktadır. Yine uygulama, sonuç kısmında karşılaştırılan cümlelerin sayısal olarak sonuçlarını göstermekte, her karşılaştırılan dosyayı ve karşılaştırılan bütün cümlelerin tamamını sayısal sonuçları ile birlikte sonuç tablosunda göstermektedir. Bu sayede kullanıcının cümlelere bakarak hangi cümlelerin hangi algoritma için nasıl bir sonuç ürettiğinin görülmesi sağlanmıştır. Uygulama için en çok kullanılan metin madenciliği bezerlik hesaplama algoritmaları olan kosinüs (cosine) ve jaccard algoritmaları kullanıp başarıları test edilmiştir.