Research Article

TÜRKÇE METİNLERİN SINIFLANDIRMA BAŞARISINI ARTIRMAK İÇİN YENİ BİR YÖNTEM ÖNERİSİ

Volume: 24 Number: 1 April 30, 2019
EN TR

TÜRKÇE METİNLERİN SINIFLANDIRMA BAŞARISINI ARTIRMAK İÇİN YENİ BİR YÖNTEM ÖNERİSİ

Abstract

Bu çalışma, yazarı bilinmeyen bir dokümanının yazarını tahmin etmeyi amaçlamaktadır. Bunun için 6 farklı köşe yazarına ait 6 köşe yazısı öncelikle ön-işlem aşamasına sokulmuştur. Ardından bu metinler üzerinden n-gram (2-3) ile özellikler çıkarılmıştır. Çıkarılan özellikler üzerinden sistem 6 farklı makine öğrenmesi üzerinde çapraz geçerleme (10)  ile test edilmiştir. Buraya kadar olan kısım literatürde şimdiye kadar uygulanmış olan yöntemdir. Bizim önerimiz ön işlem aşamasının ardından eldeki metinleri LZW algoritması ile kayıpsız sıkıştırarak özellik sayısını azaltmak ve bunun sistemin başarısı üzerindeki etkileri araştırmak üzerinedir. Ön-işlemden geçmiş olan metinler LZW algoritması ile binary (ikili) ve decimal (onlu) olarak sıkıştırılır. Sıkıştırmanın ardından n-gram (2-3) ile çıkarılan özellikler ile sistem 6 farklı makine öğrenmesi yönteminde test edilmiş ve çalışma sonuçları 5 farklı metrik için incelenmiştir. Yapılan çalışma sonucunda ikili olarak sıkıştırılmış metinler hem 2-gram hem de 3-gramda, 6 farklı makine öğrenmesi algoritmasında da daha iyi sonuçlar elde etmiştir.  Random Tree ve Naïve bayes algoritmasında onlu sıkıştırma, ham verinin gerisinde kalsa da diğer 4 algoritmada daha iyi elde sonuçlar elde etmiş ama ortalama başarı değerlerinde geride kalmıştır. Yapılan çalışma sonucunda ikili sıkıştırma tüm metriklerinde diğer iki yönteme göre daha başarılıdır. Yapılan çalışmada yazar tanıma işlemi yapılmış olsa da önerilen bu yöntemin tüm metin sınıflandırma işlemlerinde kullanılabileceği düşünülmektedir. 

Keywords

References

  1. Amasyalı .M.F. ve Yıldırım T. (2004) Otomatik Haber Metinleri Sınıflandırma, 12.IEEE Sinyal İşleme ve İletişim Uygulamaları Kurultayı, Kuşadası, Aydın, Türkiye, 224-226.
  2. Amasyalı, M. F. ve Diri, B. (2006) Automatic Turkish Text Categorization in Terms of Author, Genre and Gender, International Conference on Applications of Natural Language to Information Systems, Klagenfurt, Austria, 221-226. Doi: 10.1007/11765448_22
  3. Amasyalı, M.F., Davletov, F., Arslan, T. ve Çiftçi, Ü. (2010) Text2arff: Automatic feature extraction software for Turkish texts, 18.IEEE Sinyal İşleme ve İletişim Uygulamaları Kurultayı, Diyarbakır, Türkiye, 629-632. Doi: 10.1109/SIU.2010.5651686
  4. Bekkerman R., El-Yaniv, R., Naftali T. ve Yoad W. (2002) Distributional Word Clusters vs. Words for Text Categorization, Journal of Machine Learning Research, 3,1-48. Doi: 10.1.1.19.7938
  5. Bilgin, M. (2018) Makine Öğrenmesi Teorisi ve Algoritmaları, Papatya Bilim, İstanbul.
  6. Bilgin, M. ve Şentürk, İ.F. (2017) Sentiment analysis on Twitter data with semi-supervised Doc2Vec, International Conference Computer Science and Engineering, 661-666. Doi: 10.1109/UBMK.2017.8093492
  7. Ciya L., Shamim A., ve Paul D. (2001) Feature Preparation in Text Categorization, Oracle Text Selected Papers and Presentations, 1-8.
  8. Çatal Ç., Erbakırcı K. ve Erenler Y. (2003) Computer-based Authorship Attribution for Turkish Documents, Turkish Symposium on Artificial Intelligence and Neural Networks, Çanakkale,Türkiye, 539-541.

Details

Primary Language

Turkish

Subjects

Engineering

Journal Section

Research Article

Publication Date

April 30, 2019

Submission Date

November 17, 2018

Acceptance Date

February 12, 2019

Published in Issue

Year 2019 Volume: 24 Number: 1

APA
Bilgin, M. (2019). TÜRKÇE METİNLERİN SINIFLANDIRMA BAŞARISINI ARTIRMAK İÇİN YENİ BİR YÖNTEM ÖNERİSİ. Uludağ Üniversitesi Mühendislik Fakültesi Dergisi, 24(1), 125-136. https://doi.org/10.17482/uumfd.484525
AMA
1.Bilgin M. TÜRKÇE METİNLERİN SINIFLANDIRMA BAŞARISINI ARTIRMAK İÇİN YENİ BİR YÖNTEM ÖNERİSİ. UUJFE. 2019;24(1):125-136. doi:10.17482/uumfd.484525
Chicago
Bilgin, Metin. 2019. “TÜRKÇE METİNLERİN SINIFLANDIRMA BAŞARISINI ARTIRMAK İÇİN YENİ BİR YÖNTEM ÖNERİSİ”. Uludağ Üniversitesi Mühendislik Fakültesi Dergisi 24 (1): 125-36. https://doi.org/10.17482/uumfd.484525.
EndNote
Bilgin M (April 1, 2019) TÜRKÇE METİNLERİN SINIFLANDIRMA BAŞARISINI ARTIRMAK İÇİN YENİ BİR YÖNTEM ÖNERİSİ. Uludağ Üniversitesi Mühendislik Fakültesi Dergisi 24 1 125–136.
IEEE
[1]M. Bilgin, “TÜRKÇE METİNLERİN SINIFLANDIRMA BAŞARISINI ARTIRMAK İÇİN YENİ BİR YÖNTEM ÖNERİSİ”, UUJFE, vol. 24, no. 1, pp. 125–136, Apr. 2019, doi: 10.17482/uumfd.484525.
ISNAD
Bilgin, Metin. “TÜRKÇE METİNLERİN SINIFLANDIRMA BAŞARISINI ARTIRMAK İÇİN YENİ BİR YÖNTEM ÖNERİSİ”. Uludağ Üniversitesi Mühendislik Fakültesi Dergisi 24/1 (April 1, 2019): 125-136. https://doi.org/10.17482/uumfd.484525.
JAMA
1.Bilgin M. TÜRKÇE METİNLERİN SINIFLANDIRMA BAŞARISINI ARTIRMAK İÇİN YENİ BİR YÖNTEM ÖNERİSİ. UUJFE. 2019;24:125–136.
MLA
Bilgin, Metin. “TÜRKÇE METİNLERİN SINIFLANDIRMA BAŞARISINI ARTIRMAK İÇİN YENİ BİR YÖNTEM ÖNERİSİ”. Uludağ Üniversitesi Mühendislik Fakültesi Dergisi, vol. 24, no. 1, Apr. 2019, pp. 125-36, doi:10.17482/uumfd.484525.
Vancouver
1.Metin Bilgin. TÜRKÇE METİNLERİN SINIFLANDIRMA BAŞARISINI ARTIRMAK İÇİN YENİ BİR YÖNTEM ÖNERİSİ. UUJFE. 2019 Apr. 1;24(1):125-36. doi:10.17482/uumfd.484525

Cited By

Announcements:

30.03.2021-Beginning with our April 2021 (26/1) issue, in accordance with the new criteria of TR-Dizin, the Declaration of Conflict of Interest and the Declaration of Author Contribution forms fulfilled and signed by all authors are required as well as the Copyright form during the initial submission of the manuscript. Furthermore two new sections, i.e. ‘Conflict of Interest’ and ‘Author Contribution’, should be added to the manuscript. Links of those forms that should be submitted with the initial manuscript can be found in our 'Author Guidelines' and 'Submission Procedure' pages. The manuscript template is also updated. For articles reviewed and accepted for publication in our 2021 and ongoing issues and for articles currently under review process, those forms should also be fulfilled, signed and uploaded to the system by authors.