Araştırma Makalesi

Makine Öğrenmesi Algoritmaları ile Uçtan Uca Yazar Tanıma Uygulaması Geliştirme

Cilt: 9 Sayı: 4 31 Aralık 2022
PDF İndir
TR EN

Makine Öğrenmesi Algoritmaları ile Uçtan Uca Yazar Tanıma Uygulaması Geliştirme

Öz

Abstract: The problem of unidentified texts, which has been going on for centuries, has increased considerably with the beginning of the internet age. The biggest reason for this situation is that very high percentage of data on the internet is composed of unstructured data, and a large part of this unstructured data is composed of unclassified texts with uncertain authors. The use of machine learning methods in classification processes in recent years has brought a new perspective to authorship identification problems. In this study, an end-to-end application with a web-based interface was developed for the authorship identification problem using machine learning methods. First of all, a corpus containing 46715 text data was created from the columns of 37 authors. Features were extracted from this corpus using the TF-IDF method and a dataset was obtained. Then the dataset is trained and tested with Support Vector Machines (SVM), NB (NB) and Random Forest (RF) machine learning algorithms. As a result of the test, SVM was the best performing classifier model with 90% accuracy. A web interface was developed for the obtained SVM model by using Flask, one of the libraries of the Python programming language. Then, the application has been converted into a Docker container to run it in a stable and distribution-friendly state. As a result, an end-to-end authorship identification application has been made to deploy available directly to the end user. The creation of such a web-based application with the support of machine learning has made the authorship identification study more meaningful and usable.

Anahtar Kelimeler

Kaynakça

  1. Berry, M. W., “Survey of Text Mining”, Computing Reviews, 45(9),548,2004
  2. Brocard M. L., Traore I. Saad S., Woungang I., “Authorship Verification for Short Messages using Stylometry”, Computer, Information and Telecommunication Systems (CITS), 2013
  3. Ma J., Li Y., Teng G., Wang F. Zhao Y.,”Sequential Pattern Mining for Chinese E-mail Authorship Identification”, The 3rd Intetnational Conference on Innovative Computing Information and Control (ICICIC), 2008
  4. Diederich J., Kindermann J., Leoopold E., Paass G., “Authorship Attribution with Support Vector Machines”, Applied intelligence, 2003
  5. Peng F., Keselj V., Cerconey N., Thomasy C., “N-gram-based Author Profiles For Authorship Attribution”, Faculty of Computing Science, Dalhousie University, 2003
  6. Zheng R., Li J., Chen H., Huang Z., “A Framework for Authorship Identification of Online Messages: Writing Style Features and Classification Techniques”, Journal of the American Society of Information Science and Technology, 2006
  7. Abbasi A., Hsinchun C., “Applying Authorship Analysis to Extremist-group Web Forum Messages”, IEEE Intelligent Systems, 2005
  8. Patton J. M, Can F., “A Stylometric Analysis of Yaşar Kemal’s İnce Mehmed Tetralogy”, Computers and the Humanities, 2004

Ayrıntılar

Birincil Dil

İngilizce

Konular

Mühendislik

Bölüm

Araştırma Makalesi

Yayımlanma Tarihi

31 Aralık 2022

Gönderilme Tarihi

23 Haziran 2022

Kabul Tarihi

23 Kasım 2022

Yayımlandığı Sayı

Yıl 2022 Cilt: 9 Sayı: 4

Kaynak Göster

APA
Erdoğan, İ., Güllü, M., & Polat, H. (2022). Makine Öğrenmesi Algoritmaları ile Uçtan Uca Yazar Tanıma Uygulaması Geliştirme. El-Cezeri, 9(4), 1303-1314. https://doi.org/10.31202/ecjse.1134698
AMA
1.Erdoğan İ, Güllü M, Polat H. Makine Öğrenmesi Algoritmaları ile Uçtan Uca Yazar Tanıma Uygulaması Geliştirme. ECJSE. 2022;9(4):1303-1314. doi:10.31202/ecjse.1134698
Chicago
Erdoğan, İlayda, Merve Güllü, ve Hüseyin Polat. 2022. “Makine Öğrenmesi Algoritmaları ile Uçtan Uca Yazar Tanıma Uygulaması Geliştirme”. El-Cezeri 9 (4): 1303-14. https://doi.org/10.31202/ecjse.1134698.
EndNote
Erdoğan İ, Güllü M, Polat H (01 Aralık 2022) Makine Öğrenmesi Algoritmaları ile Uçtan Uca Yazar Tanıma Uygulaması Geliştirme. El-Cezeri 9 4 1303–1314.
IEEE
[1]İ. Erdoğan, M. Güllü, ve H. Polat, “Makine Öğrenmesi Algoritmaları ile Uçtan Uca Yazar Tanıma Uygulaması Geliştirme”, ECJSE, c. 9, sy 4, ss. 1303–1314, Ara. 2022, doi: 10.31202/ecjse.1134698.
ISNAD
Erdoğan, İlayda - Güllü, Merve - Polat, Hüseyin. “Makine Öğrenmesi Algoritmaları ile Uçtan Uca Yazar Tanıma Uygulaması Geliştirme”. El-Cezeri 9/4 (01 Aralık 2022): 1303-1314. https://doi.org/10.31202/ecjse.1134698.
JAMA
1.Erdoğan İ, Güllü M, Polat H. Makine Öğrenmesi Algoritmaları ile Uçtan Uca Yazar Tanıma Uygulaması Geliştirme. ECJSE. 2022;9:1303–1314.
MLA
Erdoğan, İlayda, vd. “Makine Öğrenmesi Algoritmaları ile Uçtan Uca Yazar Tanıma Uygulaması Geliştirme”. El-Cezeri, c. 9, sy 4, Aralık 2022, ss. 1303-14, doi:10.31202/ecjse.1134698.
Vancouver
1.İlayda Erdoğan, Merve Güllü, Hüseyin Polat. Makine Öğrenmesi Algoritmaları ile Uçtan Uca Yazar Tanıma Uygulaması Geliştirme. ECJSE. 01 Aralık 2022;9(4):1303-14. doi:10.31202/ecjse.1134698

Cited By