Araştırma Makalesi

Türkçe kısa öykülerde yazar tanıma: dilbilimsel ve hesaplamalı özellik setlerinin karşılaştırmalı analizi

Sayı: Advanced Online Publication Erken Görünüm Tarihi: 30 Temmuz 2026
PDF İndir
TR EN

Türkçe kısa öykülerde yazar tanıma: dilbilimsel ve hesaplamalı özellik setlerinin karşılaştırmalı analizi

Öz

Arka PlanYazar tanıma (authorship attribution) bir metnin üslup özelliklerine dayanarak yazarını belirleme sürecidir. İngilizce gibi eklemeli (bitişken) olmayan diller için geliştirilen yöntemler olgunlaşmış olsa da Türkçe gibi sondan eklemeli diller yeterince araştırılmamıştır. Türkçenin bu yapısı İngilizce merkezli yöntemlerin kapsamadığı farklı bir özellik uzayı oluşturmaktadır.

AmaçBu çalışma Türkçe kısa öykülerde yazar tanıma amacıyla altı farklı özellik setini beş sınıflandırıcı model üzerinde sistematik olarak karşılaştırmaktadır. Bu özellik setleri stilometrik, morfolojik (Stanza UD ve Zeyrek), işlev sözcükleri, karakter n-gramları (TF-IDF) ve BERTurk cümle vektörleridir (sentence embeddings). Özellik setleri arasındaki boyut dengesizliğinin ablasyon sonuçlarını çarpıtmasını önlemek için PCA ile boyut-eşitlemeli bir ablasyon çerçevesi önerilmektedir.

YöntemOn yazardan 11’er kısa öykü ile dengeli bir derlem oluşturulmuştur (110 öykü, 135431 sözcük). Altı özellik seti çıkarılmış ve beş sınıflandırıcı (SVM-Doğrusal, SVM-RBF, Lojistik Regresyon, Rastgele Orman, Çok Katmanlı Algılayıcı) 5 katlı tabakalı çapraz doğrulama ile değerlendirilmiştir. Standart ve PCA ile boyut-eşitlemeli ablasyon analizleri ile ikili özellik seti kombinasyonları karşılaştırılmış, farkların istatistiksel anlamlılığı eşlenmiş bootstrap testi ile sınanmıştır. Ayrıca n-gram morfolojik örtüşme analizi ve sağlamlık sınamaları (minimum sözcük sayısı filtreleme ve metin sınırlandırma) gerçekleştirilmiştir.

BulgularKarakter n-gramları en yüksek tekil set performansına ulaşmıştır (F1 = 0.889 ± 0.049, Lojistik Regresyon); BERTurk 0.783 ± 0.081 ile ikinci sıradadır. Morfolojik özellikler Stanza ile 0.577, Zeyrek ile 0.491 değerine ulaşmıştır. Standart ablasyon, çoğu özellik setinin karakter n-gramları ile birleştirildiğinde ek katkı sağlamadığını göstermiştir. Ancak PCA ile boyut-eşitlemeli ablasyon, tekrarlı çapraz doğrulama (10×5) ile değerlendirildiğinde, karakter n-gramlarının sağlam ve istatistiksel olarak anlamlı bir katkı sağladığını (ΔF1 ≈ 0.07, p < 0.001); boyut eşitlendiğinde düşük-boyutlu stilometrik ve işlev sözcüğü setlerinin de anlamlı katkı verdiğini göstermiştir. Buna karşılık morfolojik setler yüksek-güçlü testte korunan bir katkı göstermemiştir. Bu sonuçlar özellik setleri arasında belirgin boyut farkı olduğunda standart ablasyonun yanıltıcı sonuçlar üretebileceğini göstermektedir. N-gram morfolojik örtüşme analizi en ayırt edici n-gramların %16'sının Türkçe ek dizilerine karşılık geldiğini ortaya koymuştur.

SonuçStandart ablasyonda morfolojik ve stilometrik özelliklerin etkisiz görünmesi kısmen özellik setleri arasındaki boyut dengesizliğini yansıtır. PCA ile boyut-eşitlemeli ablasyon, tekrarlı çapraz doğrulama ile değerlendirildiğinde, karakter n-gramları ile düşük-boyutlu stilometrik ve işlev sözcüğü setleri anlamlı katkı sağlarken morfolojik setler yüksek-güçlü testte korunmamıştır; tek bir 5-katlı koşudaki görünür katkıları yeniden üretilememiştir. Bu nedenle bitişken dillerde boyut dengesizliğini göz ardı eden ablasyon tasarımları yanıltıcı olabilir ve küçük derlemlerde anlamlılık iddiaları temkinli kurulmalıdır. Gelecek çalışmalarda derlemin genişletilmesi, yazar-konu karışmasının ele alınması ve çerçevenin farklı bitişken dillerde sınanması planlanmaktadır.

Anahtar Kelimeler

Kaynakça

  1. E. Stamatatos, “A survey of modern authorship attribution methods”, Journal of the American Society for Information Science and Technology, 60(3), 538–556, 2009. https://doi.org/10.1002/asi.21001.
  2. M. Koppel, J. Schler, S. Argamon, “Computational methods in authorship attribution”, Journal of the American Society for Information Science and Technology, 60(1), 9–26, 2009. https://doi.org/10.1002/asi.20961.
  3. X. He, A. H. Lashkari, N. Vombatkere, D. P. Sharma, “Authorship attribution methods, challenges, and future research directions: A comprehensive survey”, Information, 15(3), 131, 2024. https://doi.org/10.3390/info15030131.
  4. B. Huang, C. Chen, K. Shu, “Authorship attribution in the era of LLMs: Problems, methodologies, and challenges”, arXiv, 2024, https://arxiv.org/abs/2408.08946.
  5. J. Burrows, “‘Delta’: a measure of stylistic difference and a guide to likely authorship”, Literary and Linguistic Computing, 17(3), 267–287, 2002. https://doi.org/10.1093/llc/17.3.267.
  6. M. Kestemont, “Function words in authorship attribution: From black magic to theory?”, Proceedings of the 3rd Workshop on Computational Linguistics for Literature (CLFL), Gothenburg, Sweden, April 2014, 59–66. https://doi.org/10.3115/v1/w14-0908.
  7. U. Sapkota, S. Bethard, M. Montes, T. Solorio, “Not all character n-grams are created equal: A study in authorship attribution”, Proceedings of the 2015 conference of the North American chapter of the association for computational linguistics: Human language Technologies (NAACL), Denver, USA, May-June 2015, 93–102. https://doi.org/10.3115/v1/n15-1010.
  8. E. Stamatatos, “On the robustness of authorship attribution based on character n-gram features”, Journal of Law and Policy, 21(2), 421–439, 2013.

Ayrıntılar

Birincil Dil

Türkçe

Konular

Doğal Dil İşleme

Bölüm

Araştırma Makalesi

Erken Görünüm Tarihi

30 Temmuz 2026

Yayımlanma Tarihi

-

Gönderilme Tarihi

27 Nisan 2026

Kabul Tarihi

2 Temmuz 2026

Yayımlandığı Sayı

Yıl 2026 Sayı: Advanced Online Publication

Kaynak Göster

APA
Aslan, Ö. (2026). Türkçe kısa öykülerde yazar tanıma: dilbilimsel ve hesaplamalı özellik setlerinin karşılaştırmalı analizi. Pamukkale Üniversitesi Mühendislik Bilimleri Dergisi, Advanced Online Publication. https://doi.org/10.65206/pajes.1938741
AMA
1.Aslan Ö. Türkçe kısa öykülerde yazar tanıma: dilbilimsel ve hesaplamalı özellik setlerinin karşılaştırmalı analizi. Pamukkale Üniversitesi Mühendislik Bilimleri Dergisi. 2026;(Advanced Online Publication). doi:10.65206/pajes.1938741
Chicago
Aslan, Özkan. 2026. “Türkçe kısa öykülerde yazar tanıma: dilbilimsel ve hesaplamalı özellik setlerinin karşılaştırmalı analizi”. Pamukkale Üniversitesi Mühendislik Bilimleri Dergisi, sy Advanced Online Publication. https://doi.org/10.65206/pajes.1938741.
EndNote
Aslan Ö (01 Temmuz 2026) Türkçe kısa öykülerde yazar tanıma: dilbilimsel ve hesaplamalı özellik setlerinin karşılaştırmalı analizi. Pamukkale Üniversitesi Mühendislik Bilimleri Dergisi Advanced Online Publication
IEEE
[1]Ö. Aslan, “Türkçe kısa öykülerde yazar tanıma: dilbilimsel ve hesaplamalı özellik setlerinin karşılaştırmalı analizi”, Pamukkale Üniversitesi Mühendislik Bilimleri Dergisi, sy Advanced Online Publication, Tem. 2026, doi: 10.65206/pajes.1938741.
ISNAD
Aslan, Özkan. “Türkçe kısa öykülerde yazar tanıma: dilbilimsel ve hesaplamalı özellik setlerinin karşılaştırmalı analizi”. Pamukkale Üniversitesi Mühendislik Bilimleri Dergisi. Advanced Online Publication (01 Temmuz 2026). https://doi.org/10.65206/pajes.1938741.
JAMA
1.Aslan Ö. Türkçe kısa öykülerde yazar tanıma: dilbilimsel ve hesaplamalı özellik setlerinin karşılaştırmalı analizi. Pamukkale Üniversitesi Mühendislik Bilimleri Dergisi. 2026. doi:10.65206/pajes.1938741.
MLA
Aslan, Özkan. “Türkçe kısa öykülerde yazar tanıma: dilbilimsel ve hesaplamalı özellik setlerinin karşılaştırmalı analizi”. Pamukkale Üniversitesi Mühendislik Bilimleri Dergisi, sy Advanced Online Publication, Temmuz 2026, doi:10.65206/pajes.1938741.
Vancouver
1.Özkan Aslan. Türkçe kısa öykülerde yazar tanıma: dilbilimsel ve hesaplamalı özellik setlerinin karşılaştırmalı analizi. Pamukkale Üniversitesi Mühendislik Bilimleri Dergisi. 01 Temmuz 2026;(Advanced Online Publication). doi:10.65206/pajes.1938741