Araştırma Makalesi

DistilBERT Tabanlı Metin Sınıflandırmada Veri Verimliliği: Farklı Veri Boyutlarında Bir Performans Analizi

Cilt: 16 Sayı: 3 8 Eylül 2026
PDF İndir
TR EN

DistilBERT Tabanlı Metin Sınıflandırmada Veri Verimliliği: Farklı Veri Boyutlarında Bir Performans Analizi

Öz

Bu çalışmada, DistilBERT tabanlı metin sınıflandırma modelinde eğitim veri kümesi boyutunun model performansı ve genelleme kapasitesi üzerindeki etkisi deneysel olarak incelenmiştir. Çalışma kapsamında, farklı dilsel yapılar ve görev karakteristiklerini temsil edecek şekilde seçilen beş ayrı veri seti (AG News, IMDb, DBpedia, TTC-4900 ve Türkçe e-ticaret ürün yorumları veri seti) üzerinde kapsamlı deneyler gerçekleştirilmiştir. Deneylerde, tüm hiperparametreler sabit tutulmuş ve yalnızca eğitim veri miktarı kademeli olarak değiştirilerek küçük veri boyutlarından büyük ölçekli veri yapılarına kadar model davranışı analiz edilmiştir. Model performansı doğruluk, Macro F1 skoru ve kayıp metrikleri üzerinden değerlendirilmiştir. Eğitim ve doğrulama veri kümelerinin sonuçları karşılaştırılarak genelleme eğilimleri ortaya konulmuştur. Elde edilen bulgular, eğitim veri boyutunun model başarımı üzerinde belirleyici bir etkiye sahip olduğunu, ancak bu etkinin görev türüne, dil yapısına ve veri gürültüsüne bağlı olarak değişkenlik gösterdiğini göstermektedir. Özellikle büyük ölçekli ve yapısal veri setlerinde daha yüksek doğruluk, daha düşük kayıp ve daha küçük genelleme farkı ile erken performans doygunluğu gözlemlenirken, öznel ve gürültülü metinlerden oluşan veri setlerinde model performansındaki iyileşmenin daha sınırlı olduğu belirlenmiştir. Bu sonuçlar, DistilBERT tabanlı modelde veri verimliliğinin yalnızca model mimarisiyle değil, aynı zamanda görev ve veri karakteristiği ile birlikte değerlendirilmesi gerektiğini ortaya koymaktadır.

Anahtar Kelimeler

DistilBERT, Veri boyutu, Metin sınıflandırma, Genelleme kapasitesi, Doğal dil işleme

Kaynakça

  1. Arzu, M., Aydoğan, M. (2023). Türkçe Duygu Sınıflandırma İçin Transformers Tabanlı Mimarilerin Karşılaştırılmalı Analizi. Computer Science, IDAP-2023: International Artificial Intelligence and Data Processing Symposium(IDAP-2023), 1-6. https://doi.org/10.53070/bbd.1350405
  2. Kaplan, J., McCandlish, S., Henighan, T.J., Brown, T.B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., Amodei, D. (2020). Scaling Laws for Neural Language Models. ArXiv, abs/2001.08361.
  3. Hoffmann, J., Borgeaud, S., Mensch, A., Buchatskaya, E., Cai, T., Rutherford, E., Casas, D.D., Hendricks, L.A., Welbl, J., Clark, A., Hennigan, T., Noland, E., Millican, K., Driessche, G.V., Damoc, B., Guy, A., Osindero, S., Simonyan, K., Elsen, E., Rae, J.W., Vinyals, O., Sifre, L. (2022). Training Compute-Optimal Large Language Models. ArXiv, abs/2203.15556. Schwartz, R., Dodge, J., Smith, N., Etzioni, O. (2019). Green AI. 10.48550/arXiv.1907.10597.
  4. Eşidir, K. A. (2025). DistilBERT ve Geleneksel Makine Öğrenmesi Modelleri ile Duygu Analizi: Performans Karşılaştırması. International Journal of Pure and Applied Sciences, 11(2), 444-459. https://doi.org/10.29132/ijpas.1604869
  5. Sanh, V., Debut, L., Chaumond, J., Wolf, T. (2019). DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter. ArXiv, abs/1910.01108.
  6. Tang, R., Lu, Y., Liu, L., Mou, L., Vechtomova, O., Lin, J.J. (2019). Distilling Task-Specific Knowledge from BERT into Simple Neural Networks. ArXiv, abs/1903.12136.
  7. Ünal, M.C., Aygün, B., Gerek, A. (2023). Comparison of Pre-trained Language Models for Turkish Address Parsing. ArXiv, abs/2306.13947.
  8. Micikevicius, P., Narang, S., Alben, J., Diamos, G. F., Elsen, E., García, D., Ginsburg, B., Houston, M., Kuchaiev, O., Venkatesh, G., Wu, H. (2017). Mixed precision training. arXiv preprint arXiv:1710.03740.
  9. Çabuk, M.(2022). https://www.kaggle.com/datasets/mujdatcabuk/eticaret-urun-yorumlari. E.T.: 18.01.2026
  10. Zhang, X., Zhao, J.J., LeCun, Y. (2015). Character-level Convolutional Networks for Text Classification. Neural Information Processing Systems.

Kaynak Göster

APA
Saygılı, H. (2026). DistilBERT Tabanlı Metin Sınıflandırmada Veri Verimliliği: Farklı Veri Boyutlarında Bir Performans Analizi. Karadeniz Fen Bilimleri Dergisi, 16(3), 1341-1361. https://doi.org/10.31466/kfbd.1869329
AMA
1.Saygılı H. DistilBERT Tabanlı Metin Sınıflandırmada Veri Verimliliği: Farklı Veri Boyutlarında Bir Performans Analizi. KFBD. 2026;16(3):1341-1361. doi:10.31466/kfbd.1869329
Chicago
Saygılı, Hülya. 2026. “DistilBERT Tabanlı Metin Sınıflandırmada Veri Verimliliği: Farklı Veri Boyutlarında Bir Performans Analizi”. Karadeniz Fen Bilimleri Dergisi 16 (3): 1341-61. https://doi.org/10.31466/kfbd.1869329.
EndNote
Saygılı H (01 Eylül 2026) DistilBERT Tabanlı Metin Sınıflandırmada Veri Verimliliği: Farklı Veri Boyutlarında Bir Performans Analizi. Karadeniz Fen Bilimleri Dergisi 16 3 1341–1361.
IEEE
[1]H. Saygılı, “DistilBERT Tabanlı Metin Sınıflandırmada Veri Verimliliği: Farklı Veri Boyutlarında Bir Performans Analizi”, KFBD, c. 16, sy 3, ss. 1341–1361, Eyl. 2026, doi: 10.31466/kfbd.1869329.
ISNAD
Saygılı, Hülya. “DistilBERT Tabanlı Metin Sınıflandırmada Veri Verimliliği: Farklı Veri Boyutlarında Bir Performans Analizi”. Karadeniz Fen Bilimleri Dergisi 16/3 (01 Eylül 2026): 1341-1361. https://doi.org/10.31466/kfbd.1869329.
JAMA
1.Saygılı H. DistilBERT Tabanlı Metin Sınıflandırmada Veri Verimliliği: Farklı Veri Boyutlarında Bir Performans Analizi. KFBD. 2026;16:1341–1361.
MLA
Saygılı, Hülya. “DistilBERT Tabanlı Metin Sınıflandırmada Veri Verimliliği: Farklı Veri Boyutlarında Bir Performans Analizi”. Karadeniz Fen Bilimleri Dergisi, c. 16, sy 3, Eylül 2026, ss. 1341-6, doi:10.31466/kfbd.1869329.
Vancouver
1.Hülya Saygılı. DistilBERT Tabanlı Metin Sınıflandırmada Veri Verimliliği: Farklı Veri Boyutlarında Bir Performans Analizi. KFBD. 01 Eylül 2026;16(3):1341-6. doi:10.31466/kfbd.1869329