Türkçe ceza hukuku metinlerinde suç türü sınıflandırması için klasik, BERT tabanlı ve GPT-5 modelleri
Öz
Arka Plan—Hukuk alanında yapay zekanın hem mevcut kurumlara entegre edilen destekleyici sistemler hem de tamamen yeni nesil hukuk teknolojisi girişimleri şeklinde geliştiği, ancak Türkiye özelinde hukuk teknolojileri alanındaki çalışmaların dünya literatürüne kıyasla oldukça sınırlı olduğu görülmektedir. Bu sınırlılık, Türkçe’nin eklemeli yapısının doğal dil işleme uygulamaları için karmaşık dilbilimsel zorluklar oluşturmasıyla ilişkilendirilmektedir. Suç türü sınıflandırması hem hukuki araştırma süreçlerini hızlandırmak hem de benzer davaların tespitini kolaylaştırmak açısından önemli bir rol oynamaktadır.
Amaç—Bu çalışmanın amacı, açık kaynaklı Türkçe ceza davası karar metinlerini kullanarak klasik makine öğrenmesi, derin öğrenme ve GPT-5 modellerinin Türkçe hukuk terminolojisi üzerindeki performanslarını karşılaştırmalı olarak analiz etmek, otomatik metin sınıflandırması için modellerin potansiyelini değerlendirmektir. Ayrıca analizler sonucunda en yüksek başarımı gösteren modeller kullanılarak gerçek zamanlı bir sınıflandırma sistemi geliştirip sistemin uygulanabilirliği test etmektir.
Yöntem—Web kazıma kullanılarak Ceza Dairesi karar metinlerinden oluşan ve yedi farklı suç türünü içeren bir veri seti oluşturulmuştur. Veri seti oluşturulurken ilk olarak ilgili web sitesinden elde edilen metinler incelenmiş ve yalnızca suç türü bilgisi içeren metinler filtrelenmiştir. Ardından, suç türleri belirlenerek metinler etiketlenmiştir. Anlamsal olarak benzer olan sınıflar birleştirilmiştir. Son aşamada etiketli veri seti temizlenmiş, metinlerin içerisinde yer alan etiket bilgileri çıkarılmış ve çok kısa olan metinler veri setinden kaldırılmıştır. Veri kümesi, farklı yaklaşımlarla değerlendirilmiştir: TFIDF + Naive Bayes, TFIDF + Logistic Regression, TFIDF + SVM, FastText + SVM, FastText + BiLSTM, BERT, RoBERTa, DistilBERT, GPT-5.2 ve GPT-5.4. Model performansları, doğruluk ve F1-skor ölçütleri kullanılarak karşılaştırılmıştır. Elde edilen sonuçlara göre en yüksek doğruluğu sağlayan TFIDF + SVM modeli ile üretken yapay zekâ tabanlı GPT-5.4 modeli, eğitim veri kümesinde yer almayan veriler üzerinde gerçek zamanlı olarak test edilmiştir.
Bulgular—Geleneksel makine öğrenmesi yöntemlerinden TFIDF + SVM, %95.71 F1 skoru ile en yüksek performansı elde etmiştir. Hukuki karar metinlerinin, suç türünü doğrudan belirleyen güçlü anahtar kelimeler içermesi nedeniyle, kelime frekansına odaklanan TFIDF + SVM yapısı, karmaşık anlamsal bağlamlara odaklanan derin öğrenme modellerine kıyasla daha ayırt edici sonuçlar vermiştir. Gerçek zamanlı test aşamasında; eğitilmiş TFIDF + SVM modeli ile az örnekli öğrenme yaklaşımı kullanılan GPT-5.4 modeli karşılaştırılmıştır. Her iki yöntem de eğitim veri kümesinde yer almayan örnek vakalar üzerinde %85.71 doğruluk oranı sağlayarak birbirine yakın bir performans potansiyeli sergilemiştir. Ancak TFIDF + SVM milisaniyeler içinde yanıt üretirken, GPT-5.4’ün yanıt süresinin daha uzun olması ve API maliyetleri, gerçek zamanlı büyük ölçekli uygulamalar açısından önemli farklılık olarak öne çıkmıştır.
Sonuç—Yapay öğrenme modelleri kullanılarak yapılan sınıflandırmalarda TFIDF + SVM yönteminin Türk dava karar metinlerindeki suç türlerini sınıflandırmada etkili olduğu gözlemlenmiştir. Bu yöntem, yapay zekâ destekli hukuk sistemlerinde karar destek mekanizmalarına entegre edilebilir. Gelecekteki çalışmalar, Türk hukuk dava metinlerini kullanarak daha büyük veri setleri üzerinden daha geniş suç türlerini kapsayan sınıflandırma yaklaşımları araştırılabilir.
Anahtar Kelimeler
Kaynakça
- R. Susskind, Tomorrow’s lawyers: An introduction to your future, 3rd Edition, Oxford, United Kingdom, Oxford University Press, 2023.
- K. D. Ashley, Artificial intelligence and legal analytics: new tools for law practice in the digital age, Cambridge, United Kingdom, Cambridge University Press, 2017.
- I. Chalkidis, M. Fergadiotis, P. Malakasiotis, N. Aletras, I. Androutsopoulos, "LEGAL-BERT: The Muppets straight out of Law School", Findings of the Association for Computational Linguistics: EMNLP, 2898-2904, 2020. https://doi.org/10.18653/v1/2020.findings-emnlp.261.
- Harvey, “Harvey | Generative AI for Professional Services”, https://www.harvey.ai/ (20.12.2025).
- LexisNexis, “Lexis+AI”, https://www.lexisnexis.com/en-int/ products/lexis-plus-ai (20.12.2025).
- Thomson Reuters, “Westlaw Edge”, https://legal.thomsonreuters. com/en/products/westlaw-edge (20.12.2025).
- DoNotPay, “DoNotPay - Your AI Consumer Champion”, https://donotpay.com/ (20.12.2025).
- ROSS Intelligence, “ROSS Intelligence - Legal Tech Corner”, https://blog.rossintelligence.com/ (20.12.2025).
Ayrıntılar
Birincil Dil
Türkçe
Konular
Doğal Dil İşleme
Bölüm
Araştırma Makalesi
Yazarlar
Eda Çetin
0009-0003-5434-9478
Türkiye
İlayda Kaya
0009-0003-0932-4116
Türkiye
Furkan Göz
*
0000-0002-6726-3679
Türkiye
Erken Görünüm Tarihi
25 Nisan 2026
Yayımlanma Tarihi
-
Gönderilme Tarihi
21 Ocak 2026
Kabul Tarihi
31 Mart 2026
Yayımlandığı Sayı
Yıl 2026 Sayı: Advanced Online Publication