Türkçe Hukuk Derleminde Dil Modellemesi Üzerine Özgün Bir Doğal Dil İşleme Yaklaşımı: Yinelemeli Sinir Ağları Kullanılarak Alana Ait Sınıflandırma (AAS) ile Model Başarımının İyileştirilmesi
An Original Natural Language Processing Approach to Language Modeling in the Turkish Legal Corpus: Improving Model Performance with Domain Classification by Using Recurrent Neural Networks
Türkiye'de hukuk alanına özel, sıfırdan eğitilmiş ilk küçük dil modeli.
Yazarlar: C. Erdoğanyılmaz · B. Mengünoğul
Özet
Çalışma, hukuk gibi kendine özgü terminolojisi olan bir alanda dil modeli başarımını artırmak için “Alana Ait Sınıflandırma” (AAS) yöntemini önerir: genel bir hukuk derlemi yerine, hukuk disiplinlerine göre bölünmüş alt derlemlerle eğitilen alan modellerinin daha başarılı olacağı hipotezi deneysel olarak sınanır. Bu hipotezi test etmek için ticaret, iş, medeni usul ve anayasa hukuku alanlarında dört ayrı karakter tabanlı GRU dil modeli sıfırdan eğitilmiş; kullanıcı girdisinin hangi hukuk dalına ait olduğunu tespit edip ilgili dil modelini çağıran ayrı bir sınıflandırıcı RNN ile hibrit bir doğal dil üreteci sistemi kurulmuştur.
Bulgular
- AAS yöntemiyle eğitilen alan modelleri, genel modele kıyasla test doğruluğunda %6,9–%13,6 arasında artış sağladı; çapraz entropi kaybında da tüm alan modelleri genel modelin altında seyretti.
- YÖK Tez Merkezi'nden derlenen 100 hukuk doktora tezinden oluşan 577.748 cümlelik derlem, 28 hukuk kategorisinde sınıflandırılarak eğitimde kullanıldı.
- Hukuki Metin Sınıflandırıcı, beş kategoride 0,81 makro F1 skoruna ulaştı; en yüksek başarım ticaret hukuku (F1 = 0,86) ve anayasa hukuku (F1 = 0,82) alanlarında elde edildi.
- Düşük donanımlı cihazlarda dahi eğitilebilen hafif mimari; dilekçe, karar ve iddianame yazımı gibi hukuki metin üretimi senaryoları için bir temel oluşturdu.
Yöntem ayrıntıları
Dil modellerinde Kapılı Tekrarlayan Hücre (GRU) mimarisi tercih edilmiştir (4 katmanlı GRU, katman başına 512 birim, 256 karakterlik sekanslar, Log-Softmax aktivasyonu, Adam iyileştirici). Karakter tabanlı temsil, Türkçe gibi biçimsel yapısı zengin ve eklemeli dillerdeki başarımı nedeniyle seçilmiştir. Değerlendirmede doğruluk ve çapraz entropi kaybının yanı sıra logaritmik çapraşıklık (log-perplexity) hesaplanmıştır. Sınıflandırıcı, kelime tabanlı, 3 katmanlı bir GRU'dur (30.000 kelimelik sözcük dağarcığı, 50 boyutlu gömme katmanı) ve girdileri beş hukuk kategorisine ayırır.