Hukuk alanında yapay zeka uygulamaları, özellikle ChatGPT ve benzeri büyük dil modellerinin yaygınlaşmasıyla birlikte ivme kazanmıştır. Hukuk uygulayıcıları ve akademisyenler, belgelere dayalı yüksek hacimli iş akışlarını otomatikleştirmek ve basitleştirmek amacıyla metin taslakları oluşturma, soru yanıtlama ve metin özetleme gibi alanlarda dil modellerinden faydalanmaktadır. Bununla birlikte, hukuki metinlerin anlamsal etiketlenmesi —örneğin bir yargı kararındaki retorik rollerin, sözleşme maddelerindeki hukuki yükümlülüklerin veya mevzuat hükümlerindeki amaçların sınıflandırılması— geleneksel olarak uzman kişilerin manuel olarak etiketlediği veri kümesi eğitimlerine dayandığı için son derece maliyetlidir. Büyük dil modellerinin sıfır örnekli öğrenme yeteneği, önceden etiketlenmiş devasa veri kümelerine ihtiyaç duymadan sadece kısa tanım cümleleriyle etiketleme yapabilme olanağı sunsa da, GPT-4 ve GPT-3.5-turbo gibi yeni nesil modellerin bu özel hukuki görevlerdeki başarısı ve maliyet-performans dengesi ayrıntılı bir ampirik inceleme gerektirmektedir.
Bu çalışmanın temel amacı, OpenAI tarafından geliştirilen GPT-4 ve GPT-3.5-turbo modellerinin hukuki metinlerin sıfır örnekli anlamsal etiketlenmesindeki başarısını değerlendirmek ve önceki nesil text-davinci-003 modeli ile geleneksel makine öğrenmesi yöntemleriyle karşılaştırmaktır. Araştırma kapsamında ABD Gaziler Temyiz Kurulu kararlarından oluşan BVA veri kümesi, ticari sözleşme maddelerini içeren CUAD veri kümesi ve halk sağlığı acil durum mevzuatını kapsayan PHASYS veri kümesi kullanılmıştır. Yöntem olarak, kısa anlamsal kategori tanımları içeren istemler hazırlanmış ve modellerin tekil istem ile toplu istem durumlarındaki sınıflandırma performansları mikro F1, kesinlik ve duyarlılık ölçütleriyle hesaplanmıştır. Geleneksel istatistiksel modellerden rastgele orman ve alan verisiyle ince ayar yapılmış RoBERTa modeli temel karşılaştırma standartları olarak deney tasarımına dahil edilmiştir.
Elde edilen bulgular, GPT-4 modelinin incelenen üç hukuki görevden ikisinde (BVA ve CUAD) önceki nesil modellere kıyasla belirgin şekilde yüksek performans gösterdiğini ortaya koymaktadır. GPT-4 modeli, BVA yargı kararı cümlelerinin retorik rollerini etiketlemede 0,82 ve CUAD sözleşme maddelerini sınıflandırmada 0,90 mikro F1 skoruna ulaşarak, binlerce veriyle eğitilmiş rastgele orman modelinin başarısını yakalamıştır. Düşük maliyetli GPT-3.5-turbo modeli ise kendisinden yirmi kat daha pahalı olan text-davinci-003 modeliyle eşdeğer bir performans sergilemiştir. Öte yandan, karmaşık hukuki ayrışmalar içeren PHASYS mevzuat veri kümesinde tüm modellerin başarısı belirgin biçimde düşmüştür. Ayrıca verilerin istem içinde toplu gruplar halinde gönderilmesinin maliyeti on kattan fazla düşürdüğü, ancak grup boyutu aşırı büyüdüğünde tahmin tutarlılığının bir miktar aşındığı tespit edilmiştir.
Sonuç olarak çalışma, büyük dil modellerinin sıfır örnekli öğrenme düzeninde hukuki metinleri anlamsal etiketlemedeki yüksek etkinliğini kanıtlayarak literatüre önemli katkılar sunmaktadır. Manuel veri seti etiketleme zorunluluğunu ortadan kaldıran bu yaklaşım, karmaşık hukuk iş akışlarına erişimi demokratikleştirme ve analitik maliyetleri radikal biçimde düşürme potansiyeline sahiptir. Yazar, doğrudan uzman insan müdahalesine olan ihtiyacı tamamen kaldırmamakla birlikte, dil modellerinin insan denetimli süreçlerde ilk aşama etiketleyicisi olarak kullanılabileceğini vurgulamaktadır. Gelecek araştırmalarda metin gruplarının sıralaması, kategori tanımlarına örnek eklenmesi ve simetrik olmayan sınıf dağılımlarının dengelenmesi gibi tekniklerin anlamsal başarım üzerindeki etkilerinin incelenmesi önerilmektedir.
Kuramsal ve kavramsal çerçeve
Çalışma, doğal dil işleme alanındaki transformatör mimarisi ile üretken önceden eğitilmiş dönüştürücülerin sıfır örnekli öğrenme yeteneklerine dayanmaktadır. Ayrıca hukuki bilgi çıkarımı ve etiketleme süreçlerinde insan denetimli makine öğrenmesinden kural/tanım odaklı istem mühendisliği yaklaşımına geçiş teorik altyapıyı oluşturmaktadır.
Makalenin ele aldığı literatür
Makale, hukuki metin işlemede kural tabanlı ve gözetimli makine öğrenmesi yöntemlerini inceleyen Walker vd., Chalkidis vd. ve Savelka vd. çalışmalarını ele almaktadır. Ayrıca GPT modellerinin baro sınavları ve hukuki akıl yürütme üzerindeki başarılarını inceleyen Katz vd., Yu vd. ve Bommarito vd. literatürüyle ilişki kurulmaktadır.