---
type: "Akademik Makale Analizi"
title: "Hukuki Metinlerin Sıfır Örnekli Anlamsal Etiketlenmesinde Büyük Dil Modellerinin Sıra Dışı Etkinliği"
description: "Hukuki metin analitiğinde metinlerin anlamsal etiketlenmesi, yargı kararlarındaki retorik rollerin, sözleşmelerdeki yükümlülüklerin ve mevzuat maddelerindeki amaçların otomatik olarak belirlenmesini sağlar. Geleneksel gözetimli makine öğrenmesi modelleri yüksek hacimli manuel etiketlenmiş veri setle"
resource: "https://makaleanalizi.com/sosyal-bilimler/egitim-bilimleri/hukuki-metinlerin-sifir-ornekli-anlamsal-etiketlenmesinde-buyuk-dil-modellerinin-sira-disi-etkinligi"
doi: "10.3389/frai.2023.1279794"
authors: ["Jaromír Šavelka", "Kevin D. Ashley"]
citation: "Šavelka, J., Ashley, K. D. (2023). The unreasonable effectiveness of large language models in zero-shot semantic annotation of legal texts. Frontiers in Artificial Intelligence, 6, 1279794-1279794. https://doi.org/10.3389/frai.2023.1279794"
publicationType: "quantitative-empirical"
discipline: "Sosyal Bilimler"
subDiscipline: "Eğitim Bilimleri"
evidenceCount: 12
tags: ["hukuki metin analitiği", "büyük dil modelleri (BDM)", "sıfır örnekli sınıflandırma", "anlamsal etiketleme", "metin etiketleme"]
timestamp: "2026-08-22T14:11:01.737Z"
---

# Hukuki Metinlerin Sıfır Örnekli Anlamsal Etiketlenmesinde Büyük Dil Modellerinin Sıra Dışı Etkinliği

Özgün başlık: The unreasonable effectiveness of large language models in zero-shot semantic annotation of legal texts
DOI: https://doi.org/10.3389/frai.2023.1279794
Künye (APA 7): Šavelka, J., Ashley, K. D. (2023). The unreasonable effectiveness of large language models in zero-shot semantic annotation of legal texts. Frontiers in Artificial Intelligence, 6, 1279794-1279794. https://doi.org/10.3389/frai.2023.1279794

Bilim alanı: [Sosyal Bilimler](/okf/sosyal-bilimler/index.md) › Eğitim Bilimleri

# Alan bağlamı

Hukuki metin analitiğinde metinlerin anlamsal etiketlenmesi, yargı kararlarındaki retorik rollerin, sözleşmelerdeki yükümlülüklerin ve mevzuat maddelerindeki amaçların otomatik olarak belirlenmesini sağlar. Geleneksel gözetimli makine öğrenmesi modelleri yüksek hacimli manuel etiketlenmiş veri setlerine ihtiyaç duymakta, bu da yüksek uzmanlık maliyeti yaratmaktadır. Büyük dil modellerinin gelişimi sıfır örnekli öğrenmeyle etiketleme imkânı sunsa da, GPT-4 ve GPT-3.5-turbo gibi modellerin bu konudaki başarım ve maliyet dengesi ampirik doğrulamaya muhtaçtır.

# Akademik özet

Hukuk alanında yapay zeka uygulamaları, özellikle ChatGPT ve benzeri büyük dil modellerinin yaygınlaşmasıyla birlikte ivme kazanmıştır. Hukuk uygulayıcıları ve akademisyenler, belgelere dayalı yüksek hacimli iş akışlarını otomatikleştirmek ve basitleştirmek amacıyla metin taslakları oluşturma, soru yanıtlama ve metin özetleme gibi alanlarda dil modellerinden faydalanmaktadır. Bununla birlikte, hukuki metinlerin anlamsal etiketlenmesi —örneğin bir yargı kararındaki retorik rollerin, sözleşme maddelerindeki hukuki yükümlülüklerin veya mevzuat hükümlerindeki amaçların sınıflandırılması— geleneksel olarak uzman kişilerin manuel olarak etiketlediği veri kümesi eğitimlerine dayandığı için son derece maliyetlidir. Büyük dil modellerinin sıfır örnekli öğrenme yeteneği, önceden etiketlenmiş devasa veri kümelerine ihtiyaç duymadan sadece kısa tanım cümleleriyle etiketleme yapabilme olanağı sunsa da, GPT-4 ve GPT-3.5-turbo gibi yeni nesil modellerin bu özel hukuki görevlerdeki başarısı ve maliyet-performans dengesi ayrıntılı bir ampirik inceleme gerektirmektedir.

Bu çalışmanın temel amacı, OpenAI tarafından geliştirilen GPT-4 ve GPT-3.5-turbo modellerinin hukuki metinlerin sıfır örnekli anlamsal etiketlenmesindeki başarısını değerlendirmek ve önceki nesil text-davinci-003 modeli ile geleneksel makine öğrenmesi yöntemleriyle karşılaştırmaktır. Araştırma kapsamında ABD Gaziler Temyiz Kurulu kararlarından oluşan BVA veri kümesi, ticari sözleşme maddelerini içeren CUAD veri kümesi ve halk sağlığı acil durum mevzuatını kapsayan PHASYS veri kümesi kullanılmıştır. Yöntem olarak, kısa anlamsal kategori tanımları içeren istemler hazırlanmış ve modellerin tekil istem ile toplu istem durumlarındaki sınıflandırma performansları mikro F1, kesinlik ve duyarlılık ölçütleriyle hesaplanmıştır. Geleneksel istatistiksel modellerden rastgele orman ve alan verisiyle ince ayar yapılmış RoBERTa modeli temel karşılaştırma standartları olarak deney tasarımına dahil edilmiştir.

Elde edilen bulgular, GPT-4 modelinin incelenen üç hukuki görevden ikisinde (BVA ve CUAD) önceki nesil modellere kıyasla belirgin şekilde yüksek performans gösterdiğini ortaya koymaktadır. GPT-4 modeli, BVA yargı kararı cümlelerinin retorik rollerini etiketlemede 0,82 ve CUAD sözleşme maddelerini sınıflandırmada 0,90 mikro F1 skoruna ulaşarak, binlerce veriyle eğitilmiş rastgele orman modelinin başarısını yakalamıştır. Düşük maliyetli GPT-3.5-turbo modeli ise kendisinden yirmi kat daha pahalı olan text-davinci-003 modeliyle eşdeğer bir performans sergilemiştir. Öte yandan, karmaşık hukuki ayrışmalar içeren PHASYS mevzuat veri kümesinde tüm modellerin başarısı belirgin biçimde düşmüştür. Ayrıca verilerin istem içinde toplu gruplar halinde gönderilmesinin maliyeti on kattan fazla düşürdüğü, ancak grup boyutu aşırı büyüdüğünde tahmin tutarlılığının bir miktar aşındığı tespit edilmiştir.

Sonuç olarak çalışma, büyük dil modellerinin sıfır örnekli öğrenme düzeninde hukuki metinleri anlamsal etiketlemedeki yüksek etkinliğini kanıtlayarak literatüre önemli katkılar sunmaktadır. Manuel veri seti etiketleme zorunluluğunu ortadan kaldıran bu yaklaşım, karmaşık hukuk iş akışlarına erişimi demokratikleştirme ve analitik maliyetleri radikal biçimde düşürme potansiyeline sahiptir. Yazar, doğrudan uzman insan müdahalesine olan ihtiyacı tamamen kaldırmamakla birlikte, dil modellerinin insan denetimli süreçlerde ilk aşama etiketleyicisi olarak kullanılabileceğini vurgulamaktadır. Gelecek araştırmalarda metin gruplarının sıralaması, kategori tanımlarına örnek eklenmesi ve simetrik olmayan sınıf dağılımlarının dengelenmesi gibi tekniklerin anlamsal başarım üzerindeki etkilerinin incelenmesi önerilmektedir.

# Araştırmanın amacı

Çalışmanın temel amacı, GPT-4 ve GPT-3.5-turbo modellerinin sıfır örnekli anlamsal etiketleme performansını üç farklı hukuki veri kümesi üzerinde değerlendirmek ve önceki nesil modeller ile geleneksel makine öğrenmesi yaklaşımlarıyla karşılaştırmaktır.

# Yöntem ve tasarım

Bu niteliksel ampirik çalışmada, GPT-4 ve GPT-3.5-turbo gibi yeni nesil büyük dil modellerinin üç farklı hukuki metin türü üzerindeki sıfır örnekli anlamsal etiketleme performansı, kural tabanlı ve gözetimli makine öğrenmesi modelleriyle karşılaştırmalı olarak değerlendirilmiştir.

# Bulgular ve önermeler

1. GPT-4 modeli, ABD Gaziler Temyiz Kurulu kararlarındaki retorik rolleri ve CUAD ticari sözleşme maddelerini etiketleme görevlerinde eğitilmiş Random Forest modelinin başarımını yakalamış veya geride bırakmıştır.
2. Sıfır örnekli GPT-4 modeli, binlerce etiketli veriyle eğitilmiş ince ayarlı RoBERTa modelinin performansına yaklaşsa da bu gözetimli modelin ulaştığı F1 puanını tam olarak yakalayamamıştır.
3. Metin verilerinin tek bir istem içinde toplu gruplar halinde sunulması işlem maliyetlerini dramatik şekilde düşürürken, tekil istem kullanımına kıyasla performansta küçük bir düşüşe yol açmaktadır.
4. Modeli aynı anda tek bir veri noktasını tahmin etmeye odaklamak, 50 verilik bir toplu gruba kıyasla etiketleme doğrulunu ve F1 performansını az miktarda artırmaktadır.

# Yazarın tartışması

Elde edilen bulgular, GPT-4 ve GPT-3.5-turbo gibi büyük dil modellerinin sıfır örnekli ortamda kısa metin tanımlarıyla hukuki metinleri yüksek doğrulukla etiketleyebildiğini göstermektedir. Özellikle GPT-4 modeli, Gaziler Temyiz Kurulu kararları ve CUAD sözleşme maddeleri üzerinde geleneksel makine öğrenmesi yaklaşımlarını geride bırakmıştır.

Yazarlar bu durumu, modern transformer mimarilerinin ve geniş ölçekli ön eğitimin sunduğu anlamsal kavrayış yeteneğine bağlamaktadır. Modelin veri kümesine özel etiketli örneklerle eğitilmeden sadece tek cümlelik kategori tanımlarıyla bu seviyede performans göstermesi, yöntemsel açıdan esnek ve düşük maliyetli bir analiz ortamı sağlamaktadır.

Tartışma bölümünde bu sonuçlar, Yu ve arkadaşlarının (2022) hukuki istem mühendisliği çalışmaları ve Hendrycks ve arkadaşlarının (2021) CUAD veri kümesi başarılarıyla ilişkilendirilmektedir. Sıfır örnekli modeller, özel eğitilmiş gözetimli modellerin bir miktar gerisinde kalsa da maliyet ve erişilebilirlik açısından belirgin bir üstünlük sunmaktadır.

Sonuç olarak çalışma, büyük dil modellerinin hukuki veri analizinde insan uzmanların yükünü hafifletme ve araştırma maliyetlerini düşürme potansiyelini ortaya koymaktadır. Bununla birlikte, hata hassasiyeti yüksek hukuki süreçlerde insan denetimli sistemlerin (human-in-the-loop) tercih edilmesi gerektiği ve model sınırlarının dikkate alınması önerilmektedir.

# Yazarın sonucu

Yazarlar, GPT-4 gibi gelişmiş büyük dil modellerinin sıfır örnekli anlamsal etiketleme görevlerinde yüksek başarı göstererek hukuk alanındaki karmaşık metin inceleme iş akışlarının maliyetini önemli ölçüde düşürdüğünü ve uzmanlık gerektiren veri analizi süreçlerini demokratikleştirdiğini sonuçuna varmaktadır. Bununla birlikte, düşük hata toleransı gerektiren pratik uygulamalarda uzman denetiminin sürdürülmesi gerektiği belirtilmektedir.

# Literatürdeki işlevi

Bu çalışma, yapay zeka ve hukuk disiplinlerinin kesişim noktasında, büyük dil modellerinin ince ayar (fine-tuning) yapılmaksızın yalnızca kısa tanım girdileriyle hukuki metinleri etiketleme yeteneğini ampirik olarak ortaya koyan işlevsel bir referans niteliğindedir. Literatürde daha önce ağırlıklı olarak gözetimli makine öğrenmesi ve kural tabanlı sistemlerle yürütülen retorik rol ve sözleşme maddesi sınıflandırma süreçlerinin, sıfır örnekli (zero-shot) istem mühendisliğiyle ne ölçüde gerçekleştirilebileceğini sistematik biçimde belgeler. İnceleme; içtihat kararları, sözleşme maddeleri ve mevzuat hükümleri olmak üzere üç farklı hukuki metin türünü kapsayarak büyük dil modellerinin genel anlamsal kavrayış sınırlarını haritalandırır.

Önceki çalışmalarla ilişkisi: Çalışma, geleneksel gözetimli yöntemlerin yüksek etiketleme maliyetine ve veri bağımlılığına dayanan yapısını sorunsallaştırarak önceki literatürden ayrılır. Walker ve arkadaşlarının (2019) Gaziler Temyiz Kurulu kararları veri seti, Hendrycks ve arkadaşlarının (2021) CUAD sözleşme kümesi ve Sweeney ve arkadaşlarının (2013) PHASYS mevzuat verisi üzerine inşa edilen analiz; bu geleneksel veri setlerini ince ayarlı modeller yerine sıfır örnekli GPT modelleriyle sınar. Yu ve arkadaşlarının (2022) hukuki istem mühendisliği çalışmalarını genişleterek, karmaşık modellerin etiketleme başarısını sadece doğruluk oranlarıyla değil, token bazlı işlem maliyetleri ve veri gruplama (batching) stratejileri bağlamında kıyaslar.

Literatür taramasına katkısı: Literatür taramaları açısından bu yayın, hukuki metin işleme projelerinde veri etiketleme süreçlerinin nasıl daha sürdürülebilir ve verimli kılınabileceğine dair teorik ve pratik bir rehber sunmaktadır. Büyük dil modellerinin tek bir istem içinde birden fazla metin bloğunu işleme kapasitesini ampirik olarak değerlendirerek araştırmacılara doğruluk ve bütçe dengesini kurma noktasında kanıta dayalı bir çerçeve sağlar. Ayrıca gözetimli veri toplama süreçlerinin zorunlu olduğu varsayımını esneterek, başlangıç aşamasındaki hukuki araştırmalarda sıfır örnekli etiketlemenin keşifsel analiz aracı olarak nasıl konumlandırılabileceğini gösterir.

# Tez ve makale araştırmalarında kullanım

- **Büyük dil modelleri, herhangi bir etiketli veri setiyle eğitime ihtiyaç duymadan sıfır örnekli öğrenme ortamında hukuki metinlerin anlamsal etiketlenmesini yüksek doğrulukla gerçekleştirebilmektedir.** — Hukuk teknolojileri ve doğal dil işleme literatüründe gözetimli modellerin getirdiği veri toplama maliyetine alternatif olarak sıfır örnekli yaklaşımların etkinliğini savunmak için kullanılır.
- **Hukuki metinlerin toplu veriler halinde (batching) dil modellerine sunulması, analiz maliyetlerini dramatik olarak düşürürken model başarımında yalnızca küçük değişimlere yol açmaktadır.** — Yapay zeka destekli metin analizi metodolojilerinde bütçe ve işlem verimliliği optimizasyonu sağlayan grup etiketleme tasarımını gerekçelendirmek için aktarılır.
- **GPT-4 gibi gelişmiş modeller sıfır örnekli etiketleme görevlerinde geleneksel makine öğrenmesi yöntemlerini geride bıraksa da, hata toleransının kritik olduğu hukuki süreçlerde uzman denetimi (human-in-the-loop) gerekliliğini korumaktadır.** — Yapay zeka modellerinin hukuki karar destek sistemlerindeki sınırlarını ve uzman insan denetiminin etik ve pratik zorunluluğunu tartışırken referans verilir.

# Türetilebilir araştırma soruları

- **Türkçe mevzuat metinlerinin sıfır örnekli büyük dil modelleriyle madde türlerine göre etiketlenmesinde GPT-4 modelinin başarısı nedir?**
  - Desen: Türk Ticaret Kanununun şirketler hukukuna ilişkin 200 maddesi seçilerek tek cümlelik semantik tanımlar oluşturulur. Örneklem büyüklüğü veri doygunluğu ilkesine göre belirlenir. GPT-4 ve GPT-3.5 modelleriyle sıfır örnekli etiketleme yapılarak hassasiyet ve duyarlılık değerleri hesaplanır.
  - Gerekçe: Makalede PHASYS eyalet mevzuatı üzerinde yapılan sıfır örnekli etiketleme metodolojisinin farklı bir hukuk düzeni ve dildeki mevzuat maddelerine uyarlanması zorunluluğundan türetilmiştir.
- **Sözleşme maddelerinin tek tek veya toplu gruplar halinde büyük dil modellerine sunulması etiketleme doğruluğunu ve işlem maliyetini nasıl etkilemektedir?**
  - Desen: 500 adet Türkçe anonimleştirilmiş ticari sözleşme maddesi materyal olarak kullanılır. İstem gruplama büyüklükleri 1, 10 ve 50 veri noktası olarak ayarlanır. Model doğruluğu F1 puanıyla, maliyet ise token harcamasıyla ölçülerek karşılaştırılır.
  - Gerekçe: Makalenin tartışma bölümünde ele alınan ve veri noktalarının grup halinde işlenmesinin F1 puanı ile maliyet üzerindeki etkilerini gösteren bulgulardan doğrudan türetilmiştir.
- **Hukuk uzmanı denetimli (human-in-the-loop) sıfır örnekli etiketleme süreci, Danıştay kararlarının analizinde etiketleme süresini ve kalitesini nasıl değiştirmektedir?**
  - Desen: Danıştay idari dava dairelerinin 100 kararından elde edilen cümleler materyal kabul edilir. Güç analiziyle belirlenen örneklem grubu ikiye ayrılarak bir grupta tam insan etiketlemesi, diğer grupta GPT-4 ön etiketlemesi üzerine uzman doğrulaması uygulanır. İşlem süreleri ve tutarlılık oranları kıyaslanır.
  - Gerekçe: Makalenin sonuç bölümünde vurgulanan, kritik hukuki süreçlerde uzman denetiminin (human-in-the-loop) sürdürülmesi gerektiği çıkarımından türetilmiştir.

# Kaynak izleri

Her iddia, özgün yayının belirtilen sayfasındaki birebir alıntıya bağlıdır.

| Kanıt | Bölüm | PDF sayfası | Basılı sayfa | Alıntı |
|---|---|---|---|---|
| ev-o-1 | Abstract | 1 | — | Given the transition to mature gene rative AI systems, we examine the performance of GPT-4 and GPT-3.5-turbo(-16k), co mparing it to the previous generation of GPT models, on three |
| ev-o-3 | 1 Introduction | 2 | — | To investigate the capabilities of various state-of-the-art GPT models on semantic annotation of short text snippets from various types of legal documents, we analyzed the followin |
| ev-s-1 | 1 Introduction | 2 | — | Semantic annotation enables conceptually indexing large corpora of legal documents in terms that legal professionals understand and can use to find and review for themselves releva |
| ev-s-2 | 5 Results | 9 | — | The GPT-4 model even matches the performance of the random forest model on the BVA and CUAD tasks. |
| ev-s-3 | 5 Results | 9 | — | It does not match the performance of the fine-tuned RoBERTa model, which is to be expected. |
| ev-s-4 | Abstract | 1 | — | While one can annotate multiple data points within a single prompt, the performance degrades as the size of the batch increases. |
| ev-s-5 | 6 Discussion | 11 | — | First of all, it appears clear that focusing the model on predicting just one single label as opposed to a batch of 50 labels somewhat improves the performance. |
| ev-s-6 | 8 Conclusions | 12 | — | The zero-shot capabilities of these LLMs appear to have potential to democratize access to the sophisticated work that traditionally has been reserved for only a small group of eli |
| ev-s-7 | 2 Related work | 3 | — | Yu et al. ( 2022 ) explored these in the context of the COLIEE entailment task based on the Japanese Bar exam, improving significantly on the then existing state-of-the-art. |
| ev-l-1 | 1 Introduction | 2 | — | Semantic annotation enables conceptually indexing large corpora of legal documents in terms that legal professionals understand and can use to find and review for themselves releva |
| ev-l-2 | 6 Discussion | 9 | — | The results indicate the feasibility of the zero-shot approach in many existing workflows that rely on semantic annotation (e.g., in contract review or case-law analysis). |
| ev-l-3 | 8 Conclusions | 12 | — | We evaluated several OpenAI's GPT models on three semantic annotation tasks using three corpora with diverse types of legal documents—adjudicatory opinions, contractual clauses, an |

# İlgili kavramlar

- [Parçacık Fiziği Öğrenme Kazanımları](/okf/sosyal-bilimler/egitim-bilimleri/parcacik-fizigi-ogrenme-kazanimlari.md)
- [Çin'in Kırsal Bölgelerinde Eğitimde Fırsat Eşitliğinin Geliştirilmesi: Yapay Zeka Cihazlarının Öğretim Kalitesi ve Öğrenme Çıktıları Üzerindeki Sürdürülebilir Kalkınma Etkisi](/okf/sosyal-bilimler/egitim-bilimleri/cinin-kirsal-bolgelerinde-egitimde-firsat-esitliginin-gelistirilmesi-yapay-zeka-cihazlarinin-ogretim-kalitesi-ve-ogrenme-ciktilari-uzerindeki-surdurulebilir-kalkinma-etkisi.md)
- [Tıp Eğitiminde Sanal Simülasyon Deneyleri: Teknoloji Kabulü, Öğrenme Çıktıları ve Motivasyonel Etkiler](/okf/sosyal-bilimler/egitim-bilimleri/tip-egitiminde-sanal-simulasyon-deneyleri-teknoloji-kabulu-ogrenme-ciktilari-ve-motivasyonel-etkiler.md)
- [Kızıldeniz'de Ticari Taşımacılığa Yönelik Husi Saldırılarının Çevresel Etkileri](/okf/sosyal-bilimler/egitim-bilimleri/kizildenizde-ticari-tasimaciliga-yonelik-husi-saldirilarinin-cevresel-etkileri.md)
- [Dönüşümcü Liderliğin Yemen Devlet Okullarında Okul Kültürünü ve Öğretim Performansını Artırmadaki Rolü](/okf/sosyal-bilimler/egitim-bilimleri/donusumcu-liderligin-yemen-devlet-okullarinda-okul-kulturunu-ve-ogretim-performansini-artirmadaki-rolu.md)
- [Sözel Olmayan Zekâ Testi Üçüncü Versiyonunun (TONI-3) Türk Ortaokul Öğrencilerindeki Psikometrik Özellikleri](/okf/sosyal-bilimler/egitim-bilimleri/sozel-olmayan-zek-testi-ucuncu-versiyonunun-toni-3-turk-ortaokul-ogrencilerindeki-psikometrik-ozellikleri.md)
- [Erken Cumhuriyet Döneminde Spor: Bir Devletin İdeolojik Aygıtı Olarak Türk Spor Kurumu Dergisi](/okf/sosyal-bilimler/egitim-bilimleri/erken-cumhuriyet-doneminde-spor-bir-devletin-ideolojik-aygiti-olarak-turk-spor-kurumu-dergisi.md)
- [Türk Eğitim Sisteminde Sekülerleşme](/okf/sosyal-bilimler/egitim-bilimleri/turk-egitim-sisteminde-sekulerlesme.md)

# Şeffaflık

- Analiz tarihi: 2026-08-22T14:11:01.737Z
- Kanıt sayısı: 12
- Üretim sürümü: makale-analizi-v3.0.0
- Kanonik sayfa: https://makaleanalizi.com/sosyal-bilimler/egitim-bilimleri/hukuki-metinlerin-sifir-ornekli-anlamsal-etiketlenmesinde-buyuk-dil-modellerinin-sira-disi-etkinligi
