Temmuz 2026 · Hukuk operasyonları

Canlı bir yapay zeka iş akışını değerlendirmek: değişiklik kapısı

Ne komut değişti ne tedarikçi; yine de sözleşme inceleme adımı, aylardır yakaladığı hükmü bir anda kaçırmaya başladı, çünkü aynı ürün adının arkasındaki model yerinden oynamıştı. Pilot ölçümü bir kez alınıp dosyalandığı için bunu size hiçbir zaman göstermez; her değişiklikte yeniden çalışan bir değişiklik kapısı gösterir.

Model, prompt ve bağlantı değişikliklerinden sonra yayın kapısından geçen canlı yapay zeka iş akışı.

Bu sitede Temmuz 2026’da yayımlanan Hukuki iş akışı otomasyonu pilotlarını ölçmek tek bir soruyu bir kez yanıtlıyor: bu iş işe yaradı mı. Mevcut durumun ölçümü, her hata sınıfı için ayrı tolerans, baştan yazılmış bir durdur ya da ölçekle eşiği. O yazı da işin devreye alındığı yerde duruyor; asıl zor kısım tam orada başlıyor, çünkü fiilen çalışan bir iş akışı birkaç haftada bir bambaşka bir soru sorar: bu hâlâ onayladığımız iş akışı mı. Aradaki boşluğa da kimsenin duyurmadığı model sürümleri, komut düzenlemeleri, bilgi getirme kaynağı güncellemeleri ve entegrasyon yükseltmeleri doluşuyor.

Altınızdaki zemin kendi kendine kayıyor ve bunu ölçen de olmuş. Lingjiao Chen, Matei Zaharia ve James Zou, GPT-4’ün Mart 2023 ve Haziran 2023 sürümlerini karşılaştırdığında, asal sayıyı bileşik sayıdan ayırmak gibi dar bir işte doğruluğun yüzde 84’ten yüzde 51’e indiğini gördü. Hizmetin adı ise hiç değişmedi.

Tam da bu yüzden kapıyı iş akışına değil, değişikliğe kurmak gerekiyor. Kendi dosyalarınızdan bir altın set (değerlendirme seti) çıkarın, doğru yanıtı o işi zaten yapacak olan hukukçu kaydetsin ve küçük başlayın: Andrew Ng haklı, zamanla büyüyen beş örnek hiç devreye giremeyen eksiksiz bir setten iyidir. Seti her model, komut, bilgi getirme ya da entegrasyon değişikliğinde çalıştırın ve ona durdurma yetkisi tanıyın; pilotta tanımladığınız kritik hata sınıfında en ufak bir kayma varsa değişiklik yayına çıkmaz. Devreye aldıktan sonra örneklem almayı da sürdürün, çünkü kapı yalnızca birinin sete koyduğu durumları görebiliyor. Adı belli tek bir avukat, sabit sayıda canlı çıktı, her hafta.

İtiraz geleceğini bildiğim iki görüş var, ikisinin de arkasındayım. Bir set üç aydır yüzde 100 geçiyorsa, ben artık iş akışının güvenli olduğunu değil setin bayatladığını düşünürüm; örneklemin bulduğu hataları o sete ekleyin. İkincisi tedarikçilerle ilgili: kendi değerlendirmeleri kapının işini görmüyor. Ticari hukuki araştırma araçları üzerine yapılan ilk ön kayıtlı çalışma, o dönemde piyasada olan LexisNexis ve Thomson Reuters araçlarının yüzde 17 ile yüzde 33 arasında halüsinasyon ürettiğini buldu; sağlayıcıların iddialarını da abartılı buldu (Magesh, Surani, Dahl, Suzgun, Manning ve Ho, Journal of Empirical Legal Studies, 2025).

Bunların hiçbiri yeni bir mühendislik buluşu değil. Gönüllü NIST Yapay Zeka Risk Yönetimi Çerçevesi, değişiklik yönetimini zaten devreye alma sonrası izleme başlığının, MANAGE 4.1’in içine koymuş durumda. Hukuk ekiplerinde eksik olan kavram değil. Bir model değişikliğini kimin onayladığını sorun; gördüğüm kadarıyla önce kısa bir sessizlik olur, sonra da aslında kimsenin işi olmadığı anlaşılan bir isim çıkar. Boşluk tam olarak burada: değişikliğin imzasını beklediği bir kişi ve o değişikliği geçiren setin sürüm numarası.

Kaynaklar

Sonraki yazı: Şirket içi hukuk ekipleri için yapay zeka yönetişimi: beş asgari kontrol →