Kurucu Notları

Bir AI Agent Kendi Kanıtını Kontrol Ettiğinde: Gerçekten Bağımsız Değerlendirme Nasıl Kurulur?

Bir değerlendirici agent'ın kendi raporuna güvenirse sonucu değil iddiayı doğrulayabilir. Bu rehber uygulama, kanıt toplama ve değerlendirmeyi ayırır.

Tekeralab Editorial··3 dk okuma
Bu içerik yapay zekâ desteğiyle hazırlanmış ve editör tarafından gözden geçirilmiştir.
Uygulama, kanıt toplama ve değerlendirmeyi ayıran bağımsız AI agent değerlendirme mimarisi

Bir AI agent'ın bir web sayfasını düzeltmekle görevlendirildiğini düşünün. İş bittikten sonra aynı agent bir rapor yazıyor ve değişikliğin doğru biçimde tamamlandığını söylüyor. Peki değerlendirme sistemi gerçek sayfayı kontrol etmek yerine bu raporu kanıt olarak kabul ederse ne olur?

Süreç profesyonel görünür: görev tamamlanmıştır, bir rapor vardır ve kalite kapısı yeşildir. Ancak sistem gerçekte kullanıcının gördüğü sonucu değil, yalnızca kendi iddiasını doğrulamıştır.

Buna kanıt kirlenmesi diyebiliriz: kanıt kaynağı uygulayıcıya veya değerlendiriciye bağımlıdır ve bu yüzden test yeterince bağımsız değildir.

Bir AI agent'ı değerlendirmek neden basit bir yanıtı kontrol etmekten farklıdır?

Bir agent genellikle yalnızca metin üretmez. Araç çağırır, dosya değiştirir, kullanıcı arayüzünü kullanır, sistem durumunu değiştirir ve birden çok adımda karar verir. Bu nedenle yalnızca son yanıt, işin gerçekten doğru yapıldığını kanıtlamaz.

Anthropic'in agent değerlendirmelerine ilişkin rehberi, tüm yürütme izinin incelenmesini önerir: çıktılar, araç çağrıları, ara sonuçlar ve ortamdaki değişiklikler birlikte görülmelidir. Rehber ayrıca görevin niteliğine göre deterministik, model tabanlı ve insan değerlendirmelerinin birlikte kullanılmasını vurgular.

OpenAI da trace grading yaklaşımını uçtan uca Workflow değerlendirmesi olarak sunar; çünkü hata son yanıtta değil, ara adımlardan birinde oluşabilir.

Sorun tam olarak nerede başlar?

Savunmasız bir mimari çoğu zaman şu yolu izler:

  1. Agent görevi yerine getirir.
  2. Agent kendi işi hakkında bir rapor yazar.
  3. Değerlendirici aynı raporu okur.
  4. Beklenen birkaç kelimenin, görselin veya durumun bulunması Pass sayılır.

Bu yapıda değerlendirici ürünün doğruluğunu değil, raporun doğru görünüp görünmediğini test ediyor olabilir. Rapor eksik, eski veya gereğinden iyimserse kalite kapısı da aynı hatayı devralır.

Birbirinden ayrılması gereken üç katman

1. Uygulayıcı

Uygulayıcı, değişikliği gerçekleştiren agent veya servistir. Çıktısı kod, dosya, ayar değişikliği ya da bir platformda tamamlanmış bir işlem olabilir.

2. Kanıt toplayıcı

Bu katman kanıtı doğrudan gerçek kaynaktan toplamalıdır: son dosya, API yanıtı, canlı sayfa, veritabanı durumu, güvenilir log veya arayüz ekran görüntüsü. Kanıt yalnızca uygulayıcının açıklamasından türetilmemelidir.

3. Değerlendirici

Değerlendirici, bağımsız kanıtı önceden tanımlanmış ölçütlerle karşılaştırır. Deterministik testler, mekanik kurallar, bir LLM veya insan incelemesi kullanabilir; ancak değerlendirdiği kanıtın ana kaynağı kendisi olmamalıdır.

Bağımsız değerlendirme için uygulanabilir bir model

Her görevi çalıştırmadan önce dört şeyi netleştirin:

  • Gözlemlenebilir sonuç: İş bittiğinde tam olarak ne doğru olmalı?
  • Gerçeğin kaynağı: Yanıtı hangi dosya, API, sayfa veya kayıttan okuyacağız?
  • Değerlendirme yöntemi: Hangi bölüm deterministik testle, hangisi model veya insan kararıyla kontrol edilecek?
  • Durma koşulu: Agent hangi durumda görevi Done olarak işaretlememeli?

Yürütmeden sonra da bu sırayı koruyun:

Execute → Collect independent evidence → Grade → Human review when needed → Accept or return

Örneğin görev bir web sayfasını değiştiriyorsa agent'ın açıklaması nihai kanıt değildir. Sistem gerçek Build'i açmalı, hedef öğeyi bulmalı, davranışını test etmeli ve sonucu kabul kriterleriyle karşılaştırmalıdır.

Bir LLM değerlendirici olabilir mi?

Evet, ancak sınırsız biçimde değil. Bir LLM; açıklık, ton, eksiksizlik veya dar bir Rubric'e uyum gibi açık uçlu nitelikleri değerlendirmede yararlıdır. HTTP durumu, dosya varlığı, alan değeri, test sonucu veya kimlik eşleşmesi gibi kesin gerçekler ise mekanik kurallarla daha iyi kontrol edilir.

Daha güvenli bir model şunları birleştirir:

  • ölçülebilir gerçekler için deterministik test;
  • sınırlandırılmış bir Rubric altında nitel değerlendirme için LLM;
  • yüksek riskli kararlar, herkese açık yayın, harcama veya erişim değişiklikleri için insan.

Kanıt kirlenmesinin beş işareti

Aşağıdakilerden birini görürseniz kanıt kaynağını yeniden kontrol edin:

  1. Görsel çıktı açıkça hatalı olsa bile rapor her zaman Pass olur.
  2. Tek kanıt aynı agent'ın yazdığı yorum veya yanıttadır.
  3. Kanıtta değerlendirilen görev, dosya veya sürüm belli değildir.
  4. Değerlendirici sonucun hangi gerçeğin kaynağından geldiğini açıklayamaz.
  5. Test temiz bir ortamda yeniden çalıştırıldığında farklı sonuç verir.

Ana ders

Bağımsız değerlendirme yalnızca farklı bir model kullanmak anlamına gelmez. İki farklı model aynı kirlenmiş raporu okuyorsa kanıt hâlâ bağımsız değildir. Gerçek bağımsızlık, rollerin ve veri kaynaklarının ayrılmasından doğar.

Güvenilir bir AI agent yalnızca iyi rapor yazan bir sistem değildir; iddiaları bağımsız bir kaynaktan yeniden kontrol edilebilen sistemdir.

Bir sonraki kapıyı yeşile çevirmeden önce kendinize şunu sorun: Ürünü mü kontrol ediyoruz, yoksa yalnızca agent'ın ürün hakkındaki raporunu mu?

Kaynaklar

PaylaşXLinkedInWhatsApp

Soru sor

Bu yazıyla ilgili bir sorun mu var? E-posta adresini bırak, cevap verelim.

Yeni yazı çıkınca haberdar ol

Türkiye pazaryeri ve yapay zekâ üzerine ayda 1–2 e-posta. Spam yok.

İlgili yazılar