Bir AI Agent Kendi Kanıtını Kontrol Ettiğinde: Gerçekten Bağımsız Değerlendirme Nasıl Kurulur?
Bir değerlendirici agent'ın kendi raporuna güvenirse sonucu değil iddiayı doğrulayabilir. Bu rehber uygulama, kanıt toplama ve değerlendirmeyi ayırır.

Bir AI agent'ın bir web sayfasını düzeltmekle görevlendirildiğini düşünün. İş bittikten sonra aynı agent bir rapor yazıyor ve değişikliğin doğru biçimde tamamlandığını söylüyor. Peki değerlendirme sistemi gerçek sayfayı kontrol etmek yerine bu raporu kanıt olarak kabul ederse ne olur?
Süreç profesyonel görünür: görev tamamlanmıştır, bir rapor vardır ve kalite kapısı yeşildir. Ancak sistem gerçekte kullanıcının gördüğü sonucu değil, yalnızca kendi iddiasını doğrulamıştır.
Buna kanıt kirlenmesi diyebiliriz: kanıt kaynağı uygulayıcıya veya değerlendiriciye bağımlıdır ve bu yüzden test yeterince bağımsız değildir.
Bir AI agent'ı değerlendirmek neden basit bir yanıtı kontrol etmekten farklıdır?
Bir agent genellikle yalnızca metin üretmez. Araç çağırır, dosya değiştirir, kullanıcı arayüzünü kullanır, sistem durumunu değiştirir ve birden çok adımda karar verir. Bu nedenle yalnızca son yanıt, işin gerçekten doğru yapıldığını kanıtlamaz.
Anthropic'in agent değerlendirmelerine ilişkin rehberi, tüm yürütme izinin incelenmesini önerir: çıktılar, araç çağrıları, ara sonuçlar ve ortamdaki değişiklikler birlikte görülmelidir. Rehber ayrıca görevin niteliğine göre deterministik, model tabanlı ve insan değerlendirmelerinin birlikte kullanılmasını vurgular.
OpenAI da trace grading yaklaşımını uçtan uca Workflow değerlendirmesi olarak sunar; çünkü hata son yanıtta değil, ara adımlardan birinde oluşabilir.
Sorun tam olarak nerede başlar?
Savunmasız bir mimari çoğu zaman şu yolu izler:
- Agent görevi yerine getirir.
- Agent kendi işi hakkında bir rapor yazar.
- Değerlendirici aynı raporu okur.
- Beklenen birkaç kelimenin, görselin veya durumun bulunması Pass sayılır.
Bu yapıda değerlendirici ürünün doğruluğunu değil, raporun doğru görünüp görünmediğini test ediyor olabilir. Rapor eksik, eski veya gereğinden iyimserse kalite kapısı da aynı hatayı devralır.
Birbirinden ayrılması gereken üç katman
1. Uygulayıcı
Uygulayıcı, değişikliği gerçekleştiren agent veya servistir. Çıktısı kod, dosya, ayar değişikliği ya da bir platformda tamamlanmış bir işlem olabilir.
2. Kanıt toplayıcı
Bu katman kanıtı doğrudan gerçek kaynaktan toplamalıdır: son dosya, API yanıtı, canlı sayfa, veritabanı durumu, güvenilir log veya arayüz ekran görüntüsü. Kanıt yalnızca uygulayıcının açıklamasından türetilmemelidir.
3. Değerlendirici
Değerlendirici, bağımsız kanıtı önceden tanımlanmış ölçütlerle karşılaştırır. Deterministik testler, mekanik kurallar, bir LLM veya insan incelemesi kullanabilir; ancak değerlendirdiği kanıtın ana kaynağı kendisi olmamalıdır.
Bağımsız değerlendirme için uygulanabilir bir model
Her görevi çalıştırmadan önce dört şeyi netleştirin:
- Gözlemlenebilir sonuç: İş bittiğinde tam olarak ne doğru olmalı?
- Gerçeğin kaynağı: Yanıtı hangi dosya, API, sayfa veya kayıttan okuyacağız?
- Değerlendirme yöntemi: Hangi bölüm deterministik testle, hangisi model veya insan kararıyla kontrol edilecek?
- Durma koşulu: Agent hangi durumda görevi Done olarak işaretlememeli?
Yürütmeden sonra da bu sırayı koruyun:
Execute → Collect independent evidence → Grade → Human review when needed → Accept or return
Örneğin görev bir web sayfasını değiştiriyorsa agent'ın açıklaması nihai kanıt değildir. Sistem gerçek Build'i açmalı, hedef öğeyi bulmalı, davranışını test etmeli ve sonucu kabul kriterleriyle karşılaştırmalıdır.
Bir LLM değerlendirici olabilir mi?
Evet, ancak sınırsız biçimde değil. Bir LLM; açıklık, ton, eksiksizlik veya dar bir Rubric'e uyum gibi açık uçlu nitelikleri değerlendirmede yararlıdır. HTTP durumu, dosya varlığı, alan değeri, test sonucu veya kimlik eşleşmesi gibi kesin gerçekler ise mekanik kurallarla daha iyi kontrol edilir.
Daha güvenli bir model şunları birleştirir:
- ölçülebilir gerçekler için deterministik test;
- sınırlandırılmış bir Rubric altında nitel değerlendirme için LLM;
- yüksek riskli kararlar, herkese açık yayın, harcama veya erişim değişiklikleri için insan.
Kanıt kirlenmesinin beş işareti
Aşağıdakilerden birini görürseniz kanıt kaynağını yeniden kontrol edin:
- Görsel çıktı açıkça hatalı olsa bile rapor her zaman Pass olur.
- Tek kanıt aynı agent'ın yazdığı yorum veya yanıttadır.
- Kanıtta değerlendirilen görev, dosya veya sürüm belli değildir.
- Değerlendirici sonucun hangi gerçeğin kaynağından geldiğini açıklayamaz.
- Test temiz bir ortamda yeniden çalıştırıldığında farklı sonuç verir.
Ana ders
Bağımsız değerlendirme yalnızca farklı bir model kullanmak anlamına gelmez. İki farklı model aynı kirlenmiş raporu okuyorsa kanıt hâlâ bağımsız değildir. Gerçek bağımsızlık, rollerin ve veri kaynaklarının ayrılmasından doğar.
Güvenilir bir AI agent yalnızca iyi rapor yazan bir sistem değildir; iddiaları bağımsız bir kaynaktan yeniden kontrol edilebilen sistemdir.
Bir sonraki kapıyı yeşile çevirmeden önce kendinize şunu sorun: Ürünü mü kontrol ediyoruz, yoksa yalnızca agent'ın ürün hakkındaki raporunu mu?
Kaynaklar
Soru sor
Bu yazıyla ilgili bir sorun mu var? E-posta adresini bırak, cevap verelim.
Yeni yazı çıkınca haberdar ol
Türkiye pazaryeri ve yapay zekâ üzerine ayda 1–2 e-posta. Spam yok.
İlgili yazılar

Test Verisini Silmeyin—Gerçek Gelirden Ayırın
Test verisini gizlemek hataları görünmez yapar; KPI’larda saymak kararları bozar. Çözüm, görünürlüğü gerçek gelir sayımından ayırmaktır.

Gelir Hunisinin Görünmez Aşaması: Ödemeler Nerede Kaybolur?
Ödeme niyeti ile kesinleşmiş gelir arasında müşteri görünmez hale gelebilir. Açık durumlar, sorumlular ve bir sonraki adımlar bu kaybı önler.

Bir Müşteri Geri Döndü ve Biz Kaçırdık: Analitik Neden Bir Uyarı Döngüsüne İhtiyaç Duyar?
GA4, Search Console ve Clarity vardı; yine de önemli bir geri dönüşü geç fark ettik. Ders basitti: veriyi toplamak, onu zamanında insan dikkatine dönüştürmekle aynı şey değildir.