Yazı ·

Feature'dan Önce Evals: Agent'ın Kötüleştiğini Nasıl Anlarız

Makul görünen cevap geçen test değildir. Golden set, pairwise inceleme ve hata dilimleri öznel agent kalitesini release kararına çevirir.

Feature'dan Önce Evals: Agent'ın Kötüleştiğini Nasıl Anlarız

Bir prompt değişikliği agent yanıtlarını daha kısa ve sakin yaptı. İnceleme odasında herkes yeni örnekleri tercih etti. Production'da ise aynı değişiklik iade açıklamalarındaki para birimi koşulunu düşürdü. Daha iyi duyuluyor, daha kötü çalışıyordu.

Agent değerlendirmesinin temel zorluğu budur. Birden fazla kabul edilebilir cevap olabilir, fakat yine de kabul edilemez eksikler, aksiyonlar ve iddialar vardır. Tek doğru cümlesi olmayan sistemin test edilebilir davranışı yok değildir.

Yeni feature'dan önce golden set kurun

Golden set, çıktıyı değerlendirmek için gereken kanıt ve beklentilerle birlikte tutulan sabit temsilî input koleksiyonudur. Olağan iş, zor sınırlar ve bilinen hataları kapsamalıdır. Prompt'a rahatça uyan sentetik sorularla doldurmayın. Production trace'leri, destek düzeltmeleri ve reddedilen tool call'lar daha iyi hammaddedir.

Her vaka için önemli olanı kaydedin: kaynak context, izinli tool'lar, zorunlu gerçekler, yasak aksiyonlar ve kabul edilebilir sonuç örneği. Bazı kontroller deterministiktir. Toplam kaynakla eşleşmeli, referans verilen kimlik bulunmalı, onaysız write tool çalışmamalıdır. Diğer kontroller rubric üzerinden insan veya model değerlendirmesi ister.

OpenAI'ın Evals API dokümanı, eval yapısını yeniden kullanılabilir test kriterleri ile veri kaynağının birleşimi olarak tanımlar ve farklı model veya parametrelerle çalıştırılabildiğini belirtir. Dashboard'dan önemli olan yeniden kullanılabilirliktir.

Çıktıları pairwise karşılaştırın

Mutlak puanlama, inceleyenin kafasında sabit bir ölçek kurmasını bekler. Pairwise comparison daha dar bir soru sorar: Aynı input ve kanıt için A mı daha iyi, B mi, yoksa eşit mi? İnceleyenler bu görevde genellikle daha tutarlıdır.

Hangi versiyonun hangi cevabı ürettiğini gizleyin. Sırayı karıştırın. Rubric'i örneklerden önce verin. Yalnızca tona değil gözlenen davranışa bağlanan kısa gerekçe isteyin. Pairwise sonuç yönü gösterirken deterministik kontroller gate olarak kalır. Daha yardımsever cevap, yetkisiz aksiyonu veya uydurulmuş gerçeği telafi edemez.

Model grader'ı hacim için ancak insan kararlarına karşı kalibre ettikten sonra kullanın. Kritik bir iş diliminde sistematik ayrışıyorsa yanlış şeyi ölçüyordur.

Hatayı ortalamada saklamayın

Toplam skor yükselirken önemli workflow gerileyebilir. Sonuçları görev, dil, müşteri tipi, tool yolu, veri kaynağı ve risk sınıfına ayırın. Cevap kaynakta varken yapılan refusal ile kanıt yokken verilen kesin yanıtı ayrı izleyin.

En küçük dilim ticari olarak en önemli olabilir. Nadir iade istisnası, permission sınırı veya aramadaki Almanca compound genel ortalamada kaybolabilir. Release gate, toplam sağlıklı görünse de adı konmuş kritik dilimleri korumalıdır.

Set'i canlı tutun

Golden, sonsuza kadar donmuş demek değildir. Production yeni hata gösterdiğinde vaka ekleyin. Tekrarları çıkarın, fakat mevcut sistemi iyi göstermek için geçmişi yeniden yazmayın. Dataset, rubric, model, prompt, tool ve retrieval konfigürasyonunu birlikte versiyonlayın. Aksi halde sonuç tekrar üretilemez.

Model, prompt, tool tanımı, retrieval ayarı veya response formatı değişmeden önce suite'i çalıştırın. Set içinde olmayan distribution shift için release sonrasında canlı trafikten örnek alın.

Bu hafta release gate kurun

Yakın zamanda düzeltilen cevapları ve başarısız run'ları toplayın. Para kaybettirebilen, güven bozan veya veri değiştiren workflow'ları kapsayan kompakt bir set seçin. Önce deterministik assertion'ları, sonra relevance, completeness ve groundedness için kısa pairwise rubric'i ekleyin.

Mevcut production konfigürasyonunu önerilen versiyonla karşılaştırın. Kritik dilimdeki her regression'ı inceleyin. Bilinen ağır hatalar hâlâ engelleniyor ve tradeoff açıkça kabul ediliyorsa yayınlayın. "İyi görünüyordu" bir ruh halini kaydeder. Eval ise neyin, nerede değiştiğini ve işletmenin bu farkı kabul edip etmediğini gösterir.