📡 AI Observability
AI Observability: AI observability, tek seferlik bir check-up değil, bir hastanenin vital signs monitörüdür — ve mekanizma gevşek değil, birebir örtüşür: bir check-up bir sorunu
AI observability, tek seferlik bir check-up değil, bir hastanenin vital signs monitörüdür — ve mekanizma gevşek değil, birebir örtüşür: bir check-up bir sorunu O ANDA, odada yakalar, oysa bir vital signs monitörü sürekli izler ve bir kriz çıplak gözle görünür hale gelmeden ÖNCE uyarır. Üzerinde durmaya değer soru şu: bu özellik yayınlandığı gün yeşil onaylı bir eval setin zaten vardı — bu neden yeterli değil? Sonrasında izlemeye devam etmene neden ihtiyaç var? Çünkü bir eval koşumu tam olarak o check-up gibi bir anlık görüntüdür ve birinci gündeki geçen bir anlık görüntü, beşinci gün ilgisiz bir deploy sırasında sessizce düşürülen bir retrieval ayarı hakkında hiçbir şey söylemez — "Üretimde AI" sekmesindeki evals, onları ÇALIŞTIRDIĞINDA regresyonları yakalar, ama onları yayın gününde bir kez çalıştırmak sadece sistemin o tek anda sağlıklı olduğunu kanıtlar, sağlıklı KALDIĞINI değil. Java karşılaştırması: bu, CI zamanında bir kez çalışan bir unit test suite'i ile çalışan bir servisi sürekli izleyen bir APM aracı (Datadog, New Relic) arasındaki tam farktır — deploy öncesi yeşil testler, saatler veya günler sonra production'da ortaya çıkan yavaş bir memory leak veya bozulan bir bağımlılık hakkında hiçbir şey söylemez, ve sessizce düşürülmüş bir retrieval top_k'sı bu memory leak'in AI-pipeline karşılığıdır. QA açısından önemi: bir hafta boyunca %3'ten %11'e sessizce süren bir halüsinasyon oranı, uygulamaya göz atan hiç kimse için görünmezdir, çünkü her bir yanıt hâlâ akıcı ve kendinden emin görünür — observability, bu spesifik kayma türünü bir destek-tiketi selinden veya gerçek bir olaydan ÖNCE yakalayan tek mekanizmadır; bu tam olarak aşağıdaki dashboard'da inceleyeceğin spike'tır.
Bir Dashboard Gerçekte Neyi İzler
Gerçek bir AI observability kurulumu üç ayrı sinyal türünü izler ve her biri farklı bir soruya cevap verir. Halüsinasyon oranı (ya da sürekli çalışan bir eval örnekleminden grounding/faithfulness puanı) "kalite zamanla mı bozuluyor?" sorusuna cevap verir — Yargıç Oyun Alanı ve RAG Lab'daki aynı rubrik-tabanlı puanlama, sadece bir kez offline değil, production'da tekrar tekrar çalıştırılıyor. Latency ve token-maliyeti dağılımı "çıktı hâlâ iyi görünse bile bir değişiklik çağrıları daha yavaş veya daha pahalı yaptı mı?" sorusuna cevap verir — doğruluktan tamamen ayrı bir eksen. Trace seviyesinde detay — TEK bir spesifik çağrının tam retrieval adımı, promptu ve token dökümü — toplu bir sayının asla cevaplayamayacağı soruyu cevaplar: "bir şey değişti" değil, "pipeline'ın hangi aşaması değişti ve neden".
Aşağıda, halüsinasyon-oranı trendi son günde eşiğini aşıyor — toplu metrik bir şeyin yanlış olduğunu söylüyor, ama neyin olduğunu söylemiyor. "Spike'ı İncele"ye bas ve trace'i sırayla tek tek incele: prompt, token sayısı, retrieval, model versiyonu, latency. Beşinden dördü "normal görünüyor" diyecek — tam olarak "Deterministik vs Stokastik" sekmesinin akıcı-ama-yanlış cevaplarının tuzağı, ama burada iyi görünen bir cevap değil bir metrik. Sadece her aşamayı tek tek kontrol etmek, sessizce regresyona uğrayan tek aşamayı izole eder.
🎬 Bir Dashboard Gerçekte Neyi İzler?
Latency (yanıt süresi)
Production'da HER AI isteği bir dashboard'a bir kayıt olarak düşer — tek bir isteği görmek yeterli değildir, TREND önemlidir.
Latency izlenir: normalde 800ms süren bir yanıt aniden 4 saniyeye çıkarsa, bu bir uyarı sinyalidir.
Token kullanımı izlenir: bir kullanıcı grubu aniden 10 kat fazla token tüketmeye başlarsa, ya kötüye kullanım ya da bir bug vardır.
Çıktı kalite skoru izlenir: otomatik bir eval, her yanıtı puanlar — ortalama skor zamanla düşerse, bu MODEL GÜNCELLEMESİ veya prompt bozulması olabilir.
Final — bu üç metrik birlikte bir ANOMALİ ALARMI tetikler. Dashboard, "çalışıyor mu" sorusuna değil, "NE KADAR İYİ ve NE KADAR PAHALI çalışıyor" sorusuna cevap verir.
Adım Adım: Bir Anomaliyi Trace'te İzole Etmek
Aggregate metrik bir sorun sinyali verir
Halüsinasyon oranı dashboard'da yükseliyor — ama SADECE "bir şey bozuldu" der, NE bozulduğunu söylemez.