Her sürümde ölçülen yapay zekâ: kalite, gecikme, maliyet
Yapay zekâ özelliğinizin cevap kalitesini, gecikmesini ve maliyetini her sürümde test vakalarıyla ölçüyor, canlıda da izlemeye devam ediyoruz.

Kimin için
Yapay zekâyı canlıda kullanan, talimatları ya da modeli sonucun kötüleşip kötüleşmediğini bilmeden değiştiren şirketler için.
Neyi çözer
- Bir vaka için düzeltilen talimat başka vakaları bozdu; bunu ilk müşteri fark etti.
- Modelin yeni sürümü çıktı; geçmenin işe yarayıp yaramayacağını kimse bilmiyor.
- Yapay zekâ faturası arttı; hangi özelliğin ya da müşterinin tükettiği bilinmiyor.
- Kalite, arada bir birkaç sohbete göz atılarak, izlenimle değerlendiriliyor.
- Yavaş cevaplar kullanıcıyı vazgeçiriyor, ama cevap süresini ölçen yok.
Ne yapıyoruz
- Test vakaları seti
- Beklenen cevabıyla birlikte gerçek sorular ve görevler; zor vakalar ve reddedilmesi gereken talepler dahil.
- Kalite ölçütleri
- İyi cevabın ne olduğu ekibinizle belirlenir: doğruluk, kaynak, biçim ve üslup.
- Her sürümde değerlendirme
- Model, talimat ya da veri değişikliği, testlerden geçip mevcut sürümle karşılaştırılmadan yayına çıkmaz.
- Örneklemle insan değerlendirmesi
- Cevapların bir kısmını insanlar değerlendirir, çünkü otomatik değerlendirme de yanılır.
- Canlı ortam panosu
- Özellik ve müşteri başına kalite, gecikme, hata ve maliyet; alarmlarıyla birlikte.
- Bütçe ve sınırlar
- Özellik başına harcama tavanı konur; sınıra yaklaşınca alarm gelir, aşılınca kullanım kesilir.
- Önceki sürüme dönüş
- Yeni sürüm canlıda kötü sonuç verirse, yeniden yayın yapmadan ayarla önceki sürüme dönülür.
Neler teslim edilir
- Deponuzda sürümlenen test vakaları seti
- Yayın sürecine bağlı otomatik değerlendirme
- Her sürüm için kalite, gecikme ve maliyet karşılaştırma raporu
- Maliyet, hata ve yavaşlık alarmları olan canlı ortam panosu
- Önceki sürüme dönüş adımları
Nasıl ilerliyoruz
Envanter
Hangi yapay zekâ özellikleri var, hangi modelleri kullanıyor, bugün ne kadara mal oluyor.
Vakalar ve ölçütler
Test vakalarını ve iyi cevabın tanımını ekibinizle birlikte hazırlarız.
Başlangıç ölçümü
Karşılaştırma yapabilmek için mevcut sürüm ölçülür.
Otomasyon
Testler her değişiklikte, yayından önce çalışmaya başlar.
İşletim
Pano, alarmlar ve test vakalarının ekibinizle düzenli olarak gözden geçirilmesi.
Teknoloji örnekleri
- OpenTelemetry
- Prometheus
- Grafana
- Python
- PostgreSQL
İlgili hizmetler
Sık sorulan sorular
Metin kalitesi nesnel olarak ölçülebilir mi?
Kısmen. Biçim, kaynak gösterilip gösterilmediği ve yasak cevaplar kuralla ölçülür; doğruluk ve üslup ise beklenen cevaplarla karşılaştırma ve örneklemle insan değerlendirmesi ister. İkisini birlikte kullanırız.
Başka bir ekibin kurduğu yapay zekâ için de olur mu?
Olur. Model çağrılarına, talimatlara ve gerçek kullanımdan örneklere erişmemiz gerekir. Ölçmeye başlamak için özelliği yeniden yazmak gerekmez.
Tasarruf için modeli değiştirmeye değer mi?
Bazen değer. Test vakalarıyla daha ucuz bir model mevcut olanla karşılaştırılır; karar vermeden önce kaliteden ne kaybedildiği görülür.
Kullanıcıların sohbetleri saklanıyor mu?
Yalnız ölçüm için gereken kadarı; erişim kısıtlıdır, saklama süresini şirketiniz belirler. Kişisel veriler kayıtlara girmeden önce maskelenebilir.
Balkan'a yazın
Projeniz için yazın