AI Niyet Analizi İçin Pilot Değerlendirme Nasıl Kurulur?
AI niyet analizi pilotunda birkaç başarılı örnek görmek yeterli değildir. Benzer görünen satış, servis ve şikâyet taleplerinin doğru ayrıldığını temsilî örneklerle değerlendirmek gerekir.
Uygulama adımları
Etiketli örnek kümesi
Gerçek kullanım çeşitliliğini temsil eden, uygun biçimde hazırlanmış mesajlar seçilir. Uzmanlar doğru niyeti belirler; anlaşmazlıklar konuşulur. Yazım hataları, kısa mesajlar ve birden fazla ihtiyaç içeren örnekler dâhil edilir. Değerlendirme örnekleri geliştirme sırasında kullanılanlardan ayrılır.
Hataların maliyeti
Genel doğruluk oranı tek başına yeterli değildir. Şikâyetin satışa gönderilmesi ile satış sorusunun genel kuyruğa düşmesi farklı sonuçlar doğurabilir. Her sınıf için kaçırılan ve yanlış atanan talepler incelenir. Belirsiz durumda insan incelemesine yönlendirme seçeneği bulunur.
Pilot sonrası izleme
Canlı kullanımda yeni ifadeler ve değişen ürünler ortaya çıkar. Kullanıcı düzeltmeleri örnek havuzuna alınır. Model veya kural güncellendiğinde eski kritik örnekler yeniden denenir. Başarı oranı açıklanırken örnek kapsamı ve değerlendirme tarihi belirtilir.
Örnek uygulama
“Aracı almaktan vazgeçtim, ödediğim tutar ne olacak?” mesajı basit satış sorusu gibi işaretlenmemelidir. Pilot bu tür iptal ve iade niyetlerini içerirse yetkili ekibe devir davranışı ölçülebilir.
Çamlıca yaklaşımı
Niyet analizinin değeri, pilotta ölçülen sonucun canlı kullanımda da korunmasıyla ortaya çıkar. Çamlıca 360'ın Yapay Zekâ modülünde müşteri niyet analizi, WhatsApp ve uygun mesaj kanallarında konuyu anlayıp talebi ilgili akışa yönlendirmek için kullanılır. Pilot kapsamı, etiketli örnek kümesi ve kabul ölçütleri kurulumdan önce işletmeyle birlikte belirlenir. Belirsiz mesajlar zorla bir sınıfa atanmak yerine insan incelemesine devredilir. Pilot sonuçları bu kabul ölçütlerine göre raporlanır.
Bu süreç için Yapay Zekâ modülünü inceleyebilirsiniz. Modüllerin birlikte nasıl çalıştığını Çamlıca 360 platformunda görebilir, ihtiyacınızı Çamlıca 360 ekibiyle değerlendirebilirsiniz.
Sık sorulan sorular
Yüzde 95 doğruluk tek başına yeterli mi?
Hayır. Oranın hangi örneklerle ölçüldüğü ve hangi hata türlerini içerdiği bilinmeden sağlıklı bir yorum yapılamaz.
Pilotta kaç mesaj değerlendirilmeli?
Sabit bir sayı yoktur. Örnek kümesi gerçek talep türlerini, kısa ve hatalı yazılmış mesajları ve birden fazla ihtiyaç içeren örnekleri temsil edecek genişlikte olmalıdır.
Değerlendirme örnekleri neden geliştirme örneklerinden ayrılmalı?
Aynı örneklerle hem geliştirme hem ölçüm yapılırsa sonuç olduğundan iyi görünebilir. Ayrı tutulan örnekler, sistemin yeni mesajlardaki davranışını daha gerçekçi gösterir.
Doğru sınıflandırma nasıl ölçülür?
Sistemin atadığı sınıflar, uzmanların aynı talepler için belirlediği etiketlerle karşılaştırılır. Farklı talep türleri ve belirsiz mesajlar örnekleme dâhil edilmelidir.
Hangi hata türleri özellikle izlenmeli?
Şikâyetin satışa gönderilmesi veya iptal talebinin basit bir soru gibi işaretlenmesi gibi sonucu ağır hatalar ayrı izlenmelidir. Her sınıf için kaçırılan ve yanlış atanan talepler incelenir.
Belirsiz mesaj zorla bir sınıfa atanmalı mı?
İnsan incelemesi veya açıklayıcı soru daha uygun olabilir.
Pilot bittikten sonra ölçüm devam etmeli mi?
Evet. Canlı kullanımda yeni ifadeler ve ürünler ortaya çıkar; kullanıcı düzeltmeleri örnek havuzuna alınır, model veya kural güncellemelerinde kritik örnekler yeniden denenir.
