Bir sohbet robotu aslında ne yapıyor?
Çok modlu bir dil modeli, bir görseli anlamsal bir tanıma dönüştürür ve ardından bu tanım üzerine metinle muhakeme yapar. "Bu resim, eğitim sırasında hakkında okuduğum yapay zeka görsellerine benziyor mu?" sorusunu yanıtlıyordur.
Bu, içerik ve kompozisyonla ilgili bir sorudur. Tespit ise dokuyla ilgili bir sorudur: komşu piksel değerlerinin birbiriyle nasıl ilişkili olduğu, anlamsal bir tanımın koruduğu her şeyin çok altında bir ölçekte.
Bir dedektörün okuduğu bilgi, dil modeli düşünmeye başlamadan önce atılır. Sohbet robotlarının bu konuda kötü olması değil, kanıtı içermeyen bir temsilden yola çıkmalarıdır.
Bunun pratikteki sonucu nedir?
- Eşik değeri olmayan kendinden emin cevaplar. Bir sohbet robotu, "olası" kelimesinin arkasında hiçbir ölçek olmadan "büyük ihtimalle yapay zeka üretimi" diyecektir. Hiçbir sayı, hiçbir bant ve başka bir görselle karşılaştırılacak hiçbir veri yoktur.
- Eskimiş ipuçlarından yola çıkan muhakeme. Modeller parmakları, dişleri, mumsu cildi ve çarpık metinleri gerekçe gösterir çünkü eğitim metni bunlara bakılmasını söyler. Bunlar yıllar önce düzeltildi.
- Sizin çerçevenizle uyum. Bir görselin sahte olup olmadığını sorun; tarafsız sormanıza kıyasla "evet" cevabını alma olasılığınız daha yüksektir. Bu, görselin değil arayüzün bir özelliğidir.
- Tekrarlanabilirlik yok. İki kez sorun; aynı dosya hakkında her biri için eşit derecede kendinden emin açıklamalara sahip iki farklı cevap alabilirsiniz.
- Bölge bilgisi yok. Size bir fotoğrafın bir köşesinin diğerinden farklı davrandığını söyleyemez; oysa genellikle önemli olan bulgu budur.
| Yetenek | Sohbet robotu | Piksel dedektörü |
|---|---|---|
| Piksel düzeyinde dokuyu okur | No | Yes |
| Yayınlanmış bantlara sahip kalibre edilmiş puan | No | Yes |
| Her seferinde aynı cevap | No | Yes |
| Bölge düzeyinde döküm | No | Yes |
| Kıyaslama noktasına göre ölçülür | No | Yes |
| Muhakemesini düzyazıyla açıklar | Yes akıcı bir şekilde | Partly sinyaller olarak |
| Resmin içinde ne olduğunu tanımlar | Yes | No |
Son iki satır tutmaya değer olanlardır. Bir dil modeli, bir resmi tanımlama ve bir sahnenin mantıklı olup olmadığını muhakeme etme konusunda gerçekten iyidir. Bunlar yararlıdır ancak tespit değildir.
Bir sohbet robotunun gerçekten yararlı olduğu yer
Aracı tamamen göz ardı etmek yanlış bir ders olur. Yapabildiği şeyler için kullanıldığında, bir dedektörün yerini almaktan ziyade onu tamamlar.
-
Ondan sahneyi ayrıntılı bir şekilde tanımlamasını isteyin
Dikkatli bir açıklama, genellikle bir araya gelmemesi gereken nesneler veya okumadığınız tabelalar dahil olmak üzere bilinçli olarak fark etmediğiniz şeyleri ortaya çıkarır.
-
Sahnenin fiziksel olarak tutarlı olup olmadığını sorun
Gölgeler, yansımalar, ölçek ve perspektif muhakeme sorunlarıdır ve model bunun için vardır. Bu, piksel analizinin gözden kaçırabileceği kompozitleri yakalar.
-
Neyin doğrulayacağını veya çürüteceğini sorun
Bir şüpheyi kontrol listesine dönüştürmek, bir dil modelinin iyi bir kullanımıdır ve liste genellikle sizin yazacağınızdan daha iyidir.
-
Ardından gerçek bir dedektör çalıştırın
Piksel sorusu için bunun için oluşturulmuş bir şey kullanın ve skoru yayınlanmış bir ölçeğe göre okuyun.
Akıcılık neden tehlikedir
Emin olmayan bir dedektör orta karar bir sayı döndürür ve sayının kendisi belirsizliği iletir. Emin olmayan bir dil modeli bir paragraf döndürür ve paragrafların hata çubukları yoktur.
Aynı iyi yapılandırılmış açıklama, model gerçek bir şeyi tanımlasa da hiçbir şey hakkında makul görünen bir hesap üretse de görünür. Okuyucular güvenlerini yazının kalitesine göre ayarlarlar ki bu da burada hiçbir bilgi taşımayan sinyaldir.
İşte bu yüzden bir sohbet robotuna sormak, resme kendinizin bakmasından daha kötü bir başlangıç noktasıdır. Kendi belirsizliğiniz en azından sizin için görülebilirdir.
Diğer araçlardaki aynı sorun
Bu aslında tek bir ürünle ilgili değil. Bir resim üzerinde anlamsal olarak muhakeme yapan herhangi bir sistem aynı boşluğa sahiptir ve dedektör olarak sunulan birkaç araç şu anda tam olarak bunu yapmaktadır.
Yararlı bir test: aracın bir fotoğrafın fotoğrafında veya hiç tanınabilir bir öznesi olmayan bir resimde ne bildireceğini sorun. Bir piksel dedektörü, içerikten bağımsız olarak doku var olduğundan her iki durumda da bir skor döndürür. Anlamsal bir sistemin muhakeme edecek hiçbir şeyi yoktur ve ya reddedecek ya da bir şeyler icat edecektir.
İkinci bir test: aynı dosyayı iki kez çalıştırın. Bir piksel modeli deterministiktir ve aynı sayıyı döndürür. Bir dil modeli örnekleme yapar ve iki çalıştırma birbirinden farklı sonuçlar verebilir. Bir araç aynı baytlar için size farklı cevaplar veriyorsa, hiçbir şeyi ölçmüyordur.
Her iki test de aracın nasıl çalıştığını anlamayı gerektirmez. İkisi de bir dakika sürer ve aralarında ölçümü tanımdan, bir pazarlama sayfasını okumaktan daha güvenilir bir şekilde ayırırlar.