Perkara yang sebenarnya dilakukan oleh bot sembang
Model bahasa multimodal menukar imej kepada huraian semantik dan kemudian membuat pertimbangan mengenai huraian tersebut dalam bentuk teks. Ia menjawab soalan adakah gambar ini kelihatan seperti imej AI yang saya baca semasa latihan.
Itu ialah soalan tentang kandungan dan komposisi. Pengesanan ialah soalan tentang tekstur: bagaimana nilai piksel bersebelahan berkaitan antara satu sama lain, pada skala yang jauh di bawah apa-apa yang dikekalkan oleh huraian semantik.
Maklumat yang dibaca oleh pengesan dibuang sebelum model bahasa mula memproses. Ini bukan kerana bot sembang lemah dalam hal ini. Ia berfungsi daripada perwakilan yang tidak mengandungi bukti tersebut.
Kesan yang dihasilkan dalam amalan
- Jawapan yakin tanpa ambang. Bot sembang akan menyatakan berkemungkinan dijana AI tanpa sebarang skala di sebalik perkataan berkemungkinan. Tiada nombor, tiada julat dan tiada apa-apa untuk dibandingkan dengan imej lain.
- Penaakulan daripada petunjuk lapuk. Model memetik jari, gigi, kulit berlilin dan teks herot, kerana itulah yang dinyatakan oleh teks latihan untuk dicari. Perkara itu telah diperbaiki bertahun-tahun lalu.
- Persetujuan dengan pembingkaian soalan anda. Tanya sama ada sesuatu imej adalah palsu dan anda lebih cenderung mendengar jawapan ya berbanding jika anda bertanya secara neutral. Itu ialah sifat antara muka, bukan gambar tersebut.
- Tiada kebolehulangan. Tanya dua kali dan anda boleh mendapat dua jawapan berbeza tentang fail yang sama, dengan penjelasan yang sama yakin bagi setiap satu.
- Tiada maklumat rantau. Ia tidak dapat memberitahu anda bahawa satu sudut foto berkelakuan berbeza daripada bahagian lain, yang biasanya merupakan penemuan paling penting.
| Keupayaan | Bot sembang | Pengesan piksel |
|---|---|---|
| Membaca tekstur peringkat piksel | No | Yes |
| Skor ditentukur dengan julat yang diterbitkan | No | Yes |
| Jawapan yang sama setiap kali | No | Yes |
| Pecahan peringkat rantau | No | Yes |
| Diukur berdasarkan tanda aras | No | Yes |
| Menerangkan pertimbangannya dalam bentuk prosa | Yes secara lancar | Partly sebagai isyarat |
| Menerangkan apa yang ada dalam gambar | Yes | No |
Dua baris terakhir adalah bahagian yang wajar disimpan. Model bahasa sememangnya mahir menerangkan imej dan membuat penaakulan sama ada sesuatu pemandangan itu masuk akal. Ciri tersebut berguna, tetapi ia bukan pengesanan.
Situasi di mana bot sembang benar-benar berguna
Menolak alat ini sepenuhnya adalah pengajaran yang salah. Jika digunakan mengikut keupayaannya, ia melengkapkan alat pengesan dan bukannya menggantikannya.
-
Minta ia menerangkan pemandangan tersebut secara terperinci
Penerangan yang teliti sering mendedahkan perkara yang tidak anda sedari, termasuk objek yang tidak sepadan atau papan tanda yang belum anda baca.
-
Tanya sama ada pemandangan itu konsisten dari segi fizikal
Bayang-bayang, pantulan, skala dan perspektif ialah masalah penaakulan, dan penaakulan adalah fungsi utama model tersebut. Ini dapat mengesan imej komposit yang mungkin terlepas daripada analisis piksel.
-
Tanya apa yang boleh mengesahkan atau menyangkalnya
Menukar syak wasangka menjadi senarai semakan ialah penggunaan model bahasa yang baik, dan senarai tersebut selalunya lebih baik daripada apa yang anda sendiri tulis.
-
Kemudian jalankan pengesan sebenar
Untuk persoalan berkaitan piksel, gunakan alat yang dibina khas untuknya, dan tafsirkan skor tersebut berdasarkan skala yang diterbitkan.
Mengapa kelancaran bahasanya menjadi bahaya
Pengesan yang tidak pasti akan memulangkan angka sederhana, dan angka itu sendiri menyampaikan ketidakpastian tersebut. Model bahasa yang tidak pasti memulangkan satu perenggan, dan perenggan tidak mempunyai margin ralat.
Penjelasan berstruktur rapi yang sama akan muncul sama ada model itu telah mengenal pasti sesuatu yang nyata atau sekadar menghasilkan huraian rekaan yang kedengaran munasabah. Pembaca mengukur kepercayaan mereka berdasarkan kualiti penulisan, iaitu isyarat yang sebenarnya tidak membawa sebarang maklumat di sini.
Inilah sebabnya bertanya kepada bot sembang adalah titik permulaan yang lebih buruk daripada melihat sendiri gambar tersebut. Ketidakpastian anda sendiri sekurang-kurangnya dapat anda sedari.
Masalah yang sama pada alat lain
Ini bukan sekadar tentang satu produk. Mana-mana sistem yang menaakul imej secara semantik mempunyai jurang yang sama, dan beberapa alat yang kini diperkenalkan sebagai pengesan sebenarnya melakukan perkara yang sama di sebalik tabir.
Ujian yang berguna: tanya apa yang akan dilaporkan oleh alat tersebut pada foto bagi sekeping foto, atau pada imej yang langsung tiada subjek yang boleh dikenali. Pengesan piksel tetap memulangkan skor dalam kedua-dua keadaan, kerana tekstur wujud tanpa mengira kandungan. Sistem semantik tiada apa-apa untuk dinaakul dan sama ada akan menolak atau mereka-reka sesuatu.
Ujian kedua: jalankan fail yang sama sebanyak dua kali. Model piksel bersifat deterministik dan memulangkan nombor yang sama. Model bahasa membuat persampelan, dan dua cubaan boleh memberikan keputusan berbeza. Jika sesuatu alat memberikan jawapan berbeza untuk bait yang sama, ia tidak mengukur apa-apa.
Kedua-dua ujian tidak memerlukan pemahaman tentang cara alat itu berfungsi. Masing-masing hanya mengambil masa seminit, dan kedua-duanya memisahkan pengukuran daripada penerangan dengan lebih boleh dipercayai berbanding membaca halaman pemasaran.