Mengapa penegakan otomatis gagal di sini
Pada akurasi berimbang 91 persen dalam kondisi laboratorium, kira-kira satu dari sebelas penilaian bernilai salah. Pada konten buatan pengguna yang diunggah berupa tangkapan layar, dikompresi ulang, dan dipotong (cropped), tingkat kesalahan nyatanya lebih buruk.
Jika diterapkan pada seratus ribu item sehari, itu berarti ribuan tindakan yang salah. Masing-masing adalah sebuah banding, dan banding memerlukan biaya per kasus yang lebih besar daripada peninjauan yang digantikan oleh otomatisasi tersebut. Perhitungannya tidak masuk akal bahkan sebelum Anda mempertimbangkan biaya reputasi akibat menghapus postingan asli.
Ada masalah kedua yang khusus untuk moderasi. Keputusan penegakan hukum akan diaudit. Regulator atau pengadilan yang menanyakan mengapa sebuah akun dihapus tidak akan menerima keluaran model dengan ambang batas yang tidak dipublikasikan sebagai alasannya.
Skor untuk menyortir, bukan untuk bertindak
Kerangka kerja yang berguna adalah pengurutan antrean. Anda memiliki lebih banyak item daripada peninjau. Skor menentukan item mana yang dilihat oleh seseorang terlebih dahulu, dan itu adalah tugas yang dapat dilakukannya dengan baik bahkan pada tingkat akurasi 85 persen, karena salah menilai hanya berarti seseorang melihat sesuatu yang sebenarnya tidak perlu dilihat.
- 1 Di atas 90 Bagian depan antrean peninjauan
- 2 65 hingga 90 Ditinjau dalam jangka waktu normal
- 3 45 hingga 65 Hanya jika dilaporkan oleh pengguna
- 4 Di bawah 45 Tidak ada tindakan, diambil sampel untuk pemeriksaan kualitas
Melakukan sampling pada pita bawah jauh lebih penting daripada kelihatannya. Ini adalah satu-satunya cara untuk mengukur tingkat negatif palsu (false negative rate) Anda, dan tanpa angka tersebut Anda tidak dapat mengetahui apakah sistem berfungsi atau telah diam-diam berhenti mendeteksi apa pun.
Hal yang harus dimuat dalam kebijakan Anda
Sebagian besar platform kini memiliki aturan media sintetik, dan kebanyakan ditulis dengan buruk. Kegagalan umumnya adalah melarang konten AI secara umum, yang tidak dapat ditegakkan dan menjaring hal-hal yang tidak dimaksudkan untuk ditangkap oleh siapa pun.
| Dapat ditegakkan | Tidak dapat ditegakkan | Alasan |
|---|---|---|
| Media sintetik dari orang asli yang tidak diungkapkan | Semua gambar buatan AI | Yang kedua melarang karya ilustrasi dan desain |
| Gambar buatan yang disajikan sebagai bukti dokumenter | Apa pun yang mendapat skor di atas 65 | Ambang batas bukanlah sebuah kebijakan |
| Media sintetik yang digunakan untuk menipu demi uang | Gambar yang terlihat seperti buatan AI | Melihat dengan mata telanjang bukanlah sebuah standar |
| Gagal memberikan label saat diminta | AI yang tidak diungkapkan dalam bentuk apa pun | Tidak dapat dibuktikan, dan pengguna tidak dapat mematuhinya |
Tulis aturan seputar bahaya dan pengungkapan alih-alih seputar teknik pembuatannya. Ilustrasi buatan pada postingan fiksi tidak merugikan siapa pun. Foto produk, orang, atau peristiwa buatan yang disajikan sebagai hal yang nyata adalah hal yang benar-benar ingin Anda hentikan.
Tiga kasus yang dipisahkan oleh peta wilayah
Skor seluruh bingkai (whole-frame) menggabungkan tiga situasi yang memerlukan penanganan berbeda. Tampilan petak (tile view) membedakannya, dan perbedaan tersebut biasanya menentukan hasil akhirnya.
- Setiap petak bernilai tinggi. Gambar yang sepenuhnya dibuat oleh AI. Jika disajikan sebagai foto dari sesuatu yang nyata, itu adalah kasus paling jelas Anda.
- Satu petak bernilai tinggi. Foto asli dengan sesuatu yang ditambahkan atau dikurangkan. Dalam konteks pasar atau berita, ini sering kali lebih serius daripada pembuatan penuh, karena dirancang untuk dipercayai.
- Merata hangat, tidak ada yang tinggi. Pemrosesan berat. Biasanya foto asli yang melalui filter atau upscaler. Hampir tidak pernah layak untuk ditindaklanjuti.
Foto asli dengan elemen yang disisipkan. Pengurutan antrean berdasarkan skor utama saja tidak akan pernah memunculkannya.
Mengukur apakah sistem berfungsi
-
Lacak presisi pada pita teratas
Dari item berskor di atas 90 yang dibuka oleh moderator, berapa banyak yang ditindak? Jika angka tersebut rendah, alat ini justru menghasilkan pekerjaan alih-alih menghematnya.
-
Ambil sampel pita terbawah setiap minggu
Ambil seratus sampel secara acak dari skor di bawah 45 dan tinjau. Ini adalah satu-satunya pengukuran dari apa yang Anda lewatkan, dan ini adalah hal yang sering dilewati oleh tim.
-
Awasi tingkat banding
Peningkatan keberhasilan banding pada keputusan media sintetik berarti ambang batas telah bergeser atau generator baru telah muncul yang menghasilkan skor rendah.
-
Tentukan ulang garis dasar (re-baseline) setelah setiap perubahan model
Pembaruan detektor mengubah skor. Ambang batas yang disetel enam bulan lalu terhadap versi model yang berbeda tidak lagi menjadi ambang batas seperti yang Anda perkirakan.
Mengisi staf untuk antrean yang dibuat oleh alat ini
Menambahkan detektor ke alur kerja moderasi tidak mengurangi jumlah karyawan, dan tim yang merencanakan hal tersebut justru akan berakhir dalam kondisi yang lebih buruk. Yang berubah adalah urutan tibanya pekerjaan, yang meningkatkan nilai setiap jam kerja peninjau tanpa mengurangi jumlah peninjau yang Anda butuhkan.
Anggarkan agar antrean yang ditandai memakan waktu lebih lama per item daripada antrean umum. Seorang peninjau yang melihat postingan yang ditandai membuat keputusan yang lebih sulit pada materi yang lebih ambigu, dan terburu-buru melakukannya adalah awal mula terjadinya penegakan hukum yang salah. Dua menit per item adalah waktu yang realistis; tiga puluh detik tidak realistis.
Berikan peta wilayah kepada peninjau alih-alih skornya. Seorang moderator yang dapat melihat bahwa satu sudut gambar bernilai tinggi (hot) membuat keputusan yang lebih baik daripada yang hanya diberi sebuah angka, dan mereka dapat menjelaskan keputusan tersebut setelahnya kepada tim banding atau regulator.
Rotasi staf dari peninjauan media sintetik. Ini adalah pekerjaan yang repetitif dengan proporsi kasus ambigu yang tinggi, dan akurasi menurun secara drastis selama giliran kerja (shift) yang panjang. Ini adalah pelajaran yang sama yang telah dipelajari oleh setiap fungsi moderasi pada kategori lainnya.