← Semua panduan Kepercayaan dan keamanan

Memoderasi gambar hasil buatan AI dalam skala besar

Ambang batas triase, alur kerja batch, dan alasan mengapa pelarangan otomatis berdasarkan skor adalah kebijakan yang salah. Panduan praktis untuk tim kepercayaan dan keamanan (trust and safety).

· 7 mnt baca · Best AI Image Detector

Gunakan skor untuk mengurutkan antrean peninjauan, jangan pernah untuk menindak sebuah akun. Deteksi memiliki tingkat kesalahan yang membuat penegakan otomatis menjadi tidak adil, dan biaya peninjauan banding lebih besar daripada penghematan dari triase.

Mengapa penegakan otomatis gagal di sini

Pada akurasi berimbang 91 persen dalam kondisi laboratorium, kira-kira satu dari sebelas penilaian bernilai salah. Pada konten buatan pengguna yang diunggah berupa tangkapan layar, dikompresi ulang, dan dipotong (cropped), tingkat kesalahan nyatanya lebih buruk.

Jika diterapkan pada seratus ribu item sehari, itu berarti ribuan tindakan yang salah. Masing-masing adalah sebuah banding, dan banding memerlukan biaya per kasus yang lebih besar daripada peninjauan yang digantikan oleh otomatisasi tersebut. Perhitungannya tidak masuk akal bahkan sebelum Anda mempertimbangkan biaya reputasi akibat menghapus postingan asli.

Ada masalah kedua yang khusus untuk moderasi. Keputusan penegakan hukum akan diaudit. Regulator atau pengadilan yang menanyakan mengapa sebuah akun dihapus tidak akan menerima keluaran model dengan ambang batas yang tidak dipublikasikan sebagai alasannya.

Skor untuk menyortir, bukan untuk bertindak

Kerangka kerja yang berguna adalah pengurutan antrean. Anda memiliki lebih banyak item daripada peninjau. Skor menentukan item mana yang dilihat oleh seseorang terlebih dahulu, dan itu adalah tugas yang dapat dilakukannya dengan baik bahkan pada tingkat akurasi 85 persen, karena salah menilai hanya berarti seseorang melihat sesuatu yang sebenarnya tidak perlu dilihat.

  1. 1 Di atas 90 Bagian depan antrean peninjauan
  2. 2 65 hingga 90 Ditinjau dalam jangka waktu normal
  3. 3 45 hingga 65 Hanya jika dilaporkan oleh pengguna
  4. 4 Di bawah 45 Tidak ada tindakan, diambil sampel untuk pemeriksaan kualitas
Pita skor memetakan ke rute antrean alih-alih hasil akhir. Tidak ada satu pun dalam diagram ini yang menghapus konten dengan sendirinya.

Melakukan sampling pada pita bawah jauh lebih penting daripada kelihatannya. Ini adalah satu-satunya cara untuk mengukur tingkat negatif palsu (false negative rate) Anda, dan tanpa angka tersebut Anda tidak dapat mengetahui apakah sistem berfungsi atau telah diam-diam berhenti mendeteksi apa pun.

Hal yang harus dimuat dalam kebijakan Anda

Sebagian besar platform kini memiliki aturan media sintetik, dan kebanyakan ditulis dengan buruk. Kegagalan umumnya adalah melarang konten AI secara umum, yang tidak dapat ditegakkan dan menjaring hal-hal yang tidak dimaksudkan untuk ditangkap oleh siapa pun.

Aturan yang dapat ditegakkan dibandingkan dengan aturan yang tidak dapat ditegakkan
Dapat ditegakkanTidak dapat ditegakkanAlasan
Media sintetik dari orang asli yang tidak diungkapkanSemua gambar buatan AIYang kedua melarang karya ilustrasi dan desain
Gambar buatan yang disajikan sebagai bukti dokumenterApa pun yang mendapat skor di atas 65Ambang batas bukanlah sebuah kebijakan
Media sintetik yang digunakan untuk menipu demi uangGambar yang terlihat seperti buatan AIMelihat dengan mata telanjang bukanlah sebuah standar
Gagal memberikan label saat dimintaAI yang tidak diungkapkan dalam bentuk apa punTidak dapat dibuktikan, dan pengguna tidak dapat mematuhinya

Tulis aturan seputar bahaya dan pengungkapan alih-alih seputar teknik pembuatannya. Ilustrasi buatan pada postingan fiksi tidak merugikan siapa pun. Foto produk, orang, atau peristiwa buatan yang disajikan sebagai hal yang nyata adalah hal yang benar-benar ingin Anda hentikan.

Tiga kasus yang dipisahkan oleh peta wilayah

Skor seluruh bingkai (whole-frame) menggabungkan tiga situasi yang memerlukan penanganan berbeda. Tampilan petak (tile view) membedakannya, dan perbedaan tersebut biasanya menentukan hasil akhirnya.

  • Setiap petak bernilai tinggi. Gambar yang sepenuhnya dibuat oleh AI. Jika disajikan sebagai foto dari sesuatu yang nyata, itu adalah kasus paling jelas Anda.
  • Satu petak bernilai tinggi. Foto asli dengan sesuatu yang ditambahkan atau dikurangkan. Dalam konteks pasar atau berita, ini sering kali lebih serius daripada pembuatan penuh, karena dirancang untuk dipercayai.
  • Merata hangat, tidak ada yang tinggi. Pemrosesan berat. Biasanya foto asli yang melalui filter atau upscaler. Hampir tidak pernah layak untuk ditindaklanjuti.
13 17 11 15 91 14 12 16 10

Foto asli dengan elemen yang disisipkan. Pengurutan antrean berdasarkan skor utama saja tidak akan pernah memunculkannya.

Kasus menengah. Skor seluruh bingkai 33 akan meloloskan item ini.

Mengukur apakah sistem berfungsi

  1. Lacak presisi pada pita teratas

    Dari item berskor di atas 90 yang dibuka oleh moderator, berapa banyak yang ditindak? Jika angka tersebut rendah, alat ini justru menghasilkan pekerjaan alih-alih menghematnya.

  2. Ambil sampel pita terbawah setiap minggu

    Ambil seratus sampel secara acak dari skor di bawah 45 dan tinjau. Ini adalah satu-satunya pengukuran dari apa yang Anda lewatkan, dan ini adalah hal yang sering dilewati oleh tim.

  3. Awasi tingkat banding

    Peningkatan keberhasilan banding pada keputusan media sintetik berarti ambang batas telah bergeser atau generator baru telah muncul yang menghasilkan skor rendah.

  4. Tentukan ulang garis dasar (re-baseline) setelah setiap perubahan model

    Pembaruan detektor mengubah skor. Ambang batas yang disetel enam bulan lalu terhadap versi model yang berbeda tidak lagi menjadi ambang batas seperti yang Anda perkirakan.

Mengisi staf untuk antrean yang dibuat oleh alat ini

Menambahkan detektor ke alur kerja moderasi tidak mengurangi jumlah karyawan, dan tim yang merencanakan hal tersebut justru akan berakhir dalam kondisi yang lebih buruk. Yang berubah adalah urutan tibanya pekerjaan, yang meningkatkan nilai setiap jam kerja peninjau tanpa mengurangi jumlah peninjau yang Anda butuhkan.

Anggarkan agar antrean yang ditandai memakan waktu lebih lama per item daripada antrean umum. Seorang peninjau yang melihat postingan yang ditandai membuat keputusan yang lebih sulit pada materi yang lebih ambigu, dan terburu-buru melakukannya adalah awal mula terjadinya penegakan hukum yang salah. Dua menit per item adalah waktu yang realistis; tiga puluh detik tidak realistis.

Berikan peta wilayah kepada peninjau alih-alih skornya. Seorang moderator yang dapat melihat bahwa satu sudut gambar bernilai tinggi (hot) membuat keputusan yang lebih baik daripada yang hanya diberi sebuah angka, dan mereka dapat menjelaskan keputusan tersebut setelahnya kepada tim banding atau regulator.

Rotasi staf dari peninjauan media sintetik. Ini adalah pekerjaan yang repetitif dengan proporsi kasus ambigu yang tinggi, dan akurasi menurun secara drastis selama giliran kerja (shift) yang panjang. Ini adalah pelajaran yang sama yang telah dipelajari oleh setiap fungsi moderasi pada kategori lainnya.

Pertanyaan yang diajukan orang

Dapatkah kami menghapus konten secara otomatis di atas ambang batas skor?
Anda bisa melakukannya, tetapi Anda sebaiknya tidak melakukannya. Pada tingkat akurasi yang realistis, itu berarti ribuan penghapusan yang salah dalam skala besar, yang masing-masing berujung pada banding dan beberapa di antaranya menjadi masalah regulasi. Gunakan skor untuk mengurutkan antrean manusia. Waktu peninjau yang dihemat oleh pengurutan yang baik lebih besar daripada waktu yang dihemat oleh otomatisasi.
Ambang batas berapa yang harus kami tetapkan untuk peninjauan?
Mulailah dengan merutekan segala sesuatu di atas batas keputusan yang dipublikasikan dan melakukan sampling di bawahnya, kemudian sesuaikan berdasarkan angka presisi Anda sendiri alih-alih rekomendasi vendor. Perpaduan konten Anda menentukan ambang batas yang tepat, dan platform yang penuh dengan ilustrasi memerlukan batas yang berbeda dari platform yang penuh dengan foto berita.
Bagaimana cara kami menangani banding?
Minta berkas aslinya. Sebagian besar banding yang berhasil berasal dari pengguna yang foto aslinya dikompresi ulang saat diunggah, dan memeriksa ulang sumbernya biasanya menyelesaikannya dalam satu langkah. Catat hasilnya, karena data banding adalah sinyal tercepat bahwa ambang batas telah bergeser.
Haruskah pengguna diberi tahu bahwa sebuah gambar ditandai oleh detektor?
Memberi tahu mereka bahwa pemeriksaan telah terjadi adalah hal yang wajar dan semakin diharapkan. Mempublikasikan ambang batas yang tepat bukanlah hal yang bijak, karena hal itu memberikan target penghindaran bagi siapa pun yang ingin menguji sistem tersebut. Nyatakan bahwa sinyal otomatis menginformasikan peninjauan dan bahwa manusia membuat setiap keputusan.
Apakah ini berfungsi untuk video?
Tidak dengan detektor gambar diam (still image). Pemeriksaan bingkai demi bingkai pada video menghasilkan volume yang sangat besar dan melewatkan artefak temporal, yang merupakan sinyal terkuat dalam video yang dimanipulasi. Perlakukan video sebagai masalah terpisah yang memerlukan perkakas (tooling) terpisah.
Bagaimana dengan gambar yang dibuat oleh pengguna kita sendiri secara sah?
Berikan label alih-alih menghapusnya. Kolom pengungkapan pada saat unggah, didukung oleh pemeriksaan yang menandai kasus yang tidak diungkapkan untuk ditinjau, akan menghasilkan aturan yang dapat diterapkan. Pengguna yang mengikuti persyaratan pelabelan tidak boleh dikenakan penegakan hukum, dan itulah yang membuat kebijakan ini dapat dipertahankan.