← Tutte le guide Accuratezza

Tutti i modi in cui un rilevatore di immagini AI può sbagliare

Una tassonomia completa degli errori: cosa si rompe, perché e che aspetto ha ciascun errore quando vi si presenta davanti. Scritto per essere letto prima di fidarsi di un punteggio.

· 8 min di lettura · Best AI Image Detector

Quattro famiglie di errori: l'immagine è stata degradata, il generatore non è stato visto, il contenuto assomiglia a una texture sintetica o qualcuno l'ha alterata deliberatamente. Ciascuna produce una risposta errata diversa.

Prima famiglia: l'immagine è stata degradata

La categoria più ampia con un ampio margine. Il segnale che un rilevatore legge vive nella texture fine, e quella texture è la prima cosa che ogni compressione, ridimensionamento e screenshot elimina.

  • Salvataggi JPEG ripetuti. L'accuratezza scende dal 91,3 percento sugli originali puliti all'84,6 percento alla qualità 40 sul benchmark pubblicato, e ulteriormente nell'uso reale.
  • Screenshot. Un re-rendering alla risoluzione dello schermo con il file originale scartato del tutto.
  • Ridimensionamento. Meno pixel, meno texture e, al di sotto di circa 576 pixel sul lato più corto, nessuna mappa delle regioni.
  • Riconversione della piattaforma. Ogni caricamento comporta almeno una riconversione e la maggior parte delle immagini è passata attraverso diverse.
  • Ritaglio aggressivo. Un piccolo ritaglio di un'immagine grande perde il contesto su cui il modello è stato calibrato.

Il degrado spinge i punteggi verso il centro in entrambe le direzioni: le fotografie autentiche verso l'alto, le immagini generate verso il basso. Un risultato medio su un file chiaramente viaggiato di solito indica il file, non l'immagine.

Seconda famiglia: il generatore non è stato visto

Un rilevatore riconosce ciò su cui è stato addestrato. Un modello rilasciato dopo la fine dell'addestramento è un territorio sconosciuto, e l'output sconosciuto tende a ottenere punteggi bassi anziché incerti.

  1. 1 Generatore rilasciato Nessuno ha visto il suo output
  2. 2 Finestra cieca Il nuovo output ottiene un punteggio reale
  3. 3 Campioni raccolti Settimane di raccolta ed etichettatura
  4. 4 Rilevatore aggiornato Fino al prossimo rilascio
La finestra di cecità è strutturale. Il riaddestramento segue sempre un rilascio anziché precederlo.

Questo produce falsi negativi sicuri, che sono il tipo più pericoloso. Lo strumento non segnala incertezza; sta comunicando che un'immagine ha un buon aspetto perché non assomiglia a nulla che sia stato istruito a segnalare.

Terza famiglia: il contenuto assomiglia a una texture sintetica

Alcune immagini autentiche sono semplicemente difficili. Non perché sia stato fatto qualcosa per ingannare, ma perché la texture che contengono assomiglia alla texture prodotta dalla generazione.

  • Modalità notte dello smartphone e fotografia computazionale. Diversi fotogrammi uniti e denoisizzati dal software, che riscrive i dettagli fini sull'intera immagine.
  • Ritocco pesante. La levigatura della pelle e la separazione delle frequenze ricostruiscono la texture sui volti.
  • Immagini sovracampionate. L'ingrandimento inventa pixel, e i pixel inventati sono pixel generati.
  • Illustrazioni, rendering 3D e CGI. Mai fotografati, quindi nulla in essi assomiglia a uno scatto fotografico.
  • Fotografia stock con pesante riduzione del rumore. Elaborata commercialmente per apparire pulita, il che viene letto come sintetico.
  • Immagini molto piatte. Pareti bianche, cieli limpidi e sfondi semplici portano scarso segnale in entrambe le direzioni.
57 62 55 60 58 63 54 61 59

Confronta con un fotogramma generato negli anni novanta e una modifica locale con una piastrella calda. Questo pattern non è nessuno dei due.

Una vera fotografia in modalità notte. Niente di drammatico, ma ogni piastrella è calda, che è la firma dell'elaborazione globale.

Quartetto familiare: elusione deliberata

La categoria più piccola e quella che preoccupa di più. Qualsiasi tecnica che riscriva le relazioni tra i pixel abbassa il punteggio e la maggior parte di esse danneggia visibilmente l'immagine mentre lo fa.

L'eccezione è il compositing. Un oggetto generato inserito in una fotografia autentica mantiene una texture reale nella maggior parte dell'inquadratura, motivo per cui esiste la mappa delle regioni e perché un numero riferito all'intera immagine da solo non basta per alcuno scenario avversario.

Che aspetto ha ciascun errore quando si manifesta

Leggere al contrario un risultato sospetto
Cosa vediCausa più probabileCosa fare
Foto autentica con punteggio alto, mappa uniformemente caldaElaborazione o compressioneRicontrolla il file originale
Foto autentica con punteggio alto, una casella caldaUna modifica legittima o una regione piattaGuarda cosa c'è in quella casella
Immagine generata con punteggio basso, file degradatoCompressione o uno screenshotTrattalo come nessuna risposta, non come un risultato pulito
Immagine generata con punteggio basso, file pulitoUn generatore non riconosciutoFai affidamento sulla provenienza e sulle fonti
Il punteggio si trova nella fascia centraleSegnale insufficiente in un senso o nell'altroTrova una copia migliore
Nessuna mappa delle regioni prodottaImmagine troppo piccola per essere suddivisa in caselleTrova una copia più grande

Cosa tutto questo non è

Vale la pena separare i limiti dalle cose che un rilevatore non ha mai cercato di fare. Uno strumento non sbaglia se non riesce a fare qualcosa al di fuori del proprio ambito.

  • Non può dire chi ha creato un'immagine. Nessun elemento nei pixel lega un file a una persona.
  • Non può dire se il contenuto sia vero. Una fotografia autentica può avere una didascalia falsa, e questo è l'inganno più comune.
  • Non può dare un nome al generatore. Solo una credenziale o un marcatore nel file possono farlo.
  • Non può tracciare il contorno di una modifica. La mappa delle regioni mostra dove si concentra il segnale, non il confine di una manipolazione.

Come costruire un processo che tolleri questo

I guasti descritti sopra sono caratteristiche permanenti piuttosto che bug in attesa di una correzione, quindi la domanda utile è come aggirarli progettando il flusso di lavoro piuttosto che come evitarli.

Usa più di un tipo di segnale. Pixel, provenienza e cronologia di pubblicazione falliscono in punti diversi, e un'immagine che appare sospetta per tutti e tre è un riscontro molto più forte di una che appare sospetta per uno solo di essi.

Invia i flag a una persona piuttosto che a un'azione automatica. Ogni errore grave menzionato sopra diventa tollerabile se la conseguenza di un errore è che qualcuno esamini la cosa più a fondo, e intollerabile se la conseguenza è un rifiuto automatico.

Chiedi l'originale prima di trarre qualsiasi conclusione. Una percentuale notevole di risultati errati si risolve in questo singolo passaggio, perché il file che ti è stato dato non è quasi mai la copia migliore esistente.

Domande frequenti

Qual è il modo più comune in cui un rilevatore sbaglia?
Una fotografia autentica segnalata perché il file è stato degradato. Screenshot, compressioni ripetute e modalità notturna del telefono alterano la texture che il rilevatore legge, e tutte e tre sono cose normali che accadono alle immagini senza che vi sia alcuna intenzione di ingannare.
Quale errore è il più pericoloso?
Un falso negativo sicuro sull'output di un nuovo generatore. Lo strumento segnala l'immagine come pulita anziché incerta, quindi nulla indica che la risposta non sia affidabile. Ecco perché la provenienza e le fonti contano anche quando il controllo dei pixel risulta basso.
Posso sapere in anticipo se un risultato sarà affidabile?
Spesso sì. Un file originale grande, proveniente direttamente da una fotocamera e ricco di texture fornisce una lettura su cui puoi fare affidamento. Un piccolo screenshot di una scena piatta inoltrato attraverso due app no, e saperlo prima di guardare il numero costituisce la maggior parte della competenza.
Questi limiti si applicano a tutti i rilevatori?
Le prime tre famiglie si applicano a qualsiasi strumento che legga i pixel, poiché sono proprietà del metodo piuttosto che di un singolo prodotto. Ciò che differisce tra gli strumenti sono i generatori che hanno visto e il punto in cui impostano la soglia di decisione.
Questi problemi saranno risolti?
Il problema del degrado è intrinseco: le informazioni distrutte non possono essere recuperate. Il problema del generatore sconosciuto è strutturale, poiché il re-training segue il rilascio. L'accuratezza sulle immagini pulite continuerà a migliorare, ma nessuno di questi due problemi scomparirà.
Quindi, quando è realmente utile un rilevatore?
Su un file ragionevolmente intatto, come un segnale tra diversi, per decidere dove indagare più a fondo. Questo è un compito genuinamente utile. Smette di esserlo nel momento in cui qualcuno tratta il numero come la risposta anziché come il motivo per continuare a investigare.