← Tutte le guide Accuratezza

Perché i rilevatori IA non concordano sulla stessa immagine

Fai passare un'immagine attraverso quattro strumenti e ottieni quattro risposte. I motivi sono strutturali e conoscerli ti dice a quale risultato credere.

· 7 min di lettura · Best AI Image Detector

Dati di training diversi, linee di decisione diverse e definizioni diverse di cosa conti come IA. Due strumenti possono leggere un'immagine in modo identico e riportare comunque verdetti opposti.

I quattro motivi per cui i risultati differiscono

Un punteggio è la fine di una lunga catena di scelte. Cambia qualsiasi anello e il numero si sposta, anche se nulla dell'immagine è cambiato.

  1. Dati di training diversi. Un rilevatore riconosce ciò che ha visto. Uno addestrato su migliaia di generatori aperti gestisce bene i modelli insoliti. Uno addestrato sui quattro maggiori strumenti commerciali gestisce quei quattro meglio e tutto il resto peggio.
  2. Linee di decisione diverse. Uno strumento definisce sospetto 60, un altro definisce sospetto 75. La stessa lettura supera una soglia e non l'altra, ottenendo così due verdetti da una singola misurazione.
  3. Definizioni diverse. Alcuni strumenti conteggiano qualsiasi coinvolgimento generativo, inclusi un upscaling o un riempimento generativo. Altri segnalano solo fotogrammi interamente sintetici. Un ritratto ritoccato è IA per il primo e reale per il secondo.
  4. Preelaborazione diversa. Gli strumenti ridimensionano, ritagliano e ricodificano prima di assegnare il punteggio. Un rilevatore che legge un quadrato di 224 pixel del centro vede un'immagine diversa rispetto a uno che legge 384 pixel dell'intero fotogramma.
La stessa fotografia, valutata in quattro modi
Strumento A, linea a 50
61
Strumento B, linea a 65
58
Strumento C, solo intero fotogramma
34
Strumento D, conteggia qualsiasi modifica
88

Cifre illustrative che mostrano una diffusione tipica di una fotografia fortemente elaborata ma autentica.

Un'immagine, quattro strumenti. Nulla qui è un malfunzionamento: ognuno riporta ciò che dice la propria scala.

Lo strumento D non è più sensibile degli altri. Risponde a una domanda più ampia. Se la tua preoccupazione è se una fotografia sia stata inscenata da un generatore, D sta sovrastimando. Se la tua preoccupazione è se qualsiasi IA abbia toccato il file, D è l'unico che ti sta rispondendo.

Chiedi a quale domanda risponde ciascuno strumento

Tre domande a cui la gente si riferisce con "è questa IA"
La domandaCosa la segnalaUso tipico
Questo fotogramma è stato generato dal nulla?Texture sintetica sull'intero fotogrammaNotizie, inserzioni di mercato, profili di incontri
Qualsiasi parte di questo è stata modificata dall'IA?Una regione sopra la lineaAssicurazioni, sinistri, revisione delle prove
Qualche IA ha toccato questo file?Upscaling, denoise, riempimento generativoLibrerie di stock, regole di concorso

La maggior parte dei disaccordi tra strumenti è in realtà un disaccordo su quale di queste tre hai chiesto. Prima di confrontare i risultati, decidi quale domanda è importante per te, quindi leggi ogni strumento in base ad essa.

Come confrontare correttamente due risultati

  1. Alimenta entrambi gli strumenti con il file identico

    Non un nuovo download, non uno screenshot, non una copia passata attraverso un'app di chat. Byte diversi sono un'immagine diversa e otterranno legittimamente punteggi diversi.

  2. Confronta le fasce, non i numeri

    Un 61 su una scala con una linea a 50 e un 58 su una scala con una linea a 65 non sono d'accordo sul verdetto pur concordando sulla lettura.

  3. Cerca una soglia pubblicata

    Uno strumento che non dice dove si trova la sua linea non può essere confrontato con nulla. Tratta il numero come non interpretabile piuttosto che come prova.

  4. Prediligi lo strumento che mostra il suo funzionamento

    Una mappa delle regioni, una fascia nominata e un benchmark dichiarato ti consentono di verificare il ragionamento. Un'etichetta sicura senza nulla dietro non lo fa.

  5. Tratta l'accordo come un forte segnale

    Due strumenti indipendenti che raggiungono la stessa fascia valgono più di uno solo. Due in disaccordo significano incerto, non dividere la differenza.

Quando il disaccordo è il risultato

Vale la pena imparare a riconoscere un pattern. Uno strumento che riporta un punteggio basso sull'intero fotogramma insieme a uno che ne riporta uno alto spesso significa che l'immagine è una fotografia reale con una modifica locale.

Il primo strumento sta mediando la modifica su un fotogramma prevalentemente genuino. Il secondo sta dando peso alla regione più forte. Entrambi sono corretti su ciò che hanno misurato, e il disaccordo stesso ti ha detto più di entrambi i numeri.

11 14 9 13 89 12 10 8 15

Un riquadro sopra la linea di decisione all'interno di un fotogramma altrimenti freddo. Nessun singolo numero cattura questo.

La vista per regioni risolve la discussione. Una media sull'intero fotogramma di questi riquadri è 24, che risulta pulita; la mappa mostra perché ciò è fuorviante.

Cosa farebbe concordare i rilevatori

Un benchmark condiviso, linee di decisione pubblicate e una definizione concordata di ciò che conta come coinvolgimento dell' IA eliminerebbero la maggior parte della diffusione. Nessuno di questi esiste ancora, e c'è poca pressione commerciale per crearli, perché uno strumento che pubblica le sue debolezze appare peggiore di uno che non lo fa.

Fino a quando la situazione non cambierà, tratta ogni punteggio come proveniente da una scala privata. Leggi le prove che uno strumento ti mostra e pesale più pesantemente rispetto alla confidenza nella sua etichetta.

Il problema delle versioni di cui nessuno parla

Un rilevatore non è una cosa fissa nel tempo. I fornitori riaddestrano i modelli, adeguano le soglie e scambiano i modelli senza preavviso, e quasi nessuno di essi assegna una versione al proprio output. Il punteggio che hai ottenuto a marzo e quello che ottieni oggi potrebbero provenire da modelli diversi con una calibrazione diversa alle spalle.

Questo è importante se registri i risultati. Un fascicolo di sinistro, un registro di moderazione o un caso accademico che cita un punteggio di diciotto mesi fa sta citando una misurazione il cui strumento non esiste più. Non c'è modo di riprodurlo e nessun modo di verificare cosa significasse all'epoca.

Dove conservi i risultati, tieni le prove insieme ad essi: i punteggi della regione, la banda, la linea di decisione e la data. Questi restano interpretabili dopo che il modello alla loro base è cambiato, cosa che una percentuale nuda e cruda non fa.

Domande frequenti

Se due rilevatori sono in disaccordo, a quale dovrei credere?
Quello che ti mostra il suo ragionamento. Una linea di decisione pubblicata, una banda denominata e una mappa delle regioni ti permettono di verificare se la lettura ha senso per la tua immagine. Una percentuale nuda da uno strumento che non specifica cosa significhi non costituisce prova, per quanto possa sembrare sicura.
Eseguire più rilevatori fornisce una risposta migliore?
Solo se decidi in anticipo come pesarli. Tre strumenti che concordano sono genuinamente più forti di uno. Sei strumenti in cui due concordano con te sono il modo in cui le persone si convincono di una conclusione a cui erano già arrivate.
Perché uno strumento definisce la mia foto modificata come IA e un altro come reale?
Stanno rispondendo a domande diverse. Uno strumento che conteggia qualsiasi intervento generativo segnala un riempimento generativo o un upscaling. Uno strumento che cerca solo fotogrammi interamente sintetici non lo fa. Nessuno dei due ha torto; verifica quale definizione stia usando ciascuno.
Possono avere ragione entrambi i rilevatori?
Sì, ed è comune. Soglie diverse significano che la stessa misurazione produce verdetti differenti, e set di addestramento diversi significano letture genuinamente diverse di un'immagine insolita. Ciò che conta è l'accordo nella banda, non l'accordo nelle cifre.