I quattro motivi per cui i risultati differiscono
Un punteggio è la fine di una lunga catena di scelte. Cambia qualsiasi anello e il numero si sposta, anche se nulla dell'immagine è cambiato.
- Dati di training diversi. Un rilevatore riconosce ciò che ha visto. Uno addestrato su migliaia di generatori aperti gestisce bene i modelli insoliti. Uno addestrato sui quattro maggiori strumenti commerciali gestisce quei quattro meglio e tutto il resto peggio.
- Linee di decisione diverse. Uno strumento definisce sospetto 60, un altro definisce sospetto 75. La stessa lettura supera una soglia e non l'altra, ottenendo così due verdetti da una singola misurazione.
- Definizioni diverse. Alcuni strumenti conteggiano qualsiasi coinvolgimento generativo, inclusi un upscaling o un riempimento generativo. Altri segnalano solo fotogrammi interamente sintetici. Un ritratto ritoccato è IA per il primo e reale per il secondo.
- Preelaborazione diversa. Gli strumenti ridimensionano, ritagliano e ricodificano prima di assegnare il punteggio. Un rilevatore che legge un quadrato di 224 pixel del centro vede un'immagine diversa rispetto a uno che legge 384 pixel dell'intero fotogramma.
Lo strumento D non è più sensibile degli altri. Risponde a una domanda più ampia. Se la tua preoccupazione è se una fotografia sia stata inscenata da un generatore, D sta sovrastimando. Se la tua preoccupazione è se qualsiasi IA abbia toccato il file, D è l'unico che ti sta rispondendo.
Chiedi a quale domanda risponde ciascuno strumento
| La domanda | Cosa la segnala | Uso tipico |
|---|---|---|
| Questo fotogramma è stato generato dal nulla? | Texture sintetica sull'intero fotogramma | Notizie, inserzioni di mercato, profili di incontri |
| Qualsiasi parte di questo è stata modificata dall'IA? | Una regione sopra la linea | Assicurazioni, sinistri, revisione delle prove |
| Qualche IA ha toccato questo file? | Upscaling, denoise, riempimento generativo | Librerie di stock, regole di concorso |
La maggior parte dei disaccordi tra strumenti è in realtà un disaccordo su quale di queste tre hai chiesto. Prima di confrontare i risultati, decidi quale domanda è importante per te, quindi leggi ogni strumento in base ad essa.
Come confrontare correttamente due risultati
-
Alimenta entrambi gli strumenti con il file identico
Non un nuovo download, non uno screenshot, non una copia passata attraverso un'app di chat. Byte diversi sono un'immagine diversa e otterranno legittimamente punteggi diversi.
-
Confronta le fasce, non i numeri
Un 61 su una scala con una linea a 50 e un 58 su una scala con una linea a 65 non sono d'accordo sul verdetto pur concordando sulla lettura.
-
Cerca una soglia pubblicata
Uno strumento che non dice dove si trova la sua linea non può essere confrontato con nulla. Tratta il numero come non interpretabile piuttosto che come prova.
-
Prediligi lo strumento che mostra il suo funzionamento
Una mappa delle regioni, una fascia nominata e un benchmark dichiarato ti consentono di verificare il ragionamento. Un'etichetta sicura senza nulla dietro non lo fa.
-
Tratta l'accordo come un forte segnale
Due strumenti indipendenti che raggiungono la stessa fascia valgono più di uno solo. Due in disaccordo significano incerto, non dividere la differenza.
Quando il disaccordo è il risultato
Vale la pena imparare a riconoscere un pattern. Uno strumento che riporta un punteggio basso sull'intero fotogramma insieme a uno che ne riporta uno alto spesso significa che l'immagine è una fotografia reale con una modifica locale.
Il primo strumento sta mediando la modifica su un fotogramma prevalentemente genuino. Il secondo sta dando peso alla regione più forte. Entrambi sono corretti su ciò che hanno misurato, e il disaccordo stesso ti ha detto più di entrambi i numeri.
Un riquadro sopra la linea di decisione all'interno di un fotogramma altrimenti freddo. Nessun singolo numero cattura questo.
Cosa farebbe concordare i rilevatori
Un benchmark condiviso, linee di decisione pubblicate e una definizione concordata di ciò che conta come coinvolgimento dell' IA eliminerebbero la maggior parte della diffusione. Nessuno di questi esiste ancora, e c'è poca pressione commerciale per crearli, perché uno strumento che pubblica le sue debolezze appare peggiore di uno che non lo fa.
Fino a quando la situazione non cambierà, tratta ogni punteggio come proveniente da una scala privata. Leggi le prove che uno strumento ti mostra e pesale più pesantemente rispetto alla confidenza nella sua etichetta.
Il problema delle versioni di cui nessuno parla
Un rilevatore non è una cosa fissa nel tempo. I fornitori riaddestrano i modelli, adeguano le soglie e scambiano i modelli senza preavviso, e quasi nessuno di essi assegna una versione al proprio output. Il punteggio che hai ottenuto a marzo e quello che ottieni oggi potrebbero provenire da modelli diversi con una calibrazione diversa alle spalle.
Questo è importante se registri i risultati. Un fascicolo di sinistro, un registro di moderazione o un caso accademico che cita un punteggio di diciotto mesi fa sta citando una misurazione il cui strumento non esiste più. Non c'è modo di riprodurlo e nessun modo di verificare cosa significasse all'epoca.
Dove conservi i risultati, tieni le prove insieme ad essi: i punteggi della regione, la banda, la linea di decisione e la data. Questi restano interpretabili dopo che il modello alla loro base è cambiato, cosa che una percentuale nuda e cruda non fa.