Cosa misura la precisione bilanciata
La precisione semplice è facile da gonfiare. Fornisci a un rilevatore un set di test composto al 90 percento da immagini generate e un modello che dice sempre sì otterrà il 90 percento pur essendo inutile.
La precisione bilanciata corregge questo pesando equamente le immagini reali e quelle generate, quindi la cifra è la media di due tassi: quanto spesso le fotografie autentiche vengono corrette e quanto spesso quelle generate vengono segnalate correttamente. Uno strumento che cita la precisione semplice senza indicare il suo mix di test non ti dice molto.
I due modi in cui un rilevatore sbaglia
Un singolo numero nasconde due fallimenti molto diversi, che comportano costi molto diversi.
Falso positivo
- Una fotografia autentica ha ottenuto un punteggio sopra la soglia
- Causato da upscaling, ritocco, modalità notte, screenshot
- Costo: un'accusa contro una persona reale
- Il fallimento che causa un danno reale
Falso negativo
- Un'immagine generata ha ottenuto un punteggio sotto la soglia
- Causato da nuovi generatori, piccole modifiche, file riciclati
- Costo: un falso passa senza essere contestato
- Il fallimento che le persone notano meno
Spostare la linea di decisione comporta un compromesso. Abbassarla intercetta più falsi e segnala più foto reali. Alzarla protegge le immagini autentiche e lascia passare più falsi. Non esiste un'impostazione che migliori entrambi, motivo per cui la linea è pubblicata a 65 anziché regolata silenziosamente.
Perché i dati dei benchmark sovrastimano le prestazioni reali
| Immagine di benchmark | La tua immagine | Effetto sul punteggio |
|---|---|---|
| File originale, mai salvato di nuovo | Compresso due o tre volte | L'accuratezza cala di diversi punti |
| Risoluzione piena | Ritagliato o ridimensionato per un'app di messaggistica | Meno dettagli da leggere, più incertezza |
| Generatori noti al momento dell'addestramento | Un modello rilasciato il mese scorso | La debolezza intrinseca di ogni rilevatore |
| Fotografia pulita o render pulito | Foto reale con una modifica AI | Il punteggio dell'intero fotogramma lo sottostima |
| Nessuna elaborazione avversariale | Deliberatamente ripulita per superare il test | Progettata per sconfiggere la misurazione |
Nessuno di questi è un caso insolito. Descrivono come viaggiano realmente le immagini. Un'immagine che ti arriva attraverso due piattaforme e uno screenshot ha già perso gran parte del segnale su cui è stato misurato il benchmark.
Come leggere una dichiarazione di accuratezza
- Chiedi quale set di test. Una cifra senza un benchmark nominato è marketing. Una cifra su un benchmark pubblico può essere verificata da chiunque altro.
- Chiedi se equilibrato o semplice. L'accuratezza semplice su un set di test sbilanciato è il numero più facile da gonfiare.
- Chiedi dove si trova la linea di decisione. L'accuratezza non ha senso senza conoscere la soglia a cui è stata misurata.
- Chiedi quali generatori sono stati inclusi. Qualsiasi rilevatore ottiene buoni punteggi sui modelli su cui è stato addestrato e peggiori su quello rilasciato successivamente.
- Chiedi separatamente il tasso di falsi positivi. È il numero che decide se lo strumento è sicuro da usare su persone reali.
Cosa l'accuratezza non può dirti
Un benchmark misura quanto spesso un modello è corretto in una popolazione di immagini. Non dice nulla sul fatto che sia corretto sulla tua. Non c'è un intervallo di confidenza associato a un singolo risultato e un rilevatore non può sapere quale dei suoi errori sta commettendo.
Ecco perché la mappa regionale e le prove del file contano più della cifra nel titolo. L'accordo tra segnali indipendenti vale più di un numero forte da uno di essi, e il disaccordo è una scoperta di per sé.
Come testare tu stesso un rilevatore
Non devi prendere per buona la cifra di nessuno. Un test utile richiede un pomeriggio e ti dice più su uno strumento di qualsiasi benchmark pubblicato, perché usa immagini che assomigliano alle tue.
-
Crea un set di cui conosci già la risposta
Venti fotografie che hai scattato tu e venti immagini che hai generato. Mantieni gli originali intatti. Venti per tipo bastano a smascherare uno strumento palesemente debole.
-
Includi la zona grigia
Aggiungi screenshot delle tue foto, scatti in modalità notte, un ritaglio ingrandito e un ritratto pesantemente ritoccato. È qui che i rilevatori falliscono, ed è la parte che ogni benchmark di un fornitore omette.
-
Registra il punteggio e la banda, non un verdetto
Scrivi cosa ha restituito ogni strumento. Confrontare le bande è più informativo che confrontare i numeri, perché due strumenti possono posizionare le loro linee di decisione in punti diversi.
-
Conta i due tipi di errore separatamente
Quante delle tue foto reali sono state segnalate e quante delle tue immagini generate sono sfuggite. Uno strumento che non manca mai un falso ma segnala un terzo delle tue foto reali non è utilizzabile sulle persone.
Il numero che conta è il primo: quanto spesso definisce falso il tuo lavoro. È quello l'errore che ha un costo, ed è quello che una cifra di accuratezza nel titolo media fino a farla sparire.