← Tutte le guide Guide

Come individuare i volti generati dall'AI

Gli indicatori visivi che tutti ripetono sono quelli che sono stati corretti per primi. Ecco cosa separa ancora un volto generato da uno fotografato e cosa non lo fa più.

· 9 min di lettura · Best AI Image Detector

Smetti di guardare il volto. Gli indicatori affidabili si sono spostati ai bordi del fotogramma anni fa: sfondi, gioielli, denti, orecchie e il confine dove i capelli incontrano tutto il resto. Il volto stesso è la parte che ogni nuovo modello corregge per prima.

Perché la vecchia lista di controllo ha smesso di funzionare

Ogni lista di indicatori ampiamente condivisa ha lo stesso problema: descrive le debolezze dei modelli che esistevano quando è stata scritta. Quelle debolezze sono pubbliche, misurabili e imbarazzanti, il che le rende esattamente le cose che la versione successiva è ottimizzata per correggere.

Le mani sono l'esempio più chiaro. Contare le dita è stato genuinamente utile per circa diciotto mesi, poi è diventato un modo per sbagliare con sicurezza in entrambe le direzioni: le mani generate sono solitamente corrette ora, e le mani reali in movimento si sfumano in forme che sembrano sbagliate a qualcuno a cui è stato detto di contarle.

Lo stesso è successo ai riflessi oculari, all'asimmetria delle orecchie e alla geometria dentale, approssimativamente in quest'ordine. Tutto ciò che può essere descritto in un post virale viene sottoposto a benchmark, e tutto ciò che viene sottoposto a benchmark viene corretto.

  1. 2019
    Sfondi dissolti I primi generatori di volti creavano visi definiti su zone sfocate. Problema risolto una volta che i modelli hanno imparato a gestire intere scene.
  2. 2022
    Orecchie e orecchini non corrispondenti I gioielli asimmetrici erano un segnale forte finché i dati di addestramento non li hanno inclusi.
  3. 2023
    Mani e dita L'indicatore più citato di tutti. Risolto in gran parte entro due cicli di rilascio.
  4. 2024
    Testo nell'inquadratura Segnaletica ed etichette sono diventate leggibili, eliminando un indizio facile.
  5. 2026
    Ciò che rimane è statistico Le differenze restanti riguardano la trama e il rumore, al di sotto di quanto l'occhio umano possa risolvere.
Periodo approssimativo in cui ogni indicatore popolare ha smesso di essere affidabile. Il modello è ciò che conta, non le date esatte.

Guarda altrove rispetto al volto

Lo sforzo di generazione si concentra dove si concentra l'attenzione. Un modello addestrato sui ritratti diventa molto bravo nella regione che le persone guardano, ma rimane più debole su tutto ciò che il segnale di addestramento ha trattato come sfondo.

È lì che risiedono i controlli durevoli. Chiediti cosa c'è scritto sul badge, se il motivo della camicia continua correttamente dietro il braccio, se la catena di una collana passa dietro il collo per poi riemergere nel punto giusto e se la stanza dietro la spalla è un luogo che potrebbe esistere.

I dettagli ripetuti sono l'altra famiglia affidabile. Carta da parati, mattoni, fogliame e volti tra la folla sono costosi da generare in modo coerente, quindi tendono a ripetersi, a deformarsi o a perdere il punto di fuga in modi che l'occhio può cogliere anche quando il ritratto di fronte è perfetto.

  • Testo lontano dal centro. Badge, segnaletica, dorsi di libri, confezioni. Il testo centrale è ormai solitamente corretto; il testo periferico è ancora dove emergono i difetti.
  • Continuità attraverso un'occlusione. Una tracolla, una catena o una striscia che passa dietro qualcosa e ne riemerge in modo errato.
  • Folle e oggetti ripetuti. La seconda e la terza fila di una folla, o la quarta sedia in una fila, ricevono meno attenzione rispetto alla prima.
  • Pelle ad alto ingrandimento. La pelle vera ha pori, peli sparsi e imperfezioni asimmetriche. La pelle generata è spesso liscia in un modo che nessuna illuminazione può giustificare.
  • Dove i capelli incontrano tutto il resto. Il confine tra i capelli e lo sfondo rimane una delle regioni più difficili da rendere in modo coerente.

Cosa vede un rilevatore che tu non puoi vedere

Il motivo per eseguire un controllo invece di fare affidamento sull'ispezione è che le differenze rimanenti sono al di sotto della risoluzione della vista umana. Un sensore fotografico produce un particolare tipo di rumore; un processo di generazione ne produce uno diverso e nessuno dei due è visibile alle dimensioni di visualizzazione standard.

Questo è anche il motivo per cui un rilevatore e i tuoi occhi possono dissentire. Un'immagine con un errore visivo evidente può ottenere un punteggio basso perché la sua trama è fotografica, mentre un'immagine che sembra perfetta può ottenere un punteggio alto perché la sua trama non lo è. Entrambe le letture sono informative e nessuna prevale sull'altra.

Due diversi tipi di prove
Ispezione visivaAnalisi dei pixel
Funziona suErrori di composizione e logicaTrama e struttura del rumore
Sopravvive alla compressioneSi degrada
Sopravvive a uno screenshotSi degrada gravemente
Rileva una piccola modificaSolo se la notiSì, tramite la mappa delle regioni
Peggiore nel tempoRapidamenteGradualmente

L'ultima riga è quella utile. Gli indizi visivi decadono a ogni rilascio del modello; un rilevatore addestrato su molti generatori decade più lentamente, perché ha imparato cosa hanno in comune le trame sintetiche invece di ciò che un singolo prodotto ha sbagliato in un anno.

Il caso più rilevante: un volto reale, alterato

I falsi più importanti non sono ritratti interamente generati. Sono fotografie di persone reali con un elemento modificato: un volto diverso sullo stesso corpo, un oggetto aggiunto alla mano, un badge alterato, una seconda persona rimossa dall'inquadratura.

Un punteggio sull'intera immagine gestisce male questo aspetto per design, perché il novanta per cento dell'immagine è effettivamente una fotografia e la media ne tiene conto. La mappa delle regioni è ciò che lo fa emergere e leggere la mappa invece del numero è l'abitudine che migliora maggiormente l'accuratezza sui volti.

14 18 11 16 12 15 89 13 17 10 14 19

Undici riquadri risultano fotografici. Uno no, ed è quello che copre un volto.

Una fotografia di gruppo autentica con un volto sostituito. Il punteggio sull'intera immagine era 31.

Un'abitudine efficace

Dedica al ritratto cinque secondi di ispezione periferica: testo, continuità, pattern ripetuti, confine dei capelli. Poi esegui un controllo e leggi la mappa. I due insieme colgono molto più di quanto farebbe uno solo dei due, e il tutto richiede meno di un minuto.

Dove la posta in gioco è reale, aggiungi il passaggio che nessuna analisi dei pixel può sostituire: trova lo stesso volto altrove con uno storico. Un profilo con tre anni di post, fotografie taggate da altre persone e un datore di lavoro coerente è una prova di un tipo che nessun generatore può produrre.

Gli indizi che non sono cambiati

Due cose hanno resistito a quattro anni di miglioramenti ed entrambe riguardano la coerenza attraverso la distanza piuttosto che il dettaglio locale. La prima è l'illuminazione: se ogni superficie nell'inquadratura è illuminata dalle stesse fonti, dalle stesse direzioni e con ombre della stessa morbidezza.

Un ritratto generato solitamente rende bene il volto e approssima bene l'ambiente, ma la discrepanza si nota nelle ombre. Un'ombra netta sotto il mento accanto a un'ombra morbida sulla parete retrostante descrive due stanze diverse.

La seconda è la profondità. Le superfici riflettenti, il vetro, l'acqua e gli specchi devono concordare con la geometria di tutto il resto, e spesso non lo fanno. Una finestra dietro un soggetto che mostra una scena che non potrebbe trovarsi lì è il tipo di errore che sopravvive agli aggiornamenti del modello, perché richiede un modello del mondo piuttosto che un modello dei volti.

Nessuno dei due è un test che si può applicare meccanicamente ed entrambi richiedono più tempo di quanto ne richiedesse il conteggio delle dita. Questo è il compromesso: i controlli che funzionano ancora sono quelli che richiedono di pensare all'immagine come a un luogo, piuttosto che scansionarla alla ricerca di un difetto.

Domande frequenti

Il conteggio delle dita è ancora utile?
Raramente, e ora fallisce in entrambe le direzioni. I modelli attuali rendono le mani correttamente la maggior parte delle volte, quindi una mano corretta non prova nulla, e le mani reali catturate a metà movimento producono forme sfocate che le persone interpretano come generate. È stata una buona euristica per circa diciotto mesi, ma ora non lo è più.
Che dire degli occhi? Ho letto che i riflessi non corrispondono.
Era vero per i primi generatori di volti, che rendevano ogni occhio in modo piuttosto indipendente. I modelli moderni producono riflessi coerenti. Vale ancora la pena dare un'occhiata perché non costa nulla, ma una coppia di riflessi corrispondenti non è più prova di alcunché.
Perché un rilevatore segnala la fotografia di una persona reale?
Solitamente si tratta di elaborazione piuttosto che di manipolazione. Filtri di bellezza, modalità ritratto, modalità notte e una riduzione aggressiva del rumore riscrivono tutti la trama della pelle dopo lo scatto, e questo è esattamente il segnale che il modello legge. Chiedi un originale non filtrato prima di considerare significativo un punteggio medio.
Può dirmi quale strumento ha creato il volto?
Non dai pixel. I modelli condividono architetture e dati di addestramento, quindi le loro impronte digitali si sovrappongono e qualsiasi post-elaborazione sfuma ciò che li distingue. Se un nome appare in un risultato, proviene da una credenziale nel file piuttosto che dall'immagine, e il risultato lo specifica.
Funziona su un volto in una foto di gruppo?
Sì, ed è qui che la mappa delle regioni si rivela utile. Un singolo volto sostituito all'interno di una fotografia altrimenti genuina sposta a malapena il punteggio sull'intera immagine, ma illumina un riquadro. Leggi prima la mappa su qualsiasi immagine con più di una persona.
E per le videochiamate?
Problema diverso, strumenti diversi. Il rilevamento di immagini fisse non affronta la manipolazione video in tempo reale, e controllare singoli fotogrammi non rileva le incongruenze temporali che svelano i cambi di volto in tempo reale. Trattalo separatamente invece di presumere che un controllo su immagine fissa sia sufficiente.