← Tutte le guide Sotto il cofano

Come funziona davvero il rilevamento di immagini IA

Cosa succede tra il trascinamento di un file e la lettura di un punteggio: il modello di analisi dei pixel, la verifica a riquadri, le informazioni del file e il modo in cui i tre elementi vengono combinati.

· 8 min di lettura · Best AI Image Detector

Un vision transformer valuta l'intero fotogramma, lo stesso modello lo analizza nuovamente suddiviso in riquadri, un lettore separato verifica le credenziali del file e i tre risultati vengono combinati in un unico numero calibrato.

Cosa sta analizzando il modello

Una fotocamera registra la luce attraverso un obiettivo su un sensore. Questo processo lascia un tipo specifico di rumore, un pattern specifico di calo della nitidezza verso i bordi e una relazione specifica tra pixel adiacenti che deriva dalla griglia del sensore e dalla demosaicizzazione successiva.

Un modello di diffusione costruisce un'immagine rimuovendo ripetutamente il rumore da un campo casuale fino a far emergere qualcosa di coerente. Anche questo processo lascia una firma, ed è diversa. Il risultato può essere visivamente perfetto e statisticamente distinguibile allo stesso tempo.

Ecco perché il rilevamento sopravvive a uno screenshot quando i metadati non lo fanno. La firma si trova nei valori dei pixel stessi anziché nell'intestazione, quindi copiare i pixel significa copiare le prove.

Le quattro fasi

  1. 1 Leggi il file Decodificato nel browser, mai caricato
  2. 2 Valuta il fotogramma Vision transformer a 384 pixel quadrati
  3. 3 Valuta i riquadri Lo stesso modello su aree sovrapposte
  4. 4 Leggi le credenziali C2PA e marcatori di generazione, se presenti
Due percorsi di prova indipendenti che convergono. A nessuno dei due viene chiesto di fornire la risposta da solo.

Prima fase: decodifica

Il file viene letto dal disco dalla pagina e decodificato in pixel grezzi. HEIC, AVIF, TIFF e gli altri formati sono gestiti direttamente dai decoder del browser. Non viene trasmesso nulla, una conseguenza del luogo in cui avviene l'elaborazione piuttosto che di una politica applicata su un server.

Seconda fase: il punteggio dell'intero fotogramma

L'immagine viene ridimensionata a 384 pixel quadrati ed elaborata tramite un vision transformer. Il modello restituisce una probabilità grezza che il fotogramma sia sintetico. Tale numero viene quindi calibrato in modo da corrispondere in modo coerente alle fasce pubblicate anziché variare insieme al modello.

Il ridimensionamento fa perdere dettagli, ed è questo il primo punto in cui si perde precisione. È anche inevitabile: il modello ha una dimensione di input fissa e una fotografia da 4000 pixel deve essere ridotta per adattarvisi.

Terza fase: la verifica a riquadri

Il fotogramma viene suddiviso in aree sovrapposte e ognuna viene valutata singolarmente dallo stesso modello. Questo è ciò che distingue un'immagine interamente generata da una fotografia reale con l'aggiunta di elementi, ed è la fase che un singolo numero non può sostituire.

14 11 16 12 88 13 9 15 10

La media di questi valori dà 21. La vista a riquadri conserva le informazioni che la media distrugge.

Lo stesso modello, eseguito nove volte su porzioni sovrapposte. Il punteggio dell'intero fotogramma per questa immagine era 31.

I riquadri devono avere pixel a sufficienza per essere significativi, motivo per cui le immagini con un lato corto inferiore a circa 576 pixel ricevono solo il punteggio dell'intero fotogramma. Non c'è abbastanza dettaglio in una porzione piccola per valutarla indipendentemente.

Quarta fase: il record del file

Indipendentemente dai pixel, il file viene controllato per verificare la presenza di Content Credentials e marcatori di generazione lasciati da alcuni strumenti. Questo percorso è crittografico anziché statistico: una firma valida viene confrontata con un elenco di fiducia, non stimata.

Come vengono combinati i risultati

I due percorsi non vengono mediati, poiché hanno pesi differenti. Una credenziale valida che dichiara l'acquisizione tramite fotocamera prevale su un punteggio dei pixel moderato. Una credenziale che dichiara la generazione tramite IA risolve la questione da sola.

Come vengono ponderate le prove
ProvaTipoPeso
Credenziale valida che dichiara la generazione tramite IACrittograficoDecisivo
Credenziale valida che dichiara l'acquisizione tramite fotocameraCrittograficoMolto forte
Marcatore di generazione nel fileDichiarativoForte, ma rimovibile
Punteggio dei pixel dell'intero fotogrammaStatisticoModerato
Punteggi dei riquadri dell'areaStatisticoModerato e più specifico
Nessuna credenziale presenteNessunoNessuna informazione in un senso o nell'altro

Quell'ultima riga è quella che le persone interpretano male più spesso. L'assenza di credenziali non è un segnale negativo. La stragrande maggioranza delle immagini mai create non ne possiede alcuna e quasi tutte le piattaforme le rimuovono durante il caricamento.

Perché viene eseguito nel browser

Il modello pesa circa 40 MB e viene eseguito tramite WebAssembly sul dispositivo dell'utente. Si tratta di una scelta architetturale deliberata con tre conseguenze importanti da comprendere.

  • Non viene caricato nulla, quindi nessun server memorizza le immagini di nessuno e non esiste alcun trattamento dei dati da documentare.
  • Un controllo non costa nulla da erogare, ed è per questo che lo strumento può essere gratuito senza un contatore di utilizzo alle spalle.
  • Il primo controllo è più lento, perché il modello viene scaricato una sola volta prima di poter essere eseguito. I controlli successivi riutilizzano la copia memorizzata nella cache.

Cosa la pipeline sceglie deliberatamente di non fare

Diverse tecniche presenti nei vecchi strumenti forensi sono assenti, poiché non funzionano più su immagini che sono transitate attraverso piattaforme moderne.

  • Analisi del livello di errore (ELA). Popolare, ampiamente fraintesa e inaffidabile su qualsiasi immagine salvata più di una volta.
  • Rilevamento copia-incolla. Trova aree duplicate all'interno di un fotogramma, utile per rilevare clonazioni di vecchio stile ma non la generazione.
  • Verdetti basati sui metadati. I EXIF vengono rimossi al momento del caricamento quasi ovunque, quindi un controllo che dipende da essi fallisce proprio sulle immagini che le persone hanno bisogno di verificare.
  • Analisi specifica dei volti. Utile per una ristretta categoria di manipolazioni e cieca rispetto a tutto il resto.

Domande frequenti

Il rilevatore esamina il contenuto dell'immagine?
No. Non ha alcun concetto di oggetti, volti o scene. Misura le relazioni statistiche tra pixel adiacenti, motivo per cui funziona allo stesso modo su un ritratto, una scena di strada e uno scontrino, e perché non può dirti se il contenuto di un'immagine sia veritiero.
Perché il primo controllo richiede più tempo?
Il modello viene scaricato una sola volta, per circa 40 MB, prima che qualsiasi operazione possa essere eseguita. Dopodiché viene inserito nella cache e i controlli successivi si avviano immediatamente. Questo è il costo dell'esecuzione sul tuo dispositivo anziché su un server, e ti garantisce che nulla venga caricato.
Come viene convertito l'output grezzo del modello in un punteggio?
Calibrazione. Il modello restituisce una probabilità grezza, che viene mappata su una scala fissa in modo che un determinato numero significhi sempre la stessa cosa. Senza questo passaggio, i punteggi cambierebbero ogni volta che il modello viene aggiornato e nessuna fascia pubblicata rimarrebbe significativa.
Perché riquadri sovrapposti anziché una semplice griglia?
Una modifica a cavallo tra i confini di un riquadro verrebbe divisa tra due aree e diluita in entrambe. Sovrapporre le porzioni fa sì che qualsiasi modifica rientri interamente in almeno una regione, impedendo che un piccolo inserimento venga azzerato dalla media.
Può indicare quale generatore ha creato un'immagine?
Solo laddove il file lo specifichi. Un marcatore di generazione o una credenziale possono indicare lo strumento; il modello di pixel non può farlo. Restituisce la probabilità che sia stato coinvolto un processo generativo, una questione diversa dall'identificazione e molto più semplice da risolvere in modo affidabile.
Viene utilizzato lo stesso modello per il fotogramma e per i riquadri?
Sì. Eseguire un modello su porzioni differenti è ciò che rende i due risultati comparabili. Un modello di regione separato avrebbe la propria calibrazione e i propri errori, e i due numeri non si troverebbero più sulla stessa scala.