← Tutte le guide Sotto il cofano

Diffusion vs GAN: perché i detector li gestiscono in modo diverso

Due modi di costruire un'immagine, due impronte digitali differenti. Cosa lascia dietro di sé ogni processo, perché le GAN erano più facili da intercettare e cosa questo ci dice su ciò che accadrà in futuro.

· 8 min di lettura · Best AI Image Detector

Le GAN lasciano un artefacto ripetuto derivante dall'upsampling che è quasi una firma. I modelli diffusion no, motivo per cui il rilevamento è diventato più difficile nel 2022 e perché i trucchi specifici dell'architettura hanno smesso di funzionare.

Come una GAN costruisce un'immagine

Una generative adversarial network parte da un piccolo vettore e lo ingrandisce ripetutamente tramite upsampling, raddoppiando la risoluzione a ogni livello fino a raggiungere le dimensioni finali. Una seconda rete giudica il risultato e le due si addestrano a vicenda.

L'upsampling ripetuto è la parte importante. Ogni passaggio di raddoppio introduce un pattern regolare e questi pattern si accumulano in una struttura periodica che è visibile quando l'immagine viene trasformata nel dominio della frequenza.

Quella struttura era vicina a una firma. I primi detector potevano cercare un pattern a scacchiera nello spettro delle frequenze e raggiungere un'elevata precisione senza comprendere nulla dell'immagine. Era un'impronta digitale dell'architettura piuttosto che di un modello specifico.

Come un modello diffusion ne costruisce una

Diffusion funziona al contrario. Inizia con un campo di rumore puro alla piena risoluzione target e ne rimuove una piccola parte a ogni passaggio, guidato da ciò che il modello ha appreso, finché non emerge un'immagine.

Non c'è una scala di sovracampionamento (upsampling), quindi non ci sono artefatti periodici. L'output è statisticamente diverso da uno scatto fotografico e la differenza è diffusa anziché strutturale. Nulla in esso appare come un pattern pulito che si possa cercare.

GAN

  • Piccolo vettore sovracampionato ripetutamente
  • Artefatti periodici da ogni raddoppio
  • Rilevabili nel dominio della frequenza
  • L'architettura lascia una quasi-firma
  • Dominante fino a circa il 2022

Diffusion

  • Rumore rimosso passo dopo passo a piena risoluzione
  • Nessuna scala di sovracampionamento, nessun pattern periodico
  • La differenza è statistica, non strutturale
  • Richiede un modello addestrato per essere rilevato
  • Dominante dal 2022
I due processi e ciò che ciascuno lascia dietro di sé. La colonna di destra spiega perché il rilevamento è dovuto essere ricostruito.

Perché i vecchi rilevatori hanno smesso di funzionare

Uno strumento creato per trovare il motivo a scacchiera nel dominio della frequenza non trova nulla in un'immagine di diffusion. Non segnala incertezza; segnala che l'artefatto è assente, il che appare come un risultato pulito.

Ecco perché l'accuratezza del rilevamento in questo campo è sembrata crollare tra il 2021 e il 2023. Gli strumenti non si erano degradati. La cosa che stavano cercando aveva smesso di essere prodotta.

Cosa ha sostituito il rilevamento specifico per architettura

Ampiezza. Anziché cercare un singolo artefatto, i rilevatori attuali sono addestrati sull'output di quanti più generatori diversi è possibile raccogliere, in modo che il modello impari ciò che la texture sintetica ha in comune anziché ciò che una singola famiglia produce.

Il modello utilizzato qui è stato addestrato su milioni di immagini provenienti da migliaia di generatori esattamente per questo motivo. La copertura tra le diverse architetture è ciò che garantisce la generalizzazione a quella successiva, ed è l'unico approccio sopravvissuto a un cambiamento di metodo dominante.

Il compromesso è che l'accuratezza su qualsiasi singolo generatore noto è inferiore a quella che otterrebbe un rilevatore specializzato. È il compromesso giusto, perché uno specialista è inutile il giorno in cui arriva qualcosa di nuovo.

Cosa prevede questo

La lezione della transizione da GAN a diffusion non riguarda diffusion. Riguarda il fatto che qualsiasi rilevatore legato al modo in cui le immagini vengono prodotte attualmente ha una vita limitata, e la transizione non verrà annunciata in anticipo.

Come è invecchiata ciascuna generazione di rilevamento
ApproccioHa funzionato suHa fallito quando
Ricerca di artefatti in frequenzaGANÈ arrivato diffusion
Analisi specifica per i voltiPrimi scambi di volto (face swap)È arrivata la generazione di intere scene
Ispezione dei metadatiFile direttamente da uno strumentoLe piattaforme hanno rimosso i metadati
Analisi dei livelli di errore (ELA)JPEG salvati una sola voltaLe immagini hanno iniziato a viaggiare
Ampio addestramento multi-generatoreLa maggior parte dell'output attualeSconosciuto, e successivo agli altri

Tutto questo importa a un utente?

Principalmente spiega due cose che noterete. Primo, perché di solito un rilevatore non sa indicare quale strumento ha prodotto un'immagine: sta leggendo una proprietà statistica condivisa anziché un'impronta digitale per singolo modello.

Secondo, perché i vecchi strumenti di controllo gratuiti funzionano male. Diversi strumenti ancora online sono stati creati attorno agli artefatti delle GAN e non sono stati riaddestrati. Restituiscono risultati puliti e sicuri sull'output attuale, e nulla nell'interfaccia ne spiega il motivo.

Cosa fa una pipeline ibrida a un risultato

La maggior parte delle immagini che ricevete non è stata prodotta da un singolo metodo. Un modello di diffusion genera una base, un upscaler basato su GAN la ingrandisce, un passaggio di ripristino del volto corregge gli occhi e un editor ritaglia e salva nuovamente il risultato.

Ogni fase riscrive la texture, quindi il file porta con sé tracce di diversi processi stratificati l'uno sull'altro. L'ultimo a toccare l'immagine di solito domina ciò che un rilevatore legge, motivo per cui un'immagine di diffusion sovracampionata può sembrare statisticamente più simile all'upscaler che al generatore.

Questo è il motivo pratico per cui l'identificazione dell'architettura non funziona al di fuori di un laboratorio. In un test controllato con output pulito da singolo modello è un problema risolvibile. Su un'immagine che è passata attraverso una vera pipeline di produzione, la domanda non è posta correttamente.

Spiega anche un risultato che le persone trovano confuso: un'immagine genuinamente generata che ottiene un punteggio inferiore rispetto a una fotografia pesantemente sovracampionata. La texture di entrambe è stata riscrivibile dal software, e il rilevatore sta leggendo la riscrittura anziché l'origine.

Domande frequenti

Le immagini GAN sono più facili da rilevare rispetto alle immagini diffusion?
Lo erano, e ora ce ne sono molte meno. Il sovracampionamento delle GAN lasciava un artefatto periodico che una semplice analisi in frequenza poteva trovare. Diffusion non lascia alcuna struttura equivalente, quindi il rilevamento richiede un modello addestrato che legga la texture statistica anziché una ricerca mirata di un singolo pattern.
Un rilevatore può dirmi se un'immagine proviene da una GAN o da un modello di diffusion?
In generale, non dai pixel. Un rilevatore ampio indica quanto sia probabile che sia stato coinvolto qualcosa di generativo, non quale famiglia lo abbia prodotto. L'identificazione dell'architettura è un problema di ricerca separato ed è notevolmente meno affidabile del rilevamento.
Le GAN vengono ancora utilizzate?
Sì, in ambiti specifici. Rimangono veloci ed efficienti per compiti circoscritti come la sintesi dei volti e alcuni upscaling, dove diffusion sarebbe più lento. Alcuni strumenti usano entrambi in fasi diverse, il che significa che un'immagine può portare tracce dell'uno o dell'altro.
La prossima architettura interromperà di nuovo il rilevamento?
Ridurrà l'accuratezza anziché interromperla, che è il miglioramento ottenuto grazie all'addestramento ampio. Un modello che ha imparato cosa la texture sintetica ha in comune tra migliaia di generatori si degrada gradualmente di fronte a qualcosa di nuovo, laddove un rilevatore basato su un singolo artefatto fallisce completamente.
Perché alcuni strumenti dichiarano ancora un'accuratezza molto elevata?
Di solito perché effettuano misurazioni su un set di test costruito dai generatori su cui sono stati addestrati. Quel dato è reale e non descrive le prestazioni sul modello rilasciato il mese scorso. Chiedete quali generatori fossero presenti nel benchmark prima di confrontare i numeri tra i diversi strumenti.
Questo influisce sul modo in cui dovrei interpretare un punteggio?
Solo in un modo. Trattate un risultato pulito su un'immagine di cui avete altri motivi di dubitare come una prova più debole rispetto a un risultato segnalato, perché la modalità di guasto di un'architettura non vista è un punteggio basso e sicuro anziché incerto.