← Todos os guias Como funciona

Difusão vs GAN: por que os detectores lidam com eles de forma diferente

Duas maneiras de criar uma imagem, duas impressões digitais diferentes. O que cada processo deixa para trás, por que as GANs eram mais fáceis de detectar e o que isso prevê sobre o que virá a seguir.

· 8 min de leitura · Best AI Image Detector

As GANs deixam um artefato repetitivo do aumento de resolução que é quase uma assinatura. Os modelos de difusão não, e é por isso que a detecção ficou mais difícil em 2022 e por que os truques específicos de arquitetura pararam de funcionar.

Como uma GAN cria uma imagem

Uma rede adversarial generativa começa a partir de um pequeno vetor e aumenta repetidamente sua resolução, dobrando-a em cada camada até atingir o tamanho total. Uma segunda rede julga o resultado, e as duas treinam uma contra a outra.

O aumento repetido de resolução é a parte importante. Cada etapa de duplicação introduz um padrão regular, e esses padrões se acumulam em uma estrutura periódica que é visível quando a imagem é transformada no domínio da frequência.

Essa estrutura era próxima de uma assinatura. Os primeiros detectores podiam procurar um padrão de tabuleiro no espectro de frequência e atingir alta precisão sem entender nada sobre a imagem. Era uma impressão digital da arquitetura, e não de qualquer modelo específico.

Como um modelo de difusão cria uma

A difusão funciona do modo inverso. Ela começa com um campo de ruído puro na resolução total de destino e remove um pouco dele a cada passo, guiado pelo que o modelo aprendeu, até que uma imagem surja.

Não há uma escada de upsampling, portanto, não há artefatos periódicos. A saída é estatisticamente diferente de uma captura de câmera, e a diferença é difusa em vez de estrutural. Nada nela aparece como um padrão claro que você possa procurar.

GAN

  • Pequeno vetor com upsampling repetido
  • Artefatos periódicos de cada duplicação
  • Detectável no domínio da frequência
  • A arquitetura deixa uma quase-assinatura
  • Dominante até aproximadamente 2022

Difusão

  • Ruído removido passo a passo em tamanho real
  • Sem escada de upsampling, sem padrão periódico
  • A diferença é estatística, não estrutural
  • Precisa de um modelo treinado para detectar
  • Dominante desde 2022
Os dois processos e o que cada um deixa para trás. A coluna da direita é o motivo pelo qual a detecção teve que ser reconstruída.

Por que os detectores mais antigos pararam de funcionar

Uma ferramenta criada para encontrar xadrez no domínio da frequência não encontra nada em uma imagem de difusão. Ela não relata incerteza; ela relata que o artefato está ausente, o que é lido como um resultado limpo.

É por isso que a precisão da detecção em todo o campo pareceu entrar em colapso entre 2021 e 2023. As ferramentas não se degradaram. A coisa que elas estavam procurando parou de ser produzida.

O que substituiu a detecção específica de arquitetura

Abrangência. Em vez de procurar um único artefato, os detectores atuais são treinados com a saída de tantos geradores diferentes quantos puderem ser coletados, para que o modelo aprenda o que a textura sintética tem em comum, em vez do que uma família produz.

O modelo usado aqui foi treinado em milhões de imagens de milhares de geradores exatamente por esse motivo. A cobertura entre arquiteturas é o que permite a generalização para a próxima, e é a única abordagem que sobreviveu a uma mudança de método dominante.

A troca é que a precisão em qualquer gerador conhecido individual é menor do que um detector especialista alcançaria. Essa é a troca correta, porque um especialista é inútil no dia em que algo novo chega.

O que isso prevê

A lição da transição de GAN para difusão não é sobre difusão. É que qualquer detector vinculado a como as imagens são feitas atualmente tem uma vida útil limitada, e a transição não será anunciada com antecedência.

Como cada geração de detecção envelheceu
AbordagemFuncionou emFalhou quando
Busca de artefatos de frequênciaGANsA difusão chegou
Análise específica de rostoPrimeiras trocas de rostoGeração de cena completa chegou
Inspeção de metadadosArquivos direto de uma ferramentaPlataformas removeram metadados
Análise de nível de erroJPEGs salvos uma única vezImagens começaram a circular
Treinamento amplo com vários geradoresA maioria da saída atualDesconhecido, e posterior aos outros

Isso importa para um usuário

Principalmente, isso explica duas coisas que você notará. Primeiro, por que um detector geralmente não consegue nomear qual ferramenta produziu uma imagem: ele está lendo uma propriedade estatística compartilhada em vez de uma impressão digital por modelo.

Segundo, por que verificadores gratuitos mais antigos apresentam um desempenho ruim. Várias ferramentas ainda online foram construídas em torno de artefatos de GAN e não foram retreinadas. Elas retornam resultados limpos e confiantes na saída atual, e nada na interface diz o porquê.

O que um pipeline híbrido faz com um resultado

A maioria das imagens que chegam até você não foi produzida por um único método. Um modelo de difusão gera uma base, um upscaler baseado em GAN a amplia, uma passagem de restauração facial corrige os olhos e um editor corta e salva novamente o resultado.

Cada estágio reescreve a textura, então o arquivo carrega vestígios de vários processos sobrepostos. O último a tocar na imagem geralmente domina o que um detector lê, e é por isso que uma imagem de difusão com upsampling pode parecer estatisticamente mais com o upscaler do que com o gerador.

Este é o motivo prático pelo qual a identificação de arquitetura não funciona fora de um laboratório. Em um teste controlado com saída limpa de modelo único, é um problema solucionável. Em uma imagem que passou por um pipeline de produção real, a questão não está bem formulada.

Isso também explica um resultado que as pessoas acham confuso: uma imagem genuinamente gerada que pontua menos do que uma fotografia com muito upsampling. Ambas tiveram sua textura reescrita por software, e o detector está lendo a reescrita em vez da origem.

Perguntas que as pessoas fazem

Imagens de GAN são mais fáceis de detectar do que imagens de difusão?
Eram, e há muito menos delas agora. O upsampling de GAN deixava um artefato periódico que uma análise de frequência simples conseguia encontrar. A difusão não deixa uma estrutura equivalente, então a detecção requer um modelo treinado lendo textura estatística em vez de uma busca direcionada por um padrão.
Um detector pode me dizer se uma imagem veio de uma GAN ou de um modelo de difusão?
Não a partir dos pixels, em geral. Um detector amplo relata a probabilidade de algo generativo estar envolvido, não qual família a produziu. A identificação de arquitetura é um problema de pesquisa separado e é consideravelmente menos confiável do que a detecção.
As GANs ainda são usadas?
Sim, em locais específicos. Elas permanecem rápidas e eficientes para tarefas restritas, como síntese de rosto e alguns upscalings, onde a difusão seria mais lenta. Algumas ferramentas usam ambas em estágios diferentes, o que significa que uma imagem pode carregar vestígios de qualquer uma.
A próxima arquitetura quebrará a detecção novamente?
Ela reduzirá a precisão em vez de quebrá-la, que é a melhoria que o treinamento amplo trouxe. Um modelo que aprendeu o que a textura sintética tem em comum entre milhares de geradores se degrada gradualmente contra algo novo, onde um detector de artefato único falha completamente.
Por que algumas ferramentas ainda afirmam ter uma precisão muito alta?
Geralmente porque estão medindo em um conjunto de teste construído a partir de geradores nos quais foram treinadas. Esse número é real e não descreve o desempenho no modelo lançado no mês passado. Pergunte quais geradores estavam no benchmark antes de comparar números entre ferramentas.
Isso afeta como devo ler uma pontuação?
Apenas de uma maneira. Trate um resultado limpo em uma imagem sobre a qual você tem outros motivos para duvidar como uma evidência mais fraca do que um resultado sinalizado, porque o modo de falha de uma arquitetura não vista é uma pontuação baixa confiante, em vez de uma incerta.