← Todos os guias Como funciona

Um guia de campo sobre geradores de imagem e o que eles deixam para trás

O que o modelo de píxeis pode estimar, o que o ficheiro pode nomear, e por que razão um detetor que afirma identificar a ferramenta por detrás de uma imagem está a exceder-se.

· 8 min de leitura · Best AI Image Detector

A análise de píxeis estima que algo generativo esteve envolvido. Apenas o ficheiro em si, através de uma credencial ou de um marcador incorporado, pode nomear a ferramenta que o fez. A maioria dos ficheiros não transporta nenhum dos dois.

As duas vias

Um detetor executa duas verificações independentes e elas respondem a coisas diferentes. Mantê-las separadas é a ideia mais útil nesta página.

Análise de píxeis

  • Funciona após capturas de ecrã e compressão
  • Retorna uma probabilidade, não uma identidade
  • Agóstico de gerador por design
  • Não consegue nomear uma ferramenta
  • Degrada-se contra arquiteturas não vistas

Evidência do ficheiro

  • Consegue nomear a ferramenta exatamente
  • Criptográfico quando assinado
  • Removido por quase todas as plataformas
  • Ausente da maioria das imagens
  • Trivialmente removido de propósito
A via da esquerda funciona em quase qualquer imagem. A via da direita funciona na pequena minoria que ainda carrega o seu próprio registo.

O que um ficheiro pode declarar

Quando uma imagem ainda mantém a sua estrutura original, vários tipos de marcadores podem estar presentes. Cada um é uma alegação feita pelo software que a escreveu, em vez de algo derivado dos píxeis.

  • Content Credentials. Um manifesto assinado que nomeia a ferramenta e o que ela fez. Alguns geradores principais assinam agora o seu resultado, o que é a forma mais forte disto.
  • Parâmetros de geração. Várias ferramentas abertas incorporam o prompt, a semente, o amostrador e o nome do modelo diretamente no ficheiro, o que é mais informação do que a maioria das pessoas espera encontrar.
  • Identificadores de software. Um campo de metadados simples que nomeia a aplicação que guardou a imagem pela última vez.
  • Marcas de água de IA declaradas. Um sinalizador que afirma que foi aplicada uma marca de água invisível, o que é uma declaração em vez da própria marca de água.
  • Asserções de captura de câmara. A alegação oposta, feita por uma câmara que assina, de que o ficheiro veio de um sensor.

Tudo isto desaparece no momento em que uma imagem é carregada para quase qualquer plataforma. É por isso que vale a pena realizar uma análise de ficheiro, mas nunca depender dela: quando encontra algo, a descoberta é forte, e não encontra nada na maioria das vezes.

Por que nomear o gerador é difícil

Parece que deveria ser possível. Ferramentas diferentes produzem estéticas diferentes, e uma pessoa que passa tempo com elas consegue muitas vezes adivinhar corretamente. Essa intuição não se transfere para um detetor por três razões.

Os modelos partilham arquiteturas e dados de treino, pelo que as suas impressões digitais estatísticas se sobrepõem fortemente. Muitas ferramentas são ajustes finos da mesma base, o que as torna quase indistinguíveis ao nível da textura, mesmo quando os seus resultados parecem diferentes para uma pessoa.

Os resultados também são pós-processados. O aumento de escala, o restauro facial e a edição acontecem todos após a geração e reescrevem exatamente a textura de que uma identificação dependeria. Quando uma imagem é publicada, pode conter mais do upscaler do que do gerador.

E o alvo move-se constantemente. Qualquer modelo de identificação é uma tabela de consulta de coisas que já existiam, o que o torna errado sobre qualquer coisa lançada desde que foi treinado, de uma forma que é silenciosa em vez de óbvia.

O que significa realmente uma boa cobertura

A questão útil sobre um detetor não é quais os geradores que reconhece pelo nome. É quão amplo foi o treino, porque a amplitude é o que prevê o desempenho no modelo que ainda não foi lançado.

Duas formas de construir cobertura
AbordagemForçaFraqueza
Treinar em algumas ferramentas comerciais principaisElevada precisão nessas ferramentasFraca generalização para qualquer outra coisa
Treinar em milhares de geradoresGeneraliza para modelos não vistosMenor precisão de pico em qualquer uma delas
Procurar o artefacto de uma arquiteturaMuito alto enquanto duraFalha completamente quando o método muda
Ler apenas marcadores de ficheiroExato quando presenteCego na maioria das imagens

A segunda linha é a abordagem utilizada aqui, e a troca é deliberada. Um detetor que é excelente em quatro produtos e inútil no quinto não tem muita utilidade para verificar uma imagem que alguém lhe enviou.

Sobre nomes de produtos

As listas de geradores suportados são mais um artefacto de marketing do que um técnico. Um modelo de píxeis não tem uma lista; tem uma distribuição de treino. Nomear produtos implica uma capacidade por ferramenta que a deteção abrangente não tem e não precisa.

Quando um nome aparece num resultado aqui, veio do ficheiro em vez dos píxeis, e o resultado diz isso mesmo. Essa distinção vale a pena ser exigida de qualquer ferramenta que utilize.

Como ler uma alegação de cobertura

Os fornecedores descrevem a cobertura de formas que parecem comparáveis, mas não o são. Três formulações surgem repetidamente e cada uma significa algo diferente.

Deteta imagens de X, Y e Z significa geralmente que o benchmark continha esses três. É uma declaração sobre testes em vez de capacidade, e não diz nada sobre o quarto gerador.

Suporta mais de quarenta geradores significa geralmente que o conjunto de treino provém desse número de fontes. Isso é mais significativo, porque a amplitude do treino é o que prevê a generalização, e ainda assim não é uma garantia sobre qualquer ferramenta específica.

Identificar o modelo de origem é a alegação mais difícil de questionar. Pergunte se essa identificação vem do arquivo ou dos pixels. Se vier dos pixels, peça a precisão da identificação separadamente da precisão da detecção, pois são números muito diferentes.

Perguntas que as pessoas fazem

Um detector pode me dizer se uma imagem veio especificamente do Midjourney?
Apenas se o arquivo ainda carregar uma credencial ou marcador que o diga, o que é incomum depois que uma imagem é compartilhada. Apenas a partir dos pixels, não. Modelos criados com arquiteturas e dados de treinamento compartilhados têm impressões digitais sobrepostas, e o pós-processamento confunde o pouco que os separa.
Geradores de IA colocam marca d'água em suas saídas?
Alguns colocam, usando um padrão invisível nos pixels ou uma credencial assinada no arquivo, e várias ferramentas importantes fazem um ou ambos. A cobertura é parcial, modelos abertos geralmente não o fazem, e qualquer um deles pode ser removido por corte, reencodificação ou upload para uma plataforma.
Por que um resultado às vezes nomeia uma ferramenta?
Porque o arquivo diz isso. Alguns geradores incorporam o nome do modelo, o prompt e a semente diretamente nos metadados da imagem. Isso é uma constatação forte quando presente, e é uma declaração feita por software em vez de algo derivado da imagem.
Uma lista mais longa de geradores suportados significa um detector melhor?
Na verdade não, e vale a pena ser cético quanto a isso. Um modelo de pixel funciona com base em uma propriedade estatística compartilhada entre geradores, e não em uma base por produto. Uma lista longa geralmente descreve o que estava no conjunto de teste, o que não é o mesmo que a ferramenta pode lidar.
E quanto a imagens de um gerador lançado na semana passada?
Espere precisão reduzida, na direção de um falso negativo. Saídas inéditas tendem a ter pontuação baixa em vez de incerta, e é por isso que uma imagem da qual você duvida por outros motivos merece ceticismo, mesmo quando uma verificação retorna limpa.
Vale a pena verificar o arquivo quando os metadados geralmente são removidos?
Sim, porque não custa nada e ocasionalmente resolve a questão diretamente. Uma credencial válida declarando a geração por IA encerra a análise em uma etapa. O escaneamento é executado junto com a verificação de pixels de qualquer maneira, então não há nada a decidir.