← Todos os guias Como funciona

Como funciona realmente a deteção de imagens por IA

O que acontece entre o momento em que larga um ficheiro e a leitura de uma pontuação: o modelo de pixéis, a passagem por mosaicos, a evidência do ficheiro e como os três são combinados.

· 8 min de leitura · Best AI Image Detector

Um vision transformer avalia o enquadramento completo, o mesmo modelo avalia-o novamente como mosaicos, um leitor separado verifica as credenciais do próprio ficheiro, e os três resultados são combinados num único número calibrado.

O que o modelo está a observar

Uma câmara regista luz através de uma lente num sensor. Esse processo deixa um tipo específico de ruído, um padrão específico de nitidez que diminui em direção às margens e uma relação específica entre pixéis adjacentes que advém da grelha do sensor e do processo de demosaicing que se segue.

Um modelo de diffusion constrói uma imagem ao remover repetidamente o ruído de um campo aleatório até que algo coerente surja. Esse processo também deixa uma assinatura, e é diferente. O resultado pode ser visualmente perfeito e estatisticamente distinguível ao mesmo tempo.

É por isso que a deteção sobrevive a uma captura de ecrã quando os metadados não sobrevivem. A assinatura está nos próprios valores dos pixéis e não num cabeçalho, pelo que copiar os pixéis copia a evidência.

As quatro fases

  1. 1 Ler o ficheiro Descodificado no navegador, nunca carregado
  2. 2 Avaliar o enquadramento Vision transformer a 384 pixéis quadrados
  3. 3 Avaliar os mosaicos O mesmo modelo em regiões sobrepostas
  4. 4 Ler as credenciais C2PA e marcadores de geradores, se presentes
Dois caminhos de evidência independentes que convergem. Não se pede a nenhum que carregue a resposta sozinho.

Fase um: descodificação

O ficheiro é lido a partir do disco pela página e descodificado em pixéis brutos. HEIC, AVIF, TIFF e os restantes são processados pelos próprios descodificadores do navegador. Nada é transmitido, o que é uma propriedade de onde o trabalho acontece e não uma política aplicada num servidor.

Fase dois: a pontuação do enquadramento completo

A imagem é redimensionada para 384 pixéis quadrados e passada por um vision transformer. O modelo devolve uma probabilidade bruta de que o enquadramento seja sintético. Esse número é então calibrado para que se mapeie nas faixas publicadas de forma consistente, em vez de oscilar com o modelo.

O redimensionamento perde detalhe, que é o primeiro local onde a precisão falha. É também inevitável: o modelo tem um tamanho de entrada fixo e uma fotografia de 4000 pixéis tem de ser reduzida para caber nele.

Fase três: a passagem de mosaicos

O enquadramento é dividido em regiões sobrepostas e cada uma é avaliada individualmente pelo mesmo modelo. É isto que separa uma imagem totalmente gerada de uma fotografia real com algo adicionado, e é a fase que um único número não pode substituir.

14 11 16 12 88 13 9 15 10

A média destas dá 21. A vista de mosaico mantém a informação que a média destrói.

O mesmo modelo, executado nove vezes em recortes sobrepostos. A pontuação do enquadramento completo para esta imagem foi 31.

Os mosaicos precisam de pixéis suficientes para serem significativos, e é por isso que imagens abaixo de aproximadamente 576 pixéis no lado mais curto obtêm apenas uma pontuação de enquadramento completo. Não há detalhe suficiente num pequeno recorte para o avaliar independentemente.

Fase quatro: o registo do próprio ficheiro

Separadamente dos pixéis, o ficheiro é verificado quanto a Content Credentials e marcadores de geradores deixados por algumas ferramentas. Este caminho é criptográfico e não estatístico: uma assinatura válida é verificada contra uma lista de confiança, não estimada.

Como os resultados são combinados

Os dois caminhos não são calculados pela média, porque carregam pesos diferentes. Uma credencial válida que declara uma captura de câmara supera uma pontuação de pixéis moderada. Uma credencial que declara geração por IA resolve a questão por si só.

Como a evidência é ponderada
EvidênciaTipoPeso
Credencial válida declarando geração por IACriptográficoDecisivo
Credencial válida declarando captura de câmaraCriptográficoMuito forte
Marcador de gerador no ficheiroDeclarativoForte, mas removível
Pontuação de pixéis do enquadramento completoEstatísticoModerado
Pontuações dos mosaicos regionaisEstatísticoModerado, e mais específico
Nenhuma credencial presenteNadaNenhuma informação em qualquer um dos sentidos

Essa última linha é a que as pessoas leem mal mais frequentemente. Uma credencial ausente não é um sinal negativo. A esmagadora maioria das imagens alguma vez criadas não carrega nenhuma, e quase todas as plataformas removem-nas ao carregar.

Por que corre no navegador

O modelo tem cerca de 40 MB e corre através de WebAssembly no próprio dispositivo do visitante. Essa é uma escolha arquitetónica deliberada com três consequências que vale a pena compreender.

  • Nada é carregado, por isso não existe nenhum servidor a reter as imagens de ninguém e nenhuma relação de processamento de dados a documentar.
  • Uma verificação não custa nada a servir, razão pela qual a ferramenta pode ser gratuita sem um medidor de utilização por trás.
  • A primeira verificação é mais lenta, porque o modelo descarrega uma vez antes de poder correr. Verificações posteriores reutilizam a cópia em cache.

O que o processo deliberadamente não faz

Várias técnicas que aparecem em ferramentas de forense mais antigas estão ausentes, porque já não funcionam em imagens que viajaram através de plataformas modernas.

  • Análise de nível de erro. Popular, amplamente mal interpretada e pouco fiável em qualquer imagem que tenha sido guardada mais do que uma vez.
  • Deteção de copiar-colar. Encontra regiões duplicadas dentro de um enquadramento, que apanha a clonagem de estilo antigo e não a geração.
  • Veredictos baseados em metadados. O EXIF é removido ao carregar em quase todo o lado, pelo que uma verificação que dependa dele falha precisamente nas imagens que as pessoas precisam de verificar.
  • Análise específica de rostos. Útil para uma classe restrita de manipulação e cega a tudo o resto.

Perguntas que as pessoas fazem

O detetor olha para o que está na imagem?
Não. Não tem qualquer conceito de objetos, rostos ou cenas. Mede relações estatísticas entre pixéis vizinhos, razão pela qual funciona igualmente num retrato, numa cena de rua e num recibo, e por que não lhe pode dizer se o conteúdo de uma imagem é verdadeiro.
Porque é que a primeira verificação demora mais?
O modelo descarrega uma vez, cerca de 40 MB, antes de qualquer coisa poder correr. Depois disso é armazenado em cache e as verificações subsequentes começam imediatamente. Este é o custo de correr no seu dispositivo em vez de num servidor, e compra-lhe o facto de que nada é carregado.
Como é que a saída bruta do modelo é transformada numa pontuação?
Calibração. O modelo devolve uma probabilidade bruta, que é mapeada numa escala fixa para que um dado número signifique sempre a mesma coisa. Sem esse passo, as pontuações alterariam sempre que o modelo mudasse e nenhuma faixa publicada permaneceria significativa.
Porque mosaicos sobrepostos em vez de uma grelha simples?
Uma edição que se estenda por uma fronteira de mosaico seria dividida entre duas regiões e diluída em ambas. Sobrepor os recortes significa que qualquer edição cai totalmente dentro de pelo menos uma região, o que é o que impede que uma pequena inserção seja eliminada pela média.
Pode dizer qual o gerador que criou uma imagem?
Apenas onde o ficheiro diz isso. Um marcador de gerador ou uma credencial pode nomear a ferramenta; o modelo de pixéis não pode. Devolve uma probabilidade de que algo generativo esteve envolvido, o que é uma questão diferente da identificação e uma questão muito mais fácil de responder de forma fiável.
É usado o mesmo modelo para o enquadramento e para os mosaicos?
Sim. Correr um modelo em diferentes recortes é o que torna os dois resultados comparáveis. Um modelo regional separado teria a sua própria calibração e os seus próprios erros, e os dois números já não estariam na mesma escala.