← Todas las guías Bajo el capó

Cómo funciona realmente la detección de imágenes con IA

Qué sucede entre soltar un archivo y leer una puntuación: el modelo de píxeles, el paso de fragmentación, la evidencia del archivo y cómo se combinan los tres.

· 8 min de lectura · Best AI Image Detector

Un vision transformer evalúa todo el encuadre, el mismo modelo lo evalúa de nuevo como fragmentos, un lector independiente comprueba las propias credenciales del archivo, y los tres resultados se combinan en un solo número calibrado.

Qué está buscando el modelo

Una cámara registra la luz a través de una lente en un sensor. Ese proceso deja un tipo específico de ruido, un patrón específico de nitidez que disminuye hacia los bordes y una relación específica entre los píxeles adyacentes que proviene de la cuadrícula del sensor y el interpolado cromático que le sigue.

Un modelo de difusión construye una imagen eliminando repetidamente el ruido de un campo aleatorio hasta que surge algo coherente. Ese proceso también deja una firma, y es diferente. El resultado puede ser visualmente perfecto y estadísticamente distinguible al mismo tiempo.

Esta es la razón por la que la detección sobrevive a una captura de pantalla cuando los metadatos no lo hacen. La firma se encuentra en los valores de los píxeles en sí mismos en lugar de en un encabezado, por lo que copiar los píxeles copia la evidencia.

Las cuatro etapas

  1. 1 Leer el archivo Decodificado en el navegador, nunca subido
  2. 2 Evaluar el encuadre Vision transformer a 384 píxeles cuadrados
  3. 3 Evaluar los fragmentos El mismo modelo en regiones superpuestas
  4. 4 Leer las credenciales Marcadores de C2PA y del generador, si están presentes
Dos rutas de evidencia independientes que convergen. A ninguna se le pide que lleve la respuesta sola.

Etapa uno: decodificación

La página lee el archivo del disco y lo decodifica en píxeles en bruto. HEIC, AVIF, TIFF y el resto son manejados por los propios decodificadores del navegador. No se transmite nada, lo cual es una propiedad de dónde se realiza el trabajo en lugar de una política aplicada en un servidor.

Etapa dos: la puntuación del encuadre completo

La imagen cambia de tamaño a 384 píxeles cuadrados y pasa por un vision transformer. El modelo devuelve una probabilidad bruta de que el encuadre sea sintético. Ese número se calibra para que se asigne a las franjas publicadas de manera consistente en lugar de desviarse con el modelo.

El cambio de tamaño pierde detalles, que es el primer lugar donde la precisión disminuye. También es inevitable: el modelo tiene un tamaño de entrada fijo, y una fotografía de 4000 píxeles debe reducirse para ajustarse a él.

Etapa tres: el paso de fragmentación

El encuadre se divide en regiones superpuestas y cada una es evaluada por sí sola por el mismo modelo. Esto es lo que separa una imagen completamente generada de una fotografía real con algo añadido, y es la etapa que un solo número no puede reemplazar.

14 11 16 12 88 13 9 15 10

Promediar estos da 21. La vista de fragmentos mantiene la información que el promedio destruye.

El mismo modelo, ejecutado nueve veces en recortes superpuestos. La puntuación del encuadre completo para esta imagen fue 31.

Los fragmentos necesitan suficientes píxeles para ser significativos, por lo que las imágenes por debajo de aproximadamente 576 píxeles en el lado más corto obtienen solo una puntuación de encuadre completo. No hay suficientes detalles en un recorte pequeño para evaluarlo de forma independiente.

Etapa cuatro: el propio registro del archivo

Por separado de los píxeles, se revisa el archivo en busca de Content Credentials y marcadores de generador dejados por algunas herramientas. Esta ruta es criptográfica en lugar de estadística: una firma válida se verifica contra una lista de confianza, no se estima.

Cómo se combinan los resultados

Las dos rutas no se promedian, porque tienen pesos diferentes. Una credencial válida que declara una captura de cámara supera una puntuación de píxeles moderada. Una credencial que declara generación por IA resuelve la cuestión por sí sola.

Cómo se pondera la evidencia
EvidenciaTipoPeso
Credencial válida que declara generación por IACriptográficoDecisivo
Credencial válida que declara captura de cámaraCriptográficoMuy fuerte
Marcador de generador en el archivoDeclarativoFuerte, pero se puede quitar
Puntuación de píxeles del encuadre completoEstadísticoModerado
Puntuaciones de fragmentos de regiónEstadísticoModerado, y más específico
No hay credencial presenteNadaSin información en ningún sentido

Esa última fila es la que la gente lee mal con más frecuencia. Una credencial ausente no es una señal negativa. La abrumadora mayoría de las imágenes jamás creadas no llevan ninguna, y casi todas las plataformas las eliminan al subirlas.

Por qué se ejecuta en el navegador

El modelo ocupa unos 40 MB y se ejecuta a través de WebAssembly en el propio dispositivo del visitante. Esa es una elección arquitectónica deliberada con tres consecuencias que vale la pena comprender.

  • No se sube nada, por lo que no hay ningún servidor que contenga las imágenes de nadie y ninguna relación de procesamiento de datos que documentar.
  • Una verificación no cuesta nada servirla, razón por la cual la herramienta puede ser gratuita sin un medidor de uso detrás.
  • La primera verificación es más lenta, porque el modelo se descarga una vez antes de poder ejecutarse. Las verificaciones posteriores reutilizan la copia en caché.

Lo que la canalización deliberadamente no hace

Varias técnicas que aparecen en herramientas de análisis forense más antiguas están ausentes, porque ya no funcionan en imágenes que han viajado a través de plataformas modernas.

  • Análisis de nivel de error. Popular, ampliamente malinterpretado y poco confiable en cualquier imagen que se haya guardado más de una vez.
  • Detección de copia-movimiento. Encuentra regiones duplicadas dentro de un encuadre, lo que detecta la clonación de estilo antiguo y no la generación.
  • Veredictos basados en metadatos. EXIF se elimina en la carga en casi todas partes, por lo que una verificación que depende de él falla precisamente en las imágenes que la gente necesita verificar.
  • Análisis específico de la cara. Útil para una clase estrecha de manipulación y ciego a todo lo demás.

Preguntas habituales

¿El detector mira lo que hay en la imagen?
No. No tiene el concepto de objetos, caras o escenas. Mide las relaciones estadísticas entre píxeles vecinos, por lo que funciona igual en un retrato, una escena callejera y un recibo, y por qué no puede decirte si el contenido de una imagen es verdadero.
¿Por qué la primera verificación tarda más?
El modelo se descarga una vez, unos 40 MB, antes de que algo pueda ejecutarse. Después de eso se almacena en caché y las verificaciones posteriores comienzan inmediatamente. Este es el costo de ejecutarlo en tu dispositivo en lugar de en un servidor, y te compra el hecho de que no se sube nada.
¿Cómo se convierte la salida bruta del modelo en una puntuación?
Calibración. El modelo devuelve una probabilidad bruta, que se asigna a una escala fija para que un número dado siempre signifique lo mismo. Sin ese paso, las puntuaciones cambiarían cada vez que cambiara el modelo y ninguna franja publicada seguiría siendo significativa.
¿Por qué fragmentos superpuestos en lugar de una cuadrícula simple?
Una edición a caballo entre los límites de un fragmento se dividiría entre dos regiones y se diluiría en ambas. La superposición de los recortes significa que cualquier edición cae completamente dentro de al menos una región, que es lo que evita que un inserto pequeño se promedie y desaparezca.
¿Puede decir qué generador hizo una imagen?
Solo donde el archivo lo dice. Un marcador de generador o una credencial puede nombrar la herramienta; el modelo de píxeles no puede. Devuelve la probabilidad de que algo generativo estuviera involucrado, lo que es una pregunta diferente de la identificación y mucho más fácil de responder de manera confiable.
¿Se usa el mismo modelo para el encuadre y los fragmentos?
Sí. Ejecutar un modelo en diferentes recortes es lo que hace que los dos resultados sean comparables. Un modelo de región separado tendría su propia calibración y sus propios errores, y los dos números ya no se asentarían en la misma escala.