Qué está buscando el modelo
Una cámara registra la luz a través de una lente en un sensor. Ese proceso deja un tipo específico de ruido, un patrón específico de nitidez que disminuye hacia los bordes y una relación específica entre los píxeles adyacentes que proviene de la cuadrícula del sensor y el interpolado cromático que le sigue.
Un modelo de difusión construye una imagen eliminando repetidamente el ruido de un campo aleatorio hasta que surge algo coherente. Ese proceso también deja una firma, y es diferente. El resultado puede ser visualmente perfecto y estadísticamente distinguible al mismo tiempo.
Esta es la razón por la que la detección sobrevive a una captura de pantalla cuando los metadatos no lo hacen. La firma se encuentra en los valores de los píxeles en sí mismos en lugar de en un encabezado, por lo que copiar los píxeles copia la evidencia.
Las cuatro etapas
- 1 Leer el archivo Decodificado en el navegador, nunca subido
- 2 Evaluar el encuadre Vision transformer a 384 píxeles cuadrados
- 3 Evaluar los fragmentos El mismo modelo en regiones superpuestas
- 4 Leer las credenciales Marcadores de C2PA y del generador, si están presentes
Etapa uno: decodificación
La página lee el archivo del disco y lo decodifica en píxeles en bruto. HEIC, AVIF, TIFF y el resto son manejados por los propios decodificadores del navegador. No se transmite nada, lo cual es una propiedad de dónde se realiza el trabajo en lugar de una política aplicada en un servidor.
Etapa dos: la puntuación del encuadre completo
La imagen cambia de tamaño a 384 píxeles cuadrados y pasa por un vision transformer. El modelo devuelve una probabilidad bruta de que el encuadre sea sintético. Ese número se calibra para que se asigne a las franjas publicadas de manera consistente en lugar de desviarse con el modelo.
El cambio de tamaño pierde detalles, que es el primer lugar donde la precisión disminuye. También es inevitable: el modelo tiene un tamaño de entrada fijo, y una fotografía de 4000 píxeles debe reducirse para ajustarse a él.
Etapa tres: el paso de fragmentación
El encuadre se divide en regiones superpuestas y cada una es evaluada por sí sola por el mismo modelo. Esto es lo que separa una imagen completamente generada de una fotografía real con algo añadido, y es la etapa que un solo número no puede reemplazar.
Promediar estos da 21. La vista de fragmentos mantiene la información que el promedio destruye.
Los fragmentos necesitan suficientes píxeles para ser significativos, por lo que las imágenes por debajo de aproximadamente 576 píxeles en el lado más corto obtienen solo una puntuación de encuadre completo. No hay suficientes detalles en un recorte pequeño para evaluarlo de forma independiente.
Etapa cuatro: el propio registro del archivo
Por separado de los píxeles, se revisa el archivo en busca de Content Credentials y marcadores de generador dejados por algunas herramientas. Esta ruta es criptográfica en lugar de estadística: una firma válida se verifica contra una lista de confianza, no se estima.
Cómo se combinan los resultados
Las dos rutas no se promedian, porque tienen pesos diferentes. Una credencial válida que declara una captura de cámara supera una puntuación de píxeles moderada. Una credencial que declara generación por IA resuelve la cuestión por sí sola.
| Evidencia | Tipo | Peso |
|---|---|---|
| Credencial válida que declara generación por IA | Criptográfico | Decisivo |
| Credencial válida que declara captura de cámara | Criptográfico | Muy fuerte |
| Marcador de generador en el archivo | Declarativo | Fuerte, pero se puede quitar |
| Puntuación de píxeles del encuadre completo | Estadístico | Moderado |
| Puntuaciones de fragmentos de región | Estadístico | Moderado, y más específico |
| No hay credencial presente | Nada | Sin información en ningún sentido |
Esa última fila es la que la gente lee mal con más frecuencia. Una credencial ausente no es una señal negativa. La abrumadora mayoría de las imágenes jamás creadas no llevan ninguna, y casi todas las plataformas las eliminan al subirlas.
Por qué se ejecuta en el navegador
El modelo ocupa unos 40 MB y se ejecuta a través de WebAssembly en el propio dispositivo del visitante. Esa es una elección arquitectónica deliberada con tres consecuencias que vale la pena comprender.
- No se sube nada, por lo que no hay ningún servidor que contenga las imágenes de nadie y ninguna relación de procesamiento de datos que documentar.
- Una verificación no cuesta nada servirla, razón por la cual la herramienta puede ser gratuita sin un medidor de uso detrás.
- La primera verificación es más lenta, porque el modelo se descarga una vez antes de poder ejecutarse. Las verificaciones posteriores reutilizan la copia en caché.
Lo que la canalización deliberadamente no hace
Varias técnicas que aparecen en herramientas de análisis forense más antiguas están ausentes, porque ya no funcionan en imágenes que han viajado a través de plataformas modernas.
- Análisis de nivel de error. Popular, ampliamente malinterpretado y poco confiable en cualquier imagen que se haya guardado más de una vez.
- Detección de copia-movimiento. Encuentra regiones duplicadas dentro de un encuadre, lo que detecta la clonación de estilo antiguo y no la generación.
- Veredictos basados en metadatos. EXIF se elimina en la carga en casi todas partes, por lo que una verificación que depende de él falla precisamente en las imágenes que la gente necesita verificar.
- Análisis específico de la cara. Útil para una clase estrecha de manipulación y ciego a todo lo demás.