Cómo construye una imagen una GAN
Una red generativa antagónica comienza a partir de un pequeño vector y lo sobremuestrea repetidamente, duplicando la resolución en cada capa hasta alcanzar el tamaño completo. Una segunda red evalúa el resultado y las dos se entrenan compitiendo entre sí.
El sobremuestreo repetido es la parte importante. Cada paso de duplicación introduce un patrón regular, y esos patrones se acumulan en una estructura periódica que es visible cuando la imagen se transforma al dominio de la frecuencia.
Esa estructura era casi una firma. Los primeros detectores podían buscar un patrón de tablero de ajedrez en el espectro de frecuencia y alcanzar una gran precisión sin entender nada sobre la imagen. Era una huella dactilar de la arquitectura más que de un modelo en particular.
Cómo la construye un modelo de diffusion
La diffusion funciona al revés. Comienza con un campo de ruido puro a la resolución objetivo completa y elimina un poco de él en cada paso, guiado por lo que aprendió el modelo, hasta que emerge una imagen.
No hay un escalado progresivo, por lo que no hay un artefacto periódico. El resultado es estadísticamente diferente a la captura de una cámara, y la diferencia es difusa en lugar de estructural. Nada en ella aparece como un patrón claro que se pueda buscar.
GAN
- Vector pequeño ampliado repetidamente
- Artefactos periódicos en cada duplicación
- Detectable en el dominio de frecuencia
- La arquitectura deja una especie de firma
- Dominante hasta aproximadamente 2022
Diffusion
- Ruido eliminado paso a paso a tamaño completo
- Sin escalado progresivo, sin patrón periódico
- La diferencia es estadística, no estructural
- Necesita un modelo entrenado para la detección
- Dominante desde 2022
Por qué dejaron de funcionar los detectores antiguos
Una herramienta creada para encontrar el efecto de tablero de ajedrez en el dominio de frecuencia no encuentra nada en una imagen de diffusion. No informa sobre incertidumbre; informa que el artefacto está ausente, lo que se interpreta como un resultado limpio.
Por eso la precisión de la detección en todo el sector pareció desplomarse entre 2021 y 2023. Las herramientas no se habían degradado. Lo que buscaban había dejado de producirse.
Qué sustituyó a la detección de arquitectura específica
Amplitud. En lugar de buscar un solo artefacto, los detectores actuales se entrenan con los resultados de tantos generadores distintos como sea posible recopilar, para que el modelo aprenda lo que la textura sintética tiene en común en lugar de lo que produce una familia concreta.
El modelo utilizado aquí se entrenó con millones de imágenes procedentes de miles de generadores exactamente por este motivo. La cobertura de diferentes arquitecturas es lo que permite generalizar para la siguiente, y es el único enfoque que ha sobrevivido a un cambio en el método dominante.
La contrapartida es que la precisión en cualquier generador conocido es menor a la que lograría un detector especializado. Es la concesión adecuada, porque un especialista es inútil el día que llega algo nuevo.
Qué predice esto
La lección de la transición de GAN a diffusion no trata sobre diffusion. Consiste en que cualquier detector vinculado a la forma actual de crear imágenes tiene una vida útil limitada, y la transición no se anunciará de antemano.
| Enfoque | Funcionó en | Falló cuando |
|---|---|---|
| Búsqueda de artefactos de frecuencia | GAN | Llegó diffusion |
| Análisis específico de rostros | Primeros intercambios de rostros | Llegó la generación de escenas completas |
| Inspección de metadatos | Archivos directos de una herramienta | Las plataformas eliminaron los metadatos |
| Análisis de nivel de error | Archivos JPEG de un solo guardado | Las imágenes empezaron a circular |
| Entrenamiento amplio multigenerador | La mayoría de resultados actuales | Desconocido y posterior a los demás |
¿Importa algo de esto a un usuario?
Principalmente explica dos cosas que notará. Primero, por qué un detector generalmente no puede nombrar la herramienta que produjo una imagen: lee una propiedad estadística compartida en lugar de una huella específica por modelo.
Segundo, por qué los verificadores gratuitos antiguos rinden mal. Varias herramientas que siguen en línea se construyeron basándose en artefactos de GAN y no se han reentrenado. Devuelven resultados limpios seguros en resultados actuales, y nada en la interfaz indica por qué.
Qué le hace una cadena híbrida a un resultado
La mayoría de las imágenes que le llegan no se produjeron por un único método. Un modelo de diffusion genera una base, un escalador basado en GAN la amplía, un paso de restauración facial arregla los ojos, y un editor recorta y vuelve a guardar el resultado.
Cada etapa reescribe la textura, por lo que el archivo lleva rastros de varios procesos superpuestos. El último en tocar la imagen suele dominar lo que lee un detector, que es la razón por la que una imagen de diffusion ampliada puede parecer estadísticamente más similar al escalador que al generador.
Esta es la razón práctica por la que la identificación de la arquitectura no funciona fuera del laboratorio. En una prueba controlada con resultados limpios de un solo modelo es un problema que se puede resolver. En una imagen que ha pasado por una cadena de producción real, la pregunta no está bien formulada.
También explica un resultado que a la gente le resulta confuso: una imagen genuinamente generada que puntúa menos que una fotografía muy ampliada. Ambas han tenido su textura reescrita por software, y el detector está leyendo la reescritura en lugar del origen.