← Todas las guías Bajo el capó

diffusion vs GAN: por qué los detectores los manejan de forma diferente

Dos formas de construir una imagen, dos huellas dactilares diferentes. Lo que deja atrás cada proceso, por qué las GAN eran más fáciles de detectar y qué predice esto sobre lo que vendrá después.

· 8 min de lectura · Best AI Image Detector

Las GAN dejan un artefacto repetitivo del sobremuestreo que es casi una firma. Los modelos de diffusion no lo hacen, que es la razón por la que la detección se volvió más difícil en 2022 y por la que los trucos específicos de la arquitectura dejaron de funcionar.

Cómo construye una imagen una GAN

Una red generativa antagónica comienza a partir de un pequeño vector y lo sobremuestrea repetidamente, duplicando la resolución en cada capa hasta alcanzar el tamaño completo. Una segunda red evalúa el resultado y las dos se entrenan compitiendo entre sí.

El sobremuestreo repetido es la parte importante. Cada paso de duplicación introduce un patrón regular, y esos patrones se acumulan en una estructura periódica que es visible cuando la imagen se transforma al dominio de la frecuencia.

Esa estructura era casi una firma. Los primeros detectores podían buscar un patrón de tablero de ajedrez en el espectro de frecuencia y alcanzar una gran precisión sin entender nada sobre la imagen. Era una huella dactilar de la arquitectura más que de un modelo en particular.

Cómo la construye un modelo de diffusion

La diffusion funciona al revés. Comienza con un campo de ruido puro a la resolución objetivo completa y elimina un poco de él en cada paso, guiado por lo que aprendió el modelo, hasta que emerge una imagen.

No hay un escalado progresivo, por lo que no hay un artefacto periódico. El resultado es estadísticamente diferente a la captura de una cámara, y la diferencia es difusa en lugar de estructural. Nada en ella aparece como un patrón claro que se pueda buscar.

GAN

  • Vector pequeño ampliado repetidamente
  • Artefactos periódicos en cada duplicación
  • Detectable en el dominio de frecuencia
  • La arquitectura deja una especie de firma
  • Dominante hasta aproximadamente 2022

Diffusion

  • Ruido eliminado paso a paso a tamaño completo
  • Sin escalado progresivo, sin patrón periódico
  • La diferencia es estadística, no estructural
  • Necesita un modelo entrenado para la detección
  • Dominante desde 2022
Los dos procesos y lo que deja cada uno. La columna de la derecha explica por qué hubo que reconstruir la detección.

Por qué dejaron de funcionar los detectores antiguos

Una herramienta creada para encontrar el efecto de tablero de ajedrez en el dominio de frecuencia no encuentra nada en una imagen de diffusion. No informa sobre incertidumbre; informa que el artefacto está ausente, lo que se interpreta como un resultado limpio.

Por eso la precisión de la detección en todo el sector pareció desplomarse entre 2021 y 2023. Las herramientas no se habían degradado. Lo que buscaban había dejado de producirse.

Qué sustituyó a la detección de arquitectura específica

Amplitud. En lugar de buscar un solo artefacto, los detectores actuales se entrenan con los resultados de tantos generadores distintos como sea posible recopilar, para que el modelo aprenda lo que la textura sintética tiene en común en lugar de lo que produce una familia concreta.

El modelo utilizado aquí se entrenó con millones de imágenes procedentes de miles de generadores exactamente por este motivo. La cobertura de diferentes arquitecturas es lo que permite generalizar para la siguiente, y es el único enfoque que ha sobrevivido a un cambio en el método dominante.

La contrapartida es que la precisión en cualquier generador conocido es menor a la que lograría un detector especializado. Es la concesión adecuada, porque un especialista es inútil el día que llega algo nuevo.

Qué predice esto

La lección de la transición de GAN a diffusion no trata sobre diffusion. Consiste en que cualquier detector vinculado a la forma actual de crear imágenes tiene una vida útil limitada, y la transición no se anunciará de antemano.

Cómo envejeció cada generación de detectores
EnfoqueFuncionó enFalló cuando
Búsqueda de artefactos de frecuenciaGANLlegó diffusion
Análisis específico de rostrosPrimeros intercambios de rostrosLlegó la generación de escenas completas
Inspección de metadatosArchivos directos de una herramientaLas plataformas eliminaron los metadatos
Análisis de nivel de errorArchivos JPEG de un solo guardadoLas imágenes empezaron a circular
Entrenamiento amplio multigeneradorLa mayoría de resultados actualesDesconocido y posterior a los demás

¿Importa algo de esto a un usuario?

Principalmente explica dos cosas que notará. Primero, por qué un detector generalmente no puede nombrar la herramienta que produjo una imagen: lee una propiedad estadística compartida en lugar de una huella específica por modelo.

Segundo, por qué los verificadores gratuitos antiguos rinden mal. Varias herramientas que siguen en línea se construyeron basándose en artefactos de GAN y no se han reentrenado. Devuelven resultados limpios seguros en resultados actuales, y nada en la interfaz indica por qué.

Qué le hace una cadena híbrida a un resultado

La mayoría de las imágenes que le llegan no se produjeron por un único método. Un modelo de diffusion genera una base, un escalador basado en GAN la amplía, un paso de restauración facial arregla los ojos, y un editor recorta y vuelve a guardar el resultado.

Cada etapa reescribe la textura, por lo que el archivo lleva rastros de varios procesos superpuestos. El último en tocar la imagen suele dominar lo que lee un detector, que es la razón por la que una imagen de diffusion ampliada puede parecer estadísticamente más similar al escalador que al generador.

Esta es la razón práctica por la que la identificación de la arquitectura no funciona fuera del laboratorio. En una prueba controlada con resultados limpios de un solo modelo es un problema que se puede resolver. En una imagen que ha pasado por una cadena de producción real, la pregunta no está bien formulada.

También explica un resultado que a la gente le resulta confuso: una imagen genuinamente generada que puntúa menos que una fotografía muy ampliada. Ambas han tenido su textura reescrita por software, y el detector está leyendo la reescritura en lugar del origen.

Preguntas habituales

¿Son más fáciles de detectar las imágenes GAN que las de diffusion?
Lo eran, y ahora hay muchas menos. El escalado de GAN dejaba un artefacto periódico que un análisis simple de frecuencia podía encontrar. Diffusion no deja una estructura equivalente, por lo que la detección requiere un modelo entrenado que lea la textura estadística en lugar de una búsqueda específica de un patrón.
¿Puede decirme un detector si una imagen proviene de una GAN o de un modelo de diffusion?
No a partir de los píxeles, en general. Un detector amplio informa sobre la probabilidad de que algo generativo haya intervenido, no qué familia lo produjo. La identificación de la arquitectura es un problema de investigación distinto y es considerablemente menos fiable que la detección.
¿Se siguen utilizando las GAN?
Sí, en casos concretos. Siguen siendo rápidas y eficaces para tareas delimitadas como la síntesis facial y cierto tipo de escalado, en las que diffusion sería más lenta. Algunas herramientas utilizan ambas en etapas diferentes, lo que significa que una imagen puede llevar rastros de cualquiera de las dos.
¿Romperá de nuevo la detección la próxima arquitectura?
Reducirá la precisión en lugar de romperla, que es la mejora aportada por el entrenamiento amplio. Un modelo que aprendió lo que tiene en común la textura sintética a través de miles de generadores se degrada gradualmente frente a algo nuevo, mientras que un detector de artefactos simples falla por completo.
¿Por qué algunas herramientas siguen afirmando tener una precisión muy alta?
Generalmente porque realizan mediciones en un conjunto de pruebas construido a partir de generadores con los que se entrenaron. Esa cifra es real y no describe el rendimiento del modelo publicado el mes pasado. Pregunte qué generadores había en la evaluación de rendimiento antes de comparar las cifras entre herramientas.
¿Afecta esto a cómo debería leer una puntuación?
Solo en un sentido. Considere un resultado limpio en una imagen de la que tiene otros motivos para dudar como una prueba más débil que un resultado marcado, porque el modo de fallo de una arquitectura desconocida es una puntuación baja con certeza en lugar de una dudosa.