Las dos vías
Un detector ejecuta dos comprobaciones independientes y responden a cosas diferentes. Mantenerlas separadas es la idea más útil de esta página.
Análisis de píxeles
- Funciona después de capturas de pantalla y compresión
- Devuelve una probabilidad, no una identidad
- Independiente del generador por diseño
- No puede nombrar una herramienta
- Se degrada ante arquitecturas no vistas
Evidencia en el archivo
- Puede nombrar la herramienta exactamente
- Criptográfico cuando está firmado
- Eliminado por casi todas las plataformas
- Ausente en la mayoría de las imágenes
- Eliminado trivialmente a propósito
Lo que un archivo puede declarar
Cuando una imagen aún conserva su estructura original, pueden estar presentes varios tipos de marcadores. Cada uno es una declaración de la herramienta que lo escribió, en lugar de algo derivado de los píxeles.
- Content Credentials. Un manifiesto firmado que nombra la herramienta y lo que hizo. Algunos de los principales generadores ahora firman sus resultados, lo cual es la forma más fuerte de esto.
- Parámetros de generación. Varias herramientas abiertas incrustan la indicación, la semilla, el muestreador y el nombre del modelo directamente en el archivo, lo que es más información de la que la mayoría de la gente espera encontrar.
- Identificadores de software. Un campo de metadatos simple que nombra la aplicación que guardó la imagen por última vez.
- Marcas de agua de IA declaradas. Un indicador que señala que se aplicó una marca de agua invisible, lo cual es una declaración y no la marca de agua en sí.
- Afirmaciones de captura de cámara. La afirmación opuesta, realizada por una cámara de firma, de que el archivo procede de un sensor.
Todos estos desaparecen en el momento en que una imagen se sube a casi cualquier plataforma. Por eso vale la pena ejecutar un análisis de archivos, pero nunca depender de él: cuando encuentra algo el hallazgo es sólido, pero la mayor parte del tiempo no encuentra nada.
Por qué es difícil nombrar el generador
Suena como si debería ser posible. Las diferentes herramientas producen estéticas diferentes, y una persona que pasa tiempo con ellas a menudo puede adivinar correctamente. Esa intuición no se transfiere a un detector por tres razones.
Los modelos comparten arquitecturas y datos de entrenamiento, por lo que sus huellas estadísticas se superponen fuertemente. Muchas herramientas son ajustes finos de la misma base, lo que las hace casi indistinguibles a nivel de textura, incluso cuando sus resultados parecen diferentes para una persona.
Los resultados también se posprocesan. La mejora de resolución, la restauración de rostros y la edición ocurren después de la generación y reescriben exactamente la textura de la que dependería una identificación. Para cuando se publica una imagen, puede llevar más del mejorador que del generador.
Y el objetivo se mueve constantemente. Cualquier modelo de identificación es una tabla de búsqueda de cosas que ya existían, lo que hace que se equivoque sobre cualquier cosa lanzada desde que se entrenó, de una forma que es silenciosa en lugar de evidente.
Lo que realmente significa una buena cobertura
La pregunta útil sobre un detector no es qué generadores reconoce por su nombre. Es qué tan amplio fue el entrenamiento, porque la amplitud es lo que predice el rendimiento en el modelo que aún no se ha lanzado.
| Enfoque | Fortaleza | Debilidad |
|---|---|---|
| Entrenar en unas pocas herramientas comerciales importantes | Alta precisión en esas herramientas | Mala generalización a cualquier otra cosa |
| Entrenar a través de miles de generadores | Se generaliza a modelos no vistos | Menor precisión máxima en cualquier modelo individual |
| Buscar el artefacto de una arquitectura | Muy alta mientras dura | Falla por completo cuando cambia el método |
| Leer solo marcadores de archivo | Exacto cuando está presente | Ciego en la mayoría de las imágenes |
La segunda fila es el enfoque utilizado aquí, y la contrapartida es deliberada. Un detector que es excelente en cuatro productos e inútil en el quinto no sirve de mucho para comprobar una imagen que alguien le ha enviado.
Sobre los nombres de los productos
Las listas de generadores compatibles son un artefacto de marketing más que técnico. Un modelo de píxeles no tiene una lista; tiene una distribución de entrenamiento. Nombrar productos implica una capacidad por herramienta que la detección amplia no tiene y no necesita.
Cuando aparece un nombre en un resultado aquí, proviene del archivo y no de los píxeles, y el resultado lo indica. Vale la pena insistir en esa distinción para cualquier herramienta que utilice.
Cómo leer una afirmación de cobertura
Los proveedores describen la cobertura de formas que parecen comparables pero no lo son. Tres frases aparecen repetidamente y cada una significa algo diferente.
Detecta imágenes de X, Y y Z generalmente significa que el punto de referencia contenía esos tres. Es una afirmación sobre las pruebas en lugar de sobre la capacidad, y no dice nada sobre el cuarto generador.
Soporta más de cuarenta generadores generalmente significa que el conjunto de entrenamiento extrajo de esa cantidad de fuentes. Eso es más significativo, porque la amplitud del entrenamiento es lo que predice la generalización, y aún así no es una garantía sobre ninguna herramienta específica.
Identificar el modelo de origen es la afirmación que más se debe cuestionar. Pregúntese si esa identificación proviene del archivo o de los píxeles. Si proviene de los píxeles, pida la precisión de la identificación por separado de la precisión de la detección, porque son números muy diferentes.