Qué mide la precisión equilibrada
La precisión simple es fácil de inflar. Si le proporciona a un detector un conjunto de prueba con un 90 por ciento de imágenes generadas, un modelo que responda afirmativamente a todo obtendrá un 90 por ciento de precisión siendo inútil.
La precisión equilibrada corrige esto ponderando por igual las imágenes reales y las generadas, de modo que la cifra es el promedio de dos tasas: la frecuencia con la que se dan por válidas las fotografías auténticas y la frecuencia con la que se marcan correctamente las imágenes generadas. Una herramienta que cite la precisión simple sin especificar la composición de su prueba no le está aportando mucha información.
Las dos formas en que se equivoca un detector
Una sola cifra oculta dos fallos muy diferentes, y cada uno conlleva costes muy distintos.
Falso positivo
- Una fotografía auténtica obtuvo una puntuación por encima del umbral
- Causado por reescalado, retoque, modo nocturno, capturas de pantalla
- Coste: una acusación contra una persona real
- El fallo que causa un daño real
Falso negativo
- Una imagen generada obtuvo una puntuación por debajo del umbral
- Causado por nuevos generadores, pequeños retoques, archivos alterados
- Coste: un contenido falso pasa desapercibido
- El fallo al que se presta menos atención
Mover la línea de decisión intercambia un aspecto por otro. Bajarla detecta más imágenes falsas y marca más fotografías reales. Subirla protege las imágenes auténticas y deja pasar más falsedades. No existe una configuración que mejore ambas cosas, por eso la línea se publica en 65 en lugar de ajustarse en silencio.
Por qué las cifras de referencia sobreestiman el rendimiento real
| Imagen de referencia | Su imagen | Efecto en la puntuación |
|---|---|---|
| Archivo original, nunca guardado de nuevo | Comprimido dos o tres veces | La precisión cae varios puntos |
| Resolución completa | Recortado o reducido para una app de mensajería | Menos detalle para analizar, más incertidumbre |
| Generadores conocidos en la fase de entrenamiento | Un modelo publicado el mes pasado | La debilidad constante de todo detector |
| Fotografía limpia o renderizado limpio | Foto real con una edición mediante IA | La puntuación del encuadre completo se queda corta |
| Sin procesamiento adversarial | Manipulado deliberadamente para superar la prueba | Diseñado para eludir la medición |
Caso habitual en la práctica. Describen el recorrido real de las imágenes. Una imagen que le llega a través de dos plataformas y una captura de pantalla ya ha perdido gran parte de la señal sobre la que se midió la referencia.
Cómo interpretar una afirmación de precisión
- Pregunte qué conjunto de prueba se usó. Una cifra sin una referencia identificada es marketing. Una cifra basada en una referencia pública puede ser verificada por cualquiera.
- Pregunte si es equilibrada o simple. La precisión simple en un conjunto de prueba descompensado es el número más fácil de inflar.
- Pregunte dónde se sitúa la línea de decisión. La precisión no significa nada si se desconoce el umbral con el que se midió.
- Pregunte qué generadores se incluyeron. Cualquier detector obtiene buenos resultados con los modelos con los que se entrenó y peores con los publicados posteriormente.
- Solicite la tasa de falsos positivos por separado. Ese es el número que determina si la herramienta es segura para usarse con personas reales.
Lo que la precisión no puede decirle
Una referencia mide con qué frecuencia acierta un modelo en un conjunto de imágenes. No dice nada sobre si acierta en la suya. No hay un intervalo de confianza asociado a un único resultado, y un detector no puede saber cuál de sus errores está cometiendo.
Por eso el mapa regional y las pruebas del archivo importan más que la cifra principal. La coincidencia entre señales independientes vale más que un número alto en una sola de ellas, y la discrepancia es un hallazgo en sí misma.
Cómo probar un detector usted mismo
No tiene que dar por buena la cifra de nadie. Una prueba útil requiere una tarde y le dirá más sobre una herramienta que cualquier referencia publicada, porque utiliza imágenes similares a las suyas.
-
Cree un conjunto cuya respuesta ya conozca
Veinte fotografías tomadas por usted y veinte imágenes que haya generado. Mantenga los originales sin modificar. Veinte de cada tipo son suficientes para dejar al descubierto una herramienta deficiente.
-
Incluya los casos más complejos
Añada capturas de pantalla de sus propias fotos, tomas en modo nocturno, un recorte reescalado y un retrato muy retocado. Aquí es donde fallan los detectores, y es la parte que todas las referencias de los proveedores omiten.
-
Anote la puntuación y el rango, no un veredicto
Escriba lo que devuelve cada herramienta. Comparar rangos aporta más información que comparar números, porque dos herramientas pueden situar sus líneas de decisión en lugares distintos.
-
Cuente los dos tipos de error por separado
Cuántas de sus fotos reales se marcaron como falsas y cuántas de sus imágenes generadas no se detectaron. Una herramienta que nunca pasa por alto una imagen falsa pero marca un tercio de sus propias fotografías no es apta para usarse con personas.
El número que importa es el primero: con qué frecuencia clasifica su propio trabajo como falso. Ese es el fallo que conlleva un coste, y es el que oculta la media de la cifra de precisión general.