Las cuatro razones por las que los resultados difieren
Una puntuación es el final de una larga cadena de decisiones. Cambia cualquier eslabón y el número se mueve, aunque nada en la imagen haya cambiado.
- Diferentes datos de entrenamiento. Un detector reconoce lo que ha visto. Uno entrenado con miles de generadores abiertos maneja bien los modelos inusuales. Uno entrenado con las cuatro herramientas comerciales más grandes maneja mejor esas cuatro y peor todo lo demás.
- Diferentes líneas de decisión. Una herramienta considera sospechoso un 60, otra considera sospechoso un 75. La misma lectura cruza un umbral y el otro no, por lo que obtienes dos veredictos a partir de una medición.
- Diferentes definiciones. Algunas herramientas cuentan cualquier implicación generativa, incluyendo un escalado o un relleno generativo. Otras solo marcan encuadres totalmente sintéticos. Un retrato retocado es IA para la primera y real para la segunda.
- Diferente preprocesamiento. Las herramientas redimensionan, recortan y vuelven a codificar antes de puntuar. Un detector que lee un cuadrado de 224 píxeles del centro ve una imagen diferente que uno que lee 384 píxeles de todo el encuadre.
La herramienta D no es más sensible que las demás. Responde a una pregunta más amplia. Si lo que te preocupa es si una fotografía fue escenificada por un generador, D está informando de más. Si lo que te preocupa es si alguna IA tocó el archivo, D es la única que te está respondiendo.
Pregunta a qué cuestión responde cada herramienta
| La cuestión | Qué lo marca | Uso típico |
|---|---|---|
| ¿Se generó este encuadre de la nada? | Textura sintética de encuadre completo | Noticias, anuncios de venta, perfiles de citas |
| ¿Fue alguna parte de esto editada por IA? | Una región por encima de la línea | Seguros, siniestros, revisión de pruebas |
| ¿Tocó alguna IA este archivo en absoluto? | Escalado, reducción de ruido, relleno generativo | Bibliotecas de recursos, reglas de competición |
La mayor parte del desacuerdo entre las herramientas es en realidad un desacuerdo sobre cuál de estas tres preguntaste. Antes de comparar los resultados, decide qué cuestión te importa y luego lee cada herramienta frente a ella.
Cómo comparar dos resultados correctamente
-
Proporciona a ambas herramientas un archivo idéntico
Ni una redescarga, ni una captura de pantalla, ni una copia que pasó por una aplicación de chat. Distintos bytes son una imagen diferente y legítimamente puntuarán de manera diferente.
-
Compara franjas, no números
Un 61 en una escala con una línea en 50 y un 58 en una escala con una línea en 65 discrepan sobre el veredicto aunque coinciden en la lectura.
-
Busca un umbral publicado
Una herramienta que no dice dónde se sitúa su línea no se puede comparar con nada. Trata el número como ininterpretable en lugar de como prueba.
-
Prefiere la herramienta que muestra cómo funciona
Un mapa de regiones, una franja con nombre y un banco de pruebas declarado te permiten comprobar el razonamiento. Una etiqueta segura sin nada detrás no lo hace.
-
Trata el acuerdo como la señal fuerte
Dos herramientas independientes que alcanzan la misma franja valen más que cualquiera de las dos por separado. Dos que discrepan significa incertidumbre, no un punto intermedio.
Cuando el desacuerdo es el hallazgo
Vale la pena aprender a reconocer un patrón. Una herramienta que informa de una puntuación baja en todo el encuadre junto con una que informa de una puntuación alta suele significar que la imagen es una fotografía real con una edición local.
La primera herramienta está promediando la edición a lo largo de un encuadre en su mayor parte genuino. La segunda está ponderando la región más fuerte. Ambas tienen razón sobre lo que han medido, y el desacuerdo en sí te ha dicho más que cualquiera de los números.
Un mosaico por encima de la línea de decisión dentro de un encuadre que por lo demás es frío. Ningún número por sí solo capta esto.
Qué haría que los detectores estuvieran de acuerdo
Un banco de pruebas compartido, líneas de decisión publicadas y una definición consensuada de lo que cuenta como implicación de IA eliminarían la mayor parte de la dispersión. Todavía no existe nada de esto, y hay poca presión comercial para crearlo, porque una herramienta que publica sus puntos débiles tiene peor aspecto que una que no lo hace.
Hasta que eso cambie, trata cada puntuación como procedente de una escala privada. Lee las pruebas que te muestra una herramienta y pondéralas más que la confianza de su etiqueta.
El problema de versión que nadie menciona
Un detector no es algo único a lo largo del tiempo. Los proveedores vuelven a entrenar, ajustan los umbrales e intercambian modelos sin previo aviso, y casi ninguno de ellos versiona sus resultados. La puntuación que obtuviste en marzo y la que obtienes hoy pueden proceder de modelos diferentes con una calibración diferente.
Esto importa si registras los resultados. Un expediente de siniestros, un registro de moderación o un caso académico que cita una puntuación de hace dieciocho meses está citando una medición cuyo instrumento ya no existe. No hay forma de reproducirla y no hay forma de comprobar qué significaba en su momento.
Donde guarde los resultados, guarde las pruebas junto a ellos: las puntuaciones de las regiones, la franja, la línea de decisión y la fecha. Estos siguen siendo interpretables después de que el modelo que los generó haya cambiado, algo que un simple porcentaje no permite.