← Todas las guías Precisión

Por qué los detectores de IA discrepan sobre la misma imagen

Pasa una imagen por cuatro herramientas y obtén cuatro respuestas. Las razones son estructurales, y conocerlas te dice qué resultado creer.

· 7 min de lectura · Best AI Image Detector

Diferentes datos de entrenamiento, diferentes líneas de decisión y diferentes definiciones de lo que cuenta como IA. Dos herramientas pueden leer una imagen de forma idéntica y emitir veredictos opuestos.

Las cuatro razones por las que los resultados difieren

Una puntuación es el final de una larga cadena de decisiones. Cambia cualquier eslabón y el número se mueve, aunque nada en la imagen haya cambiado.

  1. Diferentes datos de entrenamiento. Un detector reconoce lo que ha visto. Uno entrenado con miles de generadores abiertos maneja bien los modelos inusuales. Uno entrenado con las cuatro herramientas comerciales más grandes maneja mejor esas cuatro y peor todo lo demás.
  2. Diferentes líneas de decisión. Una herramienta considera sospechoso un 60, otra considera sospechoso un 75. La misma lectura cruza un umbral y el otro no, por lo que obtienes dos veredictos a partir de una medición.
  3. Diferentes definiciones. Algunas herramientas cuentan cualquier implicación generativa, incluyendo un escalado o un relleno generativo. Otras solo marcan encuadres totalmente sintéticos. Un retrato retocado es IA para la primera y real para la segunda.
  4. Diferente preprocesamiento. Las herramientas redimensionan, recortan y vuelven a codificar antes de puntuar. Un detector que lee un cuadrado de 224 píxeles del centro ve una imagen diferente que uno que lee 384 píxeles de todo el encuadre.
La misma fotografía, puntuada de cuatro maneras
Herramienta A, línea en 50
61
Herramienta B, línea en 65
58
Herramienta C, solo encuadre completo
34
Herramienta D, cuenta cualquier edición
88

Cifras ilustrativas que muestran una dispersión típica de una fotografía genuina pero muy procesada.

Una imagen, cuatro herramientas. Aquí nada funciona mal: cada una informa de lo que dice su propia escala.

La herramienta D no es más sensible que las demás. Responde a una pregunta más amplia. Si lo que te preocupa es si una fotografía fue escenificada por un generador, D está informando de más. Si lo que te preocupa es si alguna IA tocó el archivo, D es la única que te está respondiendo.

Pregunta a qué cuestión responde cada herramienta

Tres cuestiones a las que la gente se refiere con "¿es esto IA?"
La cuestiónQué lo marcaUso típico
¿Se generó este encuadre de la nada?Textura sintética de encuadre completoNoticias, anuncios de venta, perfiles de citas
¿Fue alguna parte de esto editada por IA?Una región por encima de la líneaSeguros, siniestros, revisión de pruebas
¿Tocó alguna IA este archivo en absoluto?Escalado, reducción de ruido, relleno generativoBibliotecas de recursos, reglas de competición

La mayor parte del desacuerdo entre las herramientas es en realidad un desacuerdo sobre cuál de estas tres preguntaste. Antes de comparar los resultados, decide qué cuestión te importa y luego lee cada herramienta frente a ella.

Cómo comparar dos resultados correctamente

  1. Proporciona a ambas herramientas un archivo idéntico

    Ni una redescarga, ni una captura de pantalla, ni una copia que pasó por una aplicación de chat. Distintos bytes son una imagen diferente y legítimamente puntuarán de manera diferente.

  2. Compara franjas, no números

    Un 61 en una escala con una línea en 50 y un 58 en una escala con una línea en 65 discrepan sobre el veredicto aunque coinciden en la lectura.

  3. Busca un umbral publicado

    Una herramienta que no dice dónde se sitúa su línea no se puede comparar con nada. Trata el número como ininterpretable en lugar de como prueba.

  4. Prefiere la herramienta que muestra cómo funciona

    Un mapa de regiones, una franja con nombre y un banco de pruebas declarado te permiten comprobar el razonamiento. Una etiqueta segura sin nada detrás no lo hace.

  5. Trata el acuerdo como la señal fuerte

    Dos herramientas independientes que alcanzan la misma franja valen más que cualquiera de las dos por separado. Dos que discrepan significa incertidumbre, no un punto intermedio.

Cuando el desacuerdo es el hallazgo

Vale la pena aprender a reconocer un patrón. Una herramienta que informa de una puntuación baja en todo el encuadre junto con una que informa de una puntuación alta suele significar que la imagen es una fotografía real con una edición local.

La primera herramienta está promediando la edición a lo largo de un encuadre en su mayor parte genuino. La segunda está ponderando la región más fuerte. Ambas tienen razón sobre lo que han medido, y el desacuerdo en sí te ha dicho más que cualquiera de los números.

11 14 9 13 89 12 10 8 15

Un mosaico por encima de la línea de decisión dentro de un encuadre que por lo demás es frío. Ningún número por sí solo capta esto.

La vista de regiones resuelve el debate. El promedio de todo el encuadre de estos mosaicos es de 24, que se lee como limpio; el mapa muestra por qué eso es engañoso.

Qué haría que los detectores estuvieran de acuerdo

Un banco de pruebas compartido, líneas de decisión publicadas y una definición consensuada de lo que cuenta como implicación de IA eliminarían la mayor parte de la dispersión. Todavía no existe nada de esto, y hay poca presión comercial para crearlo, porque una herramienta que publica sus puntos débiles tiene peor aspecto que una que no lo hace.

Hasta que eso cambie, trata cada puntuación como procedente de una escala privada. Lee las pruebas que te muestra una herramienta y pondéralas más que la confianza de su etiqueta.

El problema de versión que nadie menciona

Un detector no es algo único a lo largo del tiempo. Los proveedores vuelven a entrenar, ajustan los umbrales e intercambian modelos sin previo aviso, y casi ninguno de ellos versiona sus resultados. La puntuación que obtuviste en marzo y la que obtienes hoy pueden proceder de modelos diferentes con una calibración diferente.

Esto importa si registras los resultados. Un expediente de siniestros, un registro de moderación o un caso académico que cita una puntuación de hace dieciocho meses está citando una medición cuyo instrumento ya no existe. No hay forma de reproducirla y no hay forma de comprobar qué significaba en su momento.

Donde guarde los resultados, guarde las pruebas junto a ellos: las puntuaciones de las regiones, la franja, la línea de decisión y la fecha. Estos siguen siendo interpretables después de que el modelo que los generó haya cambiado, algo que un simple porcentaje no permite.

Preguntas habituales

Si dos detectores no concuerdan, ¿a cuál debería creerle?
A aquel que le muestre su razonamiento. Una línea de decisión publicada, una franja con nombre y un mapa de regiones le permiten comprobar si la lectura tiene sentido para su imagen. Un simple porcentaje de una herramienta que no explica su significado no es una prueba, por muy concluyente que suene.
¿Ejecutar más detectores ofrece una respuesta mejor?
Solo si decide de antemano cómo va a sopesarlos. Tres herramientas que concuerdan son realmente más sólidas que una. Seis herramientas, con dos que concuerdan con su hipótesis, es la forma en que la gente se convence de una conclusión a la que ya había llegado.
¿Por qué una herramienta califica mi foto editada como IA y otra la califica como real?
Están respondiendo a preguntas diferentes. Una herramienta que cuenta cualquier intervención generativa marca un relleno generativo o un reescalado. Una herramienta que solo busca fotogramas totalmente sintéticos no lo hace. Ninguna se equivoca; compruebe qué definición está utilizando cada una.
¿Pueden dos detectores tener razón al mismo tiempo?
Sí, y es habitual. Diferentes umbrales implican que la misma medición produce veredictos distintos, y diferentes conjuntos de entrenamiento implican lecturas genuinamente distintas de una imagen inusual. La concordancia en la franja es lo que importa, no la concordancia en los dígitos.