← Todas las guías Comparativa

¿Puede ChatGPT saber si una imagen ha sido generada por IA?

Le dará una respuesta rotunda sin nada que la respalde. Por qué los modelos de lenguaje no pueden hacer esto, qué están haciendo realmente y qué utilizar en su lugar.

· 7 min de lectura · Best AI Image Detector

No. Un modelo de lenguaje describe el aspecto de una imagen y razona sobre ella con palabras. No tiene un umbral calibrado, ni una prueba de rendimiento ni acceso a las estadísticas de píxeles de las que depende la detección.

Lo que realmente está haciendo un chatbot

Un modelo de lenguaje multimodal convierte una imagen en una descripción semántica y luego razona sobre esa descripción en texto. Está respondiendo a la pregunta de si esta imagen se parece a las imágenes de IA sobre las que leyó durante el entrenamiento.

Esa es una pregunta sobre el contenido y la composición. La detección es una pregunta sobre la textura: cómo se relacionan entre sí los valores de los píxeles adyacentes, a una escala muy inferior a todo lo que conserva una descripción semántica.

La información que lee un detector se descarta antes de que un modelo de lenguaje empiece a pensar. No es que los chatbots sean malos en esto. Están trabajando a partir de una representación que no contiene las pruebas.

Lo que eso produce en la práctica

  • Respuestas rotundas sin un umbral. Un chatbot dirá probablemente generada por IA sin ninguna escala detrás de la palabra probablemente. No hay un número, no hay un intervalo y no hay nada con lo que comparar otra imagen.
  • Razonamiento a partir de indicios obsoletos. Los modelos citan dedos, dientes, piel cérea y texto deformado, porque eso es lo que el texto de entrenamiento dice que hay que buscar. Eso se solucionó hace años.
  • Conformidad con su planteamiento. Pregunte si una imagen es falsa y será más probable que oiga un sí que si hubiera preguntado de forma neutral. Esa es una propiedad de la interfaz, no de la imagen.
  • Sin reproducibilidad. Pregunte dos veces y podrá obtener dos respuestas diferentes sobre el mismo archivo, con explicaciones igualmente seguras para cada una.
  • Sin información por regiones. No puede decirle que un rincón de una fotografía se comporta de forma diferente al resto, que es el hallazgo que suele importar.
Capacidad Chatbot Detector de píxeles
Lee la textura a nivel de píxel No Yes
Puntuación calibrada con rangos publicados No Yes
La misma respuesta cada vez No Yes
Desglose a nivel de región No Yes
Medido contra una prueba de rendimiento No Yes
Explica su razonamiento en prosa Yes con fluidez Partly como señales
Describe lo que hay en la imagen Yes No
Lo que cada enfoque puede producir realmente. La columna central es la que la gente confunde con la columna derecha.

Las dos últimas filas son las que vale la pena conservar. Un modelo de lenguaje es genuinamente bueno describiendo una imagen y razonando si una escena tiene sentido. Esas son funciones útiles y no son detección.

Dónde es genuinamente útil un chatbot

Descartar la herramienta por completo sería la lección equivocada. Utilizada para lo que puede hacer, complementa a un detector en lugar de reemplazarlo.

  1. Pídale que describa la escena en detalle

    Una descripción cuidadosa a menudo saca a la luz cosas que no notó conscientemente, incluidos objetos que no encajan juntos o letreros que no había leído.

  2. Pregunte si la escena es físicamente coherente

    Las sombras, los reflejos, la escala y la perspectiva son problemas de razonamiento, y el razonamiento es para lo que sirve el modelo. Esto detecta composiciones que el análisis de píxeles puede pasar por alto.

  3. Pregunte qué lo confirmaría o refutaría

    Convertir una sospecha en una lista de comprobaciones es un buen uso de un modelo de lenguaje, y la lista suele ser mejor que la que usted habría escrito.

  4. Luego ejecute un detector real

    Para la cuestión de los píxeles, utilice algo creado para ello y lea la puntuación comparándola con una escala publicada.

Por qué la fluidez es el peligro

Un detector que no está seguro devuelve un número intermedio, y el propio número comunica la incertidumbre. Un modelo de lenguaje que no está seguro devuelve un párrafo, y los párrafos no tienen barras de error.

Aparece la misma explicación bien estructurada tanto si el modelo ha identificado algo real como si ha producido un relato plausible sobre la nada. Los lectores calibran su confianza en función de la calidad de la redacción, que es exactamente la señal que aquí no aporta ninguna información.

Esta es la razón por la que preguntar a un chatbot es un punto de partida peor que mirar la imagen usted mismo. Su propia incertidumbre, al menos, es visible para usted.

El mismo problema en otras herramientas

Esto no se trata realmente de un solo producto. Cualquier sistema que razone sobre una imagen semánticamente tiene la misma carencia, y varias herramientas que ahora se presentan como detectores están haciendo exactamente eso de fondo.

Una prueba útil: pregunte qué informaría la herramienta sobre una fotografía de una fotografía, o sobre una imagen sin ningún sujeto reconocible en absoluto. Un detector de píxeles devuelve una puntuación de cualquier manera, porque la textura existe independientemente del contenido. Un sistema semántico no tiene sobre qué razonar y se negará o inventará algo.

Una segunda prueba: ejecute el mismo archivo dos veces. Un modelo de píxeles es determinista y devuelve el mismo número. Un modelo de lenguaje realiza un muestreo, y dos ejecuciones pueden no concordar. Si una herramienta le da respuestas diferentes para los mismos bytes, no está midiendo nada.

Ninguna de las dos pruebas requiere entender cómo funciona la herramienta. Ambas toman un minuto y, entre las dos, separan la medición de la descripción de forma más fiable que leer una página de marketing.

Preguntas habituales

¿Puede ChatGPT detectar imágenes generadas por IA?
No, en ningún sentido medible. Produce una evaluación que suena segura basándose en lo que representa la imagen en lugar de en cómo se crearon los píxeles. No hay ningún umbral calibrado detrás de la respuesta, ningún punto de referencia, y preguntar dos veces puede producir dos veredictos diferentes.
Pero acertó sobre una imagen que probé.
Acertará a menudo, sobre todo en casos obvios en los que usted también habría acertado. El problema es que suena idéntico cuando se equivoca, por lo que una respuesta correcta no le da ninguna manera de saber de qué tipo ha recibido en la siguiente imagen.
¿Y si le pido que analice los píxeles?
No puede. La imagen se convierte en una representación semántica antes de que el modelo razone sobre ella, y la textura fina de la que depende la detección se descarta en esa conversión. Pedir un análisis de píxeles produce una descripción de cómo sería el análisis de píxeles.
¿Existen modelos multimodales creados para la detección?
Hay investigación en el área y no es lo que hace un asistente general. Un detector creado con ese propósito se entrena con pares de imágenes reales y generadas con un resultado calibrado; un modelo general se entrena para ser útil en todo. Los dos no son sustitutos cercanos.
¿Debería usar un chatbot al comprobar una imagen?
Sí, para la descripción y el razonamiento. Pregúntele qué hay en el encuadre, si la iluminación es coherente y qué confirmaría o refutaría su sospecha. Luego utilice un detector para la cuestión de los píxeles, y mantenga las dos respuestas separadas en su mente.
¿Por qué tanta gente pregunta primero a un chatbot?
Porque está abierto en otra pestaña y siempre responde. La comodidad supera a la precisión cuando el coste de equivocarse es invisible, y con la verificación de imágenes el coste suele ser invisible hasta que alguien ya ha actuado en función de la respuesta.