Lo que realmente está haciendo un chatbot
Un modelo de lenguaje multimodal convierte una imagen en una descripción semántica y luego razona sobre esa descripción en texto. Está respondiendo a la pregunta de si esta imagen se parece a las imágenes de IA sobre las que leyó durante el entrenamiento.
Esa es una pregunta sobre el contenido y la composición. La detección es una pregunta sobre la textura: cómo se relacionan entre sí los valores de los píxeles adyacentes, a una escala muy inferior a todo lo que conserva una descripción semántica.
La información que lee un detector se descarta antes de que un modelo de lenguaje empiece a pensar. No es que los chatbots sean malos en esto. Están trabajando a partir de una representación que no contiene las pruebas.
Lo que eso produce en la práctica
- Respuestas rotundas sin un umbral. Un chatbot dirá probablemente generada por IA sin ninguna escala detrás de la palabra probablemente. No hay un número, no hay un intervalo y no hay nada con lo que comparar otra imagen.
- Razonamiento a partir de indicios obsoletos. Los modelos citan dedos, dientes, piel cérea y texto deformado, porque eso es lo que el texto de entrenamiento dice que hay que buscar. Eso se solucionó hace años.
- Conformidad con su planteamiento. Pregunte si una imagen es falsa y será más probable que oiga un sí que si hubiera preguntado de forma neutral. Esa es una propiedad de la interfaz, no de la imagen.
- Sin reproducibilidad. Pregunte dos veces y podrá obtener dos respuestas diferentes sobre el mismo archivo, con explicaciones igualmente seguras para cada una.
- Sin información por regiones. No puede decirle que un rincón de una fotografía se comporta de forma diferente al resto, que es el hallazgo que suele importar.
| Capacidad | Chatbot | Detector de píxeles |
|---|---|---|
| Lee la textura a nivel de píxel | No | Yes |
| Puntuación calibrada con rangos publicados | No | Yes |
| La misma respuesta cada vez | No | Yes |
| Desglose a nivel de región | No | Yes |
| Medido contra una prueba de rendimiento | No | Yes |
| Explica su razonamiento en prosa | Yes con fluidez | Partly como señales |
| Describe lo que hay en la imagen | Yes | No |
Las dos últimas filas son las que vale la pena conservar. Un modelo de lenguaje es genuinamente bueno describiendo una imagen y razonando si una escena tiene sentido. Esas son funciones útiles y no son detección.
Dónde es genuinamente útil un chatbot
Descartar la herramienta por completo sería la lección equivocada. Utilizada para lo que puede hacer, complementa a un detector en lugar de reemplazarlo.
-
Pídale que describa la escena en detalle
Una descripción cuidadosa a menudo saca a la luz cosas que no notó conscientemente, incluidos objetos que no encajan juntos o letreros que no había leído.
-
Pregunte si la escena es físicamente coherente
Las sombras, los reflejos, la escala y la perspectiva son problemas de razonamiento, y el razonamiento es para lo que sirve el modelo. Esto detecta composiciones que el análisis de píxeles puede pasar por alto.
-
Pregunte qué lo confirmaría o refutaría
Convertir una sospecha en una lista de comprobaciones es un buen uso de un modelo de lenguaje, y la lista suele ser mejor que la que usted habría escrito.
-
Luego ejecute un detector real
Para la cuestión de los píxeles, utilice algo creado para ello y lea la puntuación comparándola con una escala publicada.
Por qué la fluidez es el peligro
Un detector que no está seguro devuelve un número intermedio, y el propio número comunica la incertidumbre. Un modelo de lenguaje que no está seguro devuelve un párrafo, y los párrafos no tienen barras de error.
Aparece la misma explicación bien estructurada tanto si el modelo ha identificado algo real como si ha producido un relato plausible sobre la nada. Los lectores calibran su confianza en función de la calidad de la redacción, que es exactamente la señal que aquí no aporta ninguna información.
Esta es la razón por la que preguntar a un chatbot es un punto de partida peor que mirar la imagen usted mismo. Su propia incertidumbre, al menos, es visible para usted.
El mismo problema en otras herramientas
Esto no se trata realmente de un solo producto. Cualquier sistema que razone sobre una imagen semánticamente tiene la misma carencia, y varias herramientas que ahora se presentan como detectores están haciendo exactamente eso de fondo.
Una prueba útil: pregunte qué informaría la herramienta sobre una fotografía de una fotografía, o sobre una imagen sin ningún sujeto reconocible en absoluto. Un detector de píxeles devuelve una puntuación de cualquier manera, porque la textura existe independientemente del contenido. Un sistema semántico no tiene sobre qué razonar y se negará o inventará algo.
Una segunda prueba: ejecute el mismo archivo dos veces. Un modelo de píxeles es determinista y devuelve el mismo número. Un modelo de lenguaje realiza un muestreo, y dos ejecuciones pueden no concordar. Si una herramienta le da respuestas diferentes para los mismos bytes, no está midiendo nada.
Ninguna de las dos pruebas requiere entender cómo funciona la herramienta. Ambas toman un minuto y, entre las dos, separan la medición de la descripción de forma más fiable que leer una página de marketing.