Dos cosas diferentes que la gente llama de la misma manera
Una imagen totalmente generada parte de la nada. No hay ninguna fotografía debajo, ninguna lectura de sensor, ningún momento que haya sucedido. Cada píxel fue producido por un modelo, y la persona que aparece en él no tiene identidad que difamar porque no hay ninguna persona.
Un deepfake parte de algo real. Hay una fotografía o un vídeo debajo, una captura genuina de un momento genuino, y un modelo ha reemplazado una región específica del mismo, por lo general un rostro, con la representación de otra persona.
La distinción importa legalmente, a nivel editorial y técnico. Una foto de archivo generada de un médico inexistente es una cuestión de licencias. La fotografía de un médico real con su rostro pegado a un cuerpo al que nunca estuvo asociado es una cuestión de difamación y, posiblemente, un delito penal.
Por qué el deepfake es más difícil de detectar
Un detector lee la textura estadística de una imagen y reporta cuánto de ella parece algo producido por un modelo. Cuando todo el fotograma es sintético, esa señal está en todas partes y la puntuación no deja lugar a dudas.
Un intercambio de rostros invierte el problema. El noventa por ciento de la imagen es una fotografía real, con ruido de sensor real e historial de compresión real, y el promedio de todo el fotograma refleja eso. Un intercambio convincente puede producir una puntuación en la treintena en una imagen que es genuinamente engañosa.
Eso no es tanto un fallo del modelo como un fallo de la pregunta. Preguntar si la imagen es generada tiene la forma incorrecta cuando la respuesta honesta es que la mayor parte no lo es y una parte importante de ella sí.
El promedio que produjo el 33 es exactamente lo que oculta el único fragmento que importa.
El mapa de regiones es la respuesta a ese problema de forma. Analizar por separado fragmentos superpuestos significa que un reemplazo localizado se mide en comparación con su propio vecindario en lugar de diluirse en un fotograma al que no pertenece.
El vocabulario, en el orden en que apareció
| Término | Qué significa | ¿El sujeto es real? |
|---|---|---|
| Deepfake | La apariencia de una persona real trasladada a otras imágenes | Sí |
| Intercambio de rostros | La forma común de un deepfake, en una foto fija o en un vídeo | Sí |
| Generado por IA | Producido a partir de un aviso sin fotografía de origen | No |
| Editada con IA | Una foto real con algo añadido o eliminado | Por lo general |
| Medios sintéticos | Término paraguas que cubre todo lo anterior | Depende |
| Cheapfake | Medios reales tergiversados por un pie de foto, un recorte o una fecha antigua | Sí |
Vale la pena detenerse en la última fila, porque es la forma más común de desinformación visual y la única que ningún detector aborda. Una fotografía genuina y sin editar de un país diferente de hace tres años, presentada con un pie de foto como la noticia de hoy, obtendrá una puntuación como la fotografía real que es.
Qué hacer exactamente, según el caso
- Sospechas que la imagen entera está inventada. Realiza una comprobación de todo el fotograma. Una puntuación alta con un mapa plano es tan clara como puede ser.
- Sospechas que se insertó o intercambió a una persona. Lee primero el mapa de regiones. El número restará importancia al problema.
- Sospechas que se alteró un documento. Lo mismo que arriba, y espera exactamente un fragmento resaltado sobre el campo modificado.
- Sospechas que el pie de foto miente. Un detector no puede ayudar. Búsqueda inversa de imágenes y, a continuación, verifica la fecha y el lugar.
- Es un vídeo. Herramientas completamente diferentes. El análisis de fotogramas estáticos uno a uno pasa por alto los artefactos temporales que delatan los intercambios en tiempo real.
Por qué esta distinción protege a las personas
Tratar cada imagen sintética como igualmente grave produce dos fallos a la vez. Desperdicia atención en cosas inofensivas, como alguien que usa un retrato generado porque no podía permitirse pagar a un fotógrafo, y resta importancia al caso que realmente daña a una persona.
El daño no está en que los píxeles sean artificiales. Está en que se muestra a un individuo real y con nombre haciendo algo que no hizo. Eso es lo que vale la pena escalar, y es el caso en el que una puntuación intermedia es menos confiable como resumen.
Diseñar una política interna en torno a la identidad en lugar de en torno a la tecnología hace que envejezca mejor también. Los métodos seguirán cambiando; la cuestión de si se está tergiversando a una persona específica no lo hará.
Cómo se hace realmente un intercambio de rostros
Entender la producción ayuda a explicar la detección. Un intercambio comienza con una fotografía de destino y un conjunto de imágenes de la persona cuyo rostro se utilizará. Un modelo aprende a representar ese rostro bajo la iluminación, el ángulo y la expresión ya presentes en el destino.
El rostro representado se vuelve a componer luego en el fotograma original, y la costura es la parte difícil. Las dos mitad tienen diferentes ruidos, diferente historial de compresión y a menudo una respuesta de color ligeramente diferente, por lo que el paso de fusión suaviza el borde hasta que el ojo deja de notar la unión.
Ese suavizado es lo que lee un mapa de regiones. La fusión elimina la textura de alta frecuencia que produce un sensor, y el parche resultante es estadísticamente diferente a todo lo que lo rodea, incluso cuando la unión es invisible. La costura es invisible y medible al mismo tiempo.
También explica por qué un intercambio supera tan fácilmente una comprobación de todo el fotograma. El área manipulada es pequeña, se mezcla deliberadamente con su entorno y está rodeada por una fotografía auténtica que domina cualquier promedio tomado en todo el fotograma.
El error que se repite constantemente
La gente pasa un supuesto deepfake por un detector, ve una puntuación en la treintena y concluye que la imagen es genuina. Esa es la inferencia incorrecta a partir del número correcto: la puntuación es correcta y la pregunta que responde nunca fue la que se estaba haciendo.
El hábito que lo soluciona es pequeño. En cualquier imagen en la que la preocupación sea sobre una persona específica, abre el mapa de regiones antes de leer la cifra principal, y trata el fragmento más alto en lugar del promedio como el hallazgo sobre el cual actuar.