← Todas las guías Bajo el capó

Deepfake frente a generado por IA: no es el mismo problema

Uno inventa a una persona que no existe. El otro coloca a una persona real en un lugar en el que nunca estuvo. Necesitan comprobaciones diferentes y confundirlos causa errores reales.

· 9 min de lectura · Best AI Image Detector

Una imagen generada inventa a su sujeto. Un deepfake conserva la identidad de una persona real y cambia lo que parece estar haciendo. El segundo es el que perjudica a alguien específico, y es el más difícil de detectar de los dos porque la mayor parte del fotograma es genuina.

Dos cosas diferentes que la gente llama de la misma manera

Una imagen totalmente generada parte de la nada. No hay ninguna fotografía debajo, ninguna lectura de sensor, ningún momento que haya sucedido. Cada píxel fue producido por un modelo, y la persona que aparece en él no tiene identidad que difamar porque no hay ninguna persona.

Un deepfake parte de algo real. Hay una fotografía o un vídeo debajo, una captura genuina de un momento genuino, y un modelo ha reemplazado una región específica del mismo, por lo general un rostro, con la representación de otra persona.

La distinción importa legalmente, a nivel editorial y técnico. Una foto de archivo generada de un médico inexistente es una cuestión de licencias. La fotografía de un médico real con su rostro pegado a un cuerpo al que nunca estuvo asociado es una cuestión de difamación y, posiblemente, un delito penal.

Foto de archivo generada Autorretrato generado por IA Famoso falso generado Foto con intercambio de rostros Documento alterado
Cuánta parte del fotograma es real → ↑ Daño a una persona específica
Las posiciones son ilustrativas. Los ejes son lo que importa: el daño sigue a la identidad, no a lo sintéticos que sean los píxeles.
Dónde se sitúa cada uno. El cuadrante inferior derecho es donde se concentra el daño grave.

Por qué el deepfake es más difícil de detectar

Un detector lee la textura estadística de una imagen y reporta cuánto de ella parece algo producido por un modelo. Cuando todo el fotograma es sintético, esa señal está en todas partes y la puntuación no deja lugar a dudas.

Un intercambio de rostros invierte el problema. El noventa por ciento de la imagen es una fotografía real, con ruido de sensor real e historial de compresión real, y el promedio de todo el fotograma refleja eso. Un intercambio convincente puede producir una puntuación en la treintena en una imagen que es genuinamente engañosa.

Eso no es tanto un fallo del modelo como un fallo de la pregunta. Preguntar si la imagen es generada tiene la forma incorrecta cuando la respuesta honesta es que la mayor parte no lo es y una parte importante de ella sí.

16 12 19 14 11 91 17 13 15 18 12 16

El promedio que produjo el 33 es exactamente lo que oculta el único fragmento que importa.

Una fotografía real con un rostro reemplazado. La puntuación de todo el fotograma fue 33 y casi no te dijo nada.

El mapa de regiones es la respuesta a ese problema de forma. Analizar por separado fragmentos superpuestos significa que un reemplazo localizado se mide en comparación con su propio vecindario en lugar de diluirse en un fotograma al que no pertenece.

El vocabulario, en el orden en que apareció

Términos que la gente usa y lo que cada uno describe realmente
TérminoQué significa¿El sujeto es real?
DeepfakeLa apariencia de una persona real trasladada a otras imágenes
Intercambio de rostrosLa forma común de un deepfake, en una foto fija o en un vídeo
Generado por IAProducido a partir de un aviso sin fotografía de origenNo
Editada con IAUna foto real con algo añadido o eliminadoPor lo general
Medios sintéticosTérmino paraguas que cubre todo lo anteriorDepende
CheapfakeMedios reales tergiversados por un pie de foto, un recorte o una fecha antigua

Vale la pena detenerse en la última fila, porque es la forma más común de desinformación visual y la única que ningún detector aborda. Una fotografía genuina y sin editar de un país diferente de hace tres años, presentada con un pie de foto como la noticia de hoy, obtendrá una puntuación como la fotografía real que es.

Qué hacer exactamente, según el caso

  1. Sospechas que la imagen entera está inventada. Realiza una comprobación de todo el fotograma. Una puntuación alta con un mapa plano es tan clara como puede ser.
  2. Sospechas que se insertó o intercambió a una persona. Lee primero el mapa de regiones. El número restará importancia al problema.
  3. Sospechas que se alteró un documento. Lo mismo que arriba, y espera exactamente un fragmento resaltado sobre el campo modificado.
  4. Sospechas que el pie de foto miente. Un detector no puede ayudar. Búsqueda inversa de imágenes y, a continuación, verifica la fecha y el lugar.
  5. Es un vídeo. Herramientas completamente diferentes. El análisis de fotogramas estáticos uno a uno pasa por alto los artefactos temporales que delatan los intercambios en tiempo real.

Por qué esta distinción protege a las personas

Tratar cada imagen sintética como igualmente grave produce dos fallos a la vez. Desperdicia atención en cosas inofensivas, como alguien que usa un retrato generado porque no podía permitirse pagar a un fotógrafo, y resta importancia al caso que realmente daña a una persona.

El daño no está en que los píxeles sean artificiales. Está en que se muestra a un individuo real y con nombre haciendo algo que no hizo. Eso es lo que vale la pena escalar, y es el caso en el que una puntuación intermedia es menos confiable como resumen.

Diseñar una política interna en torno a la identidad en lugar de en torno a la tecnología hace que envejezca mejor también. Los métodos seguirán cambiando; la cuestión de si se está tergiversando a una persona específica no lo hará.

Cómo se hace realmente un intercambio de rostros

Entender la producción ayuda a explicar la detección. Un intercambio comienza con una fotografía de destino y un conjunto de imágenes de la persona cuyo rostro se utilizará. Un modelo aprende a representar ese rostro bajo la iluminación, el ángulo y la expresión ya presentes en el destino.

El rostro representado se vuelve a componer luego en el fotograma original, y la costura es la parte difícil. Las dos mitad tienen diferentes ruidos, diferente historial de compresión y a menudo una respuesta de color ligeramente diferente, por lo que el paso de fusión suaviza el borde hasta que el ojo deja de notar la unión.

Ese suavizado es lo que lee un mapa de regiones. La fusión elimina la textura de alta frecuencia que produce un sensor, y el parche resultante es estadísticamente diferente a todo lo que lo rodea, incluso cuando la unión es invisible. La costura es invisible y medible al mismo tiempo.

También explica por qué un intercambio supera tan fácilmente una comprobación de todo el fotograma. El área manipulada es pequeña, se mezcla deliberadamente con su entorno y está rodeada por una fotografía auténtica que domina cualquier promedio tomado en todo el fotograma.

El error que se repite constantemente

La gente pasa un supuesto deepfake por un detector, ve una puntuación en la treintena y concluye que la imagen es genuina. Esa es la inferencia incorrecta a partir del número correcto: la puntuación es correcta y la pregunta que responde nunca fue la que se estaba haciendo.

El hábito que lo soluciona es pequeño. En cualquier imagen en la que la preocupación sea sobre una persona específica, abre el mapa de regiones antes de leer la cifra principal, y trata el fragmento más alto en lugar del promedio como el hallazgo sobre el cual actuar.

Preguntas habituales

¿Es cada imagen de IA un deepfake?
No, y la diferencia es el sujeto. Un deepfake utiliza la apariencia de una persona real sin su consentimiento, lo que es lo que lo hace dañino y a menudo ilegal. Una imagen generada de alguien que no existe no tiene víctima, y tratar a ambas por igual desperdicia atención en el caso inofensivo.
¿Puede esta herramienta detectar un deepfake?
En una imagen fija, a menudo sí, a través del mapa de regiones en lugar de la puntuación. Un rostro intercambiado es un reemplazo localizado dentro de una fotografía genuina, por lo que se muestra como un fragmento resaltado en una cuadrícula por lo demás fría, mientras que el número de todo el fotograma se mantiene bajo. Lee primero el mapa en cualquier imagen de una persona.
¿Qué pasa con los vídeos deepfake?
Eso requiere herramientas diferentes. La manipulación de vídeo deja artefactos temporales, inconsistencias entre fotogramas consecutivos, que un modelo de imagen fija no busca. Comprobar fotogramas individuales capturará algunos casos y se perderá aquellos diseñados para sobrevivir exactamente a esa comprobación.
¿Por qué un deepfake conocido obtuvo una puntuación baja?
Porque la mayor parte es una fotografía real. La puntuación de todo el fotograma promedia en toda la imagen, y un rostro que ocupa una octava parte del fotograma mueve muy poco ese promedio. Esta es la forma más común en que las personas interpretan mal un resultado en una imagen con un rostro intercambiado.
¿Es detectable un cheapfake?
No por un detector, porque no hay nada sintético que detectar. Una fotografía real con un pie de foto falso es un problema de procedencia: búsqueda inversa de imágenes para encontrar copias anteriores, y luego comprobar si la fecha y el lugar coinciden con la afirmación que se está haciendo.
¿La ley los trata de manera diferente?
Cada vez más, sí. Varias jurisdicciones han introducido delitos que cubren específicamente las representaciones sintéticas no consensuadas de personas reales, en particular las imágenes íntimas, mientras que las imágenes generadas de nadie en particular se manejan bajo las reglas ordinarias. Consulta a tu propio equipo legal en lugar de confiar en esta página.