← Todas las guías Guías

Cómo detectar rostros generados por IA

Los indicios visuales que todo el mundo repite son los que se solucionaron primero. Aquí tienes lo que todavía separa a un rostro generado de uno fotografiado, y lo que ya no lo hace.

· 9 min de lectura · Best AI Image Detector

Deja de mirar el rostro. Los indicios fiables se trasladaron a los bordes del encuadre hace años: fondos, joyas, dientes, orejas y el límite donde el cabello se encuentra con todo lo demás. El rostro en sí es la parte que cada nuevo modelo soluciona primero.

Por qué la antigua lista de comprobación dejó de funcionar

Todas las listas de indicios ampliamente compartidas tienen el mismo problema: describen las debilidades de los modelos que existían cuando se escribieron. Esas debilidades son públicas, medibles y embarazosas, lo que las convierte precisamente en aquello que el próximo lanzamiento está diseñado para corregir.

Las manos son el ejemplo más claro. Contar los dedos fue genuinamente útil durante unos dieciocho meses, luego se convirtió en una forma de equivocarse con seguridad en ambas direcciones: las manos generadas suelen ser correctas ahora, y las manos reales en movimiento se difuminan en formas que parecen incorrectas para alguien a quien le han dicho que cuente.

Lo mismo ha ocurrido con los reflejos en los ojos, la asimetría de las orejas y la geometría dental, aproximadamente en ese orden. Cualquier cosa que se pueda describir en una publicación viral se evalúa mediante pruebas comparativas, y todo lo evaluado se soluciona.

  1. 2019
    Fondos disueltos Los primeros generadores de rostros producían una cara nítida sobre una mancha difusa. Esto se solucionó en cuanto los modelos aprendieron escenas completas.
  2. 2022
    Orejas y pendientes desalineados Las joyas asimétricas eran un claro indicio hasta que los datos de entrenamiento incluyeron este aspecto.
  3. 2023
    Manos y dedos El indicio más citado de todos. Prácticamente resuelto en dos ciclos de lanzamiento.
  4. 2024
    Texto en el fotograma La señalización y las etiquetas se volvieron legibles, lo que eliminó una pista evidente y fácil.
  5. 2026
    Lo que queda es estadístico Las diferencias restantes se encuentran en la textura y el ruido, por debajo de lo que el ojo humano puede resolver.
Aproximadamente cuándo cada indicio popular dejó de ser fiable. El patrón es lo importante, no las fechas exactas.

Aparta la vista del rostro

El esfuerzo de generación se concentra donde se concentra la atención. Un modelo entrenado con retratos se vuelve muy competente en la zona a la que la gente mira y sigue siendo más débil en todo aquello que la señal de entrenamiento trató como fondo.

Ahí es donde se encuentran las comprobaciones duraderas. Pregúntate qué está escrito en la credencial colgada al cuello, si el patrón de la camisa continúa correctamente por detrás del brazo, si la cadena de un collar pasa por detrás del cuello y sale por el lugar adecuado, y si la habitación detrás del hombro es un lugar que podría existir.

El detalle repetido es la otra familia fiable. El papel pintado, los ladrillos, el follaje y las caras de multitudes son costosos de generar de forma coherente, por lo que tienden a repetirse, desvirtuarse o perder su punto de fuga de maneras que el ojo puede detectar, incluso cuando el retrato que tienen delante es impecable.

  • Texto alejado del centro. Distintivos, cartelería, lomos de libros, envases. El texto central suele ser correcto hoy en día; el texto periférico sigue siendo donde falla.
  • Continuidad a través de una oclusión. Una correa, una cadena o una raya que pasa por detrás de algo y reaparece de forma incorrecta.
  • Multitudes y objetos repetidos. La segunda y tercera fila de una multitud, o la cuarta silla de una fila, reciben menos atención que la primera.
  • Piel con gran aumento. La piel real tiene poros, pelos sueltos e imperfecciones asimétricas. La piel generada suele ser lisa de un modo que ninguna iluminación explica.
  • Donde el cabello se encuentra con todo lo demás. El límite entre el cabello y el fondo sigue siendo una de las zonas más difíciles de representar de forma coherente.

Lo que un detector ve que usted no puede

La razón para realizar una comprobación en lugar de confiar en la inspección visual es que las diferencias restantes están por debajo de la resolución de la visión humana. El sensor de una cámara produce un tipo de ruido particular; un proceso de generación produce otro diferente, y ninguno de los dos es visible a un tamaño de visualización normal.

Esta es también la razón por la cual un detector y tus ojos pueden no coincidir. Una imagen con un error visual evidente puede obtener una puntuación baja porque su textura es fotográfica, y una imagen que parece perfecta puede obtener una puntuación alta porque su textura no lo es. Ambas lecturas son informativas y ninguna anula a la otra.

Dos tipos diferentes de evidencia
Inspección visualAnálisis de píxeles
Funciona enErrores de composición y lógicaEstructura de textura y ruido
Resiste la compresiónSe degrada
Resiste a una captura de pantallaSe degrada gravemente
Detecta una edición pequeñaSolo si la notasSí, mediante el mapa de regiones
Empeora con el tiempoRápidamenteGradualmente

La última fila es la útil. Los indicios visuales se desvanecen con cada lanzamiento de modelo; un detector entrenado en varios generadores decae más lentamente, porque aprendió lo que la textura sintética tiene en común en lugar de lo que un producto hizo mal en un año determinado.

El caso que más importa: un rostro real alterado

La mayoría de las falsificaciones importantes no son retratos generados por completo. Son fotografías de personas reales con un solo elemento modificado: una cara diferente en el mismo cuerpo, un objeto añadido en la mano, una insignia alterada o una segunda persona eliminada del encuadre.

Una puntuación de todo el fotograma gestiona esto mal por diseño, porque el noventa por ciento de la imagen es realmente una fotografía y el promedio refleja eso. El mapa de regiones es lo que lo saca a la luz, y leer el mapa en lugar del número es el hábito individual que más mejora la precisión en los rostros.

14 18 11 16 12 15 89 13 17 10 14 19

Once cuadrículas se leen como fotográficas. Una no lo es, y es la que cubre un rostro.

Una fotografía de grupo auténtica con un rostro reemplazado. La puntuación global del fotograma fue 31.

Un hábito viable

Dedica cinco segundos de inspección periférica al retrato: texto, continuidad, patrón repetido, límite del cabello. Luego ejecuta una comprobación y lee el mapa. Ambas cosas juntas detectan mucho más que cualquiera de ellas por separado, y todo el proceso toma menos de un minuto.

Donde hay intereses reales en juego, añade el paso que ninguna cantidad de análisis de píxeles reemplaza: busca el mismo rostro en algún lugar con historial. Un perfil con tres años de publicaciones, fotografías etiquetadas por otras personas y un empleador coherente constituye una evidencia del tipo que ningún generador produce.

Los indicios que no han cambiado

Dos aspectos han resistido cuatro años de mejoras, y ambos tienen que ver con la coherencia a distancia y no con el detalle local. El primero es la iluminación: si cada superficie del encuadre está iluminada por las mismas fuentes, desde las mismas direcciones y con sombras de la misma suavidad.

Un retrato generado suele acertar con la cara y aproximarse al entorno, y la discrepancia se nota en las sombras. Una sombra dura bajo la barbilla junto a una sombra suave en la pared de atrás describe dos habitaciones diferentes.

El segundo es la profundidad. Las superficies reflectantes, el vidrio, el agua y los espejos deben coincidir con la geometría de todo lo demás, y a menudo no lo hacen. Una ventana detrás de un sujeto que muestra una escena que no podría estar ahí es el tipo de error que sobrevive a las actualizaciones de los modelos, porque requiere un modelo del mundo en lugar de un modelo de rostros.

Ninguna de las dos es una prueba que puedas aplicar de forma mecánica, y ambas llevan más tiempo que contar dedos. Esa es la contrapartida: las comprobaciones que todavía funcionan son aquellas que exigen pensar en la imagen como un lugar en lugar de escanearla en busca de un defecto.

Preguntas habituales

Sigue siendo útil contar los dedos?
Rara vez, y ahora falla en ambas direcciones. Los modelos actuales representan las manos correctamente la mayoría del tiempo, por lo que una mano correcta no demuestra nada, y las manos reales capturadas a mitad de movimiento producen formas borrosas que la gente interpreta como generadas. Fue una buena heurística durante unos dieciocho meses y ya no lo es.
Y qué pasa con los ojos? Leí que los reflejos no coinciden.
Eso era cierto en los primeros generadores de rostros, que renderizaban cada ojo de forma algo independiente. Los modelos modernos producen brillos coherentes. Sigue mereciendo la pena echar un vistazo rápido porque no cuesta nada, pero un par de reflejos coincidentes ya no es prueba de nada.
Por qué un detector señala la fotografía de una persona real?
Normalmente se debe al procesamiento en lugar de a la manipulación. Los filtros de belleza, el modo retrato, el modo noche y la reducción agresiva de ruido reescriben la textura de la piel después de la captura, y esa es exactamente la señal que lee el modelo. Pide un original sin filtrar antes de tratar una puntuación intermedia como algo significativo.
Puede decirme qué herramienta creó el rostro?
No a partir de los píxeles. Los modelos comparten arquitecturas y datos de entrenamiento, por lo que sus huellas dactilares se superponen, y cualquier postprocesamiento difumina lo poco que los separa. Si aparece un nombre en un resultado, proviene de una credencial en el archivo y no de la imagen, y el resultado así lo indica.
Funciona en el rostro de una persona dentro de una foto de grupo?
Sí, y aquí es donde el mapa de regiones demuestra su utilidad. Un único rostro reemplazado dentro de una fotografía por lo demás auténtica apenas altera la puntuación de todo el fotograma, pero ilumina una sola cuadrícula. Lee primero el mapa en cualquier imagen con más de una persona.
Qué hay de las videollamadas?
Un problema diferente, herramientas diferentes. La detección en imágenes estáticas no aborda la manipulación de vídeo en directo, y comprobar fotogramas individuales pasa por alto las inconsistencias temporales que delatan los cambios de rostros en tiempo real. Trátalo por separado en lugar de asumir que una comprobación de imagen estática lo cubre.