← Todas las guías Confianza y seguridad

Moderación de imágenes generadas por IA a escala

Umbrales de clasificación, flujos de trabajo por lotes y por qué una prohibición automática basada en una puntuación es una política equivocada. Una guía de trabajo para equipos de confianza y seguridad.

· 7 min de lectura · Best AI Image Detector

Utilice una puntuación para ordenar una cola de revisión, nunca para tomar medidas en una cuenta. La detección tiene una tasa de error que hace que la aplicación automática sea injusta, y las apelaciones cuestan más de lo que ahorra la clasificación.

Por qué la aplicación automática falla aquí

Con un 91 por ciento de precisión equilibrada en condiciones de laboratorio, aproximadamente una de cada once decisiones es incorrecta. En el contenido generado por el usuario, que llega capturado en pantalla, recomprimido y recortado, la tasa real es peor.

Aplicado a cien mil elementos al día, son miles de acciones incorrectas. Cada una es una apelación, y las apelaciones cuestan más por caso que la revisión que la automatización reemplazó. Las matemáticas no cuadran ni siquiera antes de considerar el coste para la reputación que supone eliminar publicaciones genuinas.

Hay un segundo problema específico de la moderación. Las decisiones de aplicación se auditan. Un regulador o un tribunal que pregunte por qué se eliminó una cuenta no aceptará como motivo el resultado de un modelo con un umbral no publicado.

Puntuar para ordenar, no para actuar

El enfoque útil es la ordenación de colas. Tiene más elementos que revisores. Una puntuación decide cuáles ve primero una persona, y ese es un trabajo que puede hacer bien incluso con un 85 por ciento de precisión, porque equivocarse solo significa que alguien mire algo innecesariamente.

  1. 1 Por encima de 90 Frente de la cola de revisión
  2. 2 65 a 90 Revisado dentro de la ventana normal
  3. 3 45 a 65 Solo si lo denuncia un usuario
  4. 4 Por debajo de 45 Sin acción, muestreado para controles de calidad
Las franjas se asignan a rutas de cola en lugar de a resultados. Nada en este diagrama elimina el contenido por sí solo.

Muestrear la franja inferior importa más de lo que parece. Es la única forma de medir su tasa de falsos negativos, y sin ese número no puede saber si el sistema está funcionando o si ha dejado silenciosamente de detectar nada.

Lo que debe decir su política

La mayoría de las plataformas tienen ahora una regla de medios sintéticos, y la mayoría de ellas están mal redactadas. El fallo común es prohibir el contenido de IA de forma general, lo cual es inaplicable y atrapa cosas que nadie pretendía atrapar.

Reglas que se pueden aplicar frente a reglas que no se pueden aplicar
AplicableNo aplicablePor qué
Medios sintéticos no revelados de una persona realTodas las imágenes generadas por IALo segundo prohíbe el trabajo de ilustración y diseño
Imágenes generadas presentadas como prueba documentalCualquier cosa que puntúe por encima de 65Un umbral no es una política
Medios sintéticos utilizados para engañar por dineroImágenes que parecen generadas por IAMirar no es un estándar
Falta de etiquetado cuando se solicitaIA no revelada en cualquier formaImposible de probar, y los usuarios no pueden cumplir

Redacte la regla en torno al daño y la divulgación en lugar de en torno a la técnica. Una ilustración generada en una publicación de ficción no perjudica a nadie. Una fotografía generada de un producto, una persona o un evento, presentada como real, es lo que realmente desea detener.

Los tres casos que separa un mapa de regiones

Las puntuaciones de fotograma completo colapsan tres situaciones que necesitan un manejo diferente. La vista de mosaicos las distingue, y la distinción suele decidir el resultado.

  • Todos los mosaicos altos. Una imagen totalmente generada. Si se presenta como una fotografía de algo real, ese es su caso más claro.
  • Un mosaico alto. Una fotografía real con algo añadido o eliminado. En el contexto de un mercado o de noticias, esto suele ser más grave que una generación completa, porque está diseñado para ser creído.
  • Uniformemente cálido, ninguno alto. Procesamiento intenso. Normalmente una foto genuina pasada por un filtro o un reescalador. Casi nunca vale la pena tomar medidas.
13 17 11 15 91 14 12 16 10

Una fotografía real con un elemento insertado. El orden de la cola basado solo en la puntuación del titular nunca lo sacaría a la superficie.

El caso intermedio. Una puntuación de fotograma completo de 33 habría aprobado este elemento.

Medir si funciona

  1. Rastrear la precisión en la franja superior

    De los elementos puntuados por encima de 90 que abrió un moderador, ¿en cuántos se tomaron medidas? Si ese número es bajo, la herramienta está generando trabajo en lugar de ahorrarlo.

  2. Muestrear la franja inferior semanalmente

    Extraiga cien al azar por debajo de 45 y revíselos. Esta es la única medición de lo que se le está escapando, y es la que los equipos se saltan.

  3. Vigilar la tasa de apelación

    Un aumento en las apelaciones exitosas sobre decisiones de medios sintéticos significa que el umbral se ha desviado o que ha llegado un nuevo generador que puntúa bajo.

  4. Volver a establecer la línea de base después de cada cambio de modelo

    Las actualizaciones del detector mueven las puntuaciones. Un umbral ajustado hace seis meses con respecto a una versión diferente del modelo ya no es el umbral que cree que es.

Dotar de personal a la cola que crea la herramienta

Añadir un detector a un proceso de moderación no reduce la plantilla, y los equipos que planean que así sea acaban en peor situación. Lo que cambia es el orden en que llega el trabajo, lo que eleva el valor de cada hora de revisor sin reducir la cantidad que necesita.

Presupueste que la cola marcada sea más lenta por elemento que la cola general. Un revisor que analiza una publicación marcada está tomando una decisión más difícil sobre material más ambiguo, y apresurarse es la forma en que ocurren las aplicaciones incorrectas. Dos minutos por elemento es realista; treinta segundos no lo es.

Dé a los revisores el mapa de regiones en lugar de la puntuación. Un moderador que puede ver que una esquina de una imagen está caliente toma una decisión mejor que uno al que se le entrega un número, y luego puede explicar esa decisión a un equipo de apelaciones o a un regulador.

Rote a las personas de la revisión de medios sintéticos. Es un trabajo repetitivo con una alta proporción de casos ambiguos, y la precisión cae de forma medible a lo largo de un turno largo. Esta es la misma lección que cualquier función de moderación ya ha aprendido sobre otras categorías.

Preguntas habituales

¿Podemos eliminar automáticamente el contenido por encima de un umbral de puntuación?
Puede, y no debería hacerlo. Con una precisión realista, eso significa miles de eliminaciones incorrectas a escala, cada una de ellas una apelación y algunas un problema regulatorio. Utilice la puntuación para ordenar una cola humana. El tiempo del revisor que se ahorra con un buen orden es mayor que el tiempo que le ahorraría la automatización.
¿Qué umbral debemos establecer para la revisión?
Comience por enrutar todo lo que esté por encima de la línea de decisión publicada y muestrear por debajo de ella, luego ajuste según sus propios números de precisión en lugar de una recomendación del proveedor. Su mezcla de contenido decide el umbral correcto, y una plataforma llena de ilustraciones necesita una línea diferente a una llena de fotos de noticias.
¿Cómo gestionamos las apelaciones?
Pida el archivo original. La mayoría de las apelaciones exitosas provienen de usuarios cuya foto genuina fue recomprimida al subirla, y volver a comprobar la fuente suele resolverlo en un solo paso. Registre el resultado, porque los datos de las apelaciones son la señal más rápida de que un umbral se ha desviado.
¿Se debe informar a los usuarios de que un detector ha marcado una imagen?
Decirles que se ha realizado una comprobación es justo y cada vez más esperado. Publicar el umbral exacto no lo es, porque proporciona un objetivo de evasión a cualquiera que esté dispuesto a hacer pruebas con él. Indique que las señales automatizadas informan la revisión y que una persona toma cada decisión.
¿Funciona esto para el vídeo?
No con un detector de imágenes estáticas. La comprobación fotograma a fotograma del vídeo produce un volumen enorme y pasa por alto los artefactos temporales, que son la señal más fuerte en el vídeo manipulado. Trate el vídeo como un problema aparte que necesita herramientas distintas.
¿Qué pasa con las imágenes que nuestros propios usuarios generan legítimamente?
Etiquetar en lugar de eliminar. Un campo de divulgación en el momento de la carga, respaldado por una comprobación que marque los casos no divulgados para su revisión, le proporciona una regla viable. Los usuarios que cumplen el requisito de etiquetado nunca deberían ver su aplicación, que es lo que hace que la política sea defendible.