← Todos os guias Confiança e segurança

Moderação de imagens geradas por IA em escala

Limiares de triagem, fluxos de trabalho em lote e por que um bloqueio automático baseado em uma pontuação é a política errada. Um guia prático para equipes de confiança e segurança.

· 7 min de leitura · Best AI Image Detector

Use uma pontuação para ordenar uma fila de revisão, nunca para tomar uma ação contra uma conta. A detecção tem uma taxa de erro que torna a aplicação automática injusta, e os custos de apelação são maiores do que a economia da triagem.

Por que a aplicação automática falha aqui

Com 91 por cento de precisão balanceada em condições laboratoriais, aproximadamente uma decisão em onze está errada. Em conteúdo gerado pelo usuário, que chega em screenshots, recompactado e cortado, a taxa real é pior.

Aplicado a cem mil itens por dia, isso significa milhares de ações erradas. Cada uma é uma apelação, e as apelações custam mais por caso do que a revisão que a automação substituiu. A conta não fecha mesmo antes de considerar o custo reputacional de remover postagens genuínas.

Existe um segundo problema específico da moderação. As decisões de aplicação são auditadas. Um regulador ou um tribunal perguntando por que uma conta foi removida não aceitará um resultado de modelo com um limiar não publicado como justificativa.

Pontuação para classificar, não para agir

A estruturação útil é o ordenamento da fila. Você tem mais itens do que revisores. Uma pontuação decide quais itens a pessoa vê primeiro, e esse é um trabalho que ele pode fazer bem mesmo com 85 por cento de precisão, porque estar errado apenas significa que alguém olha para algo desnecessariamente.

  1. 1 Acima de 90 Início da fila de revisão
  2. 2 65 a 90 Revisado dentro do prazo normal
  3. 3 45 a 65 Apenas se denunciado por um usuário
  4. 4 Abaixo de 45 Sem ação, amostrado para verificações de qualidade
As faixas mapeiam para rotas de fila, não para resultados. Nada neste diagrama remove conteúdo por conta própria.

Amostrar a faixa inferior importa mais do que parece. É a única maneira de medir sua taxa de falso negativo e, sem esse número, você não pode dizer se o sistema está funcionando ou se parou silenciosamente de detectar qualquer coisa.

O que sua política precisa dizer

A maioria das plataformas agora tem uma regra para mídia sintética, e a maioria delas é mal escrita. A falha comum é banir conteúdo de IA de forma geral, o que é impossível de aplicar e pega coisas que ninguém pretendia pegar.

Regras que podem ser aplicadas vs. regras que não podem
AplicávelNão aplicávelPor quê
Mídia sintética não divulgada de uma pessoa realTodas as imagens geradas por IAA segunda bane trabalhos de ilustração e design
Imagens geradas apresentadas como evidência documentalQualquer coisa que pontue acima de 65Um limiar não é uma política
Mídia sintética usada para enganar por dinheiroImagens que parecem geradas por IAOlhar não é um padrão
Falha ao rotular quando solicitadoIA não divulgada de qualquer formaImpossível de provar, e os usuários não conseguem cumprir

Escreva a regra em torno de danos e divulgação, em vez de técnica. Uma ilustração gerada em uma postagem de ficção não prejudica ninguém. Uma fotografia gerada de um produto, pessoa ou evento, apresentada como real, é a coisa que você realmente deseja parar.

Os três casos que um mapa de regiões separa

Pontuações de quadro inteiro agrupam três situações que precisam de tratamentos diferentes. A visualização de blocos os diferencia, e a distinção geralmente decide o resultado.

  • Todos os blocos altos. Uma imagem totalmente gerada. Se for apresentada como uma fotografia de algo real, esse é o seu caso mais claro.
  • Um bloco alto. Uma fotografia real com algo adicionado ou removido. Em um mercado ou contexto de notícias, isso é frequentemente mais sério do que uma geração completa, porque foi projetado para ser acreditado.
  • Uniformemente quente, nenhum alto. Processamento pesado. Geralmente uma foto genuína através de um filtro ou upscaler. Quase nunca vale a pena agir.
13 17 11 15 91 14 12 16 10

Uma fotografia real com um elemento inserido. O ordenamento da fila apenas pela pontuação principal nunca o revelaria.

O caso do meio. Uma pontuação de quadro inteiro de 33 teria liberado este item.

Medindo se funciona

  1. Acompanhe a precisão na faixa superior

    Dos itens pontuados acima de 90 que um moderador abriu, quantos tiveram uma ação tomada? Se esse número for baixo, a ferramenta está gerando trabalho em vez de poupá-lo.

  2. Amostre a faixa inferior semanalmente

    Puxe cem aleatórios abaixo de 45 e revise-os. Esta é a única medida do que você está perdendo, e é a que as equipes ignoram.

  3. Observe a taxa de apelação

    Um aumento nas apelações bem-sucedidas sobre decisões de mídia sintética significa que o limiar se desviou ou um novo gerador chegou e está pontuando baixo.

  4. Redefina a base após cada mudança de modelo

    Atualizações do detector alteram as pontuações. Um limiar ajustado seis meses atrás contra uma versão de modelo diferente não é mais o limiar que você pensa que é.

Dimensionando a fila que a ferramenta cria

Adicionar um detector a um pipeline de moderação não reduz o número de funcionários, e as equipes que planejam isso acabam pior. O que muda é a ordem em que o trabalho chega, o que aumenta o valor de cada hora do revisor sem reduzir quantos você precisa.

Orce para que a fila sinalizada seja mais lenta por item do que a fila geral. Um revisor olhando para uma postagem sinalizada está tomando uma decisão mais difícil sobre um material mais ambíguo, e pressa nesse caso resulta em aplicação errada. Dois minutos por item é realista; trinta segundos não é.

Dê aos revisores o mapa de regiões em vez da pontuação. Um moderador que pode ver que um canto de uma imagem está quente toma uma decisão melhor do que aquele que recebe apenas um número, e eles podem explicar essa decisão posteriormente a uma equipe de apelação ou a um regulador.

Faça as pessoas rotacionarem fora da revisão de mídia sintética. É um trabalho repetitivo com uma alta proporção de casos ambíguos, e a precisão cai visivelmente ao longo de um turno longo. Esta é a mesma lição que toda função de moderação já aprendeu sobre outras categorias.

Perguntas que as pessoas fazem

Podemos remover automaticamente conteúdo acima de um limiar de pontuação?
Você pode, e não deveria. Com uma precisão realista, isso significa milhares de remoções erradas em escala, cada uma gerando uma apelação e algumas sendo um problema regulatório. Use a pontuação para ordenar uma fila humana. O tempo do revisor economizado por uma boa ordenação é maior do que o tempo que a automação economizaria.
Qual limiar devemos definir para revisão?
Comece roteando tudo acima da linha de decisão publicada e amostrando abaixo dela, depois ajuste com base nos seus próprios números de precisão em vez de uma recomendação do fornecedor. Sua mistura de conteúdo decide o limiar certo, e uma plataforma cheia de ilustrações precisa de uma linha diferente de uma cheia de fotos de notícias.
Como lidamos com apelações?
Peça o arquivo original. A maioria das apelações bem-sucedidas vem de usuários cuja foto genuína foi recompactada no upload, e verificar novamente a fonte geralmente resolve isso em uma etapa. Registre o resultado, porque os dados de apelação são o sinal mais rápido de que um limiar se desviou.
Os usuários devem ser informados de que uma imagem foi sinalizada por um detector?
Dizer a eles que uma verificação ocorreu é justo e cada vez mais esperado. Publicar o limiar exato não é, porque entrega um alvo de evasão a qualquer pessoa disposta a testar contra ele. Declare que sinais automatizados informam a revisão e que uma pessoa toma cada decisão.
Isso funciona para vídeo?
Não com um detector de imagens estáticas. A verificação quadro a quadro de vídeo produz um volume enorme e perde artefatos temporais, que são o sinal mais forte em vídeos manipulados. Trate vídeo como um problema separado que precisa de ferramentas separadas.
E quanto a imagens que nossos próprios usuários geram legitimamente?
Rotule em vez de remover. Um campo de divulgação no upload, apoiado por uma verificação que sinaliza casos não divulgados para revisão, oferece uma regra funcional. Usuários que seguem o requisito de rotulagem nunca devem ver aplicação de sanções, que é o que torna a política defensável.