Por que a aplicação automática falha aqui
Com 91 por cento de precisão balanceada em condições laboratoriais, aproximadamente uma decisão em onze está errada. Em conteúdo gerado pelo usuário, que chega em screenshots, recompactado e cortado, a taxa real é pior.
Aplicado a cem mil itens por dia, isso significa milhares de ações erradas. Cada uma é uma apelação, e as apelações custam mais por caso do que a revisão que a automação substituiu. A conta não fecha mesmo antes de considerar o custo reputacional de remover postagens genuínas.
Existe um segundo problema específico da moderação. As decisões de aplicação são auditadas. Um regulador ou um tribunal perguntando por que uma conta foi removida não aceitará um resultado de modelo com um limiar não publicado como justificativa.
Pontuação para classificar, não para agir
A estruturação útil é o ordenamento da fila. Você tem mais itens do que revisores. Uma pontuação decide quais itens a pessoa vê primeiro, e esse é um trabalho que ele pode fazer bem mesmo com 85 por cento de precisão, porque estar errado apenas significa que alguém olha para algo desnecessariamente.
- 1 Acima de 90 Início da fila de revisão
- 2 65 a 90 Revisado dentro do prazo normal
- 3 45 a 65 Apenas se denunciado por um usuário
- 4 Abaixo de 45 Sem ação, amostrado para verificações de qualidade
Amostrar a faixa inferior importa mais do que parece. É a única maneira de medir sua taxa de falso negativo e, sem esse número, você não pode dizer se o sistema está funcionando ou se parou silenciosamente de detectar qualquer coisa.
O que sua política precisa dizer
A maioria das plataformas agora tem uma regra para mídia sintética, e a maioria delas é mal escrita. A falha comum é banir conteúdo de IA de forma geral, o que é impossível de aplicar e pega coisas que ninguém pretendia pegar.
| Aplicável | Não aplicável | Por quê |
|---|---|---|
| Mídia sintética não divulgada de uma pessoa real | Todas as imagens geradas por IA | A segunda bane trabalhos de ilustração e design |
| Imagens geradas apresentadas como evidência documental | Qualquer coisa que pontue acima de 65 | Um limiar não é uma política |
| Mídia sintética usada para enganar por dinheiro | Imagens que parecem geradas por IA | Olhar não é um padrão |
| Falha ao rotular quando solicitado | IA não divulgada de qualquer forma | Impossível de provar, e os usuários não conseguem cumprir |
Escreva a regra em torno de danos e divulgação, em vez de técnica. Uma ilustração gerada em uma postagem de ficção não prejudica ninguém. Uma fotografia gerada de um produto, pessoa ou evento, apresentada como real, é a coisa que você realmente deseja parar.
Os três casos que um mapa de regiões separa
Pontuações de quadro inteiro agrupam três situações que precisam de tratamentos diferentes. A visualização de blocos os diferencia, e a distinção geralmente decide o resultado.
- Todos os blocos altos. Uma imagem totalmente gerada. Se for apresentada como uma fotografia de algo real, esse é o seu caso mais claro.
- Um bloco alto. Uma fotografia real com algo adicionado ou removido. Em um mercado ou contexto de notícias, isso é frequentemente mais sério do que uma geração completa, porque foi projetado para ser acreditado.
- Uniformemente quente, nenhum alto. Processamento pesado. Geralmente uma foto genuína através de um filtro ou upscaler. Quase nunca vale a pena agir.
Uma fotografia real com um elemento inserido. O ordenamento da fila apenas pela pontuação principal nunca o revelaria.
Medindo se funciona
-
Acompanhe a precisão na faixa superior
Dos itens pontuados acima de 90 que um moderador abriu, quantos tiveram uma ação tomada? Se esse número for baixo, a ferramenta está gerando trabalho em vez de poupá-lo.
-
Amostre a faixa inferior semanalmente
Puxe cem aleatórios abaixo de 45 e revise-os. Esta é a única medida do que você está perdendo, e é a que as equipes ignoram.
-
Observe a taxa de apelação
Um aumento nas apelações bem-sucedidas sobre decisões de mídia sintética significa que o limiar se desviou ou um novo gerador chegou e está pontuando baixo.
-
Redefina a base após cada mudança de modelo
Atualizações do detector alteram as pontuações. Um limiar ajustado seis meses atrás contra uma versão de modelo diferente não é mais o limiar que você pensa que é.
Dimensionando a fila que a ferramenta cria
Adicionar um detector a um pipeline de moderação não reduz o número de funcionários, e as equipes que planejam isso acabam pior. O que muda é a ordem em que o trabalho chega, o que aumenta o valor de cada hora do revisor sem reduzir quantos você precisa.
Orce para que a fila sinalizada seja mais lenta por item do que a fila geral. Um revisor olhando para uma postagem sinalizada está tomando uma decisão mais difícil sobre um material mais ambíguo, e pressa nesse caso resulta em aplicação errada. Dois minutos por item é realista; trinta segundos não é.
Dê aos revisores o mapa de regiões em vez da pontuação. Um moderador que pode ver que um canto de uma imagem está quente toma uma decisão melhor do que aquele que recebe apenas um número, e eles podem explicar essa decisão posteriormente a uma equipe de apelação ou a um regulador.
Faça as pessoas rotacionarem fora da revisão de mídia sintética. É um trabalho repetitivo com uma alta proporção de casos ambíguos, e a precisão cai visivelmente ao longo de um turno longo. Esta é a mesma lição que toda função de moderação já aprendeu sobre outras categorias.