Vad balanserad precision mäter
Vanlig precision är enkel att blåsa upp. Mata en detektor med ett testset som består av 90 procent genererade bilder, så får en modell som svarar ja på allt 90 procents precision samtidigt som den är helt oanvändbar.
Balanserad precision löser det genom att väga äkta och genererade bilder lika, så att siffran är genomsnittet av två frekvenser: hur ofta äkta fotografier korrekt frias och hur ofta genererade bilder korrekt flaggas. Ett verktyg som anger vanlig precision utan att redovisa sin testfördelning säger inte särskilt mycket.
De två sätten en detektor har fel på
En enda siffra döljer två väldigt olika fel, och de medför väldigt olika kostnader.
Falskt positivt
- Ett äkta fotografi bedöms över tröskelvärdet
- Orsakas av uppskalning, retuschering, nattläge, skärmdumpar
- Kostnad: en anklagelse mot en verklig person
- Felet som orsakar verklig skada
Falskt negativt
- En genererad bild bedöms under tröskelvärdet
- Orsakas av nya generatorer, små ändringar, tvättade filer
- Kostnad: en förfalskning släpps igenom obemärkt
- Felet som folk märker mindre
Att flytta tröskelvärdet innebär alltid en kompromiss. Sänks det upptäcks fler förfalskningar, men fler äkta fotografier flaggas felaktigt. Höjs det skyddas äkta bilder, men fler förfalskningar slinker igenom. Ingen inställning förbättrar båda samtidigt, vilket är anledningen till att tröskelvärdet är satt till 65 öppet i stället för att justeras i det tysta.
Därför överskattar prestandatester verklig funktion
| Testbild (benchmark) | Din bild | Effekt på resultatet |
|---|---|---|
| Originalfil, aldrig sparad på nytt | Komprimerad två eller tre gånger | Träffsäkerheten sjunker med flera procentenheter |
| Full upplösning | Beskuren eller nerskalad för en meddelandeapp | Färre detaljer att analysera, större osäkerhet |
| Generatorer kända vid träningstillfället | En modell som lanserades förra månaden | Den ständiga svagheten hos varje detektor |
| Rent fotografi eller ren rendering | Äkta foto med en AI-redigering | Poängen för hela bilden underskattar manipulationen |
| Ingen medveten manipulering för att lura verktyget | Medvetet tvättad för att passera | Utformad för att kringgå mätningen |
Inget av detta är ovanliga fall. De beskriver hur bilder faktiskt rör sig. En bild som når dig via två plattformar och en skärmdump har redan förlorat mycket av de signaler som testvärdena baserades på.
Så läser du påståenden om träffsäkerhet
- Fråga vilket testset som använts. En siffra utan ett namngivet prestandatest är bara marknadsföring. En siffra från ett öppet prestandatest kan granskas av andra.
- Fråga om den är balanserad eller enkel. Enkel träffsäkerhet på ett skevt testset är det enklaste sättet att blåsa upp siffror.
- Fråga var tröskelvärdet ligger. Träffsäkerhet är meningslös utan att veta vid vilket tröskelvärde den mättes.
- Fråga vilka generatorer som inkluderades. Alla detektorer presterar bra på de modeller de tränats på och sämre på de som släpps efteråt.
- Be om andelen falska positiva separat. Det är den siffran som avgör om verktyget är säkert att använda på riktiga människor.
Vad träffsäkerhet inte kan berätta
Ett prestandatest mäter hur ofta en modell har rätt över en hel grupp av bilder. Det säger ingenting om huruvida den har rätt om just din bild. Det finns inget konfidensintervall kopplat till ett enskilt resultat, och en detektor vet inte vilket av sina typfel den gör.
Därför är områdeskartan och fildatan viktigare än huvudsiffran. Samstämmighet mellan oberoende signaler är värd mer än ett högt värde från en enskild signal, och bristande överensstämmelse är en upptäckt i sig.
Så testar du en detektor själv
Du behöver inte lita på någons siffror i blindo. Ett meningsfullt test tar en eftermiddag och ger dig mer insikt om ett verktyg än något publicerat prestandatest, eftersom du använder bilder som liknar dina egna.
-
Bygg ett testset där du redan vet svaret
Tjugo fotografier du tagit själv och tjugo bilder du genererat. Rör inte originalen. Tjugo av varje räcker för att avslöja ett uppenbart svagt verktyg.
-
Inkludera de svårbedömda mellanfallen
Lägg till skärmdumpar av dina egna foton, bilder tagna i nattläge, en uppskalad beskärning och ett kraftigt retuscherat porträtt. Det är här detektorer misslyckas, och det är den delen som alla leverantörstester utelämnar.
-
Notera poäng och intervall, inte ett utlåtande
Skriv ner vad varje verktyg gav för resultat. Att jämföra intervall ger mer än att jämföra siffror, eftersom två verktyg kan ha sina tröskelvärden på olika nivåer.
-
Räkna de två feltyperna separat
Hur många av dina äkta foton flaggades, och hur många av dina genererade bilder missades? Ett verktyg som aldrig missar en AI-bild genom att flagga en tredjedel av dina egna fotografier är inte användbart i praktiken.
Den siffra som verkligen spelar roll är den första: hur ofta det kallar ditt eget arbete falskt. Det är det felet som medför verkliga kostnader, och det är just det som döljs i ett genomsnittligt träffsäkerhetsmått.