← Alla guider Under huven

Varför AI fortfarande misslyckas med händer, och när den inte gör det

Händer var det mest omtalade avslöjande tecknet i AI-bilder och är nu till största delen åtgärdat. Vad som gjorde dem svåra, vad som löste det och vad händelsen säger om alla andra visuella ledtrådar.

· 10 min läsning · Best AI Image Detector

Händer var svåra eftersom de är mycket rörliga, döljer delar av sig själva och sällan fotograferas på ett enhetligt sätt. Det var ett problem med träningsdata snarare än en permanent begränsning, och det löstes i stort sett inom två lanseringscykler.

Varför händer var genuint svåra

Det var inte godtyckligt. En hand har fler oberoende leder än nästan någon annan del av kroppen, och antalet olika positioner den kan anta är enormt jämfört med exempelvis ett ansikte, som varierar inom ett mycket snävare intervall.

Händer döljer också ständigt delar av sig själva. Fingrar hamnar bakom fingrar, ett grepp döljer större delen av handflatan och den synliga konturen förändras helt vid en liten vridning. En modell som lär sig från fotografier ser en enorm variation av ofullständiga former för ett och samma objekt.

Dessutom var träningsdatan problematisk. Fotografier komponeras runt ansikten, och händer hamnar i bildens utkant, blir suddiga av rörelse, beskärs eller håller i något som döljer dem. Exemplen var många och av låg kvalitet på precis det sätt som ställde till det.

Sammantaget gav det det välbekanta misstaget: en modell som visste att en hand har fingerformade saker fästa vid sig, men saknade en tillförlitlig uppfattning om hur många, i vilken ordning och i vilken skala.

Vad som löste det

Inget exotiskt. Mer data, bättre annoterad, tillsammans med arkitektoniska förändringar som förbättrade hur modeller generellt hanterar rumslig struktur, plus ett uttryckligt fokus från team som tröttnat på kritiken.

  1. 2022
    Händer är det vanliga skämtet Sex fingrar, sammanväxta fingrar, omöjliga grepp.
  2. 2023
    Rådet sprids Räkna fingrarna blir det universella rådet.
  3. 2023
    Riktade åtgärder lanseras Bättre annotering och rumslig hantering i nya versioner.
  4. 2024
    I stort sett löst Korrekta händer blir standard snarare än undantag.
  5. 2026
    Rådet lever längre än bristen Folk räknar fortfarande och misstolkar nu åt båda hållen.
Ungefär hur snabbt en känd begränsning upphörde att vara det.

Den sista raden är hela poängen med artikeln. Tecknet åtgärdades för flera år sedan och rådet cirkulerar fortfarande, vilket gör att människor aktivt misstolkar bilder genom att tillämpa det.

Varför räkning nu misslyckas åt båda hållen

Först ett falskt negativt utfall: korrekta händer bevisar ingenting. Nuvarande modeller återger dem korrekt för det mesta, så en bild som klarar fingertestet har klarat ett test som nästan allt klarar.

Sedan ett falskt positivt utfall, och det orsakar större skada. Riktiga händer som fotograferas i rörelse ger suddiga, sammanflytande och till synes deformerade former. Ett äkta fotografi av någon som gestikulerar på en fest kan, för en person som är inställd på att räkna, se ut precis som det man varnades för.

Den asymmetrin spelar roll eftersom kostnaden fördelas ojämnt. Att felaktigt avfärda en genererad bild som äkta går oftast att rätta till; att felaktigt anklaga ett äkta fotografi, och personen på det, gör det inte.

Det är också självförstärkande. Någon som har fått höra att händer avslöjar allt hittar en hand som ser konstig ut, drar slutsatsen att bilden är falsk och upprepar rådet som orsakade misstaget – vilket är anledningen till att en förlegad tumregel överlever sin användbarhet med flera år.

Vad förloppet lär oss om alla andra kännetecken

Händer är ett belysande exempel på ett generellt mönster, och mönstret är mer användbart än något enskilt tips.

  • En synlig brist blir ett offentligt riktmärke. Allt som kan namnges mäts, och allt som mäts optimeras.
  • Popularitet påskyndar åtgärden. Ju mer ett kännetecken upprepas, desto större incitament finns det att åtgärda det.
  • Råd lever kvar i flera år efter att bristen åtgärdats. Rättelsen sprids aldrig lika snabbt som det ursprungliga tipset gjorde.
  • Åtgärderna är ojämnt fördelade mellan verktyg. Ett kännetecken som tagits bort i en flaggskeppsmodell kan finnas kvar i en äldre eller mindre modell.
  • Spåren flyttar nedåt. Det som återstår är inte synliga brister utan statistisk textur, vilket ligger under vad ett öga kan uppfatta.

Den sista punkten är anledningen till att detektionsverktyg över huvud taget finns. Om skillnaderna fortfarande var synliga skulle ingen behöva en modell för att hitta dem, och hela området vore bara en lista över saker att leta efter.

Vad som fortfarande håller

Två typer av kontroller har stått emot mönstret, och båda handlar om sammanhang över hela bildytan snarare än om lokala detaljer.

Ljusättning är den första. Varje yta i ett fotografi belyses av samma källor, så skuggornas riktning, hårdhet och färgtemperatur stämmer överens. En genererad scen får ofta motivet rätt och omgivningen ungefär rätt, och skillnaden syns i skuggorna.

Fysisk kontinuitet är den andra. En rem som går bakom en axel och dyker upp på fel ställe, en spegling som visar ett rum som inte kan finnas där, ett mönster som inte linjerar över en överlappning. Dessa kräver en modell av världen snarare än en modell av utseenden.

Ingetdera är ett snabbt test, och det är den ärliga slutsatsen. De kontroller som fortfarande fungerar kräver att man betraktar bilden som en plats, och de kontroller som gick snabbt är de som har åtgärdats.

Vad detta innebär för den som utbildar

En stor mängd material om medie- och informationskunnighet utgår fortfarande från fingerräkning, vilket numera lär ut ett test som leder till tvärsäkra felbedömningar. Den som skriver utbildningsmaterial, riktlinjer eller lektionsplaner har ett versionsproblem snarare än ett innehållsproblem.

Den hållbara versionen av lektionen handlar om metod snarare än om detaljer. Lär ut att synliga brister är tillfälliga, att alla kännetecken som är tillräckligt kända för att läras ut är tillräckligt kända för att åtgärdas, och att de pålitliga frågorna handlar om källa och sammanhang.

Det är också värt att uttryckligen lära ut felkällan. Någon som vet att riktiga händer i rörelse ser felaktiga ut är mycket mindre benägen att rikta den anklagelse som gör verklig skada: att kalla ett äkta fotografi av en verklig person för en förfalskning.

Den ärliga slutsatsen för allt sådant material är att inget snabbt visuellt test håller mot dagens modeller, och att de användbara färdigheterna handlar om att fråga var en bild kom ifrån och vem som tjänar på att den tros vara sann.

Frågor som ställs

Gör AI-bilder fortfarande fel på händer?
Betydligt mer sällan, och det upphörde att vara ett tillförlitligt test runt 2024. Nuvarande modeller återger händer korrekt för det mesta, så en korrekt hand säger nästan ingenting, och en hand som ser konstig ut beror minst lika ofta på rörelseoskärpa i ett äkta fotografi.
Varför var händer så svåra från början?
De är mycket rörliga, de döljer ständigt delar av sig själva och de förekommer i träningsfotografier oftast i bildens utkant, suddiga eller delvis dolda. Exemplen var många och till föga hjälp, vilket är ett dataproblem snarare än en permanent begränsning.
Vad ersatte fingrar som det man ska titta på?
Inget snabbt, vilket är det ärliga svaret. Ljusets enhetlighet och fysisk kontinuitet håller fortfarande eftersom de kräver en modell av världen snarare än av utseenden, men båda kräver att man betraktar bilden som en plats snarare än att söka av den efter en defekt.
Varför fortsätter folk att upprepa rådet?
Eftersom rättelser sprids långsammare än tips. Rådet att räkna fingrar var genuint användbart i ungefär arton månader, fick stor spridning och har överlevt bristen med flera år. Människor som tillämpar det nu misstolkar aktivt bilder åt båda hållen.
Är äldre bildgeneratorer fortfarande dåliga på händer?
Vissa är det, och åtgärderna har varit ojämna. En flaggskeppsmodell från en stor leverantör kan återge händer väl medan en äldre öppen checkpoint fortfarande inte gör det, så kännetecknet lever kvar i en smal del av utbudet och fungerar inte någon annanstans.
Bör jag titta på tänder, öron eller ögon i stället?
De följde samma utveckling och finns på samma lista över förlegade kännetecken. Allt som kan beskrivas i ett viralt inlägg blir ett riktmärke, och allt som blir ett riktmärke åtgärdas. De skillnader som kvarstår är statistiska, vilket är vad en detektor läser och ett öga inte kan se.