← Alle Anleitungen Unter der Haube

Diffusion vs. GAN: Warum Detektoren sie unterschiedlich handhaben

Zwei Wege, ein Bild zu bauen, zwei verschiedene Fingerabdrücke. Was jeder Prozess hinterlässt, warum GANs leichter zu fangen waren und was das darüber voraussagt, was als Nächstes kommt.

· 8 Min. Lesezeit · Best AI Image Detector

GANs hinterlassen ein sich wiederholendes Artefakt durch Upsampling, das fast eine Signatur ist. Diffusionsmodelle tun dies nicht, weshalb die Erkennung 2022 schwieriger wurde und warum architekturspezifische Tricks nicht mehr funktioniert haben.

Wie ein GAN ein Bild baut

Ein generatives feindliches Netzwerk beginnt mit einem kleinen Vektor und führt wiederholt ein Upsampling durch, wobei die Auflösung in jeder Schicht verdoppelt wird, bis sie die volle Größe erreicht. Ein zweites Netz bewertet das Ergebnis, und die beiden trainieren gegeneinander.

Das wiederholte Upsampling ist der wichtige Teil. Jeder Verdoppelungsschritt führt ein regelmäßiges Muster ein, und diese Muster sammeln sich zu einer periodischen Struktur an, die sichtbar wird, wenn das Bild in den Frequenzbereich transformiert wird.

Diese Struktur kam einer Signatur nahe. Frühe Detektoren konnten im Frequenzspektrum nach einem Schachbrettmuster suchen und eine hohe Genauigkeit erreichen, ohne etwas über das Bild zu verstehen. Es war eher ein Fingerabdruck der Architektur als eines bestimmten Modells.

Wie ein Diffusionsmodell eines baut

Diffusion funktioniert umgekehrt. Es beginnt mit einem Feld aus reinem Rauschen bei voller Zielauflösung und entfernt bei jedem Schritt ein wenig davon, geleitet von dem, was das Modell gelernt hat, bis ein Bild entsteht.

Es gibt keine Upsampling-Leiter, daher gibt es kein periodisches Artefakt. Die Ausgabe unterscheidet sich statistisch von einer Kameraaufnahme, und der Unterschied ist eher diffus als strukturell. Nichts daran zeigt sich als sauberes Muster, nach dem man suchen könnte.

GAN

  • Kleiner Vektor, wiederholt hochskaliert
  • Periodische Artefakte von jeder Verdopplung
  • Im Frequenzbereich erkennbar
  • Architektur hinterlässt eine beinahe-Signatur
  • Dominant bis etwa 2022

Diffusion

  • Rauschen Schritt für Schritt in voller Größe entfernt
  • Keine Upsampling-Leiter, kein periodisches Muster
  • Unterschied ist statistisch, nicht strukturell
  • Benötigt ein trainiertes Modell zur Erkennung
  • Dominant seit 2022
Die beiden Prozesse und was jeder von ihnen hinterlässt. Die rechte Spalte ist der Grund, warum die Erkennung neu aufgebaut werden musste.

Warum die älteren Detektoren nicht mehr funktioniert haben

Ein Tool, das gebaut wurde, um Schachbrettmuster im Frequenzbereich zu finden, findet in einem Diffusionsbild nichts. Es meldet keine Unsicherheit; es meldet, dass das Artefakt fehlt, was sich wie ein sauberes Ergebnis liest.

Das ist der Grund, warum die Erkennungsgenauigkeit im gesamten Bereich zwischen 2021 und 2023 einzubrechen schien. Die Tools hatten sich nicht verschlechtert. Das Ding, nach dem sie gesucht hatten, wurde nicht mehr erzeugt.

Was die architekturbezogene Erkennung ersetzte

Breite. Anstatt nach einem einzelnen Artefakt zu suchen, werden aktuelle Detektoren mit der Ausgabe von so vielen verschiedenen Generatoren wie möglich trainiert, sodass das Modell lernt, was synthetische Textur gemeinsam hat, anstatt was eine einzelne Familie produziert.

Das hier verwendete Modell wurde genau aus diesem Grund an Millionen von Bildern von Tausenden von Generatoren trainiert. Die Abdeckung über Architekturen hinweg sorgt für die Verallgemeinerung auf den nächsten Generator, und sie ist der einzige Ansatz, der einen Wandel der dominanten Methode überstanden hat.

Der Kompromiss ist, dass die Genauigkeit bei jedem einzelnen bekannten Generator geringer ist, als ein Spezialdetektor erreichen würde. Das ist der richtige Kompromiss, da ein Spezialist nutzlos ist, sobald etwas Neues eintrifft.

Was dies vorhersagt

Die Lektion aus dem Übergang von GAN zu Diffusion betrifft nicht die Diffusion. Sie besagt, dass jeder Detektor, der an die aktuelle Erstellungsweise von Bildern gebunden ist, eine begrenzte Lebensdauer hat und der Übergang nicht im Voraus angekündigt wird.

Wie jede Detektionsgeneration alterte
AnsatzFunktionierte beiScheiterte bei
FrequenzartefaktsucheGANsDiffusion traf ein
Gesichtsspezifische AnalyseFrühe Tauschvorgänge von GesichternGenerierung ganzer Szenen traf ein
MetadatenprüfungDateien direkt von einem ToolPlattformen entfernten Metadaten
FehlerstufenanalyseEinmalig gespeicherte JPEGsBilder begannen zu reisen
Breites Training mit mehreren GeneratorenDie meiste aktuelle AusgabeUnbekannt und später als die anderen

Spielt das alles für einen Nutzer eine Rolle

Meistens erklärt es zwei Dinge, die Ihnen auffallen werden. Erstens, warum ein Detektor normalerweise nicht benennen kann, welches Tool ein Bild erzeugt hat: Er liest eine gemeinsame statistische Eigenschaft statt eines Fingerabdrucks pro Modell.

Zweitens, warum ältere kostenlose Prüfer schlecht abschneiden. Mehrere Tools, die noch online sind, wurden um GAN-Artefakte herum gebaut und wurden nicht neu trainiert. Sie liefern überzeugende saubere Ergebnisse bei aktuellen Ausgaben, und nichts in der Benutzeroberfläche erklärt warum.

Was eine Hybrid-Pipeline mit einem Ergebnis macht

Die meisten Bilder, die Sie erreichen, wurden nicht mit einer einzigen Methode erzeugt. Ein Diffusionsmodell erzeugt eine Basis, ein GAN-basierter Upscaler vergrößert sie, ein Gesichtswiederherstellungs-Durchgang repariert die Augen, und ein Editor schneidet das Ergebnis zu und speichert es erneut.

Jede Stufe schreibt die Textur neu, sodass die Datei Spuren mehrerer übereinandergelagerter Prozesse trägt. Die letzte Stufe, die das Bild berührt, dominiert normalerweise das, was ein Detektor liest, weshalb ein hochskaliertes Diffusionsbild statistisch eher wie der Upscaler als wie der Generator aussehen kann.

Dies ist der praktische Grund, warum die Architekturidentifikation außerhalb eines Labors nicht funktioniert. In einem kontrollierten Test mit sauberer Einzelmodell-Ausgabe ist dies ein lösbares Problem. Bei einem Bild, das eine reale Produktions-Pipeline durchlaufen hat, ist die Frage nicht klar gestellt.

Es erklärt auch ein Ergebnis, das Menschen verwirklich erscheint: ein tatsächlich generiertes Bild, das schlechter abschneidet als ein stark hochskaliertes Foto. Bei beiden wurde die Textur durch Software neu geschrieben, und der Detektor liest die Neuschreibung statt des Ursprungs.

Häufig gestellte Fragen

Sind GAN-Bilder einfacher zu erkennen als Diffusionsbilder?
Das waren sie, und es gibt heute viel weniger davon. GAN-Upsampling hinterließ ein periodisches Artefakt, das eine einfache Frequenzanalyse finden konnte. Diffusion hinterlässt keine äquivalente Struktur, weshalb die Erkennung ein trainiertes Modell erfordert, das statistische Textur liest, anstatt gezielt nach einem Muster zu suchen.
Kann ein Detektor mir sagen, ob ein Bild von einem GAN oder einem Diffusionsmodell stammt?
Im Allgemeinen nicht anhand der Pixel. Ein breiter Detektor meldet, wie wahrscheinlich es ist, dass etwas Generatives beteiligt war, aber nicht, welche Familie es produziert hat. Die Architekturidentifikation ist ein separates Forschungsproblem und deutlich unzuverlässiger als die Erkennung.
Werden GANs immer noch verwendet?
Ja, an bestimmten Stellen. Sie bleiben schnell und effizient für enge Aufgaben wie die Gesichtssynthese und einige Upscaling-Prozesse, bei denen Diffusion langsamer wäre. Einige Tools verwenden beide in verschiedenen Phasen, was bedeutet, dass ein Bild Spuren von beiden tragen kann.
Wird die nächste Architektur die Erkennung erneut brechen?
Sie wird die Genauigkeit eher verringern als sie brechen, was der Vorteil ist, den das breite Training eingebracht hat. Ein Modell, das gelernt hat, was synthetische Textur über Tausende von Generatoren hinweg gemeinsam hat, verschlechtert sich bei etwas Neuem allmählich, während ein Detektor für einzelne Artefakte komplett versagt.
Warum behaupten einige Tools nach wie vor eine sehr hohe Genauigkeit?
Normalerweise, weil sie an einem Testset messen, das aus Generatoren aufgebaut ist, mit denen sie trainiert wurden. Dieser Wert ist real und beschreibt nicht die Leistung des im letzten Monat veröffentlichten Modells. Fragen Sie, welche Generatoren im Benchmark enthalten waren, bevor Sie Zahlen zwischen Tools vergleichen.
Beeinflusst dies, wie ich einen Wert lesen sollte?
Nur in einer Hinsicht. Behandeln Sie ein sauberes Ergebnis bei einem Bild, an dem Sie aus anderen Gründen zweifeln, als schwächeren Beleg als ein markiertes Ergebnis, denn der Fehlermodus einer ungesehenen Architektur ist ein überzeugender niedriger Wert statt eines unsicheren.