← Alle Anleitungen Vergleich

Kann ChatGPT erkennen, ob ein Bild KI-generiert ist?

Es liefert Ihnen eine zuversichtliche Antwort ohne jeglichen Hintergrund. Warum Sprachmodelle das nicht können, was sie tatsächlich tun und was Sie stattdessen verwenden sollten.

· 7 Min. Lesezeit · Best AI Image Detector

Nein. Ein Sprachmodell beschreibt, wie ein Bild aussieht, und argumentiert darüber in Worten. Es hat keinen kalibrierten Schwellenwert, keinen Benchmark und keinen Zugriff auf die Pixelstatistiken, von denen die Erkennung abhängt.

Was ein Chatbot tatsächlich tut

Ein multimodales Sprachmodell konvertiert ein Bild in eine semantische Beschreibung und argumentiert dann anhand dieses Textes über diese Beschreibung. Es beantwortet die Frage, ob dieses Bild wie die KI-Bilder aussieht, über die ich während des Trainings gelesen habe.

Das ist eine Frage des Inhalts und der Komposition. Die Erkennung ist eine Frage der Textur: wie sich benachbarte Pixelwerte zueinander verhalten, in einem Maßstab, der weit unter dem liegt, was eine semantische Beschreibung bewahrt.

Die Informationen, die ein Detektor liest, werden verworfen, bevor ein Sprachmodell zu denken beginnt. Es ist nicht so, dass Chatbots darin schlecht sind. Sie arbeiten auf der Basis einer Repräsentation, die die Beweise nicht enthält.

Was das in der Praxis erzeugt

  • Zuversichtliche Antworten ohne Schwellenwert. Ein Chatbot sagt wahrscheinlich KI-generiert, ohne dass ein Maßstab hinter dem Wort wahrscheinlich steht. Es gibt keine Zahl, keinen Bereich und nichts, womit man ein anderes Bild vergleichen könnte.
  • Argumentation anhand veralteter Indizien. Modelle nennen Finger, Zähne, wachsartige Haut und verzerrten Text, weil das im Trainingstext steht, worauf zu achten ist. Diese wurden vor Jahren behoben.
  • Übereinstimmung mit Ihrer Fragestellung. Fragen Sie, ob ein Bild gefälscht ist, ist es wahrscheinlicher, dass Sie Ja hören, als wenn Sie neutral gefragt hätten. Das ist eine Eigenschaft der Benutzeroberfläche, nicht des Bildes.
  • Keine Reproduzierbarkeit. Fragen Sie zweimal, und Sie erhalten möglicherweise zwei verschiedene Antworten zu derselben Datei mit gleichermaßen zuversichtlichen Erklärungen für jede einzelne.
  • Keine Regionsinformationen. Es kann Ihnen nicht sagen, dass sich eine Ecke eines Fotos anders verhält als der Rest, was der Befund ist, auf den es normalerweise ankommt.
Fähigkeit Chatbot Pixeldetektor
Liest Textur auf Pixelebene No Yes
Kalibrierter Wert mit veröffentlichten Bereichen No Yes
Jedes Mal dieselbe Antwort No Yes
Aufteilung auf Regionenebene No Yes
Anhand eines Benchmarks gemessen No Yes
Erklärt seine Argumentation in Prosa Yes flüssig Partly als Signale
Beschreibt, was auf dem Bild zu sehen ist Yes No
Was die einzelnen Ansätze tatsächlich liefern können. Die mittlere Spalte ist diejenige, die Leute mit der rechten Spalte verwechseln.

Die letzten beiden Zeilen sind diejenigen, die man behalten sollte. Ein Sprachmodell ist wirklich gut darin, ein Bild zu beschreiben und zu begründen, ob eine Szene Sinn ergibt. Das ist nützlich, aber keine Erkennung.

Wo ein Chatbot wirklich nützlich ist

Das Tool komplett abzulehnen, wäre die falsche Lektion. Wenn man es für das einsetzt, was es kann, ergänzt es einen Detektor, anstatt ihn zu ersetzen.

  1. Bitten Sie es, die Szene im Detail zu beschreiben

    Eine sorgfältige Beschreibung bringt oft Dinge zutage, die Ihnen nicht bewusst aufgefallen sind, darunter Objekte, die nicht zusammengehören, oder Beschilderungen, die Sie nicht gelesen hatten.

  2. Fragen Sie, ob die Szene physikalisch konsistent ist

    Schatten, Reflexionen, Maßstab und Perspektive sind Probleme des logischen Denkens, und genau dafür ist das Modell da. Dies fängt Composites auf, die die Pixelanalyse übersehen kann.

  3. Fragen Sie, was dies bestätigen oder widerlegen würde

    Einen Verdacht in eine Liste von Prüfpunkten zu verwandeln, ist eine gute Verwendung für ein Sprachmodell, und die Liste ist oft besser als die, die Sie selbst geschrieben hätten.

  4. Führen Sie dann einen echten Detektor aus

    Für die Pixel-Frage verwenden Sie etwas, das dafür entwickelt wurde, und lesen Sie den Score anhand einer veröffentlichten Skala ab.

Warum die Sprachgewandtheit die Gefahr ist

Ein Detektor, der sich unsicher ist, liefert einen mittleren Wert, und dieser Wert selbst kommuniziert die Unsicherheit. Ein Sprachmodell, das sich unsicher ist, liefert einen Absatz, und Absätze haben keine Fehlerbalken.

Dieselbe gut strukturierte Erklärung erscheint unabhängig davon, ob das Modell etwas Reiales identifiziert oder einen plausibel klingenden Bericht über Nichts verfasst hat. Leser kalibrieren ihr Vertrauen an der Qualität des Schreibens, was genau das Signal ist, das hier keinerlei Information enthält.

Aus diesem Grund ist es ein schlechterer Ausgangspunkt, einen Chatbot zu fragen, als sich das Bild selbst anzusehen. Ihre eigene Unsicherheit ist für Sie zumindest sichtbar.

Das gleiche Problem bei anderen Tools

Hier geht es eigentlich nicht um ein einzelnes Produkt. Jedes System, das semantisch über ein Bild nachdenkt, weist dieselbe Lücke auf, und mehrere Tools, die heute als Detektoren präsentiert werden, tun im Hintergrund genau das.

Ein nützlicher Test: Fragen Sie, was das Tool bei der Fotografie einer Fotografie oder bei einem Bild ohne erkennbares Motiv überhaupt melden würde. Ein Pixeldetektor liefert so oder so einen Score, weil Textur unabhängig vom Inhalt existiert. Ein semantisches System hat nichts, worüber es nachdenken könnte, und wird sich entweder verweigern oder etwas erfinden.

Ein zweiter Test: Führen Sie dieselbe Datei zweimal aus. Ein Pixelmodell ist deterministisch und liefert denselben Wert. Ein Sprachmodell zieht Zufallsstichproben, und zwei Durchläufe können voneinander abweichen. Wenn Ihnen ein Tool für dieselben Bytes unterschiedliche Antworten gibt, misst es überhaupt nichts.

Keiner der beiden Tests erfordert ein Verständnis der Funktionsweise des Tools. Beide dauern eine Minute, und dazwischen trennen sie Messung und Beschreibung zuverlässiger, als eine Marketingseite zu lesen.

Häufig gestellte Fragen

Kann ChatGPT von KI generierte Bilder erkennen?
Nein, in keinem messbaren Sinne. Es liefert eine selbstbewusst klingende Einschätzung basierend darauf, was das Bild darstellt, und nicht darauf, wie die Pixel erzeugt wurden. Hinter der Antwort steht kein kalibrierter Schwellenwert und kein Benchmark, und zweimaliges Nachfragen kann zu zwei unterschiedlichen Urteilen führen.
Aber es lag bei einem von mir getesteten Bild richtig.
Es wird oft richtig liegen, insbesondere bei offensichtlichen Fällen, in denen Sie auch richtig gelegen hätten. Das Problem ist, dass es sich bei Fehlern identisch anhört, sodass Ihnen eine korrekte Antwort keine Möglichkeit gibt zu wissen, welche Art Sie beim nächsten Bild erhalten haben.
Was ist, wenn ich es bitte, die Pixel zu analysieren?
Das kann es nicht. Das Bild wird in eine semantische Darstellung konvertiert, bevor das Modell darüber nachdenkt, und die feine Textur, auf die die Erkennung angewiesen ist, geht bei dieser Konvertierung verloren. Die Bitte um eine Pixelanalyse erzeugt eine Beschreibung dessen, wie eine Pixelanalyse aussehen würde.
Gibt es multimodale Modelle, die für die Erkennung gebaut wurden?
Es gibt Forschung in diesem Bereich, und diese unterscheidet sich von dem, was ein allgemeiner Assistent tut. Ein speziell dafür entwickelter Detektor wird mit Paaren aus echten und generierten Bildern mit einer kalibrierten Ausgabe trainiert; ein allgemeines Modell wird darauf trainiert, bei allem hilfreich zu sein. Die beiden sind keine nahen Ersatzprodukte.
Sollte ich beim Prüfen eines Bildes überhaupt einen Chatbot verwenden?
Ja, für Beschreibung und Begründung. Fragen Sie ihn, was im Bildausschnitt zu sehen ist, ob die Beleuchtung konsistent ist und was Ihren Verdacht bestätigen oder widerlegen würde. Verwenden Sie dann einen Detektor für die Pixel-Frage und halten Sie die beiden Antworten in Ihrem Kopf getrennt.
Warum fragen so viele Menschen zuerst einen Chatbot?
Weil er in einem anderen Tab geöffnet ist und immer antwortet. Bequemlichkeit schlägt Genauigkeit, wenn die Kosten des Irrtums unsichtbar sind, und bei der Bildverifikation sind die Kosten normalerweise so lange unsichtbar, bis bereits jemand nach der Antwort gehandelt hat.