Was die ausgeglichene Genauigkeit misst
Einfache Genauigkeit lässt sich leicht aufblähen. Füttern Sie einen Detektor mit einem Testset, das zu 90 Prozent aus generierten Bildern besteht, und ein Modell, das zu allem Ja sagt, erreicht 90 Prozent, während es nutzlos ist.
Die ausgeglichene Genauigkeit behebt dies, indem reale und generierte Bilder gleich gewichtet werden, sodass der Wert der Durchschnitt aus zwei Raten ist: wie oft echte Fotos korrekt freigegeben werden und wie oft generierte Bilder korrekt markiert werden. Ein Tool, das eine einfache Genauigkeit angibt, ohne seine Testmischung zu nennen, sagt Ihnen nicht viel.
Die zwei Arten, wie ein Detektor falsch liegt
Eine Zahl verschleiert zwei sehr unterschiedliche Fehler, und sie sind mit sehr unterschiedlichen Kosten verbunden.
False Positive
- Ein echtes Foto wurde über dem Schwellenwert bewertet
- Verursacht durch Hochskalieren, Retusche, Nachtmodus, Screenshots
- Kosten: Ein Vorwurf gegen eine echte Person
- Der Fehler, der tatsächlichen Schaden anrichtet
False Negative
- Ein generiertes Bild wurde unter dem Schwellenwert bewertet
- Verursacht durch neue Generatoren, kleine Bearbeitungen, kaschierte Dateien
- Kosten: Eine Fälschung kommt ungehindert durch
- Der Fehler, den die Leute weniger bemerken
Das Verschieben der Entscheidungsschwelle bewirkt einen Kompromiss zwischen zwei Aspekten. Ein Absenken fängt mehr Fälschungen ab und markiert mehr echte Fotos. Ein Anheben schützt echte Bilder und lässt mehr Fälschungen passieren. Es gibt keine Einstellung, die beides verbessert, weshalb die Schwelle bei 65 liegt, anstatt stillschweigend angepasst zu werden.
Warum Benchmark-Werte die reale Leistung überschätzen
| Benchmark-Bild | Ihr Bild | Auswirkung auf den Score |
|---|---|---|
| Originaldatei, nie erneut gespeichert | Zweimal oder dreimal komprimiert | Die Genauigkeit sinkt um mehrere Punkte |
| Volle Auflösung | Zugeschnitten oder herunterskaliert für eine Chat-App | Weniger Details zum Auswerten, mehr Unsicherheit |
| Generatoren, die zum Zeitpunkt des Trainings bekannt waren | Ein im letzten Monat veröffentlichtes Modell | Die beständige Schwäche jedes Detektors |
| Sauberes Foto oder sauberes Render | Echtes Foto mit einer KI-Bearbeitung | Der Ganzbild-Score untertreibt |
| Keine adversarialen Verfahren | Absichtlich manipuliert, um zu bestehen | Entwickelt, um die Messung zu täuschen |
Keiner dieser Fälle ist ungewöhnlich. Sie beschreiben, wie Bilder tatsächlich übertragen werden. Ein Bild, das Sie über zwei Plattformen und einen Screenshot erreicht, hat bereits einen Großteil des Signals eingebüßt, anhand dessen der Benchmark gemessen wurde.
Wie man eine Genauigkeitsangabe liest
- Fragen Sie nach dem Testdatensatz. Eine Angabe ohne benannten Benchmark ist Marketing. Ein Wert auf einem öffentlichen Benchmark kann von jemand anderem überprüft werden.
- Fragen Sie nach Ausgewogenheit oder Neutralität. Eine einfache Genauigkeit auf einem unausgewogenen Testdatensatz ist die am leichtesten aufzublähende Zahl.
- Fragen Sie nach der Entscheidungsschwelle. Genauigkeit ist bedeutungslos, ohne den Schwellenwert zu kennen, bei dem sie gemessen wurde.
- Fragen Sie, welche Generatoren enthalten waren. Jeder Detektor schneidet bei den Modellen gut ab, mit denen er trainiert wurde, und schlechter bei den danach veröffentlichten.
- Fragen Sie separat nach der Rate falscher Positiver. Das ist die Zahl, die entscheidet, ob das Tool sicher für echte Menschen verwendet werden kann.
Was Genauigkeit Ihnen nicht sagen kann
Ein Benchmark misst, wie oft ein Modell über eine Population von Bildern hinweg Recht hat. Er sagt nichts darüber aus, ob es bei Ihrem Bild Recht hat. Ein einzelnes Ergebnis hat kein Konfidenzintervall, und ein Detektor kann nicht wissen, welchen seiner Fehler er gerade macht.
Aus diesem Grund sind die Regionskarte und die Dateibeweise wichtiger als der Hauptwert. Die Übereinstimmung zwischen unabhängigen Signalen ist mehr wert als ein starker Wert von einem von ihnen, und ein Widerspruch ist bereits ein Befund für sich.
Wie Sie einen Detektor selbst testen
Sie müssen niemandes Wert ungeprüft glauben. Ein nützlicher Test dauert einen Nachmittag und verrät Ihnen mehr über ein Tool als jeder veröffentlichte Benchmark, weil er Bilder verwendet, die Ihren ähneln.
-
Erstellen Sie einen Satz, bei dem Sie das Ergebnis bereits kennen
Zwanzig Fotos, die Sie selbst gemacht haben, und zwanzig Bilder, die Sie generiert haben. Lassen Sie die Originale unverändert. Zwanzig von jeder Sorte reichen aus, um ein offensichtlich schwaches Tool zu entlarven.
-
Schließen Sie den schwierigen Mittelbereich ein
Fügen Sie Screenshots Ihrer eigenen Fotos, Nachtmodus-Aufnahmen, einen skalierten Ausschnitt und ein stark retuschiertes Porträt hinzu. Hier versagen Detektore und das ist der Teil, den jeder Hersteller-Benchmark auslässt.
-
Notieren Sie den Score und den Bereich, kein Urteil
Schreiben Sie auf, was jedes Tool ausgegeben hat. Der Vergleich von Bereichen ist aufschlussreicher als der Vergleich von Zahlen, da zwei Tools ihre Entscheidungsschwellen an unterschiedlichen Orten platzieren können.
-
Zählen Sie die beiden Fehlerarten getrennt
Wie viele Ihrer echten Fotos wurden markiert und wie viele Ihrer generierten Bilder wurden übersehen. Ein Tool, das niemals eine Fälschung übersieht, indem es ein Drittel Ihrer eigenen Fotos markiert, ist für die Anwendung an Menschen unbrauchbar.
Die Zahl, auf die es ankommt, ist die erste: wie oft es Ihre eigene Arbeit als gefälscht bezeichnet. Das ist der Fehler, der Kosten verursacht, und es ist derjenige, den ein Schlagzeilen-Genauigkeitswert wegrechnet.