← Alle Anleitungen Vertrauen und Sicherheit

Moderation von KI-generierten Bildern im großen Stil

Triage-Schwellenwerte, Batch-Workflows und warum ein automatischer Bann bei einem Score die falsche Vorgehensweise ist. Ein praxisnaher Leitfaden für Trust- und Safety-Teams.

· 7 Min. Lesezeit · Best AI Image Detector

Verwenden Sie einen Score zur Sortierung einer Prüfwarteschlange, niemals für Maßnahmen gegen ein Konto. Die Erkennung weist eine Fehlerrate auf, die automatische Sanktionen unfair macht, und die Kosten für Einsprüche übersteigen die Einsparungen durch die Triage.

Warum automatische Maßnahmen hier versagen

Bei einer ausgewogenen Genauigkeit von 91 Prozent unter实验室bedingungen (Laborbedingungen) ist etwa jeder elfte Fall falsch. Bei nutzergenerierten Inhalten, die als Screenshots, neu komprimiert und zugeschnitten eintreffen, ist die reale Rate noch schlechter.

Angewandt auf hunderttausend Elemente pro Tag sind das Tausende falscher Aktionen. Jede davon zieht einen Einspruch nach sich, und Einsprüche kosten pro Fall mehr als die Überprüfung, die durch die Automatisierung ersetzt wurde. Die Rechnung geht selbst dann nicht auf, wenn man die Reputationskosten für das Entfernen echter Beiträge noch gar nicht berücksichtigt.

Es gibt ein zweites Problem, das spezifisch für die Moderation ist. Durchsetzungsentscheidungen werden überprüft. Eine Regulierungsbehörde oder ein Gericht, die fragen, warum ein Konto entfernt wurde, akzeptieren kein Modellerausgabe mit einem unveröffentlichten Schwellenwert als Begründung.

Nach Score sortieren, nicht handeln

Der sinnvolle Ansatz ist die Sortierung der Warteschlange. Sie haben mehr Elemente als Prüfpersonen. Ein Score entscheidet, welche davon eine Person zuerst sieht, und das ist eine Aufgabe, die er selbst bei 85 Prozent Genauigkeit gut erledigen kann, da ein Fehler lediglich bedeutet, dass sich jemand etwas ansieht, was nicht nötig gewesen wäre.

  1. 1 Über 90 Anfang der Prüfwarteschlange
  2. 2 65 bis 90 Prüfung innerhalb des normalen Zeitfensters
  3. 3 45 bis 65 Nur bei Meldung durch Nutzerinnen oder Nutzer
  4. 4 Unter 45 Keine Maßnahme, Stichprobenprüfung zur Qualitätskontrolle
Bereiche entsprechen eher Warteschlangen-Routen als Ergebnissen. Nichts in diesem Diagramm entfernt Inhalte eigenständig.

Stichproben aus dem untersten Bereich sind wichtiger, als sie aussehen. Sie sind die einzige Möglichkeit, Ihre Rate an falsch negativen Ergebnissen zu messen, und ohne diese Zahl können Sie nicht sagen, ob das System funktioniert oder unbemerkt aufgehört hat, überhaupt noch etwas zu erkennen.

Was in Ihrer Richtlinie stehen muss

Die meisten Plattformen haben mittlerweile eine Regel für synthetische Medien, und die Meisten davon sind schlecht formuliert. Der häufige Fehler besteht darin, KI-Inhalte generell zu verbieten, was nicht durchsetzbar ist und Dinge erfasst, die niemand erfassen wollte.

Regeln, die durchgesetzt werden können, im Gegensatz zu Regeln, die das nicht können
DurchsetzbarNicht durchsetzbarWarum
Nicht offengelegte synthetische Medien einer realen PersonAlle KI-generierten BilderDas zweite verbietet Illustrationen und Designarbeiten
Als dokumentarischer Beweis dargestellte generierte BilderAlles mit einem Score über 65Ein Schwellenwert ist keine Richtlinie
Synthetische Medien, die zur Täuschung für Geld eingesetzt werdenBilder, die nach KI aussehenHinsehen ist kein Standard
Fehlende Kennzeichnung auf NachfrageNicht offengelegte KI in jeglicher FormNicht nachweisbar, und Nutzerinnen und Nutzer können dem nicht nachkommen

Richten Sie die Regel an Schaden und Offenlegung aus und nicht an der Technik. Eine generierte Illustration in einem Fiktionsbeitrag schadet niemandem. Ein generiertes Foto eines Produkts, einer Person oder eines Ereignisses, das als real dargestellt wird, ist das, was Sie tatsächlich stoppen möchten.

Die drei Fälle, die ein Regionsdiagramm unterscheidet

Ganze-Rahmen-Scores fassen drei Situationen zusammen, die eine unterschiedliche Handhabung erfordern. Die Kachelansicht unterscheidet sie, und diese Unterscheidung entscheidet meist über das Ergebnis.

  • Jede Kachel hoch. Ein vollständig generiertes Bild. Wenn es als Foto von etwas Realem dargestellt wird, ist das Ihr eindeutigster Fall.
  • Eine Kachel hoch. Ein echtes Foto, bei dem etwas hinzugefügt oder entfernt wurde. In einem Marktplatz- oder Nachrichtenkontext ist dies oft schwerwiegender als eine vollständige Generierung, da es darauf ausgelegt ist, geglaubt zu werden.
  • Gleichmäßig warm, keine Kachel hoch. Starke Bearbeitung. Meist ein echtes Foto mit Filter oder Upscaler. Fast nie eine Maßnahme wert.
13 17 11 15 91 14 12 16 10

Ein echtes Foto mit einem eingefügten Element. Eine Warteschlangensortierung allein nach dem Haupt-Score würde dies niemals zutage fördern.

Der mittlere Fall. Ein Ganzes-Rahmen-Score von 33 hätte diesen Artikel passieren lassen.

Messen, ob es funktioniert

  1. Genauigkeit (Precision) im obersten Bereich verfolgen

    Wie viele der mit über 90 bewerteten Elemente, die eine Moderatorin oder ein Moderator öffnete, zogen eine Maßnahme nach sich? Wenn diese Zahl niedrig ist, erzeugt das Tool Arbeit, anstatt sie einzusparen.

  2. Wöchentlich Stichproben aus dem untersten Bereich ziehen

    Ziehen Sie zufällig hundert Elemente unter 45 und prüfen Sie diese. Dies ist die einzige Messung dessen, was Ihnen entgeht, und genau diejenige, die Teams überspringen.

  3. Die Einspruchsquote beobachten

    Ein Anstieg erfolgreicher Einsprüche bei Entscheidungen zu synthetischen Medien bedeutet, dass sich der Schwellenwert verschoben hat oder ein neuer Generator aufgetaucht ist, der einen niedrigen Score erzielt.

  4. Nach jeder Modelländerung neu kalibrieren

    Detektor-Updates verändern Scores. Ein vor sechs Monaten gegen eine andere Modellversion abgestimmter Schwellenwert ist nicht mehr der Schwellenwert, für den Sie ihn halten.

Besetzung der Warteschlange, die das Tool erzeugt

Das Hinzufügen eines Detektors zu einer Moderations-Pipeline reduziert nicht den Personalbedarf, und Teams, die dies einplanen, stehen am Ende schlechter da. Was sich ändert, ist die Reihenfolge, in der die Arbeit eintrifft, wodurch der Wert jeder Arbeitsstunde im Review steigt, ohne dass Sie weniger Personen benötigen.

Kalkulieren Sie ein, dass die markierte Warteschlange pro Element langsamer bearbeitet wird als die allgemeine Warteschlange. Eine prüfende Person, die sich einen markierten Beitrag ansieht, trifft bei mehrdeutigem Material eine schwierigere Entscheidung, und ein Übereilen führt zu fehlerhaften Durchsetzungsmaßnahmen. Zwei Minuten pro Element sind realistisch; dreißig Sekunden sind es nicht.

Geben Sie dem Review-Team das Regionsdiagramm anstelle des Scores. Eine Moderatorin, die sehen kann, dass eine Ecke eines Bildes heiß ist, trifft eine bessere Entscheidung als jemand, dem nur eine Zahl übergeben wird, und sie kann diese Entscheidung anschließend einem Einspruchsteam oder einer Regulierungsbehörde erklären.

Personen regelmäßig aus der Moderation synthetischer Medien abziehen. Es ist eine repetitive Arbeit mit einem hohen Anteil mehrdeutiger Fälle, und die Genauigkeit sinkt über eine lange Schicht hinweg messbar. Dies ist dieselbe Lektion, die jede Moderationsabteilung bereits in anderen Kategorien gelernt hat.

Häufig gestellte Fragen

Können wir Inhalte über einem Schwellenwert automatisch entfernen?
Das können Sie, aber Sie sollten es nicht tun. Bei realistischer Genauigkeit bedeutet dies Tausende falscher Löschungen im großen Stil, von denen jede einen Einspruch und einige davon ein regulatorisches Problem darstellen. Verwenden Sie den Score, um eine menschliche Warteschlange zu sortieren. Die durch eine gute Sortierung eingesparte Zeit für Prüfungen ist größer als die Zeit, die Ihnen eine Automatisierung einsparen würde.
Welchen Schwellenwert sollten wir für die Überprüfung festlegen?
Beginnen Sie damit, alles oberhalb der veröffentlichten Entscheidungslinie weiterzuleiten und darunter Stichproben zu nehmen, und optimieren Sie dann anhand Ihrer eigenen Präzisionswerte anstelle einer Empfehlung des Anbieters. Ihr Inhaltstempo bestimmt den richtigen Schwellenwert, und eine Plattform voller Illustrationen benötigt eine andere Linie als eine voller Nachrichten-Fotos.
Wie gehen wir mit Einsprüchen um?
Fordern Sie die Originaldatei an. Die meisten erfolgreichen Einsprüche stammen von Nutzerinnen und Nutzern, deren echtes Foto beim Hochladen neu komprimiert wurde, und das erneute Prüfen der Quelle löst dies meist in einem Schritt. Zeichnen Sie das Ergebnis auf, denn Einspruchsdaten sind das schnellste Signal dafür, dass sich ein Schwellenwert verschoben hat.
Sollten Nutzerinnen und Nutzer erfahren, dass ein Bild von einem Detektor markiert wurde?
Ihnen mitzuteilen, dass eine Prüfung stattgefunden hat, ist fair und wird zunehmend erwartet. Die Veröffentlichung des genauen Schwellenwerts ist es nicht, da dies jedem, der bereit ist, dagegen zu testen, ein Umgehungsziel liefert. Geben Sie an, dass automatisierte Signale in die Überprüfung einfließen und jede Entscheidung von einem Menschen getroffen wird.
Funktioniert das für Videos?
Nicht mit einem Detektor für Standbilder. Die bildweise Prüfung von Videos erzeugt ein enormes Volumen und übersieht zeitliche Artefakte, die das stärkste Signal in manipulierten Videos sind. Betrachten Sie Video als ein separates Problem, das eigene Werkzeuge erfordert.
Was ist mit Bildern, die unsere eigenen Nutzerinnen und Nutzer legitim generieren?
Kennzeichnen statt entfernen. Ein Offenlegungsfeld beim Hochladen, unterstützt durch eine Prüfung, die nicht offengelegte Fälle zur Überprüfung markiert, verschafft Ihnen eine praktikable Regel. Nutzer, die die Kennzeichnungspflicht befolgen, sollten niemals von Durchsetzungsmaßnahmen betroffen sein – genau das macht die Richtlinie vertretbar.