← すべてのガイド 信頼と安全

AI生成画像のモデレーションを大規模に行う

トリアージのしきい値、バッチワークフロー、そしてスコアに基づく自動BANが誤ったポリシーである理由について。信頼と安全を確保するチーム向けのガイド。

· 7 分で読めます · Best AI Image Detector

スコアはレビューの優先順位付けに使用し、アカウントへの処分には決して使用しないでください。検出ツールのエラー率は、自動執行を不公平なものにしており、不服申し立てへの対応コストはトリアージで節約できるコストを上回ります。

なぜここで自動執行が失敗するのか

実験室環境で91パーセントのバランス精度を誇る場合でも、11件に1件は誤判定です。スクリーンショットや再圧縮、トリミングを経て投稿されるユーザー生成コンテンツでは、実効精度はさらに悪化します。

1日10万件のアイテムに適用すれば、数千件の誤った執行が発生します。それぞれに対して不服申し立てが行われ、その対応コストは、自動化で置き換えたはずのレビューコストを上回ります。本物の投稿を削除することによる評判の低下まで考慮する以前に、数学的に採算が合いません。

モデレーション特有の2つ目の問題があります。執行の決定は監査されます。アカウントを削除した理由を規制当局や裁判所から問われた際、しきい値が公開されていないモデルの出力を理由として受け入れてもらうことはできません。

スコアで仕分け、判断はしない

有益なのはキューの順序付けです。レビュー担当者よりもアイテムの数の方が多い場合、スコアは人が最初に確認すべきものを決定します。これは85パーセントの精度であっても十分に機能します。誤っていたとしても、誰かが不要なものを見るというだけの結果で済むからです。

  1. 1 90以上 レビューキューの最優先
  2. 2 65から90 通常の期間内にレビュー
  3. 3 45から65 ユーザーによる通報があった場合のみ
  4. 4 45未満 対応なし、品質チェック用にサンプリング
バンド(範囲)はキューのルートを割り当てるものであり、最終的な結果を決めるものではありません。この図の中にあるものは、それ単体ではコンテンツを削除しません。

下のバンドをサンプリングすることは、見た目以上に重要です。これは偽陰性率を測定する唯一の方法であり、その数値がなければシステムが機能しているのか、それとも何も検知できなくなっているのか判断できません。

ポリシーに含めるべき内容

ほとんどのプラットフォームには合成メディアに関するルールがありますが、その多くは記述が不適切です。共通する失敗は、AIコンテンツを包括的に禁止することです。これは執行不可能であり、意図しなかったコンテンツまで削除対象にしてしまいます。

執行可能なルールと不可能なルール
執行可能執行不可能理由
実在の人物の未開示の合成メディアすべてのAI生成画像後者はイラストやデザインワークを禁止してしまう
ドキュメンタリーの証拠として提示された生成画像65以上のスコアがつくものすべてしきい値はポリシーではない
金銭を目的として欺くために使用された合成メディアAI生成のように見える画像目視確認は基準ではない
求められた際の開示義務違反いかなる形式であれ、未開示のAI立証不可能であり、ユーザーは順守できない

ルールは技術ではなく、害と開示を中心に作成してください。フィクション投稿の生成イラストは誰にも害を与えません。本物として提示された製品、人物、またはイベントの生成写真は、あなたが実際に防ぎたい対象です。

領域マップが分離する3つのケース

フレーム全体のスコアは、異なる対応が必要な3つの状況を混同させます。タイルビューはこれらを識別し、その区別が通常は最終的な結果を左右します。

  • すべてのタイルが高い。 全体的に生成された画像。本物の写真として提示されている場合、最も明白なケースです。
  • 1つのタイルが高い。 何かが追加または削除された本物の写真。マーケットプレイスやニュースの文脈では、これは完全な生成画像よりも深刻なケースが多く、信じ込ませることを意図しているためです。
  • 全体的に高く、高いタイルはない。 強度な処理。通常はフィルターやアップスケーラーを通した本物の写真。処分する価値はほとんどありません。
13 17 11 15 91 14 12 16 10

要素が挿入された本物の写真。ヘッドラインのスコアだけでキューの順序付けを行っていては、決して表面化しません。

中間のケース。フレーム全体のスコアが33であれば、このアイテムは問題なしと判定されていたでしょう。

機能しているかどうかの測定

  1. 上位バンドでの精度を追跡する

    90以上のスコアでモデレーターが開封したアイテムのうち、いくつが処分対象となったか。その数値が低い場合、そのツールは作業を節約するのではなく、仕事を増やしています。

  2. 毎週、下のバンドをサンプリングする

    45未満からランダムに100件抽出し、レビューしてください。これは見逃しているものを測定する唯一の方法であり、チームが怠りがちな作業です。

  3. 不服申し立て率を監視する

    合成メディアの判定に対する不服申し立ての成功率が上昇している場合、しきい値がずれているか、低いスコアを出す新しい生成ツールが登場したことを意味します。

  4. モデル変更のたびに基準を再設定する

    検出ツールの更新はスコアを変動させます。6ヶ月前に異なるモデルバージョンに対して設定されたしきい値は、もはや現在の基準ではありません。

ツールが作成するキューの人員配置

検出ツールをモデレーションパイプラインに追加しても人員は削減されません。それを計画するチームは、かえって状況を悪化させます。変わるのは作業が到着する順序であり、必要人数を減らすことなく、各レビュー担当者の時間の価値を高めることができます。

フラグが立てられたキューは、通常のキューよりも1件あたりの作業時間が長くなることを予算に組み込んでください。フラグ付けされた投稿を審査する担当者は、より曖昧な素材に対して難しい判断を下しており、それを急かすと誤った執行につながります。1件あたり2分は現実的な数字ですが、30秒では不可能です。

レビュー担当者にはスコアではなく領域マップを提供してください。画像の1つの角が怪しいと視覚的に判断できるモデレーターの方が、数値だけを与えられた者よりも優れた決断を下せます。また、彼らは後に不服申し立てチームや規制当局に対して、その決断の理由を説明することができます。

合成メディアのレビュー担当者を定期的に交代させてください。これは曖昧なケースが多い単調な作業であり、長時間シフトでは精度が目に見えて低下します。これは他のカテゴリのモデレーション業務において、すでに全てのチームが学んでいる教訓と同じです。

よくある質問

スコアしきい値を超えたコンテンツを自動削除できますか?
可能ですが、行うべきではありません。現実的な精度では、それは大規模な誤削除を意味します。その一つ一つが不服申し立ての対象となり、一部は規制上の問題となります。スコアは人間がレビューするキューの順序付けに使用してください。優れた順序付けによって節約されたレビュー担当者の時間は、自動化が節約できる時間よりも大きくなります。
レビューのしきい値はどこに設定すべきですか?
公開されている決定ラインをすべてルーティングし、その下をサンプリングすることから始め、ベンダーの推奨値ではなく、自身の精度数値に基づいて調整してください。コンテンツ構成によって適切な数値は決まります。イラスト中心のプラットフォームとニュース写真中心のプラットフォームでは、必要となるラインは異なります。
不服申し立てにどう対応しますか?
オリジナルファイルの提出を求めてください。不服申し立ての成功例のほとんどは、アップロード時に再圧縮された本物の写真を投稿したユーザーによるものです。ソースを再確認することで、通常は1ステップで解決します。結果を記録してください。申し立てデータは、しきい値がずれたことを示す最も速いシグナルです。
検出ツールがフラグを立てたことをユーザーに伝えるべきですか?
チェックが行われたことを伝えるのは公正であり、ますます期待されるようになっています。正確なしきい値を公開するのは避けてください。それに対する回避策をテストしようとする者に、ターゲットを与えてしまうからです。自動化された信号がレビューを通知し、全ての決定は人間が行っていると明記してください。
これは動画にも機能しますか?
静止画検出ツールでは機能しません。動画のフレームごとのチェックは膨大なボリュームを生成し、操作された動画において最も強力なシグナルである時間的なアーティファクトを見逃します。動画は別のツールが必要な問題として扱ってください。
ユーザーが合法的に生成した画像についてはどうですか?
削除ではなくラベル付けを行ってください。アップロード時に開示フィールドを設け、未開示のケースにフラグを立ててレビューに回すことで、実行可能なルールになります。ラベル付けの要件に従うユーザーには執行が行われないようにすべきです。これこそがポリシーを妥当なものにします。