なぜ手が本来困難だったのか
それは恣意的なものではありません。手には他の体の部位のほぼどこよりも多くの独立した関節があり、とり得る異なる構成の数は、はるかに狭い範囲で変化する顔などと比較して膨大です。
また、手は常に自分自身を遮蔽します。指が別の指の後ろに隠れたり、握りこぶしが手のひらの大部分を隠したりし、わずかな回転で外形が完全に変わります。写真から学習するモデルにとって、一つの対象物に対して膨大な種類の部分的な形状が見えることになります。
さらに、学習データも役立つものではありませんでした。写真は顔を中心に構成され、手はフレームの端に現れたり、動きでぼやけていたり、切り取られていたり、何かを持っていて隠れていたりします。例は豊富でしたが、まさに重要となる点で質が低いものでした。
これらを合わせると、おなじみの失敗が生じました。指のようなものが付いていることは知っていても、何本で、どのような配置で、どの程度の大きさであるかという信頼できる感覚を持たないモデルです。
何がそれを修正したのか
特別なことではありません。より多く、より適切に注釈が付けられたデータ、モデルが空間構造を扱う方法を一般的に改善したアーキテクチャの変更、そして批判に飽き飽きしていたチームによる明示的な取り組みが要因です。
-
2022
手は標準的なジョーク 6本指、融合した指、不可能な握り方。
-
2023
アドバイスの拡散 指を数えろ、が万能なヒントになる。
-
2023
的を絞った修正の公開 新しいリリースにおけるより良い注釈付けと空間処理。
-
2024
ほぼ解決 正しい手が例外ではなくデフォルトになる。
-
2026
アドバイスが欠陥よりも長生きする 人々は今でも指を数え、両方の意味で間違った結果を得ている。
最後の行がこの記事全体の要点です。判別方法は数年前に修正されましたが、アドバイスは今も広まっており、人々はそれを適用することで積極的に画像を読み違えています。
なぜカウントが現在双方向で失敗するのか
まず偽陰性について。正しい手は何の証明にもなりません。現在のモデルはほとんどの場合適切に描画するため、指のテストを通過した画像は、ほぼすべてが通過するテストに合格したに過ぎません。
次に偽陽性について。これがより大きな害を及ぼします。動きの中で撮影された本物の手は、ぼやけて結合し、明らかに変形した形状を生み出します。誰かがパーティーで身振り手振りをしている本物の写真は、数えるように教え込まれた人には、まさに警告されていたもののように見えることがあります。
この非対称性は重要です。なぜならコストが不均等に発生するからです。生成画像を誤って本物と判断することは通常リカバリー可能ですが、本物の写真やその人物を誤って非難することは取り返しがつきません。
また、これは自己強化的な性質があります。手が判別ポイントだと教えられた人が、奇妙に見える手を見つけて画像が偽物だと結論付け、誤りを引き起こしたアドバイスを繰り返す。これが、役割を終えた経験則が本来の有用性を何年も超えて生き残る仕組みです。
このエピソードが他のすべての判別ポイントについて教えること
手は一般的なパターンの実例であり、そのパターンは特定のヒントよりも有益です。
- 目に見える欠陥は公のベンチマークです。 名前を付けられるものは測定され、測定されるものは最適化されます。
- 人気は修正を加速させます。 判別ポイントが広く繰り返されるほど、それを削除するインセンティブが高まります。
- アドバイスは欠陥よりも何年も長生きします。 修正が元のヒントほど速く広まることはありません。
- 修正はツール間で不均等です。 フラッグシップモデルで削除された判別ポイントが、古かったり小規模なモデルには残っている可能性があります。
- 残渣は下位へ移動します。 生き残るのは目に見える欠陥ではなく、統計的なテクスチャであり、それは肉眼の解像度よりも低いレベルにあります。
最後の点が、そもそも検出ツールが存在する理由です。もし違いがまだ目に見えるなら、それを見つけるためのモデルは必要なく、分野全体が単なる探すべきもののリストになっていたでしょう。
今でも通用するもの
2種類のチェック方法がこのパターンに耐えています。どちらも局所的な詳細ではなく、フレーム全体の一貫性に関するものです。
1つ目は照明です。写真内のすべての表面は同じ光源によって照らされているため、影の方向、硬さ、色温度はすべて一致します。生成されたシーンでは、被写体は正しくても周囲との関係が概ね正しい程度であることが多く、影に不一致が現れます。
2つ目は物理的な連続性です。肩の後ろを通るストラップが間違った場所から現れる、そこに存在するはずのない部屋を映し出す反射、遮蔽物をまたいで線が揃わないパターンなどです。これらには外見のモデルではなく、世界のモデルが必要です。
どちらも迅速なテストではありません。それが誠実な結論です。今でも機能するチェックは写真を場所として見る必要があり、迅速だったチェックはすでに修正されたものだからです。
これを教える人にとって意味すること
依然としてメディアリテラシー教材の多くは指を数えることから始まりますが、それは人々に自信を持って誤った結論を出すテストを教えているようなものです。これに関するトレーニング、ガイダンス、授業を作成する人は、コンテンツの問題ではなくバージョンの問題を抱えています。
教訓の永続的なバージョンは、特徴ではなく手法に関するものです。目に見える欠陥は一時的なものであること、教えられるほど人気のある判別ポイントは修正されるほど人気があること、そして信頼できる質問はソースとコンテキストに関するものであることを教えてください。
失敗モードを明示的に教えることも価値があります。動きの中にある本物の手が不自然に見えることがあると知っている人は、実際に損害を与えるような告発、つまり実在する人物の本物の写真を偽物だと呼ぶようなことをする可能性が低くなります。
そのような教材にとって誠実な見出しは、現在のモデルに対して機能する迅速な視覚テストは存在せず、有用なスキルは、その画像がどこから来たのか、そして誰がそれを信じさせることで利益を得るのかを問いかけることだ、という点にあります。