← すべてのガイド 内部構造

なぜAIは今でも手を失敗するのか、そしていつ失敗しなくなるのか

手はAI画像で最も指摘された欠陥であり、現在はほぼ修正されています。なぜ手が難しかったのか、どう解決されたのか、そしてこの事例が他の視覚的な欠陥について何を物語っているかを解説します。

· 10 分で読めます · Best AI Image Detector

手は可動域が広く、自己遮蔽が発生しやすく、一貫した方法で撮影されることが稀であるため、以前は困難でした。それは学習データの問題であり、恒久的な限界ではありませんでしたが、2回のリリースサイクルのうちにほぼ解決されました。

なぜ手が本来困難だったのか

それは恣意的なものではありません。手には他の体の部位のほぼどこよりも多くの独立した関節があり、とり得る異なる構成の数は、はるかに狭い範囲で変化する顔などと比較して膨大です。

また、手は常に自分自身を遮蔽します。指が別の指の後ろに隠れたり、握りこぶしが手のひらの大部分を隠したりし、わずかな回転で外形が完全に変わります。写真から学習するモデルにとって、一つの対象物に対して膨大な種類の部分的な形状が見えることになります。

さらに、学習データも役立つものではありませんでした。写真は顔を中心に構成され、手はフレームの端に現れたり、動きでぼやけていたり、切り取られていたり、何かを持っていて隠れていたりします。例は豊富でしたが、まさに重要となる点で質が低いものでした。

これらを合わせると、おなじみの失敗が生じました。指のようなものが付いていることは知っていても、何本で、どのような配置で、どの程度の大きさであるかという信頼できる感覚を持たないモデルです。

何がそれを修正したのか

特別なことではありません。より多く、より適切に注釈が付けられたデータ、モデルが空間構造を扱う方法を一般的に改善したアーキテクチャの変更、そして批判に飽き飽きしていたチームによる明示的な取り組みが要因です。

  1. 2022
    手は標準的なジョーク 6本指、融合した指、不可能な握り方。
  2. 2023
    アドバイスの拡散 指を数えろ、が万能なヒントになる。
  3. 2023
    的を絞った修正の公開 新しいリリースにおけるより良い注釈付けと空間処理。
  4. 2024
    ほぼ解決 正しい手が例外ではなくデフォルトになる。
  5. 2026
    アドバイスが欠陥よりも長生きする 人々は今でも指を数え、両方の意味で間違った結果を得ている。
有名な制限がどれくらいの速さで解消されたか

最後の行がこの記事全体の要点です。判別方法は数年前に修正されましたが、アドバイスは今も広まっており、人々はそれを適用することで積極的に画像を読み違えています。

なぜカウントが現在双方向で失敗するのか

まず偽陰性について。正しい手は何の証明にもなりません。現在のモデルはほとんどの場合適切に描画するため、指のテストを通過した画像は、ほぼすべてが通過するテストに合格したに過ぎません。

次に偽陽性について。これがより大きな害を及ぼします。動きの中で撮影された本物の手は、ぼやけて結合し、明らかに変形した形状を生み出します。誰かがパーティーで身振り手振りをしている本物の写真は、数えるように教え込まれた人には、まさに警告されていたもののように見えることがあります。

この非対称性は重要です。なぜならコストが不均等に発生するからです。生成画像を誤って本物と判断することは通常リカバリー可能ですが、本物の写真やその人物を誤って非難することは取り返しがつきません。

また、これは自己強化的な性質があります。手が判別ポイントだと教えられた人が、奇妙に見える手を見つけて画像が偽物だと結論付け、誤りを引き起こしたアドバイスを繰り返す。これが、役割を終えた経験則が本来の有用性を何年も超えて生き残る仕組みです。

このエピソードが他のすべての判別ポイントについて教えること

手は一般的なパターンの実例であり、そのパターンは特定のヒントよりも有益です。

  • 目に見える欠陥は公のベンチマークです。 名前を付けられるものは測定され、測定されるものは最適化されます。
  • 人気は修正を加速させます。 判別ポイントが広く繰り返されるほど、それを削除するインセンティブが高まります。
  • アドバイスは欠陥よりも何年も長生きします。 修正が元のヒントほど速く広まることはありません。
  • 修正はツール間で不均等です。 フラッグシップモデルで削除された判別ポイントが、古かったり小規模なモデルには残っている可能性があります。
  • 残渣は下位へ移動します。 生き残るのは目に見える欠陥ではなく、統計的なテクスチャであり、それは肉眼の解像度よりも低いレベルにあります。

最後の点が、そもそも検出ツールが存在する理由です。もし違いがまだ目に見えるなら、それを見つけるためのモデルは必要なく、分野全体が単なる探すべきもののリストになっていたでしょう。

今でも通用するもの

2種類のチェック方法がこのパターンに耐えています。どちらも局所的な詳細ではなく、フレーム全体の一貫性に関するものです。

1つ目は照明です。写真内のすべての表面は同じ光源によって照らされているため、影の方向、硬さ、色温度はすべて一致します。生成されたシーンでは、被写体は正しくても周囲との関係が概ね正しい程度であることが多く、影に不一致が現れます。

2つ目は物理的な連続性です。肩の後ろを通るストラップが間違った場所から現れる、そこに存在するはずのない部屋を映し出す反射、遮蔽物をまたいで線が揃わないパターンなどです。これらには外見のモデルではなく、世界のモデルが必要です。

どちらも迅速なテストではありません。それが誠実な結論です。今でも機能するチェックは写真を場所として見る必要があり、迅速だったチェックはすでに修正されたものだからです。

これを教える人にとって意味すること

依然としてメディアリテラシー教材の多くは指を数えることから始まりますが、それは人々に自信を持って誤った結論を出すテストを教えているようなものです。これに関するトレーニング、ガイダンス、授業を作成する人は、コンテンツの問題ではなくバージョンの問題を抱えています。

教訓の永続的なバージョンは、特徴ではなく手法に関するものです。目に見える欠陥は一時的なものであること、教えられるほど人気のある判別ポイントは修正されるほど人気があること、そして信頼できる質問はソースとコンテキストに関するものであることを教えてください。

失敗モードを明示的に教えることも価値があります。動きの中にある本物の手が不自然に見えることがあると知っている人は、実際に損害を与えるような告発、つまり実在する人物の本物の写真を偽物だと呼ぶようなことをする可能性が低くなります。

そのような教材にとって誠実な見出しは、現在のモデルに対して機能する迅速な視覚テストは存在せず、有用なスキルは、その画像がどこから来たのか、そして誰がそれを信じさせることで利益を得るのかを問いかけることだ、という点にあります。

よくある質問

AI画像の手は今でも間違っているのか?
はるかに少なくなっており、2024年頃には信頼できるテストではなくなりました。現在のモデルはほとんどの場合正しく描画するため、正しい手は何の証明にもならず、奇妙に見える手は本物の写真におけるモーションブラーである可能性が少なくとも同じくらいあります。
なぜそもそも手が難しかったのか?
可動域が広く、自己遮蔽が頻繁に起こり、学習写真では主にフレームの端に現れ、ぼやけていたり部分的に隠れていたりしたからです。例は豊富でしたが役に立たず、それは恒久的な制限ではなくデータの問題でした。
指に代わって何を見るべきか?
誠実な答えは、迅速なものはない、ということです。照明の一貫性と物理的な連続性は、外見ではなく世界のモデルを必要とするため今でも通用しますが、どちらも画像を欠陥を探す対象としてではなく、場所として見る必要があります。
なぜ人々は今でもアドバイスを繰り返すのか?
修正はヒントよりもゆっくりとしか伝わらないからです。指を数えるというアドバイスは、約18か月間は真に有益で広く拡散されましたが、欠陥がなくなってから何年も生き残っています。今それを使っている人々は、積極的に画像を双方向で読み違えています。
古い生成ツールは今でも手が苦手なのか?
苦手なものもあり、修正にはばらつきがあります。大手プロバイダーのフラッグシップモデルは手を上手に描画する一方で、古いオープンソースのチェックポイントはそうではない可能性があるため、判別ポイントは出力の限られた範囲で生き残り、他の場所では機能しません。
代わりに歯、耳、目を見るべきか?
それらも同じ軌跡をたどっており、引退した判別ポイントのリストに含まれています。バイラル投稿で説明できるものはすべてベンチマークされ、ベンチマークされたものはすべて修正されます。残された違いは統計的なものであり、それが検出器が読み取るものであって、人間の目には見えないものです。