← جميع الأدلة خلف الكواليس

diffusion مقابل GAN: لماذا تتعامل أجهزة الكشف معها بشكل مختلف

طريقتان لبناء الصورة، وبصمتان مختلفتان. ما تتركه كل عملية وراءها، ولماذا كان من الأسهل اكتشاف GAN، وماذا يتنبأ ذلك بشأن ما سيأتي بعد.

· 8 دقيقة قراءة · Best AI Image Detector

تترك نماذج GAN أثراً متكرراً من زيادة أخذ العينات يُعد بمثابة توقيع تقريباً. لا تفعل نماذج diffusion ذلك، ولهذا السبب أصبح الاكتشاف أكثر صعوبة في عام 2022 ولماذا توقفت الحيل الخاصة بالبنية عن العمل.

كيف يبني GAN صورة

تبدأ الشبكة التوليدية التنافسية من متجه صغير وتزيد من أخذ العينات بشكل متكرر، وتضاعف الدقة في كل طبقة حتى تصل إلى الحجم الكامل. تحكم شبكة ثانية على النتيجة، وتتدرب الاثنتان ضد بعضهما البعض.

زيادة أخذ العينات المتكررة هي الجزء المهم. تقدم كل خطوة مضاعفة نمطاً منتظماً، وتتراكم هذه الأنماط في بنية دورية تكون مرئية عند تحويل الصورة إلى مجال التردد.

كانت تلك البنية قريبة من التوقيع. يمكن لأجهزة الكشف المبكرة البحث عن نمط رقعة الشطرنج في طيف التردد والوصول إلى دقة عالية دون فهم أي شيء عن الصورة. كانت بصمة للبنية أكثر من كونها لأي نموذج معين.

كيف يبني نموذج diffusion صورة

يعمل نموذج diffusion بطريقة عكسية. يبدأ بمجال من التشويش النقي بدقة الهدف الكاملة ويزيل القليل منه في كل خطوة، مسترشداً بما تعلمه النموذج، حتى تظهر الصورة.

لا يوجد سلم تدرج (upsampling ladder)، لذا لا توجد آثار دورية. المخرجات تختلف إحصائياً عن لقطة الكاميرا، والفرق منتشر بدلاً من أن يكون هيكلياً. لا شيء في الصورة يظهر كنمط واضح يمكنك البحث عنه.

GAN

  • ناقل صغير تم تدرجه (upsampled) بشكل متكرر
  • آثار دورية من كل مضاعفة
  • يمكن اكتشافها في نطاق التردد
  • البنية تترك ما يشبه التوقيع
  • سائدة حتى عام 2022 تقريباً

الانتشار (Diffusion)

  • تتم إزالة الضوضاء خطوة بخطوة بالحجم الكامل
  • لا يوجد سلم تدرج، ولا نمط دوري
  • الاختلاف إحصائي وليس هيكلياً
  • يتطلب نموذجاً مُدرباً للكشف عنه
  • سائدة منذ عام 2022
العمليتان وما تتركه كل منهما خلفها. العمود الأيمن هو السبب في ضرورة إعادة بناء الكشف.

سبب توقف الكواشف القديمة عن العمل

أداة بُنيت للعثور على نمط الترقيع في نطاق التردد لا تجد شيئاً في صورة الانتشار (diffusion). لا تبلغ الأداة عن وجود حالة عدم يقين؛ بل تبلغ عن غياب الأثر، وهو ما يُقرأ كنتيجة نظيفة.

هذا هو السبب في أن دقة الكشف عبر المجال بدت وكأنها تنهار بين عامي 2021 و2023. الأدوات لم تتدهور، بل الشيء الذي كانت تبحث عنه توقف عن الإنتاج.

ما الذي حل محل الكشف الخاص ببنية معينة

الشمولية. بدلاً من البحث عن أثر واحد، يتم تدريب الكواشف الحالية على مخرجات أكبر عدد ممكن من المولدات المختلفة، بحيث يتعلم النموذج القواسم المشتركة للنسيج الاصطناعي بدلاً من ما تنتجه عائلة واحدة.

تم تدريب النموذج المستخدم هنا على ملايين الصور من آلاف المولدات لهذا السبب تحديداً. التغطية عبر البنى هي ما يضمن التعميم للنموذج التالي، وهي النهج الوحيد الذي نجا من تغير الأسلوب السائد.

المقايضة هي أن الدقة في أي مولد معروف تكون أقل مما يحققه كاشف متخصص. هذه مقايضة صحيحة، لأن المتخصص يصبح عديم الفائدة في اليوم الذي يظهر فيه شيء جديد.

ما يتنبأ به هذا

الدرس المستفاد من الانتقال من GAN إلى الانتشار (diffusion) ليس حول الانتشار بحد ذاته. بل هو أن أي كاشف مرتبط بكيفية صنع الصور حالياً له عمر محدود، ولن يتم الإعلان عن الانتقال مسبقاً.

كيف تقادم كل جيل من أجيال الكشف
النهجعمل علىفشل عندما
البحث عن أثر الترددشبكات GANوصل الانتشار (Diffusion)
تحليل خاص بالوجهتبديل الوجوه المبكروصل توليد المشهد بالكامل
فحص البيانات الوصفية (Metadata)ملفات مباشرة من أداةقامت المنصات بإزالة البيانات الوصفية
تحليل مستوى الخطأصور JPEG محفوظة لمرة واحدةبدأت الصور في الانتقال
تدريب واسع متعدد المولداتمعظم المخرجات الحاليةغير معروف، ولاحق للأخرى

هل يهم أي من هذا للمستخدم

في الغالب يفسر أمرين ستلاحظهما. أولاً، لماذا لا يستطيع الكاشف عادة تسمية الأداة التي أنتجت الصورة: فهو يقرأ خاصية إحصائية مشتركة بدلاً من بصمة لكل نموذج.

ثانياً، لماذا تعطي الكواشف المجانية القديمة أداءً سيئاً. تم بناء العديد من الأدوات التي لا تزال عبر الإنترنت حول آثار شبكات GAN ولم يتم إعادة تدريبها. إنها تعيد نتائج نظيفة واثقة على المخرجات الحالية، ولا يوجد شيء في الواجهة يفسر السبب.

ما تفعله سلسلة المعالجة الهجينة للنتيجة

معظم الصور التي تصل إليك لم يتم إنتاجها بأسلوب واحد. نموذج انتشار (diffusion) يولد القاعدة، ومكبر دقة (upscaler) يعتمد على GAN يوسعها، ويمرر إصلاح الوجه العينين، ويقوم محرر بقص وحفظ النتيجة.

كل مرحلة تعيد كتابة النسيج، لذا يحمل الملف آثاراً لعدة عمليات متراكبة فوق بعضها البعض. المرحلة الأخيرة التي تلمس الصورة تهيمن عادة على ما يقرؤه الكاشف، وهذا هو السبب في أن صورة الانتشار (diffusion) المكبرة يمكن أن تبدو إحصائياً أشبه بالمكبر أكثر من المولد.

هذا هو السبب العملي لعدم نجاح تحديد البنية خارج المختبر. في اختبار خاضع للرقابة مع مخرجات نموذج واحد نظيفة، تكون المشكلة قابلة للحل. أما في صورة مرت عبر سلسلة إنتاج حقيقية، فإن السؤال لا يُطرح بشكل جيد.

وهذا يفسر أيضاً نتيجة يجدها الناس محيرة: صورة مولدة حقيقياً تسجل نتيجة أقل من صورة فوتوغرافية مكبرة بكثافة. كلاهما تمت إعادة كتابة نسيجهما بواسطة البرمجيات، والكاشف يقرأ إعادة الكتابة بدلاً من الأصل.

أسئلة يطرحها الناس

هل صور GAN أسهل في الاكتشاف من صور الانتشار (diffusion)؟
كانت كذلك، وهناك عدد أقل بكثير منها الآن. ترك تدرج GAN آثاراً دورية يمكن لتحليل تردد بسيط العثور عليها. لا يترك الانتشار (diffusion) هيكلاً مكافئاً، لذا يتطلب الكشف نموذجاً مدرباً يقرأ النسيج الإحصائي بدلاً من البحث المستهدف عن نمط واحد.
هل يستطيع الكاشف إخباري ما إذا كانت الصورة جاءت من GAN أو نموذج انتشار (diffusion)؟
ليس من البكسلات، بشكل عام. يبلغ الكاشف العام عن مدى احتمال تورط شيء توليدي، وليس أي عائلة أنتجته. تحديد البنية هو مشكلة بحثية منفصلة وهي أقل موثوقية بكثير من الكشف.
هل لا تزال شبكات GAN مستخدمة؟
نعم، في أماكن محددة. تظل سريعة وفعالة لمهام ضيقة مثل تركيب الوجوه وبعض عمليات التكبير، حيث يكون الانتشار (diffusion) أبطأ. تستخدم بعض الأدوات كليهما في مراحل مختلفة، مما يعني أن الصورة يمكن أن تحمل آثاراً لأي منهما.
هل ستكسر البنية التالية الكشف مرة أخرى؟
ستقلل من الدقة بدلاً من كسرها، وهو التحسن الذي وفرته التدريبات الواسعة. النموذج الذي تعلم ما يشترك فيه النسيج الاصطناعي عبر آلاف المولدات يتدهور تدريجياً مقابل شيء جديد، بينما يفشل كاشف الأثر الواحد تماماً.
لماذا تدعي بعض الأدوات دقة عالية جداً؟
عادة لأنها تقيس على مجموعة اختبار مبنية من مولدات تم تدريبها عليها. هذا الرقم حقيقي وهو لا يصف الأداء على النموذج الذي صدر الشهر الماضي. اسأل عن المولدات التي كانت في المعيار قبل مقارنة الأرقام بين الأدوات.
هل يؤثر هذا على كيفية قراءتي للنتيجة؟
فقط بطريقة واحدة. عامل النتيجة النظيفة على صورة لديك أسباب أخرى للشك فيها كدليل أضعف من النتيجة التي تم تحديدها (flagged)، لأن نمط الفشل لبنية غير معروفة هو درجة منخفضة واثقة بدلاً من أن تكون غير مؤكدة.