← Lahat ng gabay Paghahambing

Masasabi ba ng ChatGPT kung ang isang larawan ay ginawa ng AI?

Magbibigay ito sa iyo ng tiwala na sagot na walang laman sa likod nito. Kung bakit hindi ito magagawa ng mga language model, kung ano talaga ang ginagawa nila, at kung ano ang gagamitin sa halip.

· 7 min na pagbabasa · Best AI Image Detector

Hindi. Inilalarawan ng isang language model ang hitsura ng isang larawan at pinag-iisipan ito sa pamamagitan ng mga salita. Wala itong naka-calibrate na threshold, walang benchmark, at walang access sa mga istatistika ng pixel na pinag-aabangan ng detection.

Ang talagang ginagawa ng isang chatbot

Ang isang multimodal language model ay nag-convert ng isang larawan sa isang semantic na paglalarawan at pagkatapos ay pinag-iisipan ang paglalarawang iyon sa teksto. Sinasagot nito ang tanong kung ang larawang ito ba ay kamukha ng mga larawan ng AI na binasa ko noong pagsasanay.

Iyon ay tanong tungkol sa nilalaman at komposisyon. Ang detection ay tanong tungkol sa texture: kung paano nauugnay ang mga kalapit na halaga ng pixel sa isa't isa, sa sukat na malayo sa ibaba ng anuman na pinapanatili ng isang semantic na paglalarawan.

Ang impormasyon na binabasa ng detector ay itinatapon bago magsimulang mag-isip ang isang language model. Hindi sa masama ang mga chatbot dito. Gumagana sila mula sa isang representasyon na hindi naglalaman ng ebidensya.

Ang ibinubunga nito sa pagsasagawa

  • Mga tiyak na sagot na walang threshold. Sasabihin ng isang chatbot na malamang na ginawa ng AI nang walang anumang sukat sa likod ng salitang malamang. Walang numero, walang band, at walang maihahambing sa isa pang larawan.
  • Pangangatwiran mula sa mga lumang senyales. Binabanggit ng mga modelo ang mga daliri, ngipin, makintab na balat, at baluktot na teksto, dahil iyon ang sinasabi ng teksto ng pagsasanay na dapat hanapin. Naayos na ang mga iyon taon na ang nakakaraan.
  • Pagkakasundo sa iyong balangkas. Magtanong kung ang isang larawan ay peke at mas malamang na marinig mo ang oo kaysa kung nagtanong ka nang neutral. Katangian iyon ng interface, hindi ng larawan.
  • Walang pag-uulit. Magtanong nang dalawang uli at maaari kang makakuha ng dalawang magkaibang sagot tungkol sa parehong file, na may pantay na kumpiyansang mga paliwanag para sa bawat isa.
  • Walang impormasyon sa rehiyon. Hindi nito masasabi sa iyo na ang isang sulok ng isang litrato ay kumikilos nang iba sa iba, na siyang natuklasan na kadalasang mahalaga.
Kakayahan Chatbot Pixel detector
Binabasa ang texture sa antas ng pixel No Yes
Naka-calibrate na iskor na may mga nai-publish na band No Yes
Parehong sagot sa bawat pagkakataon No Yes
Paghahati sa antas ng rehiyon No Yes
Sinukat laban sa isang benchmark No Yes
Ipinapaliwanag ang pangangatwiran nito sa tuluyan Yes nang matatas Partly bilang mga signal
Inilalarawan kung ano ang nasa loob ng larawan Yes No
Ang aktibong maibubunga ng bawat diskarte. Ang gitnang kolumn ang pinagkakamalan ng mga tao bilang tamang kolum.

Ang huling dalawang hilera ang mga dapat panatilihin. Ang isang language model ay tunay na magaling sa paglalarawan ng larawan at sa pangangatwiran kung may katuturan ang isang tagpo. Kapaki-pakinabang ang mga iyon at hindi ito pag-detect.

Kung saan tunay na kapaki-pakinabang ang isang chatbot

Ang lubusang pagwawalang-bahala sa tool ay maling hakbang. Kung gagamitin sa kung ano ang kaya nitong gawin, kinukumpleto nito ang isang detector sa halip na palitan ito.

  1. Hilinging ilarawan nang detalyado ang tagpo

    Ang maingat na paglalarawan ay madalas na naglalantad ng mga bagay na hindi mo namamalayan, kabilang ang mga bagay na hindi nababagay sa isa't isa o mga karatula na hindi mo nabasa.

  2. Tanungin kung magkakaugnay sa pisikal ang tagpo

    Ang mga anino, repleksyon, sukat at pananaw ay mga problema sa pangangatwiran, at ang pangangatwiran ang layunin ng model. Nahuhuli nito ang mga composite na maaaring makaligtaan ng pixel analysis.

  3. Itanong kung ano ang magpapatunay o magpapasubali rito

    Ang pagtro-tsek ng hinala tungo sa listahan ng mga susuriin ay isang magandang gamit ng language model, at ang listahan ay madalas na mas mahusay kaysa sa isusulat mo.

  4. Pagkatapos ay magpatakbo ng totoong detector

    Para sa tanong tungkol sa pixel, gumamit ng isang bagay na binuo para rito, at basahin ang score laban sa isang nai-publish na sukat.

Bakit ang katatasan ang panganib

Ang detector na hindi sigurado ay nagbabalik ng katamtamang numero, at ang numero mismo ang nagpapakita ng kawalan ng katiyakan. Ang language model na hindi sigurado ay nagbabalik ng talata, at ang mga talata ay walang mga error bar.

Ang parehong mahusay na pagkakaayos na paliwanag ay lumilitaw kung natukoy man ng model ang isang bagay na totoo o gumawa ng kapani-paniwalang paliwanag tungkol sa wala. Binibigyang-kahulugan ng mga mambabasa ang kanilang tiwala batay sa kalidad ng pagsusulat, na eksaktong signal na walang dalang impormasyon dito.

Ito ang dahilan kung bakit ang pag-tsek sa isang chatbot ay mas masamang simula kaysa sa pagtingin mo mismo sa larawan. Ang sarili mong kawalan ng katiyakan ay kahit paano nakikita mo.

Ang parehong problema sa iba pang mga tool

Hindi ito tungkol sa iisang produkto. Anumang sistema na nangangatwiran tungkol sa isang larawan nang semantiko ay may parehong puwang, at ilang mga tool na ipinakita ngayon bilang mga detector ay eksaktong ginagawa iyon sa ilalim.

Isang kapaki-pakinabang na pagsubok: tanungin kung ano ang iuulat ng tool sa isang larawan ng isang larawan, o sa isang larawan na walang nakikilalang paksa. Ang pixel detector ay nagbabalik ng score sa alinmang paraan, dahil umiiral ang texture anuman ang nilalaman. Ang isang semantikong sistema ay walang pinagtatalunan at tatanggi o mag-imbento ng isang bagay.

Pangalawang pagsubok: patakbuhin ang parehong file nang dalawang beses. Ang pixel model ay deterministic at ibinabalik ang parehong numero. Ang language model ay nagpili, at ang dalawang pagtakbo ay maaaring mag-iba. Kung ang tool ay nagbibigay sa iyo ng iba't ibang sagot para sa parehong bytes, hindi ito sumusukat ng anuman.

Wala sa alinmang pagsubok ang nangangailangan ng pag-unawa kung paano gumagana ang tool. Parehong tumatagal ng isang minuto, at sa pagitan nila ay pinaghihiwalay nila ang pagsukat mula sa paglalarawan nang mas maaasahan kaysa sa pagbabasa ng pahina ng marketing.

Mga tanong ng mga tao

Makakapag-detect ba ang ChatGPT ng mga larawang ginawa ng AI?
Hindi, sa anumang masusukat na kahulugan. Gumagawa ito ng pagtatasa na mukhang may kumpiyansa batay sa kung ano ang inilalarawan ng larawan sa halip na kung paano ginawa ang mga pixel. Walang naka-calibrate na threshold sa likod ng sagot, walang benchmark, at ang pagtatanong nang dalawang beses ay maaaring magbunga ng dalawang magkaibang hatol.
Pero tama ito tungkol sa isang larawang sinubukan ko.
Magiging tama ito nang madalas, lalo na sa mga malinaw na kaso kung saan tama ka rin sana. Ang problema ay magkapareho ang tunog nito kapag mali ito, kaya ang tamang sagot ay nagbibigay sa iyo ng walang paraan upang malaman kung aling uri ang natanggap mo sa susunod na larawan.
Paano kung hilingin ko itong suriin ang mga pixel?
Hindi nito kaya. Ang larawan ay kinakalap sa isang semantikong representasyon bago ito pag-isipan ng model, at ang pinong texture detection na nakasalalay dito ay itinatapon sa konseptong iyon. Ang paghingi ng pagsusuri sa pixel ay gumagawa ng paglalarawan kung ano ang magiging hitsura ng pagsusuri sa pixel.
Mayroon bang mga multimodal model na binuo para sa detection?
May pananaliksik sa lugar na ito at hindi ito ang ginagawa ng isang pangkalahatang katulong. Ang isang de-kalidad na detector ay sinanay sa mga pares ng totoo at nabuong mga larawan na may naka-calibrate na output; ang isang pangkalahatang model ay sinanay upang maging kapaki-pakinabang sa lahat ng bagay. Ang dalawa ay hindi malapit na kapalit.
Dapat ba akong gumamit ng chatbot kapag sinusuri ang isang larawan?
Oo, para sa paglalarawan at pangangatwiran. Tanungin kung ano ang nasa frame, kung pare-pareho ang liwanag, at kung ano ang magpapatunay o magpapasubali sa iyong hinala. Pagkatapos ay gumamit ng detector para sa tanong sa pixel, at panatilihing hiwalay ang dalawang sagot sa iyong isip.
Bakit napakaraming tao ang nagtatanong muna sa chatbot?
Dahil bukas ito sa ibang tab at palaging sumasagot. Ang kaginhawahan ay namamayani sa katumpakan kapag ang halaga ng pagiging mali ay hindi nakikita, at sa pagpapatunay ng larawan ang halaga ay karaniwang hindi nakikita hanggang sa ang isang tao ay kumilos na sa sagot.