Ang talagang ginagawa ng isang chatbot
Ang isang multimodal language model ay nag-convert ng isang larawan sa isang semantic na paglalarawan at pagkatapos ay pinag-iisipan ang paglalarawang iyon sa teksto. Sinasagot nito ang tanong kung ang larawang ito ba ay kamukha ng mga larawan ng AI na binasa ko noong pagsasanay.
Iyon ay tanong tungkol sa nilalaman at komposisyon. Ang detection ay tanong tungkol sa texture: kung paano nauugnay ang mga kalapit na halaga ng pixel sa isa't isa, sa sukat na malayo sa ibaba ng anuman na pinapanatili ng isang semantic na paglalarawan.
Ang impormasyon na binabasa ng detector ay itinatapon bago magsimulang mag-isip ang isang language model. Hindi sa masama ang mga chatbot dito. Gumagana sila mula sa isang representasyon na hindi naglalaman ng ebidensya.
Ang ibinubunga nito sa pagsasagawa
- Mga tiyak na sagot na walang threshold. Sasabihin ng isang chatbot na malamang na ginawa ng AI nang walang anumang sukat sa likod ng salitang malamang. Walang numero, walang band, at walang maihahambing sa isa pang larawan.
- Pangangatwiran mula sa mga lumang senyales. Binabanggit ng mga modelo ang mga daliri, ngipin, makintab na balat, at baluktot na teksto, dahil iyon ang sinasabi ng teksto ng pagsasanay na dapat hanapin. Naayos na ang mga iyon taon na ang nakakaraan.
- Pagkakasundo sa iyong balangkas. Magtanong kung ang isang larawan ay peke at mas malamang na marinig mo ang oo kaysa kung nagtanong ka nang neutral. Katangian iyon ng interface, hindi ng larawan.
- Walang pag-uulit. Magtanong nang dalawang uli at maaari kang makakuha ng dalawang magkaibang sagot tungkol sa parehong file, na may pantay na kumpiyansang mga paliwanag para sa bawat isa.
- Walang impormasyon sa rehiyon. Hindi nito masasabi sa iyo na ang isang sulok ng isang litrato ay kumikilos nang iba sa iba, na siyang natuklasan na kadalasang mahalaga.
| Kakayahan | Chatbot | Pixel detector |
|---|---|---|
| Binabasa ang texture sa antas ng pixel | No | Yes |
| Naka-calibrate na iskor na may mga nai-publish na band | No | Yes |
| Parehong sagot sa bawat pagkakataon | No | Yes |
| Paghahati sa antas ng rehiyon | No | Yes |
| Sinukat laban sa isang benchmark | No | Yes |
| Ipinapaliwanag ang pangangatwiran nito sa tuluyan | Yes nang matatas | Partly bilang mga signal |
| Inilalarawan kung ano ang nasa loob ng larawan | Yes | No |
Ang huling dalawang hilera ang mga dapat panatilihin. Ang isang language model ay tunay na magaling sa paglalarawan ng larawan at sa pangangatwiran kung may katuturan ang isang tagpo. Kapaki-pakinabang ang mga iyon at hindi ito pag-detect.
Kung saan tunay na kapaki-pakinabang ang isang chatbot
Ang lubusang pagwawalang-bahala sa tool ay maling hakbang. Kung gagamitin sa kung ano ang kaya nitong gawin, kinukumpleto nito ang isang detector sa halip na palitan ito.
-
Hilinging ilarawan nang detalyado ang tagpo
Ang maingat na paglalarawan ay madalas na naglalantad ng mga bagay na hindi mo namamalayan, kabilang ang mga bagay na hindi nababagay sa isa't isa o mga karatula na hindi mo nabasa.
-
Tanungin kung magkakaugnay sa pisikal ang tagpo
Ang mga anino, repleksyon, sukat at pananaw ay mga problema sa pangangatwiran, at ang pangangatwiran ang layunin ng model. Nahuhuli nito ang mga composite na maaaring makaligtaan ng pixel analysis.
-
Itanong kung ano ang magpapatunay o magpapasubali rito
Ang pagtro-tsek ng hinala tungo sa listahan ng mga susuriin ay isang magandang gamit ng language model, at ang listahan ay madalas na mas mahusay kaysa sa isusulat mo.
-
Pagkatapos ay magpatakbo ng totoong detector
Para sa tanong tungkol sa pixel, gumamit ng isang bagay na binuo para rito, at basahin ang score laban sa isang nai-publish na sukat.
Bakit ang katatasan ang panganib
Ang detector na hindi sigurado ay nagbabalik ng katamtamang numero, at ang numero mismo ang nagpapakita ng kawalan ng katiyakan. Ang language model na hindi sigurado ay nagbabalik ng talata, at ang mga talata ay walang mga error bar.
Ang parehong mahusay na pagkakaayos na paliwanag ay lumilitaw kung natukoy man ng model ang isang bagay na totoo o gumawa ng kapani-paniwalang paliwanag tungkol sa wala. Binibigyang-kahulugan ng mga mambabasa ang kanilang tiwala batay sa kalidad ng pagsusulat, na eksaktong signal na walang dalang impormasyon dito.
Ito ang dahilan kung bakit ang pag-tsek sa isang chatbot ay mas masamang simula kaysa sa pagtingin mo mismo sa larawan. Ang sarili mong kawalan ng katiyakan ay kahit paano nakikita mo.
Ang parehong problema sa iba pang mga tool
Hindi ito tungkol sa iisang produkto. Anumang sistema na nangangatwiran tungkol sa isang larawan nang semantiko ay may parehong puwang, at ilang mga tool na ipinakita ngayon bilang mga detector ay eksaktong ginagawa iyon sa ilalim.
Isang kapaki-pakinabang na pagsubok: tanungin kung ano ang iuulat ng tool sa isang larawan ng isang larawan, o sa isang larawan na walang nakikilalang paksa. Ang pixel detector ay nagbabalik ng score sa alinmang paraan, dahil umiiral ang texture anuman ang nilalaman. Ang isang semantikong sistema ay walang pinagtatalunan at tatanggi o mag-imbento ng isang bagay.
Pangalawang pagsubok: patakbuhin ang parehong file nang dalawang beses. Ang pixel model ay deterministic at ibinabalik ang parehong numero. Ang language model ay nagpili, at ang dalawang pagtakbo ay maaaring mag-iba. Kung ang tool ay nagbibigay sa iyo ng iba't ibang sagot para sa parehong bytes, hindi ito sumusukat ng anuman.
Wala sa alinmang pagsubok ang nangangailangan ng pag-unawa kung paano gumagana ang tool. Parehong tumatagal ng isang minuto, at sa pagitan nila ay pinaghihiwalay nila ang pagsukat mula sa paglalarawan nang mas maaasahan kaysa sa pagbabasa ng pahina ng marketing.