← Lahat ng gabay Katumpakan

Katumpakan ng detector ng larawan ng AI: kung ano talaga ang ibig sabihin ng 91%

Balanseng katumpakan, mga linya ng desisyon, at ang pagkakaiba sa pagitan ng benchmark at ng iyong larawan. Ang saklaw ng pangunahing numero, at ang tahimik nitong iniwan.

· 7 min na pagbabasa · Best AI Image Detector

Ang 91.3% na balanseng katumpakan ay nangangahulugang humigit-kumulang isang larawan sa labing-isa ang lumalapag sa maling panig ng linya ng desisyon, sa ilalim ng mga kondisyon sa laboratoryo sa mga malinis na file. Ang iyong larawan ay hindi kondisyon sa laboratoryo.

Ano ang sinusukat ng balanseng katumpakan

Ang simpleng katumpakan ay madaling mapalaki. Magpakain sa detector ng set ng pagsubok na 90 porsyentong binuong mga larawan at ang isang modelong nagsasabi ng oo sa lahat ay nakakakuha ng 90 porsyento habang walang kwenta.

Inaayos ito ng balanseng katumpakan sa pamamagitan ng pagbibigay ng pantay na timbang sa totoo at binuong mga larawan, kaya ang pigura ay ang average ng dalawang rate: kung gaano kadalas tama ang paglilinis ng mga tunay na litrato, at kung gaano kadalas tama ang pag-flag sa mga binuong larawan. Ang isang tool na nagbabanggit ng simpleng katumpakan nang hindi binabanggit ang halo ng pagsubok nito ay hindi nagsasabi sa iyo ng marami.

Balanseng katumpakan ayon sa kalidad ng JPEG
Mga malinis na orihinal
91.3 %
Kalidad ng JPEG 60
87.3 %
Kalidad ng JPEG 40
84.6 %

Nagsisimula ang axis sa 80% upang mabasa ang paglihis. Ang buong 0-100 axis ay ganap na magtatago sa epekto.

Ang mga nai-publish na pigura para sa modelong ginamit dito, na sinusukat sa benchmark ng pananaliksik nito.

Ang dalawang paraan na mali ang isang detector

Ang isang numero ay nagtatago ng dalawang magkaibang kabiguan, at mayroon silang magkaibang gastos.

Maling positibo

  • Isang tunay na litrato ang nakakuha ng marka sa itaas ng linya
  • Dulot ng pag-upscale, retouch, night mode, mga screenshot
  • Gastos: isang paratang laban sa isang tunay na tao
  • Ang kabiguang talagang nananakit

Maling negatibo

  • Isang binuong larawan ang nakakuha ng marka sa ibaba ng linya
  • Dulot ng mga bagong generator, maliliit na pagbabago, mga pinalinis na file
  • Gastos: nakalusot ang isang peke nang walang laban
  • Ang kabiguang hindi gaanong napapansin ng mga tao
Ang iisang pigura ng katumpakan ay nag-a-average ng dalawang ito. Hindi sila mapapalitan, at mas pinapahalagahan ng karamihan ng mga tao ang isa sa kanila.

Ang paggalaw sa linya ng desisyon ay nagpapalit ng isa para sa isa pa. Ang pagbaba nito ay nakakahuli ng mas maraming pekeng litrato at nagmamarka ng mas maraming totoong litrato. Ang pagataas nito ay nag-iingat sa mga tunay na larawan at nagpapalusot sa mas maraming peke. Walang setting na nagpapaganda sa pareho, kaya naman ang linya ay inilathala sa 65 sa halip na tahimik na binago.

Bakit ang mga numero ng benchmark ay nagpapalabis sa totoong performance

Ang agwat sa pagitan ng isang test set at ng isang larawang ipinadala sa iyo ng isang tao
Benchmark imageIyong larawanEpekto sa marka
Orihinal na file, hindi kailanman muling nai-saveNai-compress nang dalawa o tatlong besesBumababa ang katumpakan nang ilang puntos
Buong resolutionNa-crop o ibinaba ang laki para sa isang chat appMas kaunting detalye para basahin, mas maraming kawalan ng katiyakan
Mga generator na kilala sa oras ng pagsasanayIsang modelong inilabas noong nakaraang buwanAng patuloy na kahinaan ng bawat detector
Malinis na litrato o malinis na renderTotoong larawan na may isang pag-edit ng AIAng marka ng buong frame ay nagpapababa nito
Walang adversarial processingSadyang nilinis para makalusotIdinisenyo para talunin ang sukat

Wala sa mga ito ang mga hindi pangkaraniwang kaso. Inilalarawan nila kung paano talaga naglalakbay ang mga larawan. Ang isang larawan na umabot sa iyo sa pamamagitan ng dalawang platform at isang screenshot ay nagbigay na ng malaking bahagi ng signal kung saan sinukat ang benchmark.

Paano magbasa ng paghahabol sa katumpakan

  • Itanong kung anong test set. Ang isang pigura na walang pinangalanang benchmark ay marketing. Ang isang pigura sa isang pampublikong benchmark ay maaaring suriin ng ibang tao.
  • Itanong kung balanse o simple. Ang simpleng katumpakan sa isang tagilid na test set ay ang pinakamadaling numerong palobohin.
  • Itanong kung nasaan ang linya ng desisyon. Walang saysay ang katumpakan nang hindi nalalaman ang threshold kung saan ito sinukat.
  • Itanong kung aling mga generator ang isinama. Ang anumang detector ay nakakakuha ng magandang marka sa mga modelong pinagsanayan nito at mas masahol pa sa inilabas pagkatapos.
  • Itanong nang hiwalay ang rate ng maling positibo. Iyon ang numerong nagpapasya kung ligtas na gamitin ang tool sa mga totoong tao.

Ang hindi masasabi sa iyo ng katumpakan

Ang isang benchmark ay sumusukat kung gaano kadalas tama ang isang modelo sa isang populasyon ng mga larawan. Wala itong sinasabi tungkol sa kung tama ba ito sa iyo. Walang confidence interval na nakalakip sa isang solong resulta, at hindi alam ng isang detector kung aling mga error nito ang ginagawa nito.

Ito ang dahilan kung bakit mas mahalaga ang mapa ng rehiyon at ang ebidensya ng file kaysa sa numero sa headline. Ang kasunduan sa pagitan ng mga independiyenteng signal ay mas mahalaga kaysa sa isang malakas na numero mula sa isa sa kanila, at ang hindi pagkakasundo ay isang pagtuklas sa sarili nitong.

Paano subukan ang isang detector sa iyong sarili

Hindi mo kailangang paniwalaan ang pigura ng sinuman. Ang isang kapaki-pakinabang na pagsubok ay tumatagal ng isang hapon at nagbibigay sa iyo ng higit pang impormasyon tungkol sa isang tool kaysa sa anumang inilathalang benchmark, dahil gumagamit ito ng mga larawang mukhang sa iyo.

  1. Bumuo ng isang set na alam mo na ang sagot

    Dalawampung litrato na kinunan mo mismo, at dalawampung larawan na binuo mo. Panatilihing hindi ginalaw ang mga orihinal. Ang dalawampu sa bawat isa ay sapat na upang ilantad ang isang halatang mahinang tool.

  2. Isama ang mahirap na gitna

    Magdagdag ng mga screenshot ng iyong sariling mga larawan, mga kuha sa night-mode, isang upscaled na crop, at isang mabigat na nire-retouched na portrait. Dito nabibigo ang mga detector, at ito ang bahaging iniiwan ng bawat benchmark ng vendor.

  3. Itala ang marka at ang banda, sa halip na isang hatol

    Isulat kung ano ang ibinalik ng bawat tool. Ang paghahambing ng mga banda ay mas nagbibigay-kaalaman kaysa sa paghahambing ng mga numero, dahil ang dalawang tool ay maaaring maglagay ng kanilang mga linya ng desisyon sa iba't ibang lugar.

  4. Bilangin nang hiwalay ang dalawang uri ng error

    Ilan sa iyong mga totoong litrato ang minarkahan, at ilan sa iyong mga nabuong larawan ang napalampas. Ang isang tool na hindi kailanman nakakaligtaan ng isang peke sa pamamagitan ng pagmamarka sa sangkatlo ng iyong sariling mga larawan ay hindi magagamit sa mga tao.

Ang numerong mahalaga ay ang una: kung gaano kadalas nitong tinatawag na peke ang iyong sariling gawa. Iyon ang pagkabigo na may kalakip na gastos, at ito ang inaalis ng isang headline figure ng katumpakan.

Mga tanong ng mga tao

Maganda ba ang 91% na katumpakan para sa isang AI image detector?
Ito ay isang makatwirang pigura para sa isang pixel-based detector sa isang malinis na benchmark, at hindi ito sapat na mataas para pag-aksyunan nang mag-isa. Ang siyam na maling tawag sa isang daan ay marami kapag ang bawat isa ay maaaring isang paratang. Ituring ito bilang isang screening tool na nagsasabi sa iyo kung saan titingin sa halip na isang pagsubok na nagtatapos sa tanong.
Aling AI image detector ang pinakatumpak?
Ang matapat na sagot ay ang mga inilathalang pigura ay hindi mapaghahambing. Gumagamit ang iba't ibang tool ng iba't ibang test set, iba't ibang linya ng desisyon, at iba't ibang kahulugan ng katumpakan, kaya sinusukat ng mga numero ang iba't ibang bagay. Ihambing kung ano ang ipinapakita sa iyo ng isang tool sa halip: mga inilathalang banda, mapa ng rehiyon, at isang nakasaad na rate ng maling positibo.
Bumubuti ba ang katumpakan habang bumubuti ang mga modelo?
Ang pagtuk DETECTION at pagbuo ay sabay na bumubuti, kaya nanatiling halos pareho ang agwat. Ang bawat bagong generator ay hindi nakikitang data para sa bawat umiiral na detector, at ang muling pagsasanay ay sumusunod sa pagpapalabas sa halip na mauna dito. Asahan ang isang permanenteng lag sa halip na isang nalutas na problema.
Bakit nagbibigay ang parehong tool ng iba't ibang marka para sa parehong larawan?
Hindi dapat ganoon, at kung gagawin nito, magkaiba ang dalawang file. Ang isang kopya na muling nai-save, binago ang laki, o ipinasa sa isang platform ay ibang file na may iba't ibang mga pixel. Ihambing ang orihinal sa orihinal, hindi ang orihinal sa isang pag-download ng sarili nito.