Ano ang sinusukat ng balanseng katumpakan
Ang simpleng katumpakan ay madaling mapalaki. Magpakain sa detector ng set ng pagsubok na 90 porsyentong binuong mga larawan at ang isang modelong nagsasabi ng oo sa lahat ay nakakakuha ng 90 porsyento habang walang kwenta.
Inaayos ito ng balanseng katumpakan sa pamamagitan ng pagbibigay ng pantay na timbang sa totoo at binuong mga larawan, kaya ang pigura ay ang average ng dalawang rate: kung gaano kadalas tama ang paglilinis ng mga tunay na litrato, at kung gaano kadalas tama ang pag-flag sa mga binuong larawan. Ang isang tool na nagbabanggit ng simpleng katumpakan nang hindi binabanggit ang halo ng pagsubok nito ay hindi nagsasabi sa iyo ng marami.
Ang dalawang paraan na mali ang isang detector
Ang isang numero ay nagtatago ng dalawang magkaibang kabiguan, at mayroon silang magkaibang gastos.
Maling positibo
- Isang tunay na litrato ang nakakuha ng marka sa itaas ng linya
- Dulot ng pag-upscale, retouch, night mode, mga screenshot
- Gastos: isang paratang laban sa isang tunay na tao
- Ang kabiguang talagang nananakit
Maling negatibo
- Isang binuong larawan ang nakakuha ng marka sa ibaba ng linya
- Dulot ng mga bagong generator, maliliit na pagbabago, mga pinalinis na file
- Gastos: nakalusot ang isang peke nang walang laban
- Ang kabiguang hindi gaanong napapansin ng mga tao
Ang paggalaw sa linya ng desisyon ay nagpapalit ng isa para sa isa pa. Ang pagbaba nito ay nakakahuli ng mas maraming pekeng litrato at nagmamarka ng mas maraming totoong litrato. Ang pagataas nito ay nag-iingat sa mga tunay na larawan at nagpapalusot sa mas maraming peke. Walang setting na nagpapaganda sa pareho, kaya naman ang linya ay inilathala sa 65 sa halip na tahimik na binago.
Bakit ang mga numero ng benchmark ay nagpapalabis sa totoong performance
| Benchmark image | Iyong larawan | Epekto sa marka |
|---|---|---|
| Orihinal na file, hindi kailanman muling nai-save | Nai-compress nang dalawa o tatlong beses | Bumababa ang katumpakan nang ilang puntos |
| Buong resolution | Na-crop o ibinaba ang laki para sa isang chat app | Mas kaunting detalye para basahin, mas maraming kawalan ng katiyakan |
| Mga generator na kilala sa oras ng pagsasanay | Isang modelong inilabas noong nakaraang buwan | Ang patuloy na kahinaan ng bawat detector |
| Malinis na litrato o malinis na render | Totoong larawan na may isang pag-edit ng AI | Ang marka ng buong frame ay nagpapababa nito |
| Walang adversarial processing | Sadyang nilinis para makalusot | Idinisenyo para talunin ang sukat |
Wala sa mga ito ang mga hindi pangkaraniwang kaso. Inilalarawan nila kung paano talaga naglalakbay ang mga larawan. Ang isang larawan na umabot sa iyo sa pamamagitan ng dalawang platform at isang screenshot ay nagbigay na ng malaking bahagi ng signal kung saan sinukat ang benchmark.
Paano magbasa ng paghahabol sa katumpakan
- Itanong kung anong test set. Ang isang pigura na walang pinangalanang benchmark ay marketing. Ang isang pigura sa isang pampublikong benchmark ay maaaring suriin ng ibang tao.
- Itanong kung balanse o simple. Ang simpleng katumpakan sa isang tagilid na test set ay ang pinakamadaling numerong palobohin.
- Itanong kung nasaan ang linya ng desisyon. Walang saysay ang katumpakan nang hindi nalalaman ang threshold kung saan ito sinukat.
- Itanong kung aling mga generator ang isinama. Ang anumang detector ay nakakakuha ng magandang marka sa mga modelong pinagsanayan nito at mas masahol pa sa inilabas pagkatapos.
- Itanong nang hiwalay ang rate ng maling positibo. Iyon ang numerong nagpapasya kung ligtas na gamitin ang tool sa mga totoong tao.
Ang hindi masasabi sa iyo ng katumpakan
Ang isang benchmark ay sumusukat kung gaano kadalas tama ang isang modelo sa isang populasyon ng mga larawan. Wala itong sinasabi tungkol sa kung tama ba ito sa iyo. Walang confidence interval na nakalakip sa isang solong resulta, at hindi alam ng isang detector kung aling mga error nito ang ginagawa nito.
Ito ang dahilan kung bakit mas mahalaga ang mapa ng rehiyon at ang ebidensya ng file kaysa sa numero sa headline. Ang kasunduan sa pagitan ng mga independiyenteng signal ay mas mahalaga kaysa sa isang malakas na numero mula sa isa sa kanila, at ang hindi pagkakasundo ay isang pagtuklas sa sarili nitong.
Paano subukan ang isang detector sa iyong sarili
Hindi mo kailangang paniwalaan ang pigura ng sinuman. Ang isang kapaki-pakinabang na pagsubok ay tumatagal ng isang hapon at nagbibigay sa iyo ng higit pang impormasyon tungkol sa isang tool kaysa sa anumang inilathalang benchmark, dahil gumagamit ito ng mga larawang mukhang sa iyo.
-
Bumuo ng isang set na alam mo na ang sagot
Dalawampung litrato na kinunan mo mismo, at dalawampung larawan na binuo mo. Panatilihing hindi ginalaw ang mga orihinal. Ang dalawampu sa bawat isa ay sapat na upang ilantad ang isang halatang mahinang tool.
-
Isama ang mahirap na gitna
Magdagdag ng mga screenshot ng iyong sariling mga larawan, mga kuha sa night-mode, isang upscaled na crop, at isang mabigat na nire-retouched na portrait. Dito nabibigo ang mga detector, at ito ang bahaging iniiwan ng bawat benchmark ng vendor.
-
Itala ang marka at ang banda, sa halip na isang hatol
Isulat kung ano ang ibinalik ng bawat tool. Ang paghahambing ng mga banda ay mas nagbibigay-kaalaman kaysa sa paghahambing ng mga numero, dahil ang dalawang tool ay maaaring maglagay ng kanilang mga linya ng desisyon sa iba't ibang lugar.
-
Bilangin nang hiwalay ang dalawang uri ng error
Ilan sa iyong mga totoong litrato ang minarkahan, at ilan sa iyong mga nabuong larawan ang napalampas. Ang isang tool na hindi kailanman nakakaligtaan ng isang peke sa pamamagitan ng pagmamarka sa sangkatlo ng iyong sariling mga larawan ay hindi magagamit sa mga tao.
Ang numerong mahalaga ay ang una: kung gaano kadalas nitong tinatawag na peke ang iyong sariling gawa. Iyon ang pagkabigo na may kalakip na gastos, at ito ang inaalis ng isang headline figure ng katumpakan.