Bakit nabibigo ang awtomatikong pagpapatupad dito
Sa 91 porsiyento ng balanseng katumpakan sa ilalim ng mga kondisyon sa laboratoryo, humigit-kumulang isang tawag sa labing-isa ang mali. Sa nilalamang nilikha ng gumagamit, na dumarating na na-screenshot, na-recompress, at na-crop, mas malala ang tunay na rate.
Kung ilalapat sa sandaang libong aytem sa isang araw, libu-libong maling aksyon iyon. Ang bawat isa ay isang apela, at ang mga apela ay mas mahal bawat kaso kaysa sa pagsusuri na pinalitan ng automation. Hindi gumagana ang matematika bago mo pa man isaalang-alang ang gastos sa reputasyon ng pag-aalis ng mga tunay na post.
May pangalawang problema na partikular sa pag-moderate. Ang mga desisyon sa pagpapatupad ay ina-audit. Ang isang regulator o isang hukuman na nagtanong kung bakit tinanggal ang isang account ay hindi tatanggap ng output ng modelo na may hindi pa nailalathalang threshold bilang dahilan.
Score para isaayos, hindi para umaksyon
Ang kapaki-pakinabang na pagbalangkas ay ang pag-order ng pila. Mas marami kang aytem kaysa sa mga tagasuri. Ang isang score ang nagpapasya kung aling mga ito ang unang nakikita ng isang tao, at iyon ay isang trabaho na magagawa nito nang maayos kahit sa 85 porsiyentong katumpakan, dahil ang pagkakamali ay nangangahulugan lamang na may tumitingin sa isang bagay nang hindi kinakailangan.
- 1 Higit sa 90 Unahan ng review queue
- 2 65 hanggang 90 Sinuri sa loob ng normal na window
- 3 45 hanggang 65 Lamang kung naiulat ng isang gumagamit
- 4 Mababa sa 45 Walang aksyon, sinuri para sa mga pagsusuri sa kalidad
Ang pagsusuri sa ibabang banda ay mas mahalaga kaysa sa hitsura nito. Ito ang tanging paraan upang masukat ang iyong false negative rate, at kung wala ang numerong iyon ay hindi mo masabi kung gumagana ang sistema o tahimik na tumigil sa paghuli ng anuman.
Ano ang kailangang sabihin ng iyong patakaran
Karamihan sa mga plataporma ay mayroon nang panuntunan sa synthetic media, at karamihan sa kanila ay masamang nakasulat. Ang karaniwang pagkabigo ay ang pag-ban sa nilalaman ng AI sa pangkalahatan, na hindi naipatutupad at nahuhuli ang mga bagay na walang sinumang naglalayong mahuli.
| Maipatutupad | Hindi maipatutupad | Bakit |
|---|---|---|
| Hindi isiniwalat na synthetic media ng isang totoong tao | Lahat ng larawang gawa ng AI | Ang pangalawa ay nagbabawal sa gawaing ilustrasyon at disenyo |
| Mga larawang gawa na iniharap bilang patunay ng dokumentaryo | Anumang may score na higit sa 65 | Ang threshold ay hindi isang patakaran |
| Synthetic media na ginamit upang mandaya para sa pera | Mga larawang mukhang gawa ng AI | Ang pagtingin ay hindi isang pamantayan |
| Kabiguan na lagyan ng label kapag hiniling | Hindi isiniwalat na AI sa anumang anyo | Hindi mapatunayan, at ang mga gumagamit ay hindi sumusunod |
Isulat ang panuntunan sa paligid ng pinsala at pagsisiwalat sa halip na sa paligid ng pamamaraan. Ang isang nabuong ilustrasyon sa isang post ng kathang-isip ay walang sinasaktong tao. Ang isang nabuong litrato ng isang produkto, isang tao, o isang kaganapan, na iniharap bilang totoo, ang nais mong pigilan.
Ang tatlong kaso na pinaghihiwalay ng isang region map
Ang mga score ng buong frame ay nagpapanatili ng tatlong sitwasyon na nangangailangan ng magkakaibang paghawak. Pinaghihiwalay sila ng view ng tile, at ang pagkakaiba ay karaniwang nagpapasya sa kinalabasan.
- Bawat tile ay mataas. Isang buong nabuong larawan. Kung iniharap ito bilang isang litrato ng isang bagay na totoo, iyon ang iyong pinakamalinaw na kaso.
- Isang tile ang mataas. Isang tunay na litrato na may idinagdag o inalis. Sa konteksto ng pamilihan o balita, ito ay kadalasang mas seryoso kaysa sa buong pagbuo, dahil ito ay idinisenyo upang paniwalaan.
- Pantay-pantay ang init, walang mataas. Mabigat na pagpoproseso. Karaniwang isang tunay na litrato sa pamamagitan ng filter o upscaler. Halos hindi kailanman karapat-dapat gawan ng aksyon.
Isang tunay na litrato na may nakasuksok na elemento. Ang pag-order ng pila sa score ng headline lamang ay hindi kailanman magpapakita nito.
Pagsukat kung ito ay gumagana
-
Subaybayan ang katumpakan sa tuktok na banda
Sa mga aytem na may score na higit sa 90 na binuksan ng isang moderator, ilan ang inaksyunan? Kung ang numerong iyon ay mababa, ang tool ay lumilikha ng trabaho sa halip na i-save ito.
-
Suriin ang ilalim na banda linggu-linggo
Hilahin ang random na sandaan mula sa ibaba ng 45 at suriin ang mga ito. Ito lamang ang pagsukat sa kung ano ang iyong napalalampas, at ito ang nilalaktawan ng mga koponan.
-
Panoorin ang rate ng apela
Ang pagtaas ng matagumpay na mga apela sa mga desisyon ng synthetic media ay nangangahulugan na ang threshold ay lumihis o may dumating na bagong generator na may mababang score.
-
Mag-re-baseline pagkatapos ng bawat pagbabago ng modelo
Ang mga update ng detector ay naglilipat ng mga score. Ang isang threshold na tinutunan anim na buwan na ang nakalipas laban sa ibang bersyon ng modelo ay hindi na ang threshold na iniisip mo.
Pag-staff sa queue na nilikha ng tool
Ang pagdaragdag ng detector sa isang pipeline ng pag-moderate ay hindi nagpapababa ng bilang ng tauhan, at ang mga koponan na nagpaplano para dito ay nagiging mas masahol pa. Ang binabago nito ay ang pagkakasunud-sunod kung kailan dumarating ang trabaho, na nagpapataas ng halaga ng bawat oras ng tagasuri nang hindi binabawasan kung ilan ang kailangan mo.
Maglaan ng badyet para sa flagged queue na maging mas mabagal bawat aytem kaysa sa pangkalahatang queue. Ang isang tagasuri na tumitingin sa isang flagged na post ay gumagawa ng mas mahirap na desisyon sa mas malalabong materyal, at ang pagmamadali doon ay kung paano nangyayari ang maling pagpapatupad. Ang dalawang minuto bawat aytem ay makatotohanan; ang tatlumpung segundo ay hindi.
Bigyan ang mga tagasuri ng region map sa halip na ang score. Ang isang moderator na nakikitang mainit ang isang sulok ng isang larawan ay gumagawa ng mas mahusay na desisyon kaysa sa binigyan lamang ng numero, at maipapaliwanag nila ang desisyong iyon pagkatapos sa isang team ng apela o isang regulator.
Paikutin ang mga tao sa synthetic media review. Ito ay paulit-ulit na trabaho na may mataas na proporsyon ng mga malalabong kaso, at ang katumpakan ay kapansin-pansing bumababa sa mahabang shift. Ito ang parehong aral na natutunan na ng bawat tungkulin ng pag-moderate tungkol sa iba pang mga kategorya.