Når en forhandler annoncerer, at der kommer intelligente kameraer, stiller medarbejderne sjældent et teknisk spørgsmål. De spørger snarere: "Kommer den til at holde øje med mig?". Spørgsmålet er legitimt, og en salgsbrochure giver ikke svar på det. For at forstå, hvad AI-baseret billedanalyse egentlig analyserer i butikken, er det nemmest at følge et billedes vej fra kameraet til notifikationen og undervejs notere alt, hvad modellen ignorerer.

Videoanalyse er i øvrigt stadig kun lidt udbredt i detailhandlen. I ECR Retail Losss undersøgelse af videoanalyse i detailhandlen, gennemført i 2024 blandt 70 detailhandlere, for de flestes vedkommende europæiske og nordamerikanske, lå den gennemsnitlige anvendelsesgrad for de registrerede analyser ikke over 10 %, og den faldt til 4 % på salgsarealet. Da der ikke er konsensus i branchen, foreslår den samme rapport en arbejdsdefinition af videoanalyse: et system, der automatisk fortolker billeder for at frembringe resultater, som er klart definerede og anvendelige. Alt det følgende hviler på de to ord.


Hvad det vil sige at "se" for en AI til billedanalyse

Et kamera sender en række billeder. Modellen "forstår" ikke en scene, som en medarbejder på gulvet ville gøre: den sammenligner håndpositioner, genstande og bevægelser med kategorier, den har lært. Når det, den observerer, passer tilstrækkeligt godt til en af dem, producerer den en hændelse: en type gestus, en zone, et tidspunkt og et kort videoklip. Intet mere.

Alt afhænger derefter af billedets detaljeringsgrad. I en videostrøm med lav opløsning bliver hånden, der lader en barberhøvl glide ned i en jakkelomme, reduceret til nogle få slørede pixels, og derfor er der en pointe i en videoanalyse af hovedstrømmen i høj opløsning. Hos Oxania behandles denne hovedstrøm på en dedikeret GPU, der er installeret i butikken: detektionen foregår lokalt, kameraernes videostrøm forlader ikke stedet, og kun de klip, der er knyttet til en alarm, gemmes, på servere placeret så tæt som muligt på kundens land.


Et lukket ordforråd af gestus, ikke et blik rettet mod mennesker

Anvendt til forebyggelse af svind arbejder en model til gestusgenkendelse med en begrænset liste af kategorier. Når det gælder tyveri, finder man som regel:

  • skjulning af en vare i en lomme, under tøjet eller i en personlig taske;
  • nedlæggelse af et produkt i en rygsæk, en håndtaske eller en taske, hvis art er uklar;
  • åbning af en emballage før betaling ved kassen;
  • indtagelse på stedet, altså at drikke eller spise et produkt, der ikke er betalt;
  • kontekstelementer som en indkøbsvogn, en klapvogn eller en indkøbspose, der hjælper med at aflæse scenen.

Nogle systemer tilføjer en faldalarm, som er nyttig for kunders og medarbejderes sikkerhed snarere end for varerne. Ingen af disse kategorier siger hvem der er i billedet. Detektionen af risikofyldte gestus vedrører en handling, på et givent tidspunkt, i en given zone.


Hvad AI'en ikke gør

Listen over det, der er udelukket, tæller lige så meget som listen over det, der detekteres, og det er ofte den, der beroliger teamene. En AI til gestusanalyse, der er udviklet inden for denne ramme:

  • identificerer ingen: ingen ansigtsgenkendelse, intet navn, intet register over personer;
  • følger ikke en person fra en afdeling til en anden eller fra et besøg til det næste;
  • opretter ingen profil: hverken alder, oprindelse eller "risikofyldt" påklædning. Statistikkerne aflæses pr. zone og pr. tidsrum, ikke pr. person;
  • vurderer ikke hensigter: en risikofyldt gestus er ikke en forbrydelse, blot en situation, der fortjener et menneskeligt blik;
  • måler ikke medarbejdernes arbejde: ingen kategori vedrører produktivitet, pauser eller overholdelse af procedurer.

Med et så snævert afgrænset område er det fortsat let at forklare, hvordan værktøjet bruges. Man kan med én sætning, både over for en medarbejder i butikken og over for en kunde, sige, hvad der udløser en alarm, og det er netop det, der gør det acceptabelt.


Alarmen er ikke en dom: beslutningen forbliver menneskelig

En model tager af og til fejl. Tag en kunde, der lægger sine briller i lommen lige efter at have grebet en pose kaffe: for maskinen ligner scenen en skjulning. Alarmen skal derfor behandles som et spørgsmål stillet til teamet, aldrig som en konklusion.

Den europæiske forordning om AI, i artikel 14 om menneskeligt tilsyn, nævner faldgruben ligeud: automatiseringsbias, altså tendensen til automatisk eller overdrevent at stole på maskinens resultater. Den kræver, at de personer, der har til opgave at føre tilsyn, har mulighed for at se bort fra systemets resultat, erstatte det eller omstøde det. Teksten omfatter højrisikosystemer, men intet forhindrer, at den samme disciplin anvendes på ethvert værktøj til registrering af risikofyldte gestus.

I praksis ser den person, der modtager alarmen, klippet og vælger derefter: gøre ingenting, gå en tur forbi afdelingen, tilbyde kunden sin hjælp eller, når situationen er bekræftet, kontakte myndighederne. Medarbejdere og AI arbejder sammen efter en enkel regel: teknologien registrerer, mennesket beslutter.


Gennemsigtighed over for kunder og medarbejdere

Den OECD's principper for AI, vedtaget i 2019 og opdateret i maj 2024, regner gennemsigtighed, forklarlighed og ansvarlighed blandt de fem principper for en troværdig AI. I en butik kommer det til udtryk i nogle få konkrete vaner:

  1. Forklar før installationen. Vis teamene, hvad der detekteres, hvad der ikke gør, og hvem der modtager alarmerne. Inddrag medarbejderrepræsentanterne, når det er foreskrevet.
  2. Skriv en brugsregel. Værktøjet bruges til at begrænse tab og beskytte personer, ikke til at evaluere personalet: så kan det lige så godt stå sort på hvidt.
  3. Informer kunderne. Skiltning ved indgangen påhviler den driftsansvarlige, ligesom for den eksisterende kameraovervågning. Et letlæseligt skilt og en kort tilgængelig information er ofte nok til at aflive bekymringerne.
  4. Uddan i at læse alarmer. Kontrollér klippet, vær høflig, og henvend dig aldrig til nogen alene på grundlag af en notifikation.
  5. Gør status jævnligt. Gennemgå de afviste alarmer, juster de dækkede zoner, og del det, man lærer, med teamet.

Når den er implementeret rigtigt, ligner en AI til billedanalyse mindre et øje, der dømmer, end en kollega med et meget begrænset ordforråd: den signalerer gestus og overlader resten til dem, der kender butikken. Rammen bør præsenteres allerede ved opstartsmødet, før udstyret overhovedet monteres. Et team, der ved, hvad værktøjet ser på, og hvad det ikke ser på, bruger det for alvor, og det er på det tidspunkt, at det begynder at reducere det ukendte svind.