Wanneer een retailer de komst van slimme camera's aankondigt, stellen zijn teams zelden een technische vraag. Ze vragen eerder: « Kijkt dit naar mij? ». Die vraag is terecht, en een commerciële brochure geeft er geen antwoord op. Om te weten wat de AI voor beeldanalyse in de winkel echt analyseert, is de eenvoudigste manier het pad van een beeld te volgen, van de camera tot de melding, en onderweg te noteren wat het model allemaal negeert.

Videoanalyse wordt in de retail overigens nog weinig toegepast. In het onderzoek van ECR Retail Loss naar videoanalyse in de retail, uitgevoerd in 2024 onder 70 retailers, voornamelijk uit Europa en Noord-Amerika, bedroeg het gemiddelde gebruikspercentage van de geïnventariseerde analyses niet meer dan 10 % en zakte het tot 4 % op de verkoopvloer. Bij gebrek aan consensus in de sector stelt hetzelfde rapport een werkdefinitie van videoanalyse voor: een systeem dat beelden automatisch interpreteert om duidelijk gedefinieerde en bruikbare resultaten te produceren. Alles wat volgt draait om deze twee woorden.


Wat « zien » betekent voor een AI voor beeldanalyse

Een camera stuurt een reeks beelden door. Het model « begrijpt » een scène niet zoals een medewerker van de afdeling dat zou doen: het vergelijkt handposities, voorwerpen en bewegingen met aangeleerde categorieën. Wanneer wat het waarneemt voldoende overeenkomt met een van die categorieën, produceert het een gebeurtenis: een type gebaar, een zone, een tijdstip, een kort videofragment. Niets meer.

Alles hangt dan af van de scherpte van het beeld. Bij een stream met lage resolutie wordt de hand die een scheermesje in een jaszak laat glijden herleid tot enkele vage pixels, vandaar het belang van een videoanalyse op de hoofdstream in hoge resolutie. Bij Oxania wordt die hoofdstream verwerkt op een speciale GPU die in de winkel is geïnstalleerd: de detectie gebeurt lokaal, de camerabeelden verlaten de locatie niet en alleen de fragmenten die aan een alert zijn gekoppeld, worden bewaard, op servers die zo dicht mogelijk bij het land van de klant staan.


Een gesloten vocabulaire van gebaren, geen blik op mensen

Toegepast op verliespreventie werkt een model voor gebarendetectie met een beperkte lijst van categorieën. Op het gebied van diefstal vinden we over het algemeen:

  • het verbergen van een artikel in een zak, onder kleding of in een persoonlijke tas;
  • het stoppen van een product in een rugzak, een handtas of een tas waarvan de aard onduidelijk is;
  • het openen van een verpakking vóór het afrekenen bij de kassa;
  • consumptie ter plaatse: een niet-betaald product drinken of eten;
  • contextelementen zoals een winkelwagen, een kinderwagen of een boodschappentas, die helpen de scène te lezen.

Sommige systemen voegen een valmelding toe, nuttig voor de veiligheid van klanten en teams eerder dan voor de koopwaar. Geen enkele van deze categorieën zegt wie er in beeld is. De detectie van risicovolle gebaren heeft betrekking op een handeling, op een bepaald moment, in een bepaalde zone.


Wat de AI niet doet

De lijst met uitsluitingen weegt even zwaar als die met detecties, en vaak stelt juist die de teams gerust. Een AI voor gebarenanalyse die binnen dit kader is ontworpen:

  • identificeert niemand: geen gezichtsherkenning, geen naam, geen personenbestand;
  • volgt een persoon niet van het ene schap naar het andere, noch van het ene bezoek naar het volgende;
  • stelt geen enkel profiel op: geen leeftijd, geen afkomst, geen kleding die « risicovol » zou zijn. De statistieken worden per zone en per tijdvak gelezen, niet per persoon;
  • kent geen intentie toe: een risicovol gebaar is geen misdrijf, enkel een situatie die een menselijke blik verdient;
  • meet het werk van medewerkers niet: geen enkele categorie heeft betrekking op productiviteit, pauzes of naleving van procedures.

Met zo'n afgebakend bereik blijft het gebruik van de tool eenvoudig uit te leggen. In één zin kun je, zowel aan een medewerkster als aan een klant, vertellen wat een alert activeert, en juist dat maakt de tool aanvaardbaar.


Een alert is geen vonnis: de beslissing blijft menselijk

Een model vergist zich soms. Neem een klant die zijn bril in zijn zak steekt, net nadat hij een pak koffie heeft gepakt: voor de machine lijkt de scène op een verberging. De alert moet dus worden behandeld als een vraag aan het team, nooit als een conclusie.

De Europese AI-verordening benoemt in artikel 14 over menselijk toezicht de valkuil zonder omwegen: de automatiseringsbias, de neiging om automatisch of overmatig te vertrouwen op de resultaten van de machine. De verordening eist dat de personen die toezicht houden de mogelijkheid hebben om het resultaat van het systeem te negeren, te vervangen of terug te draaien. De tekst richt zich op hoogrisicosystemen, maar niets belet om dezelfde discipline toe te passen op elke tool voor het detecteren van risicovolle gebaren.

In de praktijk bekijkt de persoon die de alert ontvangt het fragment en kiest dan: niets doen, langs het schap lopen, de klant hulp aanbieden of, wanneer de situatie bevestigd is, stappen ondernemen bij de autoriteiten. Medewerkers en AI werken samen volgens een eenvoudige regel: de technologie detecteert, de mens beslist.


Transparantie naar klanten en medewerkers

De OESO-principes voor AI, aangenomen in 2019 en bijgewerkt in mei 2024, rekenen transparantie, verklaarbaarheid en verantwoordingsplicht tot de vijf principes van betrouwbare AI. In een winkel vertaalt zich dat in een paar concrete gewoonten:

  1. Uitleggen vóór de installatie. Aan de teams tonen wat er wordt gedetecteerd, wat niet en wie de alerts ontvangt. De personeelsvertegenwoordigers betrekken wanneer dat is voorgeschreven.
  2. Een gebruiksregel opstellen. De tool dient om verlies te beperken en mensen te beschermen, niet om het personeel te beoordelen: leg dat dus zwart op wit vast.
  3. De klanten informeren. De signalering bij de ingang is de verantwoordelijkheid van de exploitant, net als bij de al bestaande camera-installatie. Een leesbaar bord en een korte, toegankelijke toelichting volstaan vaak om zorgen weg te nemen.
  4. Opleiden in het lezen van alerts. Het fragment controleren, beleefd blijven en nooit iemand aanspreken op basis van alleen een melding.
  5. Regelmatig de balans opmaken. De afgewezen alerts doorlopen, de gedekte zones bijstellen en wat men ervan leert delen met het team.

Goed uitgerold lijkt een AI voor beeldanalyse minder op een oog dat oordeelt dan op een collega met een zeer beperkte woordenschat: ze signaleert gebaren en laat het vervolg over aan wie de winkel kent. Het kader wordt het best al tijdens de kick-off gepresenteerd, nog voor de apparatuur wordt geplaatst. Een team dat weet waar de tool naar kijkt, en waar niet naar, gebruikt hem echt, en pas dan begint hij de onbekende derving te verminderen.