När en handlare meddelar att intelligenta kameror ska installeras ställer personalen sällan en teknisk fråga. Den frågar snarare: ”Kommer det här att titta på mig?”. Frågan är befogad, och en säljbroschyr svarar inte på den. För att förstå vad bildanalys med AI egentligen analyserar i butik är det enklast att följa en bilds väg, från kameran till notifieringen, och samtidigt notera allt som modellen ignorerar.

Videoanalys är för övrigt fortfarande ovanligt inom handeln. I ECR Retail Losss undersökning om videoanalys inom handeln, som genomfördes 2024 bland 70 återförsäljare, främst europeiska och nordamerikanska, översteg den genomsnittliga användningsgraden för de kartlagda analyserna inte 10 %, och den sjönk till 4 % på försäljningsytan. Eftersom branschen saknar konsensus föreslår samma rapport en arbetsdefinition av videoanalys: ett system som automatiskt tolkar bilder för att ge tydligt definierade och användbara resultat. Allt som följer vilar på dessa två ord.


Vad det innebär att ”se” för en AI med datorseende

En kamera skickar en följd av bilder. Modellen ”förstår” inte en scen på det sätt en medarbetare på avdelningen gör: den jämför handpositioner, föremål och rörelser med inlärda kategorier. När det den observerar stämmer tillräckligt väl med en av dem skapar den en händelse: en typ av gest, en zon, en tidpunkt, ett kort videoklipp. Inget mer.

Allt beror då på bildens skärpa. I en videoström med låg upplösning reduceras handen som stoppar ett rakblad i en jackficka till några suddiga pixlar, och därför är det värdefullt med en videoanalys av huvudströmmen i hög upplösning. Hos Oxania behandlas denna huvudström av en dedikerad GPU som är installerad i butiken: detekteringen sker lokalt, kamerornas videoström lämnar aldrig platsen, och endast de klipp som hör till en alert sparas, på servrar belägna så nära kundens land som möjligt.


Ett slutet vokabulär av gester, inte en blick på människor

Tillämpad på förlustprevention arbetar en modell för gestdetektering med en begränsad lista av kategorier. När det gäller stöld återfinns vanligtvis:

  • att dölja en vara i en ficka, under ett klädesplagg eller i en privat väska;
  • att lägga en produkt i en ryggsäck, en handväska eller en väska av osäker typ;
  • att öppna en förpackning före kassan;
  • konsumtion på plats, att dricka eller äta en produkt som inte är betald;
  • kontextelement som en kundvagn, en barnvagn eller en matkasse, som hjälper till att tolka scenen.

Vissa system lägger till en fallalert, användbar för kundernas och personalens säkerhet snarare än för varorna. Ingen av dessa kategorier säger vem som syns i bild. Detekteringen av riskgester avser en handling, vid en given tidpunkt, i en given zon.


Vad AI:n inte gör

Listan över undantag väger lika tungt som listan över detekteringar, och det är ofta den som lugnar personalen. En AI för gestanalys som är utformad inom denna ram:

  • identifierar ingen: ingen ansiktsigenkänning, inga namn, inget register över personer;
  • följer inte en individ från en avdelning till en annan, och inte heller från ett besök till nästa;
  • upprättar ingen profil: varken ålder, ursprung eller ”riskfylld” klädsel. Statistiken läses per zon och tidsintervall, inte per person;
  • bedömer ingen avsikt: en riskgest är inte ett brott, bara en situation som förtjänar en mänsklig blick;
  • mäter inte de anställdas arbete: ingen kategori rör produktivitet, raster eller efterlevnad av rutiner.

Med ett så snävt avgränsat område är det enkelt att förklara hur verktyget används. Man kan på en enda mening, både för en butiksbiträde och för en kund, säga vad som utlöser en avisering, och det är just det som gör verktyget acceptabelt.


Alerten är inte en dom: beslutet förblir mänskligt

En modell har ibland fel. Tänk på en kund som stoppar ner sina glasögon i fickan just efter att ha tagit ett kaffepaket: för maskinen liknar scenen en dold vara. Alerten ska därför behandlas som en fråga till teamet, aldrig som en slutsats.

Den europeiska AI-förordningen, i artikel 14 om mänsklig tillsyn, pekar rakt på fallgropen: automatiseringsbias, alltså tendensen att automatiskt eller alltför mycket lita på maskinens resultat. Den kräver att de personer som ansvarar för tillsynen har möjlighet att bortse från, ersätta eller upphäva systemets resultat. Texten gäller system med hög risk, men inget hindrar att samma disciplin tillämpas på alla verktyg för detektering av riskfyllda gester.

I praktiken tittar personen som tar emot aviseringen på klippet och väljer sedan: att inte göra något, att gå förbi i avdelningen, att erbjuda kunden hjälp eller, när situationen är bekräftad, att kontakta myndigheterna. Personalen och AI:n arbetar tillsammans enligt en enkel regel: tekniken upptäcker, människan beslutar.


Transparens gentemot kunder och anställda

De OECD:s principer för AI, som antogs 2019 och uppdaterades i maj 2024, räknar transparens, förklarbarhet och ansvarsskyldighet bland de fem principerna för en pålitlig AI. I en butik innebär det några konkreta rutiner:

  1. Förklara före installationen. Visa teamen vad som detekteras, vad som inte gör det och vem som får alerterna. Involvera personalens representanter när det är föreskrivet.
  2. Skriva en användningsregel. Verktyget används för att begränsa förluster och skydda människor, inte för att utvärdera personalen: lika bra att skriva det svart på vitt.
  3. Informera kunderna. Skyltningen vid entrén åligger verksamhetsutövaren, på samma sätt som för den befintliga kamerainstallationen. En läslig skylt och en kort tillgänglig information räcker ofta för att skingra oron.
  4. Utbilda i att läsa alerter. Kontrollera klippet, förbli artig och ta aldrig kontakt med någon enbart på grund av en notifiering.
  5. Göra regelbundna avstämningar. Gå igenom de avfärdade alerterna, justera de zoner som täcks och dela med teamet vad man lär sig.

Rätt införd liknar en AI med datorseende mindre ett öga som dömer än en kollega med ett mycket begränsat ordförråd: den signalerar gester och överlåter resten åt dem som känner butiken. Ramen vinner på att presenteras redan vid uppstartsmötet, innan utrustningen ens är monterad. Ett team som vet vad verktyget tittar på, och vad det inte tittar på, använder det på riktigt, och det är då det börjar minska den okända svinnet.