Under en demonstrasjon av videoanalyse med KI dukker alltid det samme spørsmålet opp, enten det stilles av IT-ansvarlig eller av butikksjefen selv: hvor blir det av bildene? Mange ser for seg en kontinuerlig overføring til en fjern server, via butikkens internettlinje. I virkeligheten avgjøres alt av et arkitekturvalg som tas lenge før den første innstillingen: lokal videoanalyse, på en GPU i butikken, basert på hovedstrømmen fra de eksisterende kameraene.

Vi går ikke inn på selve bildekvaliteten her. Vi følger heller dataenes vei, fra kameraets linse til lederens skjerm: hva som blir værende på stedet, hva som sendes ut, og hva dette valget konkret endrer for hvor raskt varslene kommer, for butikkens nettverk og for kontrollen over dataene.


En videostrøm er tung, og et stort varehus har titalls av dem

Et IP-kamera produserer vanligvis minst to strømmer. Hovedstrømmen (mainstream) har høy oppløsning. Den sekundære strømmen (substream) er lettere og brukes blant annet til mosaikkvisning og fjernvisning. For å oppdage en fin bevegelse, som et produkt som glir ned i en lomme eller en åpnet emballasje i hylla, er det hovedstrømmen som teller: i den sekundære strømmen utgjør hånden bare noen få piksler. Vi har gått nærmere inn på dette i artikkelen vår om analyse av hovedstrømmen i butikk.

Da blir problemet regnestykke. Å sende hovedstrømmen fra tjue eller tretti kameraer kontinuerlig til en ekstern server krever høy og stabil opplastingshastighet, noe mange butikkforbindelser ikke kan garantere. Og denne linjen deler de allerede med betalingsterminalene, kassene, e-posten og noen ganger kundenes wifi. En lørdag med sommersalg, når betalingsterminalene går uten stans, er det ingen som ønsker at linjen skal bli overbelastet.

Denne begrensningen er ikke ny. I sin studie om bruk av videoteknologi i varehandelen, publisert i 2020 og basert på intervjuer med 22 europeiske og amerikanske detaljister, påpekte ECR Retail Loss-gruppen allerede at flere deltakere var bekymret for hvordan båndbredde og regnekraft påvirker bruken av videoanalyse.

Hvorfor beregningen skjer så nær kameraene som mulig

I stedet for å sende bildene av gårde flytter man beregningen: det er prinsippet bak edge computing. Messen EuroShop oppsummerer det i en artikkel om edge computing i varehandelen: bare nyttige data sendes videre til skyen, nettverket avlastes og reaksjonen kan skje i sanntid. For video er en av de mulige løsningene en dedikert GPU, installert i butikken, som leser kamerastrømmen og kjører modellen på stedet. For driveren merkes forskjellen på tre områder:

  • Latens. Et varsel er bare nyttig hvis situasjonen fortsatt pågår i butikkgangen når det kommer fram. Uten en tur-retur av hele strømmen til et datasenter blir kjeden mellom gesten og varselet kortere: hos Oxania kommer videovarselet fram på under 10 sekunder på mobil, nettbrett eller datamaskin.
  • Oppløsning. Siden strømmen ikke går over internett, er det ikke nødvendig å forringe den for å få den gjennom linjen. Modellen arbeider på bildet i høy oppløsning, det som gjør det mulig å skille en personlig veske fra en handlepose, eller å se at et produkt er blitt konsumert før kassen.
  • Nettverket. GPU-serveren er dedikert til butikken og installert på stedet: lesing og analyse av kamerastrømmen bruker ikke båndbredden på internettforbindelsen. Bekreftelse av deteksjoner, sending av alarmklipp og varsler går derimot via denne forbindelsen, som må være tilgjengelig.

Hva som blir i butikken, og hva som forlater den

Enhver IT-ansvarlig ender opp med å stille spørsmålet, og en slagord er ikke nok som svar. I arkitekturen Oxania har valgt, følger kamerabildene tre helt adskilte veier:

  • Det som blir værende på stedet: den kontinuerlige videostrømmen fra kameraene, i høy oppløsning. Butikkens GPU leser og analyserer den, og strømmen går ikke lenger. Opptakene i det eksisterende videosystemet ditt forblir, som før, driverens ansvar.
  • Det som sendes for bekreftelse: når en risikofylt gest oppdages, sendes en kompakt digital beskrivelse av deteksjonen for å bli bekreftet. Dette er ikke video, og størrelsen har ingenting til felles med bildenes.
  • Det som sendes og lagres: videoutdraget knyttet til varselet, og bare det. Det lagres på servere som ligger så nær kundens land som mulig, både for rask tilgang og av hensyn til lokale regler.

Sorteringen skjer altså ved kilden. Av timevis med video er det bare klippene knyttet til alerter som forlater butikken: de som rettferdiggjør at et teammedlem tar en titt. Det er de samme klippene man finner i alerten, med automatisk gradvis zoom på det interessante punktet. Personen som mottar den forstår situasjonen med et blikk og avgjør hva som skal skje videre.

Lokal betyr ikke avskåret fra verden

Det må likevel være klart hva lokal inferens innebærer. Deteksjonen skjer i butikken, på en dedikert GPU, men stedet er fortsatt koblet til skyen: det trenger en tilkobling for å få deteksjonene bekreftet, sende varselutdragene og få varslene fram til teamets enheter. Det som endrer seg, er det som sendes: noen få meldinger og korte utdrag, i stedet for titalls kontinuerlige strømmer. En leverandør som påstår det motsatte, samtidig som den sender varsler til telefonen din, fortjener et ekstra spørsmål.

Et annet punkt som ofte glemmes: GPU-serveren er en høyst fysisk maskin. Den må ha en plass, strømforsyning, ventilasjon og en ordentlig tilkobling til kameraene. Dette er integratorens jobb, og resultatet avhenger ikke bare av modellens kvalitet, slik vi forklarte om integratorenes rolle for effektiviteten til AI-kameraer. Med et nettverk av sertifiserte integratorer tar installasjonen på eksisterende kameraer vanligvis under én dag.


Fem spørsmål å stille før du signerer

Enten det gjelder én enkelt butikk eller en hel kjede, gjør disse fem punktene det enkelt å vurdere hvor solid en arkitektur for videoanalyse er:

  1. Strømmen som analyseres: hovedstrømmen, i høy oppløsning, eller sekundærstrømmen.
  2. Hvor modellen kjører, og om maskinen faktisk er dedikert til butikken din.
  3. Hva som forlater stedet, helt presist, og når.
  4. Hvor varselutdragene lagres: i hvilket land, og hvor lenge.
  5. Hva som skjer når butikkens tilkobling er brutt eller svekket.

Forvent konkrete svar. En gjennomtenkt arkitektur kan beskrives med noen få setninger, uten sjargong. En leverandør som ikke klarer det, har ofte selv ikke et klart kart over strømmene sine. Og hvis kameraparken din er noen år gammel, hjelper guiden vår for å velge riktig kamera i butikk deg med å kontrollere at de leverer en brukbar hovedstrøm.

En arkitektur som også bygger tillit

Å beholde strømmen på stedet handler ikke bare om båndbredde. Det betyr også å begrense det som sendes til det strengt nødvendige, og å la dataene forbli under butikkeierens kontroll. OECDs prinsipper om robusthet, sikkerhet og trygghet for KI anbefaler at KI-systemer forblir trygge, sikre og i stand til å fungere som de skal gjennom hele livssyklusen, og at det finnes mekanismer som gjør det mulig å nøytralisere dem, reparere dem eller ta dem ut av drift på en trygg måte hvis de risikerer å forårsake uberettiget skade.

I butikken er oversettelsen enkel: teknologien oppdager, teamet avgjør. KI-en analyserer gester, ikke personer, og følger ingen fra ett kamera til et annet. Foran utdraget er det et menneske som velger å gå til butikkgangen, tilby hjelp eller la være å gjøre noe.

Ingenting spektakulært i dette: bare en beregning gjort på riktig sted og en video som kun sendes når den trengs. Likevel er det dette som gir raske og presise alerter, og bedre kontroll over ukjent svinn. Før du sammenligner funksjoner, be om å få se kartet over datastrømmene: det sier ofte mer enn en salgsbrosjyre.