Vid en demonstration av AI-baserad videoanalys dyker alltid samma fråga upp, ställd av IT-ansvarig eller av butikschefen själv: vart tar bilderna vägen? Många föreställer sig en kontinuerlig överföring till en avlägsen server via butikens uppkoppling. I verkligheten avgörs allt av ett arkitekturbeslut som fattas långt före den första inställningen: lokal videoanalys, på en GPU i butiken, utifrån huvudströmmen från de befintliga kamerorna.

Vi går inte tillbaka till själva bildkvaliteten här. Vi följer i stället datans väg, från kamerans objektiv till chefens skärm: vad som stannar på plats, vad som skickas vidare, och vad det här valet konkret förändrar för hur snabbt larmen kommer, för butikens nätverk och för kontrollen över datan.


Ett videoflöde är tungt, och en stor butik har dussintals

En IP-kamera producerar vanligtvis minst två flöden. Huvudflödet (mainstream) har hög upplösning. Det sekundära flödet (substream) är lättare och används bland annat för mosaikvisning och fjärrvisning. För att upptäcka en liten gest, en produkt som glider ner i en ficka eller en öppnad förpackning i gången, är det huvudflödet som räknas: i det sekundära flödet består handen bara av några få pixlar. Vi har gått igenom den här punkten i vår artikel om analys av huvudflödet i butik.

Problemet blir då aritmetiskt. Att kontinuerligt skicka huvudflödet från tjugo eller trettio kameror till en fjärrserver kräver en hög och permanent uppladdningshastighet, något som många butiksanslutningar inte kan garantera. Dessutom delar de redan den linjen med betalterminaler, kassor, e-post och ibland kundernas wifi. En lördag under sommarrean, när betalterminalerna går för fullt, vill ingen se den bli överbelastad.

Den här begränsningen är inte ny. I sin studie om användningen av videoteknik inom handeln, publicerad 2020 och baserad på intervjuer med 22 europeiska och amerikanska återförsäljare, konstaterade ECR Retail Loss-gruppen redan då att flera deltagare oroade sig för hur bandbredd och beräkningskraft påverkade deras användning av videoanalys.

Varför beräkningen sker så nära kamerorna som möjligt

I stället för att låta bilderna färdas flyttar man beräkningen: det är principen bakom edge computing. Mässan EuroShop sammanfattar det i ett dossier om edge computing inom handeln: bara de användbara uppgifterna skickas vidare till molnet, nätverket avlastas och reaktionen kan ske i realtid. För video är en möjlig form en dedikerad GPU, installerad i butiken, som läser kamerornas flöde och kör modellen på plats. För driftansvarig syns skillnaden på tre ställen:

  • Latensen. Ett larm är bara användbart om situationen fortfarande pågår i rayongen när det kommer fram. Utan en tur och retur av hela strömmen till ett datacenter blir kedjan mellan gesten och notifieringen kortare: hos Oxania kommer videolarmet fram på under 10 sekunder på mobil, surfplatta eller dator.
  • Upplösningen. Eftersom strömmen inte passerar via internet behöver den inte försämras för att rymmas i uppkopplingen. Modellen arbetar på bilden i hög upplösning, den som gör det möjligt att skilja en privat väska från en shoppingväska, eller att se att en produkt har konsumerats före kassan.
  • Nätverket. GPU-servern är dedikerad till butiken och installerad på plats: att läsa och analysera kamerornas flöde förbrukar inte internetanslutningens bandbredd. Bekräftelsen av detektioner, översändningen av alertklipp och notiserna går däremot via den anslutningen, som måste förbli tillgänglig.

Vad som stannar i butiken och vad som lämnar den

Alla IT-ansvariga ställer till sist frågan, och en slogan räcker inte som svar. I den arkitektur som Oxania har valt följer kamerabilderna tre helt åtskilda vägar:

  • Det som stannar på plats: kamerornas kontinuerliga videoflöde i hög upplösning. Butikens GPU läser och analyserar det, och flödet går inte längre än så. Inspelningarna från ert befintliga videosystem förblir, som tidigare, under driftansvariges ansvar.
  • Det som skickas för bekräftelse: när en riskfylld gest upptäcks skickas en kompakt digital beskrivning av detektionen för att bekräftas. Det är inte video, och dess storlek har ingenting att göra med bildernas.
  • Det som skickas och sparas: videoklippet kopplat till larmet, och bara det. Det lagras på servrar som ligger så nära kundens land som möjligt, både för snabb åtkomst och för att följa lokala regler.

Sorteringen sker alltså vid källan. Av timmar av video lämnar bara de klipp som hör till alerter butiken: de som motiverar att en person i teamet tittar. Det är just dessa klipp som finns i alerten, med en automatisk gradvis inzoomning på det intressanta området. Den som tar emot den förstår scenen med en blick och bestämmer vad som ska göras.

Lokalt betyder inte avskuret från omvärlden

Man måste ändå vara tydlig med vad lokal inferens innebär. Detektionen sker i butiken, på en dedikerad GPU, men platsen förblir ansluten till molnet: den behöver en uppkoppling för att få detektionerna bekräftade, skicka larmklippen och leverera notifieringar till teamets enheter. Det som förändras är det som skickas: några meddelanden och korta klipp, i stället för dussintals kontinuerliga strömmar. En leverantör som påstår motsatsen samtidigt som den skickar larm till din telefon förtjänar en fråga till.

En annan punkt som ofta glöms bort: GPU-servern är en högst verklig maskin. Den behöver en plats, strömförsörjning, ventilation och en ordentlig koppling till kamerorna. Det är integratörens arbete, och resultatet beror inte bara på modellens kvalitet, som vi förklarade när vi skrev om integratörernas roll för AI-kamerornas effektivitet. Med ett nätverk av certifierade integratörer går installationen på befintliga kameror vanligtvis på mindre än en dag.


Fem frågor att ställa innan du skriver under

Oavsett om det gäller en enda butik eller en hel kedja gör dessa fem punkter det möjligt att snabbt bedöma hur robust en arkitektur för videoanalys är:

  1. Den analyserade strömmen: huvudströmmen, i hög upplösning, eller den sekundära.
  2. Var modellen körs, och om maskinen verkligen är dedikerad till din butik.
  3. Vad som lämnar platsen, exakt, och när.
  4. Var larmklippen lagras: i vilket land, och hur länge.
  5. Vad som händer när butikens uppkoppling bryts eller försämras.

Förvänta dig konkreta svar. En väl genomtänkt arkitektur kan beskrivas med några få meningar, utan jargong. En leverantör som inte klarar det har ofta inte själv en tydlig bild av sina flöden. Och om ditt kameraparK är några år gammalt hjälper vår guide för att välja rätt kamera i butik dig att kontrollera att de levererar en användbar huvudström.

En arkitektur som också bygger förtroende

Att behålla flödet på plats handlar inte bara om bandbredd. Det innebär också att begränsa det som förflyttas till det absolut nödvändiga, och att låta uppgifterna stå under handlarens kontroll. OECD:s principer om robusthet, säkerhet och trygghet för AI rekommenderar att AI-system förblir säkra, trygga och kan fungera som avsett under hela sin livscykel, och att det finns mekanismer som gör det möjligt att inaktivera dem, reparera dem eller ta dem ur bruk på ett säkert sätt om de riskerar att orsaka omotiverad skada.

I butik är översättningen enkel: tekniken upptäcker, teamet beslutar. AI:n analyserar gester, inte personer, och följer ingen från en kamera till en annan. Inför klippet är det en människa som väljer att gå till rayongen, erbjuda hjälp eller inte göra något alls.

Inget av detta är spektakulärt: bara en beräkning som görs på rätt ställe och en video som bara färdas när den behövs. Det är ändå det som ger snabba och träffsäkra alerter, och bättre kontroll över den okända svinnet. Innan ni jämför funktioner, be att få se flödeskartan: den säger ofta mer än en säljbroschyr.