Amikor egy kereskedő bejelenti, hogy intelligens kamerákat telepít, a csapata ritkán tesz fel technikai kérdést. Inkább azt kérdezi: „Engem fog figyelni?”. A kérdés jogos, és egy üzleti prospektus nem válaszol rá. Hogy megtudjuk, mit elemez valójában a látástechnológiai MI az üzletben, a legegyszerűbb, ha végigkövetjük egy kép útját a kamerától az értesítésig, miközben megjegyezzük mindazt, amit a modell figyelmen kívül hagy.

A videóelemzés egyébként még kevéssé elterjedt a kereskedelemben. Az ECR Retail Loss kereskedelmi videóelemzésről szóló felmérésében, amelyet 2024-ben 70, többségében európai és észak-amerikai kiskereskedő körében végeztek, a számba vett elemzések átlagos használati aránya nem haladta meg a 10%-ot, az értékesítési területen pedig 4%-ra esett vissza. Mivel az ágazatban nincs egyetértés, ugyanez a jelentés munkadefiníciót javasol a videóelemzésre: olyan rendszer, amely automatikusan értelmezi a képeket, hogy világosan meghatározott és hasznosítható eredményeket állítson elő. Minden, ami következik, ebben a két szóban rejlik.


Mit jelent a „látás” egy látástechnológiai MI számára

A kamera képek sorozatát továbbítja. A modell pedig nem „érti meg” a jelenetet úgy, ahogyan azt egy részlegben dolgozó munkatárs tenné: a kezek helyzetét, a tárgyakat és a mozgásokat összeveti a megtanult kategóriákkal. Ha amit megfigyel, kellőképpen illeszkedik valamelyikhez, létrehoz egy eseményt: egy mozdulattípust, egy zónát, egy időpontot, egy rövid videókivonatot. Semmi többet.

Ezután minden a kép élességén múlik. Alacsony felbontású adatfolyamnál az a kéz, amely egy borotvát csúsztat a kabát zsebébe, néhány elmosódott pixelre zsugorodik, ezért érdemes a fő, nagy felbontású adatfolyamon végzett videóelemzést választani. Az Oxanianál ezt a fő adatfolyamot az üzletben telepített, dedikált GPU dolgozza fel: az észlelés helyben történik, a kamerák adatfolyama nem hagyja el a helyszínt, és csak a riasztáshoz kapcsolódó kivonatokat őrizzük meg, az ügyfél országához lehető legközelebb található szervereken.


Zárt mozdulatkészlet, nem az emberek figyelése

A veszteségmegelőzésben alkalmazott gesztusfelismerő modell véges számú kategóriával dolgozik. A lopás terén általában a következőket találjuk:

  • egy áru elrejtése zsebben, ruha alatt vagy személyes táskában;
  • egy termék betétele hátizsákba, kézitáskába vagy bizonytalan jellegű táskába;
  • egy csomagolás felbontása a kasszán való áthaladás előtt;
  • a helyszíni fogyasztás, vagyis egy ki nem fizetett termék elfogyasztása vagy megivása;
  • olyan kontextuális elemek, mint a bevásárlókocsi, a babakocsi vagy a bevásárlótáska, amelyek segítenek a jelenet értelmezésében.

Egyes rendszerek eséstjelzést is kínálnak, amely inkább az ügyfelek és a csapatok biztonsága, mint az áru szempontjából hasznos. E kategóriák egyike sem mondja meg, ki látható a képen. A kockázatos mozdulatok észlelése egy adott pillanatban, egy adott zónában végrehajtott cselekvésre vonatkozik.


Amit az MI nem csinál

A kizárások listája legalább annyit számít, mint az észlelésekéi, és gyakran éppen ez nyugtatja meg a csapatokat. Az ebben a keretben megtervezett mozdulatelemző MI:

  • senkit nem azonosít: nincs arcfelismerés, nincs név, nincs személyekről vezetett nyilvántartás;
  • nem követ egyént egyik részlegtől a másikig, sem egyik látogatástól a következőig;
  • nem készít profilt: sem életkor, sem származás, sem „kockázatos” öltözék alapján. A statisztikák zónák és idősávok szerint olvashatók, nem személyenként;
  • nem minősít szándékot: egy kockázatos mozdulat nem bűncselekmény, csupán olyan helyzet, amely megérdemel egy emberi pillantást;
  • nem méri a munkavállalók munkáját: egyik kategória sem vonatkozik a termelékenységre, a szünetekre vagy az eljárások betartására.

Ilyen szűk hatókör mellett az eszköz használata könnyen megmagyarázható. Egyetlen mondatban el lehet mondani egy eladónak és egy vásárlónak is, hogy mi vált ki riasztást, és éppen ez teszi elfogadhatóvá.


Az értesítés nem ítélet: a döntés emberi marad

A modell olykor téved. Vegyünk egy vásárlót, aki közvetlenül azután teszi zsebre a szemüvegét, hogy levett egy csomag kávét: a gép számára a jelenet elrejtésnek tűnik. Az értesítést ezért a csapatnak feltett kérdésként kell kezelni, soha nem következtetésként.

Az európai MI-rendelet az emberi felügyeletről szóló 14. cikkében nyíltan megnevezi a csapdát: az automatizálási torzítást, vagyis azt a hajlamot, hogy automatikusan vagy túlzottan megbízunk a gép eredményeiben. Előírja, hogy a felügyeletért felelős személyeknek legyen lehetőségük figyelmen kívül hagyni, felülírni vagy visszafordítani a rendszer eredményét. A szöveg a nagy kockázatú rendszereket célozza, de semmi sem akadályozza, hogy ugyanezt a fegyelmet minden kockázatos gesztusokat felismerő eszközre alkalmazzuk.

A gyakorlatban az, aki megkapja a riasztást, megnézi a felvételt, majd dönt: nem tesz semmit, odamegy a részlegre, felajánlja segítségét a vásárlónak, vagy ha a helyzet beigazolódik, lépéseket tesz a hatóságoknál. Az ügynökök és az MI együtt dolgoznak egy egyszerű szabály szerint: a technológia észlel, az ember dönt.


Átláthatóság az ügyfelek és a munkavállalók felé

Az OECD MI-alapelvei, amelyeket 2019-ben fogadtak el és 2024 májusában frissítettek, az átláthatóságot, a magyarázhatóságot és az elszámoltathatóságot a megbízható MI öt alapelve közé sorolják. Egy üzletben ez néhány konkrét szokást jelent:

  1. Magyarázat a telepítés előtt. Meg kell mutatni a csapatoknak, mit észlel a rendszer, mit nem, és ki kapja az értesítéseket. Be kell vonni a munkavállalói képviselőket, ha ez előírás.
  2. Használati szabály írásba foglalása. Az eszköz a veszteségek csökkentését és az emberek védelmét szolgálja, nem a személyzet értékelését: érdemes ezt feketén-fehéren rögzíteni.
  3. Az ügyfelek tájékoztatása. A bejáratnál elhelyezett tájékoztatás az üzemeltető feladata, ahogyan a meglévő kamerarendszere esetében is. Egy jól olvasható tábla és egy rövid, elérhető tájékoztató gyakran elegendő az aggodalmak eloszlatásához.
  4. Képzés az értesítések értelmezésére. Ellenőrizni kell a kivonatot, udvariasnak kell maradni, és soha nem szabad megszólítani valakit pusztán egy értesítés alapján.
  5. Rendszeres értékelés. Át kell nézni az elvetett értesítéseket, finomítani a lefedett zónákat, és megosztani a tanulságokat a csapattal.

Jól bevezetve a látástechnológiai MI kevésbé hasonlít ítélkező szemre, inkább egy nagyon korlátozott szókincsű kollégára: jelzi a mozdulatokat, a folytatást pedig azokra hagyja, akik ismerik az üzletet. A keretrendszert érdemes már az indító megbeszélésen bemutatni, még az eszközök felszerelése előtt. Az a csapat, amely tudja, mit figyel az eszköz, és mit nem, valóban használja is, és ekkor kezdi el csökkenteni az ismeretlen eredetű készletveszteséget.