Když obchodník oznámí příchod inteligentních kamer, jeho týmy se jen zřídka ptají na techniku. Spíš se ptají: „Bude to sledovat mě?“. Ta otázka je oprávněná a obchodní leták na ni neodpovídá. Nejjednodušší způsob, jak zjistit, co AI pro analýzu obrazu v obchodě skutečně analyzuje, je sledovat cestu jednoho snímku od kamery až po upozornění a po cestě si všímat všeho, co model ignoruje.

Videoanalýza je ostatně v maloobchodě stále málo rozšířená. V průzkumu ECR Retail Loss o videoanalýze v maloobchodě, provedeném v roce 2024 mezi 70 obchodníky, většinou evropskými a severoamerickými, nepřesáhla průměrná míra využití evidovaných analytických nástrojů 10 % a na prodejní ploše klesla na 4 %. Protože v odvětví chybí shoda, nabízí tatáž zpráva pracovní definici videoanalýzy: systém, který automaticky interpretuje obraz a vytváří výsledky, jež jsou jasně definované a využitelné. Všechno, co následuje, se vejde do těchto dvou slov.


Co pro AI pro analýzu obrazu znamená „vidět“

Kamera přenáší sled snímků. Model však scénu „nechápe“ tak, jak by ji chápal zaměstnanec z oddělení: porovnává polohy rukou, předměty a pohyby s naučenými kategoriemi. Když to, co pozoruje, dostatečně odpovídá některé z nich, vytvoří událost: typ gesta, zónu, čas a krátký videozáznam. Nic víc.

Vše pak závisí na kvalitě obrazu. Na videu v nízkém rozlišení se ruka, která zasouvá holicí strojek do kapsy bundy, scvrkne na pár rozmazaných pixelů, a proto má smysl videoanalýza hlavního proudu ve vysokém rozlišení. U Oxania se tento hlavní proud zpracovává na vyhrazeném GPU nainstalovaném přímo v obchodě: detekce probíhá lokálně, proud z kamer místo neopouští a uchovávají se pouze záznamy spojené s upozorněním, a to na serverech umístěných co nejblíže zemi zákazníka.


Uzavřený slovník gest, ne pohled na lidi

Při použití v prevenci ztrát pracuje model pro detekci gest s konečným seznamem kategorií. Pokud jde o krádeže, najdeme obvykle:

  • ukrytí zboží do kapsy, pod oděv nebo do osobní tašky;
  • vložení výrobku do batohu, kabelky nebo tašky nejasného druhu;
  • otevření obalu před průchodem pokladnou;
  • konzumaci na místě, tedy pití nebo jedení nezaplaceného výrobku;
  • prvky kontextu, například vozík, kočárek nebo nákupní tašku, které pomáhají scénu vyhodnotit.

Některé systémy přidávají upozornění na pád, které slouží spíše bezpečnosti zákazníků a týmů než ochraně zboží. Žádná z těchto kategorií neříká, kdo je v obraze. Detekce rizikových gest se týká jednoho úkonu, v daném okamžiku, v dané zóně.


Co AI nedělá

Seznam toho, co je vyloučeno, má stejnou váhu jako seznam detekcí a právě on týmy často uklidní. AI pro analýzu gest navržená v tomto rámci:

  • nikoho neidentifikuje: žádné rozpoznávání obličejů, žádná jména, žádná evidence osob;
  • nesleduje jednotlivce z jednoho oddělení do druhého ani z jedné návštěvy na další;
  • nevytváří žádné profily: ani věk, ani původ, ani „rizikové“ oblečení. Statistiky se čtou podle zóny a časového úseku, ne podle osoby;
  • neposuzuje úmysl: rizikové gesto není trestný čin, jen situace, která si zaslouží lidský pohled;
  • neměří práci zaměstnanců: žádná kategorie se netýká produktivity, přestávek ani dodržování postupů.

Při tak úzce vymezeném rozsahu zůstává použití nástroje snadno vysvětlitelné. Prodavačce i zákazníkovi lze jednou větou říct, co spouští alert, a právě to je důvod, proč je nástroj přijatelný.


Upozornění není verdikt: rozhodnutí zůstává na člověku

Model se občas splete. Představte si zákazníka, který si strčí brýle do kapsy těsně poté, co vzal balíček kávy: pro stroj scéna připomíná ukrytí zboží. Upozornění je proto třeba brát jako otázku položenou týmu, nikdy jako závěr.

Evropské nařízení o umělé inteligenci ve svém článku 14 o lidském dohledu pojmenovává úskalí zcela otevřeně: zkreslení způsobené automatizací, tedy sklon spoléhat se na výsledky stroje automaticky nebo nadměrně. Vyžaduje, aby osoby pověřené dohledem měly možnost výsledek systému ignorovat, nahradit nebo zvrátit. Text se týká vysoce rizikových systémů, ale nic nebrání uplatňovat stejnou kázeň u každého nástroje pro detekci rizikových gest.

V praxi osoba, která alert obdrží, zhlédne záznam a pak se rozhodne: neudělat nic, projít se po oddělení, nabídnout zákazníkovi pomoc nebo, pokud je situace potvrzena, zahájit kroky u orgánů činných v trestním řízení. Pracovníci a umělá inteligence spolupracují podle jednoduchého pravidla: technologie detekuje, člověk rozhoduje.


Transparentnost vůči zákazníkům a zaměstnancům

Zásady OECD pro umělou inteligenci, přijaté v roce 2019 a aktualizované v květnu 2024, řadí transparentnost, vysvětlitelnost a odpovědnost mezi pět zásad důvěryhodné umělé inteligence. V obchodě se to promítá do několika konkrétních návyků:

  1. Vysvětlit před instalací. Ukázat týmům, co se detekuje, co ne a kdo dostává upozornění. Zapojit zástupce zaměstnanců, pokud to vyžaduje předpis.
  2. Sepsat pravidla používání. Nástroj slouží ke snížení ztrát a ochraně lidí, ne k hodnocení personálu: je lepší to uvést černé na bílém.
  3. Informovat zákazníky. Označení u vchodu je věcí provozovatele, stejně jako u stávající kamerové instalace. Čitelná cedule a stručné dostupné sdělení často stačí k rozptýlení obav.
  4. Školit ve čtení upozornění. Zkontrolovat záznam, zachovat zdvořilost a nikdy nikoho neoslovit jen na základě samotného upozornění.
  5. Pravidelně vyhodnocovat. Projít zamítnutá upozornění, upravit pokryté zóny a sdílet s týmem, co jsme se z toho naučili.

Správně nasazená AI pro analýzu obrazu nepřipomíná oko, které soudí, ale spíš kolegu s velmi omezenou slovní zásobou: signalizuje gesta a zbytek přenechává těm, kdo obchod znají. Je dobré rámec představit už na zahajovací schůzce, ještě před instalací zařízení. Tým, který ví, co nástroj sleduje a co ne, ho skutečně používá, a právě tehdy začne snižovat neznámé ztráty zboží.