Gdy właściciel sklepu ogłasza, że pojawią się inteligentne kamery, jego zespoły rzadko zadają pytanie techniczne. Pytają raczej: „Czy to będzie patrzeć na mnie?”. To uzasadnione pytanie, a broszura handlowa na nie nie odpowiada. Aby dowiedzieć się, co sztuczna inteligencja wizyjna naprawdę analizuje w sklepie, najprościej prześledzić drogę obrazu, od kamery aż do powiadomienia, odnotowując po drodze wszystko, czego model nie bierze pod uwagę.

Analiza wideo jest zresztą w handlu wciąż rzadko wdrażana. W badaniu ECR Retail Loss poświęconym analizie wideo w handlu, przeprowadzonym w 2024 roku wśród 70 detalistów, głównie europejskich i północnoamerykańskich, średni poziom wykorzystania wskazanych analiz nie przekraczał 10 %, a na sali sprzedaży spadał do 4 %. Wobec braku konsensusu w branży ten sam raport proponuje roboczą definicję analizy wideo: system, który automatycznie interpretuje obrazy, aby generować wyniki jasno zdefiniowane i możliwe do wykorzystania. Wszystko, co następuje dalej, mieści się w tych dwóch słowach.


Co oznacza „widzieć” dla sztucznej inteligencji wizyjnej

Kamera przekazuje ciąg obrazów. Model natomiast nie „rozumie” sceny tak jak pracownik działu sklepowego: porównuje położenia dłoni, przedmioty i ruchy z wyuczonymi kategoriami. Gdy to, co obserwuje, wystarczająco pasuje do jednej z nich, generuje zdarzenie: typ gestu, strefę, godzinę, krótki fragment nagrania. Nic więcej.

Wszystko zależy wtedy od jakości obrazu. W strumieniu o niskiej rozdzielczości dłoń, która wsuwa maszynkę do golenia do kieszeni kurtki, sprowadza się do kilku rozmytych pikseli, stąd zaleta analizy wideo na głównym strumieniu w wysokiej rozdzielczości. W Oxania ten główny strumień jest przetwarzany na dedykowanym procesorze GPU zainstalowanym w sklepie: detekcja odbywa się lokalnie, strumień z kamer nie opuszcza obiektu, a przechowywane są wyłącznie fragmenty powiązane z alertem, na serwerach położonych jak najbliżej kraju klienta.


Zamknięty słownik gestów, a nie przyglądanie się ludziom

W zastosowaniu do zapobiegania stratom model wykrywania gestów działa na skończonej liście kategorii. W obszarze kradzieży znajdziemy zazwyczaj:

  • ukrycie artykułu w kieszeni, pod ubraniem lub w torbie osobistej;
  • włożenie produktu do plecaka, torebki lub torby o niejasnym charakterze;
  • otwarcie opakowania przed przejściem przez kasę;
  • konsumpcja na miejscu, czyli picie lub jedzenie nieopłaconego produktu;
  • elementy kontekstu, takie jak wózek sklepowy, wózek dziecięcy lub torba na zakupy, które pomagają odczytać scenę.

Niektóre systemy dodają alert o upadku, przydatny dla bezpieczeństwa klientów i zespołów, a nie dla towaru. Żadna z tych kategorii nie mówi, kto jest w kadrze. Wykrywanie gestów ryzykownych dotyczy działania, w danym momencie, w danej strefie.


Czego AI nie robi

Lista wyłączeń liczy się tak samo jak lista detekcji i to często ona uspokaja zespoły. Sztuczna inteligencja analizująca gesty, zaprojektowana w tych ramach:

  • nikogo nie identyfikuje: brak rozpoznawania twarzy, brak imion i nazwisk, brak bazy osób;
  • nie śledzi osoby z jednego działu do drugiego ani z jednej wizyty do następnej;
  • nie tworzy żadnego profilu: ani wieku, ani pochodzenia, ani „ryzykownego” ubioru. Statystyki odczytuje się według strefy i przedziału czasowego, a nie według osoby;
  • nie ocenia intencji: gest ryzykowny nie jest przestępstwem, a jedynie sytuacją, która zasługuje na spojrzenie człowieka;
  • nie mierzy pracy pracowników: żadna kategoria nie dotyczy produktywności, przerw ani przestrzegania procedur.

Przy tak wąskim zakresie sposób działania narzędzia łatwo wyjaśnić. Jednym zdaniem można powiedzieć, zarówno sprzedawczyni, jak i klientowi, co uruchamia alert, i właśnie to sprawia, że narzędzie jest akceptowalne.


Alert nie jest wyrokiem: decyzja pozostaje po stronie człowieka

Model czasem się myli. Weźmy klienta, który chowa okulary do kieszeni tuż po wzięciu paczki kawy: dla maszyny scena przypomina ukrycie towaru. Alert należy więc traktować jako pytanie zadane zespołowi, nigdy jako wniosek.

W europejskim rozporządzeniu w sprawie AI, w artykule 14 dotyczącym nadzoru ze strony człowieka, pułapka została nazwana wprost: to błąd automatyzacji, czyli skłonność do automatycznego lub nadmiernego zaufania wynikom generowanym przez maszynę. Rozporządzenie wymaga, aby osoby sprawujące nadzór mogły zignorować, zastąpić lub odwrócić wynik systemu. Przepis dotyczy systemów wysokiego ryzyka, ale nic nie stoi na przeszkodzie, by stosować tę samą dyscyplinę wobec każdego narzędzia do wykrywania gestów z grupy ryzyka.

W praktyce osoba, która otrzymuje alert, ogląda fragment nagrania, a następnie wybiera: nie robić nic, przejść do danego działu, zaproponować klientowi pomoc lub, gdy sytuacja zostanie potwierdzona, wszcząć kroki wobec odpowiednich organów. Pracownicy i AI współpracują według prostej zasady: technologia wykrywa, człowiek decyduje.


Przejrzystość wobec klientów i pracowników

W zasadach OECD dotyczących AI, przyjętych w 2019 roku i zaktualizowanych w maju 2024 roku, przejrzystość, wyjaśnialność i odpowiedzialność znajdują się wśród pięciu zasad godnej zaufania AI. W sklepie przekłada się to na kilka konkretnych nawyków:

  1. Wyjaśnić przed instalacją. Pokazać zespołom, co jest wykrywane, czego nie wykrywa się i kto otrzymuje alerty. Włączyć przedstawicieli pracowników, gdy jest to przewidziane.
  2. Spisać zasady korzystania. Narzędzie służy do ograniczania strat i ochrony ludzi, a nie do oceniania personelu: lepiej to zapisać czarno na białym.
  3. Informować klientów. Oznaczenie przy wejściu leży po stronie operatora, tak jak w przypadku istniejącej instalacji kamer. Czytelna tabliczka i krótka, dostępna informacja często wystarczają, by rozwiać obawy.
  4. Szkolić w odczytywaniu alertów. Sprawdzić fragment nagrania, zachować uprzejmość, nigdy nie zaczepiać nikogo wyłącznie na podstawie powiadomienia.
  5. Regularnie podsumowywać. Wrócić do odrzuconych alertów, dostosować strefy objęte ochroną, dzielić się z zespołem tym, czego się dowiedziano.

Dobrze wdrożona sztuczna inteligencja wizyjna przypomina mniej oko, które ocenia, a bardziej kolegę o bardzo ograniczonym słownictwie: sygnalizuje gesty, a resztę zostawia tym, którzy znają sklep. Warto przedstawić te ramy już na spotkaniu rozpoczynającym wdrożenie, jeszcze przed montażem sprzętu. Zespół, który wie, na co narzędzie patrzy, a na co nie, naprawdę z niego korzysta i właśnie wtedy zaczyna ono ograniczać straty nieznane.