Podczas demonstracji analizy wideo opartej na AI zawsze w końcu pada to samo pytanie, zadane przez informatyka albo przez samego kierownika sklepu: dokąd trafia obraz? Wiele osób wyobraża sobie ciągłe przesyłanie wideo do odległego serwera przez łącze sklepu. W rzeczywistości wszystko rozstrzyga decyzja architektoniczna podjęta na długo przed pierwszą konfiguracją: lokalna analiza wideo na GPU w sklepie, na podstawie głównego strumienia istniejących kamer.
Nie będziemy tu wracać do samej jakości obrazu. Prześledzimy raczej drogę danych, od obiektywu kamery aż do ekranu kierownika: co zostaje na miejscu, co wychodzi i co ten wybór zmienia w praktyce, zarówno dla szybkości alertów, jak i dla sieci sklepu oraz kontroli nad danymi.
Strumień wideo to duże obciążenie, a w dużym sklepie takich strumieni są dziesiątki
Kamera IP zazwyczaj generuje co najmniej dwa strumienie. Strumień główny (mainstream) ma wysoką rozdzielczość. Strumień dodatkowy (substream), odchudzony, służy m.in. do wyświetlania w formie mozaiki i do zdalnego podglądu. Aby wychwycić subtelny gest, produkt wsunięty do kieszeni czy otwarte opakowanie na regale, liczy się strumień główny: w dodatkowym dłoń zajmuje zaledwie kilka pikseli. Opisaliśmy to szczegółowo w naszym artykule o analizie strumienia głównego w sklepie.
Problem staje się wtedy arytmetyczny. Ciągłe przesyłanie strumienia głównego z dwudziestu czy trzydziestu kamer do zdalnego serwera wymaga wysokiej i stałej przepustowości wysyłania, której wiele sklepowych łączy nie gwarantuje. A łącze to sklepy dzielą już z terminalami płatniczymi, kasami, pocztą, czasem także z wi-fi dla klientów. W sobotę podczas letnich wyprzedaży, gdy terminale pracują bez przerwy, nikt nie chce, żeby łącze się przeciążyło.
To ograniczenie nie jest nowe. W swoim badaniu dotyczącym wykorzystania technologii wideo w handlu, opublikowanym w 2020 roku i opartym na rozmowach z 22 europejskimi i amerykańskimi detalistami, grupa ECR Retail Loss zauważała już, że kilku uczestników obawiało się wpływu przepustowości łącza i mocy obliczeniowej na wykorzystanie analizy wideo.
Dlaczego obliczenia wykonuje się jak najbliżej kamer
Zamiast przesyłać obraz, przenosi się obliczenia: na tym polega idea edge computingu. Targi EuroShop podsumowują ją w opracowaniu poświęconym edge computingowi w handlu: do chmury trafiają tylko przydatne dane, sieć jest odciążona, a reakcja może następować w czasie rzeczywistym. W przypadku wideo jedną z możliwych form jest dedykowany procesor GPU zainstalowany w sklepie, który odczytuje strumień z kamer i uruchamia model na miejscu. Dla operatora różnicę widać w trzech miejscach:
- Opóźnienie. Alert ma sens tylko wtedy, gdy sytuacja nadal trwa w alejce, kiedy do nas dociera. Bez przesyłania pełnego strumienia tam i z powrotem do centrum danych droga od gestu do powiadomienia się skraca: w Oxania alert wideo dociera w mniej niż 10 sekund na telefon, tablet lub komputer.
- Rozdzielczość. Skoro strumień nie przechodzi przez Internet, nie trzeba go pogarszać, by zmieścił się w łączu. Model pracuje na obrazie w wysokiej rozdzielczości, takim, który pozwala odróżnić torbę osobistą od torby z zakupami albo zauważyć, że produkt został skonsumowany przed przejściem przez kasę.
- Sieć. Serwer GPU jest dedykowany sklepowi i zainstalowany na miejscu: odczyt i analiza strumienia z kamer nie zużywają przepustowości łącza internetowego. Potwierdzanie wykryć, wysyłanie fragmentów nagrań z alertów i powiadomienia korzystają natomiast z tego łącza, które musi pozostać dostępne.
Co zostaje w sklepie, a co z niego wychodzi
Każdy dział IT w końcu zadaje to pytanie, a samo hasło nie wystarczy za odpowiedź. W architekturze przyjętej przez Oxania obraz z kamer podąża trzema wyraźnie rozdzielonymi ścieżkami:
- Co zostaje na miejscu: ciągły strumień wideo z kamer w wysokiej rozdzielczości. GPU w sklepie odczytuje go i analizuje, a strumień nie wychodzi dalej. Nagrania z Państwa istniejącego systemu wideo pozostają, jak dotychczas, w gestii operatora.
- Co wychodzi do potwierdzenia: gdy zostanie wykryty ryzykowny gest, wysyłany jest kompaktowy opis cyfrowy detekcji, który ma zostać potwierdzony. To nie jest wideo, a jego rozmiar nie ma nic wspólnego z rozmiarem obrazów.
- Co wychodzi i jest przechowywane: fragment wideo powiązany z alertem, i tylko on. Jest zapisywany na serwerach znajdujących się jak najbliżej kraju klienta, dla szybkiego dostępu i zgodności z lokalnymi przepisami.
Selekcja odbywa się więc u źródła. Z wielu godzin nagrań ze sklepu wychodzą tylko fragmenty powiązane z alertami: te, które uzasadniają, by ktoś z zespołu zwrócił na nie uwagę. Te same fragmenty znajdują się w alercie, z automatycznym, stopniowym przybliżeniem na istotny punkt. Osoba, która go otrzymuje, rozumie scenę na pierwszy rzut oka i decyduje, co dalej.
Lokalnie nie znaczy odcięty od świata
Trzeba jednak jasno powiedzieć, co obejmuje lokalna inferencja. Detekcja odbywa się w sklepie, na dedykowanym GPU, ale lokalizacja pozostaje połączona z chmurą: potrzebuje łącza, aby potwierdzać detekcje, wysyłać fragmenty alertów i dostarczać powiadomienia na urządzenia zespołu. Zmienia się to, co krąży w sieci: kilka wiadomości i krótkie fragmenty zamiast dziesiątek ciągłych strumieni. Dostawca, który twierdziłby coś przeciwnego, a jednocześnie wysyłał alerty na Twój telefon, zasługuje na dodatkowe pytanie.
Inna często pomijana kwestia: serwer GPU to jak najbardziej fizyczna maszyna. Trzeba znaleźć dla niej miejsce, zapewnić zasilanie, wentylację i poprawnie połączyć ją z kamerami. To zadanie integratora, a efekt zależy nie tylko od jakości modelu, jak wyjaśnialiśmy, pisząc o roli integratorów w skuteczności kamer z AI. Dzięki sieci certyfikowanych integratorów instalacja na istniejących kamerach zajmuje zazwyczaj mniej niż jeden dzień.
Pięć pytań, które warto zadać przed podpisaniem umowy
Zarówno dla pojedynczego punktu sprzedaży, jak i dla całej sieci, te pięć punktów pozwala szybko ocenić solidność architektury analizy wideo:
- Analizowany strumień: główny, w wysokiej rozdzielczości, czy dodatkowy.
- Miejsce, w którym działa model, i to, czy urządzenie jest rzeczywiście dedykowane Twojemu sklepowi.
- Co dokładnie opuszcza lokalizację i w którym momencie.
- Miejsce przechowywania fragmentów alertów: w jakim kraju i przez jak długi czas.
- Co się dzieje, gdy łącze sklepu zostanie przerwane lub będzie działać gorzej.
Oczekujcie konkretnych odpowiedzi. Dobrze przemyślaną architekturę da się opisać w kilku zdaniach, bez żargonu. Dostawca, któremu się to nie udaje, często sam nie ma jasnej mapy swoich strumieni. A jeśli Wasze kamery mają już kilka lat, nasz poradnik, jak dobrze wybrać kamerę do sklepu pomoże sprawdzić, czy dostarczają użyteczny strumień główny.
Architektura, która buduje także zaufanie
Zatrzymanie strumienia na miejscu to nie tylko kwestia przepustowości. Oznacza to również ograniczenie tego, co jest przesyłane, do absolutnie niezbędnego minimum oraz pozostawienie danych pod kontrolą sprzedawcy. Zasady OECD dotyczące odporności, bezpieczeństwa i ochrony w obszarze AI zalecają, aby systemy AI pozostawały bezpieczne, chronione i zdolne do prawidłowego działania przez cały cykl życia, a także aby istniały mechanizmy pozwalające je bezpiecznie wyłączyć, naprawić lub wycofać z użytku, jeśli grożą wyrządzeniem nieuzasadnionej szkody.
W sklepie przekłada się to prosto: technologia wykrywa, zespół decyduje. AI analizuje gesty, a nie osoby, i nie śledzi nikogo od kamery do kamery. Po obejrzeniu fragmentu to człowiek wybiera, czy pójść do alejki, zaproponować pomoc, czy nie robić nic.
W tym wszystkim nie ma nic spektakularnego: po prostu obliczenia wykonywane we właściwym miejscu i wideo, które przesyła się tylko wtedy, gdy jest potrzebne. To jednak właśnie dzięki temu alerty są szybkie i precyzyjne, a nieznane straty magazynowe (démarque inconnue) lepiej kontrolowane. Zanim zaczną Państwo porównywać funkcje, poproszą o pokazanie mapy przepływów: często mówi ona więcej niż broszura handlowa.