Bei einer Demonstration der KI-Videoanalyse taucht immer irgendwann dieselbe Frage auf, gestellt vom IT-Verantwortlichen oder vom Marktleiter selbst: Wohin gehen die Bilder? Viele stellen sich einen kontinuierlichen Versand an einen weit entfernten Server über die Internetverbindung des Geschäfts vor. In Wirklichkeit entscheidet sich alles an einer Architekturentscheidung, die lange vor der ersten Einstellung getroffen wird: die lokale Videoanalyse auf einer GPU im Geschäft, auf Basis des Hauptstreams der vorhandenen Kameras.

Auf die Bildqualität selbst gehen wir hier nicht noch einmal ein. Stattdessen folgen wir dem Weg der Daten, vom Kameraobjektiv bis zum Bildschirm des Verantwortlichen: was vor Ort bleibt, was das Geschäft verlässt und was diese Entscheidung ganz konkret für die Geschwindigkeit der Alarme, für das Netzwerk des Geschäfts und für die Kontrolle über die Daten ändert.


Ein Videostream ist datenintensiv, und ein großes Geschäft hat davon Dutzende

Eine IP-Kamera erzeugt in der Regel mindestens zwei Streams. Der Hauptstream (Mainstream) hat eine hohe Auflösung. Der schlankere Nebenstream (Substream) dient unter anderem der Mosaikanzeige und dem Fernzugriff. Um eine feine Geste zu erkennen, etwa einen in die Tasche gesteckten Artikel oder eine geöffnete Verpackung im Regal, zählt der Hauptstream: Im Nebenstream besteht die Hand nur noch aus wenigen Pixeln. Diesen Punkt haben wir in unserem Artikel über die Analyse des Hauptstreams im Geschäft ausführlich behandelt.

Das Problem wird dann zu einer Rechenaufgabe. Den Hauptstream von zwanzig oder dreißig Kameras dauerhaft an einen entfernten Server zu senden, setzt eine hohe und konstante Upload-Bandbreite voraus, die viele Internetanschlüsse von Geschäften nicht gewährleisten. Und diese Leitung teilen sie sich bereits mit den Zahlungsterminals, den Kassen, dem E-Mail-Verkehr und manchmal dem WLAN für Kunden. An einem Samstag im Sommerschlussverkauf, wenn die Kartenterminals ununterbrochen laufen, möchte niemand erleben, dass sie überlastet ist.

Diese Grenze ist nicht neu. In ihrer Studie zum Einsatz von Videotechnologien im Handel, die 2020 veröffentlicht wurde und auf Interviews mit 22 europäischen und amerikanischen Händlern beruht, stellte die Gruppe ECR Retail Loss bereits fest, dass sich mehrere Teilnehmer um die Auswirkungen von Bandbreite und Rechenleistung auf ihren Einsatz der Videoanalyse sorgten.

Warum die Berechnung möglichst nah an den Kameras stattfindet

Statt die Bilder zu übertragen, verlagert man die Berechnung: Das ist das Prinzip des Edge Computing. Die Messe EuroShop fasst es in einem Dossier zum Edge Computing im Handel zusammen: Nur die relevanten Daten gelangen in die Cloud, das Netzwerk wird entlastet und die Reaktion kann in Echtzeit erfolgen. Für Video besteht eine mögliche Form in einer dedizierten GPU, die im Geschäft installiert ist, den Stream der Kameras liest und das Modell vor Ort ausführt. Für den Betreiber zeigt sich der Unterschied an drei Stellen:

  • Die Latenz. Ein Alarm ist nur nützlich, wenn die Situation in der Abteilung beim Eintreffen noch andauert. Ohne Hin- und Rücktransport des vollständigen Streams zu einem Rechenzentrum verkürzt sich die Kette zwischen der Geste und der Benachrichtigung: Bei Oxania trifft der Video-Alarm in weniger als 10 Sekunden auf dem Smartphone, Tablet oder Computer ein.
  • Die Auflösung. Da der Stream nicht durch das Internet läuft, muss er nicht verschlechtert werden, um durch die Verbindung zu passen. Das Modell arbeitet mit dem hochauflösenden Bild, das es ermöglicht, eine private Tasche von einer Einkaufstasche zu unterscheiden oder zu erkennen, dass ein Produkt vor dem Kassiervorgang verzehrt wurde.
  • Das Netzwerk. Der GPU-Server ist dem Geschäft zugeordnet und vor Ort installiert: Das Lesen und Analysieren des Kamerastreams beansprucht nicht die Bandbreite der Internetverbindung. Die Bestätigung der Erkennungen, die Übermittlung der Alarmausschnitte und die Benachrichtigungen laufen hingegen über diese Verbindung, die verfügbar bleiben muss.

Was im Geschäft bleibt, was es verlässt

Jeder IT-Verantwortliche stellt irgendwann die Frage, und ein Slogan reicht als Antwort nicht aus. In der von Oxania gewählten Architektur folgen die Kamerabilder drei klar getrennten Wegen:

  • Was vor Ort bleibt: der kontinuierliche Videostream der Kameras in hoher Auflösung. Die GPU im Geschäft liest und analysiert ihn, und dieser Stream geht nicht weiter. Die Aufzeichnungen Ihres bestehenden Videosystems verbleiben wie bisher in der Verantwortung des Betreibers.
  • Was zur Bestätigung gesendet wird: Wenn eine at-risk Geste (Geste mit Risiko) erkannt wird, wird eine kompakte digitale Beschreibung der Erkennung zur Bestätigung gesendet. Das ist kein Video, und sein Datenvolumen hat nichts mit dem der Bilder zu tun.
  • Was gesendet und gespeichert wird: der mit dem Alarm verbundene Videoausschnitt, und nur dieser. Er wird auf Servern gespeichert, die sich möglichst nah am Land des Kunden befinden, sowohl für einen schnellen Zugriff als auch zur Einhaltung der lokalen Vorschriften.

Die Auswahl erfolgt also an der Quelle. Von Stunden an Videomaterial verlassen nur die mit Alerts verbundenen Ausschnitte das Geschäft: jene, die es rechtfertigen, dass ein Teammitglied hinschaut. Genau diese Ausschnitte finden sich im Alert wieder, mit einem automatischen, fortlaufenden Zoom auf den relevanten Punkt. Wer ihn erhält, versteht die Szene auf einen Blick und entscheidet über das weitere Vorgehen.

Lokal bedeutet nicht von der Welt abgeschnitten

Man muss allerdings klar sagen, was die lokale Inferenz umfasst. Die Erkennung findet im Geschäft auf einer dedizierten GPU statt, doch der Standort bleibt mit der Cloud verbunden: Er braucht eine Verbindung, um Erkennungen bestätigen zu lassen, Alarmausschnitte zu senden und Benachrichtigungen an die Geräte des Teams zu übermitteln. Was sich ändert, ist das, was übertragen wird: einige Nachrichten und kurze Ausschnitte statt Dutzender kontinuierlicher Streams. Ein Anbieter, der das Gegenteil behauptet und gleichzeitig Alarme auf Ihr Telefon sendet, verdient eine weitere Nachfrage.

Ein weiterer Punkt, der oft vergessen wird: Der GPU-Server ist eine ganz reale Maschine. Man muss einen Platz für ihn finden, ihn mit Strom versorgen, belüften und sauber mit den Kameras verbinden. Das ist die Aufgabe des Integrators, und das Ergebnis hängt nicht allein von der Qualität des Modells ab, wie wir es im Beitrag über die Rolle der Integratoren für die Wirksamkeit von KI-Kameras erläutert haben. Mit einem Netzwerk zertifizierter Integratoren dauert die Installation an bestehenden Kameras in der Regel weniger als einen Tag.


Fünf Fragen, die Sie vor der Unterschrift stellen sollten

Für eine einzelne Filiale ebenso wie für ein ganzes Netz lässt sich mit diesen fünf Punkten schnell beurteilen, wie solide eine Videoanalyse-Architektur ist:

  1. Der analysierte Stream: der Hauptstream in hoher Auflösung oder der Sekundärstream.
  2. Der Ort, an dem das Modell läuft, und ob die Maschine wirklich ausschließlich Ihrem Geschäft zugeordnet ist.
  3. Was den Standort genau verlässt und zu welchem Zeitpunkt.
  4. Der Speicherort der Alarmausschnitte: in welchem Land und für wie lange.
  5. Was passiert, wenn die Verbindung des Geschäfts unterbrochen oder beeinträchtigt ist.

Erwarten Sie konkrete Antworten. Eine durchdachte Architektur lässt sich in wenigen Sätzen und ohne Fachjargon beschreiben. Ein Anbieter, dem das nicht gelingt, hat oft selbst keinen klaren Überblick über seine Datenflüsse. Und wenn Ihr Kamerabestand ein paar Jahre alt ist, hilft Ihnen unser Leitfaden zur Auswahl der richtigen Kamera im Geschäft, zu prüfen, ob sie einen verwertbaren Hauptstream liefern.

Eine Architektur, die auch Vertrauen schafft

Den Stream vor Ort zu behalten, ist nicht nur eine Frage der Bandbreite. Es bedeutet auch, das, was übertragen wird, auf das unbedingt Notwendige zu beschränken und die Daten unter der Kontrolle des Händlers zu belassen. Die OECD-Grundsätze zu Robustheit, Sicherheit und Gefahrenabwehr von KI empfehlen, dass KI-Systeme über ihren gesamten Lebenszyklus hinweg sicher, geschützt und in der Lage bleiben, ordnungsgemäß zu funktionieren, und dass es Mechanismen gibt, um sie sicher zu deaktivieren, zu reparieren oder außer Betrieb zu nehmen, falls sie ungerechtfertigten Schaden verursachen könnten.

Im Geschäft lässt sich das einfach übersetzen: Die Technologie erkennt, das Team entscheidet. Die KI analysiert Gesten, keine Personen, und verfolgt niemanden von einer Kamera zur nächsten. Vor dem Ausschnitt entscheidet ein Mensch, ob er in die Abteilung geht, seine Hilfe anbietet oder nichts unternimmt.

Nichts Spektakuläres daran: nur eine Berechnung am richtigen Ort und ein Video, das nur dann übertragen wird, wenn es gebraucht wird. Genau das sorgt jedoch für schnelle und präzise Alerts und für eine besser beherrschte unbekannte Inventurdifferenz. Bevor Sie Funktionen vergleichen, lassen Sie sich die Karte der Datenflüsse zeigen: Sie sagt oft mehr aus als eine Verkaufsbroschüre.