Wenn ein Händler die Einführung intelligenter Kameras ankündigt, stellen seine Teams selten eine technische Frage. Sie fragen eher: „Wird das mich beobachten?“ Die Frage ist berechtigt, und eine Werbebroschüre beantwortet sie nicht. Um zu verstehen, was die Bild-KI im Geschäft tatsächlich analysiert, folgt man am einfachsten dem Weg eines Bildes von der Kamera bis zur Benachrichtigung und hält dabei fest, was das Modell alles ignoriert.

Die Videoanalyse ist im Einzelhandel übrigens noch wenig verbreitet. In der Umfrage von ECR Retail Loss zur Videoanalyse im Einzelhandel, die 2024 unter 70 Händlern durchgeführt wurde, überwiegend aus Europa und Nordamerika, lag die durchschnittliche Nutzungsquote der erfassten Analysen bei höchstens 10 % und sank auf der Verkaufsfläche auf 4 %. Da es in der Branche keinen Konsens gibt, schlägt derselbe Bericht eine Arbeitsdefinition der Videoanalyse vor: ein System, das Bilder automatisch interpretiert, um klar definierte und verwertbare Ergebnisse zu liefern. Alles Weitere steckt in diesen beiden Wörtern.


Was „Sehen“ für eine Bild-KI bedeutet

Eine Kamera liefert eine Folge von Bildern. Das Modell „versteht“ eine Szene nicht so, wie es ein Mitarbeiter in der Abteilung täte: Es vergleicht Handpositionen, Objekte und Bewegungen mit erlernten Kategorien. Wenn das Beobachtete einer davon hinreichend entspricht, erzeugt es ein Ereignis: eine Art von Geste, einen Bereich, eine Uhrzeit, einen kurzen Videoausschnitt. Mehr nicht.

Alles hängt dann von der Bildqualität ab. Bei einem Stream mit niedriger Auflösung schrumpft die Hand, die einen Rasierer in eine Jackentasche gleiten lässt, auf einige unscharfe Pixel zusammen. Deshalb ist eine Videoanalyse auf dem hochauflösenden Hauptstream so sinnvoll. Bei Oxania wird dieser Hauptstream auf einer dedizierten GPU verarbeitet, die im Geschäft installiert ist: Die Erkennung erfolgt lokal, der Kamerastream verlässt den Standort nicht, und nur die mit einem Alarm verbundenen Ausschnitte werden gespeichert, und zwar auf Servern in möglichst großer Nähe zum Land des Kunden.


Ein geschlossenes Vokabular an Gesten, kein Blick auf Menschen

Bei der Anwendung auf die Verlustprävention arbeitet ein Modell zur Gestenerkennung mit einer begrenzten Liste von Kategorien. Im Bereich Diebstahl finden sich in der Regel:

  • das Verbergen eines Artikels in einer Tasche, unter der Kleidung oder in einer persönlichen Tasche;
  • das Ablegen eines Produkts in einem Rucksack, einer Handtasche oder einer Tasche unklarer Art;
  • das Öffnen einer Verpackung vor dem Bezahlen an der Kasse;
  • den Verzehr vor Ort, also das Trinken oder Essen eines nicht bezahlten Produkts;
  • Kontextelemente wie ein Einkaufswagen, ein Kinderwagen oder eine Einkaufstasche, die helfen, die Szene einzuordnen.

Manche Systeme bieten zusätzlich einen Sturzalarm, der eher der Sicherheit von Kunden und Teams dient als dem Schutz der Ware. Keine dieser Kategorien sagt, wer im Bild zu sehen ist. Die Erkennung von Risikogesten bezieht sich auf eine Handlung, zu einem bestimmten Zeitpunkt, in einem bestimmten Bereich.


Was die KI nicht tut

Die Liste der Ausschlüsse ist ebenso wichtig wie die der Erkennungen, und oft beruhigt sie die Teams am meisten. Eine in diesem Rahmen entwickelte KI zur Gestenanalyse:

  • identifiziert niemanden: keine Gesichtserkennung, keine Namen, keine Personendatei;
  • verfolgt keine Person von einer Abteilung zur nächsten, auch nicht von einem Besuch zum nächsten;
  • erstellt keine Profile: weder nach Alter noch nach Herkunft, noch nach „riskanter“ Kleidung. Die Statistiken werden nach Bereich und Zeitfenster ausgewertet, nicht nach Person;
  • bewertet keine Absicht: Eine Risikogeste ist keine Straftat, sondern lediglich eine Situation, die einen menschlichen Blick verdient;
  • misst nicht die Arbeit der Mitarbeitenden: Keine Kategorie betrifft Produktivität, Pausen oder die Einhaltung von Abläufen.

Bei einem so eng gefassten Umfang lässt sich der Einsatz des Tools leicht erklären. In einem Satz kann man einer Verkäuferin ebenso wie einem Kunden sagen, was einen Alarm auslöst, und genau das macht es akzeptabel.


Der Alarm ist kein Urteil: Die Entscheidung bleibt beim Menschen

Ein Modell irrt sich manchmal. Nehmen wir einen Kunden, der seine Brille in die Tasche steckt, kurz nachdem er eine Packung Kaffee gegriffen hat: Für die Maschine ähnelt die Szene einer Dissimulation. Der Alarm muss daher als Frage an das Team behandelt werden, niemals als Schlussfolgerung.

Die europäische KI-Verordnung benennt in Artikel 14 zur menschlichen Aufsicht die Falle ohne Umschweife: den Automatisierungsbias, also die Neigung, sich automatisch oder übermäßig auf die Ergebnisse der Maschine zu verlassen. Sie verlangt, dass die mit der Aufsicht betrauten Personen die Möglichkeit haben, das Ergebnis des Systems zu ignorieren, zu ersetzen oder umzukehren. Der Text zielt auf Hochrisikosysteme ab, doch nichts hindert daran, dieselbe Disziplin auf jedes Tool zur Erkennung von Risikogesten anzuwenden.

In der Praxis sieht sich die Person, die den Alarm erhält, den Ausschnitt an und entscheidet dann: nichts tun, in die Abteilung gehen, dem Kunden Hilfe anbieten oder, wenn sich die Situation bestätigt, Schritte bei den Behörden einleiten. Mitarbeitende und KI arbeiten zusammen nach einer einfachen Regel: Die Technologie erkennt, der Mensch entscheidet.


Transparenz gegenüber Kunden und Mitarbeitenden

Die KI-Grundsätze der OECD, die 2019 verabschiedet und im Mai 2024 aktualisiert wurden, zählen Transparenz, Erklärbarkeit und Verantwortlichkeit zu den fünf Grundsätzen einer vertrauenswürdigen KI. In einem Geschäft bedeutet das einige konkrete Gewohnheiten:

  1. Vor der Installation erklären. Den Teams zeigen, was erkannt wird, was nicht und wer die Alarme erhält. Die Personalvertretung einbinden, wenn dies vorgesehen ist.
  2. Eine Nutzungsregel festhalten. Das Werkzeug dient dazu, Verluste zu begrenzen und Menschen zu schützen, nicht dazu, das Personal zu beurteilen: Das sollte man schwarz auf weiß festhalten.
  3. Kunden informieren. Der Aushang am Eingang liegt in der Verantwortung des Betreibers, ebenso wie bei seiner bestehenden Kameraanlage. Ein gut lesbares Schild und ein kurzer, zugänglicher Hinweis reichen oft aus, um Bedenken auszuräumen.
  4. Im Umgang mit Alarmen schulen. Den Ausschnitt prüfen, höflich bleiben, niemanden allein aufgrund einer Benachrichtigung ansprechen.
  5. Regelmäßig Bilanz ziehen. Verworfene Alarme noch einmal durchgehen, die abgedeckten Bereiche anpassen, die gewonnenen Erkenntnisse mit dem Team teilen.

Richtig eingesetzt, gleicht eine Bild-KI weniger einem urteilenden Auge als einem Kollegen mit sehr begrenztem Wortschatz: Sie meldet Gesten und überlässt alles Weitere denjenigen, die das Geschäft kennen. Der Rahmen sollte schon beim Kick-off-Meeting vorgestellt werden, noch vor der Installation der Hardware. Ein Team, das weiß, worauf das Werkzeug achtet und worauf nicht, nutzt es wirklich, und ab diesem Moment beginnt es, die unbekannte Differenz im Warenbestand (Inventurdifferenz) zu verringern.