Quando un commerciante annuncia l'arrivo di telecamere intelligenti, i suoi team raramente pongono una domanda tecnica. Chiedono piuttosto: «Mi guarderà, me?». La domanda è legittima e una brochure commerciale non vi risponde. Per sapere cosa analizza davvero l'IA di visione in negozio, il modo più semplice è seguire il percorso di un'immagine, dalla telecamera fino alla notifica, annotando lungo la strada tutto ciò che il modello ignora.

L'analisi video, del resto, resta poco diffusa nel commercio. Nell'indagine di ECR Retail Loss sull'analisi video nel retail, condotta nel 2024 su 70 distributori, per lo più europei e nordamericani, il tasso medio di utilizzo delle analisi rilevate non superava il 10 % e scendeva al 4 % sulla superficie di vendita. In assenza di un consenso nel settore, lo stesso rapporto propone una definizione operativa di analisi video: un sistema che interpreta automaticamente le immagini per produrre risultati chiaramente definiti e utilizzabili. Tutto ciò che segue ruota attorno a queste due parole.


Cosa significa «vedere» per un'IA di visione

Una telecamera trasmette una sequenza di immagini. Il modello, dal canto suo, non «comprende» una scena come farebbe un addetto di reparto: confronta posizioni delle mani, oggetti e movimenti con categorie apprese. Quando ciò che osserva corrisponde abbastanza a una di esse, produce un evento: un tipo di gesto, una zona, un orario, un breve estratto video. Nient'altro.

Tutto dipende quindi dalla nitidezza dell'immagine. Su un flusso a bassa definizione, la mano che fa scivolare un rasoio nella tasca di una giacca si riduce a qualche pixel sfocato, da cui l'interesse di un'analisi video sul flusso principale ad alta risoluzione. Con Oxania, questo flusso principale viene elaborato su una GPU dedicata installata nel negozio: il rilevamento avviene in locale, il flusso delle telecamere non lascia il sito e vengono conservati solo gli estratti legati a un'alerta, su server situati il più vicino possibile al paese del cliente.


Un vocabolario chiuso di gesti, non uno sguardo sulle persone

Applicato alla prevenzione delle perdite, un modello di rilevamento dei gesti lavora con un elenco finito di categorie. Sul fronte del furto, in genere troviamo:

  • l'occultamento di un articolo in una tasca, sotto un indumento o in una borsa personale;
  • il deposito di un prodotto in uno zaino, in una borsa a mano o in una borsa di natura incerta;
  • l'apertura di una confezione prima del passaggio alla cassa;
  • il consumo sul posto, bere o mangiare un prodotto non pagato;
  • elementi di contesto come un carrello, un passeggino o una borsa della spesa, che aiutano a leggere la scena.

Alcuni sistemi aggiungono un'alerta di caduta, utile per la sicurezza dei clienti e dei team più che per la merce. Nessuna di queste categorie dice chi sia presente nell'immagine. Il rilevamento dei gesti a rischio riguarda un'azione, in un dato istante, in una data zona.


Cosa non fa l'IA

L'elenco delle esclusioni conta quanto quello dei rilevamenti, ed è spesso lui a rassicurare i team. Un'IA di analisi dei gesti concepita in questo quadro:

  • non identifica nessuno: niente riconoscimento facciale, niente nomi, niente schedari di persone;
  • non segue un individuo da un reparto all'altro, né da una visita alla successiva;
  • non crea alcun profilo: né età, né origine, né abbigliamento «a rischio». Le statistiche si leggono per zona e per fascia oraria, non per persona;
  • non qualifica alcuna intenzione: un gesto a rischio non è un reato, solo una situazione che merita uno sguardo umano;
  • non misura il lavoro dei dipendenti: nessuna categoria riguarda la produttività, le pause o il rispetto delle procedure.

Con un perimetro così ristretto, l'uso dello strumento resta facile da spiegare. Si può dire in una frase, a una commessa come a un cliente, che cosa fa scattare un'alerta, ed è proprio questo che lo rende accettabile.


L'alerta non è un verdetto: la decisione resta umana

Un modello a volte sbaglia. Pensate a un cliente che mette gli occhiali in tasca subito dopo aver preso un pacco di caffè: per la macchina, la scena somiglia a un occultamento. L'alerta va quindi trattata come una domanda posta al team, mai come una conclusione.

Il regolamento europeo sull'IA, all'articolo 14 sulla sorveglianza umana, indica la trappola senza giri di parole: il bias di automazione, ovvero la tendenza ad affidarsi in modo automatico o eccessivo ai risultati della macchina. Richiede che le persone incaricate della sorveglianza abbiano la possibilità di ignorare, sostituire o invertire il risultato del sistema. Il testo riguarda i sistemi ad alto rischio, ma nulla impedisce di applicare la stessa disciplina a qualsiasi strumento di rilevamento dei gesti a rischio.

Sul campo, la persona che riceve l'alerta guarda la clip, poi sceglie: non fare nulla, passare nel reparto, offrire il proprio aiuto al cliente oppure, quando la situazione è confermata, avviare le procedure presso le autorità. Gli addetti e l'IA lavorano insieme secondo una regola semplice: la tecnologia rileva, l'uomo decide.


Trasparenza verso clienti e dipendenti

I principi dell'OCSE sull'IA, adottati nel 2019 e aggiornati a maggio 2024, annoverano la trasparenza, la spiegabilità e la responsabilità tra i cinque principi di un'IA affidabile. In un negozio, questo si traduce in alcune abitudini concrete:

  1. Spiegare prima di installare. Mostrare ai team che cosa viene rilevato, che cosa no e chi riceve le alerte. Coinvolgere i rappresentanti del personale quando previsto.
  2. Scrivere una regola d'uso. Lo strumento serve a limitare le perdite e a proteggere le persone, non a valutare il personale: meglio metterlo nero su bianco.
  3. Informare i clienti. L'informativa all'ingresso spetta al gestore, come per il suo impianto di telecamere esistente. Un cartello leggibile e una breve nota accessibile bastano spesso a dissipare le preoccupazioni.
  4. Formare alla lettura delle alerte. Verificare l'estratto, restare cortesi, non fermare mai nessuno sulla sola base di una notifica.
  5. Fare il punto regolarmente. Riesaminare le alerte scartate, regolare le zone coperte, condividere con il team ciò che se ne impara.

Ben distribuita, un'IA di visione somiglia meno a un occhio che giudica che a un collega dal vocabolario molto limitato: segnala gesti e lascia il resto a chi conosce il negozio. Il quadro d'uso va presentato fin dalla riunione di avvio, prima ancora dell'installazione dell'hardware. Un team che sa che cosa guarda lo strumento, e che cosa non guarda, lo usa davvero, ed è in quel momento che comincia a ridurre la démarque inconnue.