Durante uma demonstração de análise de vídeo por IA, a mesma pergunta acaba sempre por surgir, feita pelo responsável de informática ou pelo próprio gerente: para onde vão as imagens? Muitos imaginam um envio contínuo para um servidor distante, através da ligação da loja. Na realidade, tudo depende de uma decisão de arquitetura tomada muito antes da primeira configuração: a análise de vídeo local, num GPU na loja, a partir do fluxo principal das câmaras existentes.
Não voltaremos aqui à qualidade da imagem em si. Vamos antes seguir o percurso dos dados, da objetiva da câmara até ao ecrã do responsável: o que fica no local, o que sai, e o que esta escolha muda, de forma muito concreta, na rapidez dos alertas, bem como na rede da loja e no controlo dos dados.
Um fluxo de vídeo é pesado, e uma grande superfície tem dezenas deles
Uma câmara IP produz, em geral, pelo menos dois fluxos. O fluxo principal (o mainstream) tem alta resolução. O fluxo secundário (o substream), mais leve, serve nomeadamente para a visualização em mosaico e para a consulta remota. Para detetar um gesto subtil, um produto deslizado para um bolso ou uma embalagem aberta no corredor, é o fluxo principal que conta: no secundário, a mão ocupa apenas alguns pixels. Detalhámos este ponto no nosso artigo sobre a análise do fluxo principal em loja.
O problema torna-se então aritmético. Enviar continuamente o fluxo principal de vinte ou trinta câmaras para um servidor remoto pressupõe um débito de upload elevado e permanente, que muitas ligações de loja não garantem. E essa linha já é partilhada com os terminais de pagamento, as caixas, o correio eletrónico e, por vezes, o wifi dos clientes. Num sábado de saldos de verão, quando os terminais de pagamento funcionam sem parar, ninguém quer vê-la saturada.
Este limite não é novo. No seu estudo sobre a utilização das tecnologias de vídeo no comércio, publicado em 2020 e baseado em entrevistas com 22 retalhistas europeus e americanos, o grupo ECR Retail Loss já observava que vários participantes se preocupavam com o efeito da largura de banda e da capacidade de processamento na sua utilização da análise de vídeo.
Porque é que o cálculo é feito o mais perto possível das câmaras
Em vez de fazer viajar as imagens, desloca-se o processamento: é o princípio do edge computing. A feira EuroShop resume-o num dossiê dedicado ao edge computing no comércio: apenas os dados úteis sobem para a cloud, a rede fica aliviada e a reação pode ser feita em tempo real. Para o vídeo, uma das formas possíveis é uma GPU dedicada, instalada na loja, que lê o fluxo das câmaras e executa o modelo no local. Para o operador, a diferença nota-se em três pontos:
- A latência. Um alerta só serve se a situação ainda estiver a decorrer no corredor quando ele chega. Sem a ida e volta do fluxo completo para um centro de dados, a cadeia entre o gesto e a notificação encurta: na Oxania, o alerta de vídeo chega em menos de 10 segundos ao telemóvel, tablet ou computador.
- A resolução. Como o fluxo não atravessa a Internet, não é necessário degradá-lo para o fazer passar pela ligação. O modelo trabalha sobre a imagem em alta resolução, a que permite distinguir uma mala pessoal de um saco de compras, ou ver que um produto foi consumido antes da passagem pela caixa.
- A rede. O servidor GPU é dedicado à loja e instalado no local: ler e analisar o fluxo das câmaras não consome a largura de banda da ligação à Internet. A confirmação das deteções, o envio dos excertos de alerta e as notificações passam, em contrapartida, por essa ligação, que deve permanecer disponível.
O que fica na loja, o que sai
Todo o responsável de informática acaba por colocar a pergunta, e um slogan não basta para lhe responder. Na arquitetura adotada pela Oxania, as imagens das câmaras seguem três caminhos bem distintos:
- O que permanece no local: o fluxo de vídeo contínuo das câmaras, em alta resolução. A GPU da loja lê-o e analisa-o, e esse fluxo não vai mais longe. As gravações do seu sistema de vídeo existente continuam, como antes, sob a responsabilidade do operador.
- O que sai para confirmação: quando um gesto de risco é detetado, é enviada uma descrição numérica compacta da deteção para ser confirmada. Não é vídeo, e o seu peso nada tem a ver com o das imagens.
- O que sai e é conservado: o excerto de vídeo associado ao alerta, e apenas esse. É armazenado em servidores situados o mais perto possível do país do cliente, tanto pela rapidez de acesso como pelo cumprimento das regras locais.
A triagem faz-se, portanto, na origem. De horas de vídeo, apenas os excertos associados a alertas saem da loja: aqueles que justificam que um membro da equipa olhe. São esses mesmos excertos que se encontram no alerta, com um zoom progressivo automático sobre o ponto de interesse. A pessoa que o recebe compreende a cena num relance e decide o que fazer a seguir.
Local não quer dizer isolado do mundo
Ainda assim, é preciso ser claro quanto ao que abrange a inferência local. A deteção é feita na loja, num GPU dedicado, mas o local continua ligado à cloud: precisa de uma ligação para confirmar as deteções, enviar os excertos de alerta e fazer chegar as notificações aos dispositivos da equipa. O que muda é o que circula: algumas mensagens e excertos curtos, em vez de dezenas de fluxos contínuos. Um fornecedor que afirmasse o contrário e, ao mesmo tempo, enviasse alertas para o seu telemóvel merece uma pergunta adicional.
Outro ponto muitas vezes esquecido: o servidor GPU é uma máquina bem real. É preciso encontrar-lhe um lugar, alimentá-lo, ventilá-lo e ligá-lo corretamente às câmaras. Esse é o trabalho do integrador, e o resultado não depende apenas da qualidade do modelo, como explicámos a propósito do papel dos integradores na eficácia das câmaras de IA. Com uma rede de integradores certificados, a instalação em câmaras existentes faz-se geralmente em menos de um dia.
Cinco perguntas a fazer antes de assinar
Para um único ponto de venda ou para toda uma rede, estes cinco pontos permitem avaliar rapidamente a solidez de uma arquitetura de análise de vídeo:
- O fluxo analisado: o principal, em alta resolução, ou o secundário.
- O local onde o modelo é executado, e se a máquina é realmente dedicada à sua loja.
- O que sai do local, com precisão, e em que momento.
- O local de conservação dos excertos de alerta: em que país e por quanto tempo.
- O que acontece quando a ligação da loja é cortada ou está degradada.
Espere respostas concretas. Uma arquitetura bem pensada descreve-se em poucas frases, sem jargão. Um fornecedor que não o consegue fazer muitas vezes não tem, ele próprio, um mapa claro dos seus fluxos. E se o seu parque de câmaras tem alguns anos, o nosso guia para escolher bem uma câmara na loja ajuda a verificar se fornecem um fluxo principal utilizável.
Uma arquitetura que também serve a confiança
Manter o fluxo no local não se resume a uma questão de largura de banda. Significa também limitar o que circula ao estritamente necessário e deixar os dados sob o controlo do comerciante. Os princípios da OCDE sobre a robustez, a segurança e a proteção da IA recomendam que os sistemas de IA permaneçam seguros, protegidos e capazes de funcionar adequadamente ao longo de todo o seu ciclo de vida, e que existam mecanismos que permitam neutralizá-los, repará-los ou desativá-los em segurança caso corram o risco de causar um prejuízo injustificado.
Na loja, a tradução é simples: a tecnologia deteta, a equipa decide. A IA analisa gestos, não pessoas, e não segue ninguém de uma câmara para outra. Perante o excerto, é um ser humano que escolhe ir ao corredor, oferecer ajuda ou não fazer nada.
Nada de espetacular em tudo isto: apenas um processamento feito no sítio certo e um vídeo que só viaja quando é útil. É, no entanto, isso que dá alertas rápidos e precisos, e uma quebra desconhecida mais bem controlada. Antes de comparar funcionalidades, peça para ver o mapa dos fluxos: diz muitas vezes mais do que um folheto comercial.