En una demostración de análisis de vídeo con IA, siempre acaba surgiendo la misma pregunta, formulada por el responsable de informática o por el propio gerente: ¿adónde van las imágenes? Muchos imaginan un envío continuo a un servidor lejano, a través de la conexión de la tienda. En realidad, todo depende de una decisión de arquitectura tomada mucho antes del primer ajuste: el análisis de vídeo local, en una GPU instalada en la tienda, a partir del flujo principal de las cámaras existentes.
No volveremos aquí sobre la calidad de imagen en sí. Vamos a seguir más bien el recorrido de los datos, desde el objetivo de la cámara hasta la pantalla del responsable: qué se queda en la tienda, qué sale y qué cambia, muy concretamente, esta decisión en la rapidez de las alertas, en la red de la tienda y en el control de los datos.
Un flujo de vídeo pesa mucho, y un gran almacén cuenta con decenas
Una cámara IP genera por lo general al menos dos flujos. El flujo principal (el mainstream) es de alta resolución. El flujo secundario (el substream), más ligero, sirve sobre todo para la visualización en mosaico y la consulta a distancia. Para detectar un gesto sutil, un producto metido en un bolsillo o un envase abierto en el pasillo, lo que cuenta es el flujo principal: en el secundario, la mano ocupa apenas unos píxeles. Detallamos este punto en nuestro artículo sobre el análisis del flujo principal en tienda.
El problema se vuelve entonces aritmético. Enviar de forma continua el flujo principal de veinte o treinta cámaras a un servidor remoto exige un caudal de subida elevado y permanente, que muchas conexiones de tienda no garantizan. Y esa línea ya la comparten con los terminales de pago, las cajas, la mensajería y, a veces, el wifi para clientes. Un sábado de rebajas de verano, cuando los TPV funcionan sin parar, nadie quiere ver cómo se satura.
Este límite no es nuevo. En su estudio sobre el uso de las tecnologías de vídeo en el comercio, publicado en 2020 y basado en entrevistas con 22 distribuidores europeos y estadounidenses, el grupo ECR Retail Loss ya señalaba que varios participantes se preocupaban por el efecto del ancho de banda y de la potencia de cálculo en su uso del análisis de vídeo.
Por qué el cálculo se hace lo más cerca posible de las cámaras
En lugar de hacer viajar las imágenes, se traslada el cálculo: es el principio del edge computing. La feria EuroShop lo resume en un dossier dedicado al edge computing en el comercio: solo los datos útiles suben a la nube, la red se descarga y la reacción puede producirse en tiempo real. En el caso del vídeo, una de las formas posibles es una GPU dedicada, instalada en la tienda, que lee el flujo de las cámaras y ejecuta el modelo in situ. Para el operador, la diferencia se aprecia en tres puntos:
- La latencia. Una alerta solo sirve si la situación sigue en curso en el pasillo cuando llega. Sin un viaje de ida y vuelta del flujo completo a un centro de datos, la cadena entre el gesto y la notificación se acorta: en Oxania, la alerta de vídeo llega en menos de 10 segundos al móvil, a la tableta o al ordenador.
- La resolución. Como el flujo no atraviesa Internet, no hace falta degradarlo para que quepa en la conexión. El modelo trabaja con la imagen en alta resolución, la que permite distinguir un bolso personal de una bolsa de la compra, o ver que un producto se ha consumido antes de pasar por caja.
- La red. El servidor GPU está dedicado a la tienda e instalado in situ: leer y analizar el flujo de las cámaras no consume el ancho de banda de la conexión a Internet. En cambio, la confirmación de las detecciones, el envío de los fragmentos de alerta y las notificaciones sí pasan por esa conexión, que debe seguir disponible.
Qué se queda en la tienda y qué sale de ella
Todo responsable de informática acaba haciendo la pregunta, y un eslogan no basta para responderla. En la arquitectura adoptada por Oxania, las imágenes de las cámaras siguen tres caminos bien distintos:
- Lo que se queda en la tienda: el flujo de vídeo continuo de las cámaras, en alta resolución. La GPU de la tienda lo lee y lo analiza, y ese flujo no sale de ahí. Las grabaciones de su sistema de vídeo actual siguen, como antes, bajo la responsabilidad del operador.
- Lo que sale para su confirmación: cuando se detecta un gesto de riesgo, se envía una descripción numérica compacta de la detección para confirmarla. No es vídeo, y su peso no tiene nada que ver con el de las imágenes.
- Lo que sale y se conserva: el fragmento de vídeo vinculado a la alerta, y solo ese. Se almacena en servidores situados lo más cerca posible del país del cliente, tanto por la rapidez de acceso como por el cumplimiento de la normativa local.
La selección se hace, por tanto, en origen. De horas de vídeo, solo salen de la tienda los fragmentos vinculados a las alertas: los que justifican que un miembro del equipo mire. Son esos mismos fragmentos los que aparecen en la alerta, con un zoom progresivo automático sobre el punto de interés. Quien la recibe entiende la escena de un vistazo y decide qué hacer.
Local no significa aislado del mundo
Conviene aclarar qué implica la inferencia local. La detección se hace en la tienda, en una GPU dedicada, pero el establecimiento sigue conectado a la nube: necesita una conexión para confirmar las detecciones, enviar los fragmentos de alerta y hacer llegar las notificaciones a los dispositivos del equipo. Lo que cambia es lo que circula: unos pocos mensajes y fragmentos cortos, en lugar de decenas de flujos continuos. Un proveedor que afirmara lo contrario mientras envía alertas a su teléfono merece una pregunta más.
Otro punto que a menudo se olvida: el servidor GPU es una máquina muy real. Hay que encontrarle un sitio, alimentarlo, ventilarlo y conectarlo correctamente a las cámaras. Es el trabajo del integrador, y el resultado no depende solo de la calidad del modelo, como explicábamos a propósito del papel de los integradores en la eficacia de las cámaras con IA. Con una red de integradores certificados, la instalación sobre cámaras existentes suele llevar menos de un día.
Cinco preguntas que hacer antes de firmar
Tanto para un solo punto de venta como para toda una red, estos cinco puntos permiten juzgar rápidamente la solidez de una arquitectura de análisis de vídeo:
- El flujo analizado: el principal, en alta resolución, o el secundario.
- Dónde se ejecuta el modelo y si la máquina está realmente dedicada a su tienda.
- Qué sale exactamente del establecimiento y en qué momento.
- El lugar de conservación de los fragmentos de alerta: en qué país y durante cuánto tiempo.
- Qué ocurre cuando la conexión de la tienda se corta o se degrada.
Espere respuestas concretas. Una arquitectura bien pensada se describe en pocas frases, sin jerga. Un proveedor que no lo consigue, a menudo no tiene él mismo un mapa claro de sus flujos. Y si su parque de cámaras tiene unos años, nuestra guía para elegir bien una cámara en la tienda le ayuda a comprobar que ofrecen un flujo principal aprovechable.
Una arquitectura que también favorece la confianza
Mantener el flujo in situ no se reduce a una cuestión de ancho de banda. También supone limitar lo que circula a lo estrictamente necesario y dejar los datos bajo el control del comerciante. Los principios de la OCDE sobre la robustez, la seguridad y la protección de la IA recomiendan que los sistemas de IA sean seguros, estén protegidos y puedan funcionar adecuadamente durante todo su ciclo de vida, y que existan mecanismos para neutralizarlos, repararlos o ponerlos fuera de servicio con total seguridad si corren el riesgo de causar un perjuicio injustificado.
En la tienda, la traducción es sencilla: la tecnología detecta, el equipo decide. La IA analiza gestos, no personas, y no sigue a nadie de una cámara a otra. Ante el fragmento de vídeo, es un humano quien decide ir al pasillo, ofrecer su ayuda o no hacer nada.
Nada espectacular en todo esto: solo un cálculo hecho en el lugar adecuado y un vídeo que viaja únicamente cuando es útil. Es, sin embargo, lo que permite obtener alertas rápidas y precisas, y una mejor gestión de la merma desconocida. Antes de comparar funcionalidades, pida ver el mapa de flujos: a menudo dice mucho más que un folleto comercial.