जब कोई दुकानदार स्मार्ट कैमरे लगाने की घोषणा करता है, तो उसकी टीमें शायद ही कभी कोई तकनीकी सवाल पूछती हैं। वे ज़्यादातर यह पूछती हैं: "क्या यह मुझे देखेगा?" यह सवाल जायज़ है, और किसी विज्ञापन ब्रोशर में इसका जवाब नहीं मिलता। स्टोर में विज़न AI वास्तव में क्या विश्लेषित करता है, यह जानने का सबसे आसान तरीका है एक तस्वीर का सफ़र देखना, कैमरे से लेकर नोटिफ़िकेशन तक, और रास्ते में यह दर्ज करना कि मॉडल क्या-क्या अनदेखा करता है।

वैसे भी, रिटेल में वीडियो एनालिटिक्स का उपयोग अभी कम ही होता है। 2024 में 70 रिटेलरों (अधिकांश यूरोपीय और उत्तरी अमेरिकी) के बीच किए गए रिटेल में वीडियो एनालिटिक्स पर ECR Retail Loss के सर्वेक्षण में, दर्ज किए गए एनालिटिक्स का औसत उपयोग दर 10 % से अधिक नहीं था, और सेल्स फ्लोर पर यह घटकर 4 % रह गया। क्षेत्र में आम सहमति न होने के कारण, इसी रिपोर्ट में वीडियो एनालिटिक्स की एक कार्यकारी परिभाषा दी गई है: ऐसी प्रणाली जो छवियों की स्वचालित रूप से व्याख्या करके स्पष्ट रूप से परिभाषित और उपयोग में लाने योग्य परिणाम तैयार करती है। आगे की सारी बात इन्हीं दो शब्दों में समाई है।


विज़न AI के लिए "देखने" का मतलब क्या है

कैमरा छवियों की एक श्रृंखला भेजता है। मॉडल किसी दृश्य को उस तरह "समझता" नहीं जैसे रैक पर तैनात कर्मचारी समझता है: वह हाथों की स्थितियों, वस्तुओं और गतिविधियों की तुलना सीखी हुई श्रेणियों से करता है। जब उसका अवलोकन किसी श्रेणी से पर्याप्त मेल खाता है, तो वह एक इवेंट बनाता है: एक प्रकार का हाव-भाव, एक ज़ోन, एक समय, एक छोटी वीडियो क्लिप। इससे अधिक कुछ नहीं।

फिर सब कुछ छवि की स्पष्टता पर निर्भर करता है। कम रिज़ॉल्यूशन वाली स्ट्रीम में, जैकेट की जेब में रेज़र डालता हाथ कुछ धुंधले पिक्सेल भर रह जाता है, इसीलिए हाई रिज़ॉल्यूशन वाली मुख्य स्ट्रीम पर वीडियो विश्लेषण का महत्व है। Oxania में यह मुख्य स्ट्रीम स्टोर में लगे एक समर्पित GPU पर प्रोसेस होती है: डिटेक्शन स्थानीय स्तर पर होता है, कैमरों की स्ट्रीम साइट से बाहर नहीं जाती, और केवल अलर्ट से जुड़ी क्लिप ही सहेजी जाती हैं, वह भी ग्राहक के देश के सबसे नज़दीक स्थित सर्वरों पर।


हाव-भाव की एक सीमित शब्दावली, लोगों पर नज़र नहीं

हानि रोकथाम (लॉस प्रिवेंशन) में लागू होने पर, हावभाव पहचानने वाला मॉडल श्रेणियों की एक सीमित सूची के साथ काम करता है। चोरी के संदर्भ में आमतौर पर ये श्रेणियाँ मिलती हैं:

  • किसी वस्तु को जेब में, कपड़ों के नीचे या निजी बैग में छिपाना;
  • किसी उत्पाद को बैकपैक, हैंडबैग या ऐसे बैग में रखना जिसकी प्रकृति अस्पष्ट हो;
  • चेकआउट पर पहुँचने से पहले पैकेजिंग खोल देना;
  • वहीं उपभोग करना, यानी बिना भुगतान किए किसी उत्पाद को पीना या खाना;
  • संदर्भ के तत्व, जैसे ट्रॉली, बच्चों की गाड़ी या शॉपिंग बैग, जो दृश्य को समझने में मदद करते हैं।

कुछ सिस्टम गिरने का अलर्ट भी जोड़ते हैं, जो माल से ज़्यादा ग्राहकों और टीमों की सुरक्षा के लिए उपयोगी है। इनमें से कोई भी श्रेणी यह नहीं बताती कि छवि में कौन है। जोखिम भरे हाव-भाव की पहचान किसी एक क्रिया पर, किसी खास क्षण में, किसी खास ज़ोन में केंद्रित होती है।


AI क्या नहीं करती

जो पहचाना नहीं जाता, उसकी सूची भी पहचाने जाने वाली सूची जितनी ही मायने रखती है, और अक्सर यही टीमों को आश्वस्त करती है। इस ढाँचे में बना हाव-भाव विश्लेषण करने वाला AI:

  • किसी की पहचान नहीं करता: न फ़ेशियल रिकग्निशन, न कोई नाम, न लोगों की कोई फ़ाइल;
  • किसी व्यक्ति का एक रैक से दूसरे रैक तक, या एक विज़िट से अगली विज़िट तक पीछा नहीं करता;
  • कोई प्रोफ़ाइल नहीं बनाता: न उम्र, न मूल, न कोई "जोखिम भरा" पहनावा। आँकड़े ज़ोन और समय-स्लॉट के अनुसार पढ़े जाते हैं, व्यक्ति के अनुसार नहीं;
  • किसी इरादे का आकलन नहीं करता: जोखिम भरा हाव-भाव कोई अपराध नहीं है, बस एक ऐसी स्थिति है जिस पर इंसानी नज़र पड़नी चाहिए;
  • कर्मचारियों के काम को नहीं मापता: कोई भी श्रेणी उत्पादकता, ब्रेक या प्रक्रियाओं के पालन से संबंधित नहीं है।

इतने सीमित दायरे के कारण इस टूल के उपयोग को समझाना आसान रहता है। किसी सेल्सवुमन या ग्राहक को एक वाक्य में बताया जा सकता है कि अलर्ट किस बात से शुरू होता है, और यही बात इसे स्वीकार्य बनाती है।


अलर्ट कोई फ़ैसला नहीं है: निर्णय इंसान के हाथ में ही रहता है

मॉडल कभी-कभी गलती करता है। मान लीजिए कोई ग्राहक कॉफ़ी का पैकेट उठाने के ठीक बाद अपना चश्मा जेब में रख लेता है: मशीन को यह दृश्य छिपाने जैसा लगता है। इसलिए अलर्ट को टीम से पूछे गए एक सवाल की तरह लिया जाना चाहिए, कभी निष्कर्ष की तरह नहीं।

AI पर यूरोपीय विनियमन, मानवीय निगरानी से जुड़े अपने अनुच्छेद 14 में, इस जाल का सीधे शब्दों में नाम लेता है: ऑटोमेशन पूर्वाग्रह, यानी मशीन के नतीजों पर अपने आप या ज़रूरत से ज़्यादा भरोसा करने की प्रवृत्ति। यह माँग करता है कि निगरानी करने वाले लोगों के पास सिस्टम के नतीजे को नज़रअंदाज़ करने, बदलने या पलटने की क्षमता हो। यह पाठ उच्च जोखिम वाली प्रणालियों पर लागू होता है, लेकिन जोखिम भरे हावभाव (at-risk gestures) पहचानने वाले किसी भी टूल पर यही अनुशासन लागू करने से कोई नहीं रोकता।

ज़मीनी स्तर पर, अलर्ट पाने वाला व्यक्ति वीडियो क्लिप देखता है, फिर तय करता है: कुछ न करना, रेयॉन (शेल्फ़ सेक्शन) में जाना, ग्राहक को मदद की पेशकश करना, या स्थिति की पुष्टि होने पर अधिकारियों के पास कार्रवाई शुरू करना। एजेंट और AI साथ मिलकर काम करते हैं एक सरल नियम के अनुसार: तकनीक पहचानती है, इंसान फ़ैसला करता है।


ग्राहकों और कर्मचारियों के प्रति पारदर्शिता

2019 में अपनाए गए और मई 2024 में अपडेट किए गए AI पर OECD के सिद्धांत पारदर्शिता, व्याख्या-योग्यता और जवाबदेही को भरोसेमंद AI के पाँच सिद्धांतों में गिनते हैं। स्टोर में यह कुछ ठोस आदतों के रूप में दिखता है:

  1. इंस्टॉल करने से पहले समझाएँ। टीमों को दिखाएँ कि क्या पहचाना जाता है, क्या नहीं, और अलर्ट किसे मिलते हैं। जहाँ प्रावधान हो, वहाँ कर्मचारी प्रतिनिधियों को शामिल करें।
  2. उपयोग का नियम लिखें। यह टूल नुकसान घटाने और लोगों की सुरक्षा के लिए है, कर्मचारियों का मूल्यांकन करने के लिए नहीं: बेहतर है कि इसे लिखित में स्पष्ट कर दिया जाए।
  3. ग्राहकों को सूचित करें। प्रवेश द्वार पर सूचना लगाना संचालक की ज़िम्मेदारी है, जैसा कि उसके मौजूदा कैमरा सिस्टम के लिए होता है। एक पठनीय बोर्ड और सुलभ छोटा नोटिस अक्सर चिंताओं को शांत करने के लिए काफ़ी होता है।
  4. अलर्ट पढ़ने का प्रशिक्षण दें। क्लिप की जाँच करें, विनम्र रहें, और केवल किसी नोटिफ़िकेशन के भरोसे कभी किसी को न रोकें।
  5. नियमित रूप से समीक्षा करें। खारिज किए गए अलर्ट दोबारा देखें, कवर किए गए ज़ोन समायोजित करें, और जो सीखा जाए उसे टीम के साथ साझा करें।

सही ढंग से लागू होने पर, विज़न AI किसी फ़ैसला सुनाने वाली आँख से कम और बहुत सीमित शब्दावली वाले सहकर्मी जैसा अधिक लगता है: वह हाव-भाव की सूचना देता है और आगे का काम उन पर छोड़ देता है जो स्टोर को जानते हैं। इस ढाँचे को लॉन्च मीटिंग में ही, उपकरण लगने से भी पहले, प्रस्तुत करना फ़ायदेमंद रहता है। जिस टीम को पता होता है कि टूल क्या देखता है और क्या नहीं देखता, वह उसका सचमुच उपयोग करती है, और तभी वह श्रिंकेज को घटाना शुरू करता है।