Founder Lab च्या Shopify स्टोअरचे एका AI-आधारित स्कोअरिंग टूलद्वारे सहा वेळा स्कॅनिंग करण्यात आले, आणि त्यातील केवळ “intent” (हेतू) घटक बदलत होता—जो ४ आणि ६ च्या दरम्यान फिरत होता, तर एकूण निकाल प्रभावीपणे तोच राहिला. या निष्कर्षावरून असे दिसून येते की, एखाद्या शॉपच्या AI-जनरेटेड रेटिंगमधील एक अंताचा बदल हा केवळ सांख्यिकीय गोंधळ (statistical noise) असू शकतो, कोणतीही वास्तविक सुधारणा नाही.

ही चाचणी का महत्त्वाची होती

स्टोअर मालक अधिकाधिक स्वयंचलित साधनांवर अवलंबून राहत आहेत, जी त्यांच्या साइटला एक एकल संख्यात्मक रेटिंग देतात. ही रेटिंग्स जलद आरोग्य तपासणी आणि ऑप्टिमायझेशनसाठी रोडमॅपचे आश्वासन देतात. असे गृहित धरले जाते की उच्च संख्या म्हणजे अधिक चांगला स्टोअर, त्यामुळे कोणताही वाढलेला आकडा हा बदल यशस्वी झाल्याचा पुरावा मानला जातो. Founder Lab ला या गृहितकाची पडताळणी करायची होती. न बदललेल्या स्टोअरवर हे टूल चालवून, टीमला हे पाहता आले की स्कोअर स्वतःहून किती प्रमाणात बदलतो.

प्रयोग कसा होता

  • तारीख १ (१२ जुलै): एक स्कॅन, एकूण स्कोअर ७८, intent ६.
  • तारीख २ (१७ जुलै): पाच स्कॅन, प्रत्येक एक मिनिटापेक्षा कमी वेळात, ज्यातून खालील निकाल मिळाले:
    • स्कॅन १: ७६ / ४
    • स्कॅन २: ७६ / ४
    • स्कॅन ३: ७८ / ६
    • स्कॅन ४: ७७ / ५
    • स्कॅन ५: ७७ / ५

इतर सर्व उप-स्कोअर—व्हिज्युअल डिझाइन, स्कीमा मार्कअप, ट्रस्ट सिग्नल्स, तांत्रिक आरोग्य (technical health), किंमत (pricing), शिफारस (recommendation) आणि ब्रँड—सर्व स्कॅनमध्ये तंतोतंत सारखेच होते. केवळ intent उप-स्कोअर बदलला होता, आणि intent वजा केल्यानंतरचा एकूण स्कोअर (७८ – ६, ७६ – ४, ७७ – ५) नेहमी ७२ इतकाच होता. दुसऱ्या शब्दांत सांगायचे तर, मूल्यांकनाचे नियतकालिक (deterministic) भाग पूर्णपणे स्थिर होते; केवळ AI-आधारित intent मूल्यांकन हेच एकमेव चल (variable) होते.

“intent” ची सुप्त अस्थिरता

Intent हा अल्गोरिदमचा असा भाग आहे जो स्टोअर खरेदीदाराच्या उद्देशाशी किती चांगल्या प्रकारे सुसंगत आहे हे मोजण्याचा प्रयत्न करतो—मग ते प्रॉडक्ट मिक्स असो, कॉपी असो किंवा एकूण संदेश असो. जेव्हा एकूण रेटिंग एका एकल संख्या स्वरूपात दिसते, तेव्हा ही तफावत लक्षात घेणे सोपे असते. ७८ वरून ८० वर जाणारे स्टोअर सुधारलेले वाटू शकते, परंतु तो बदल Founder Lab च्या चाचणीत दिसून आलेल्या २ अंकांच्या चढ-उतारापेक्षा जास्त काहीही नसू शकतो.

डेव्हलपर्सनी अनेक स्कॅन का करावेत

हा प्रयोग एक व्यावहारिक नियम सुचवतो: जोपर्यंत एखादा बदल पुन्हा सिद्ध करता येत नाही, तोपर्यंत एका स्कॅनमधील एक किंवा दोन अंकांच्या बदलाला संशयास्पद मानावे. एकाच साइटवर टूल अनेक वेळा चालवल्यामुळे एक “नॉइज फ्लोअर” (noise floor) मिळतो – म्हणजेच काहीही न बदललेले असताना तुम्ही अपेक्षित असलेल्या स्कोअरची श्रेणी. जर एखादे नवीन ऑप्टिमायझेशन स्कोअरला सातत्याने त्या श्रेणीबाहेर ढकलत असेल, तरच तुमच्याकडे तो बदल महत्त्वाचा असल्याचा भक्कम पुरावा असतो.

आम्ही आता एका सिंगल रीस्कॅनवर विश्वास ठेवत नाही. प्रत्येक वास्तविक बदलासाठी तो केवळ 'नॉइज' नाही हे सिद्ध करण्यासाठी आता अनेक स्कॅन आवश्यक आहेत. लक्ष देखील आता सुरुवातीच्या टप्प्यावर केंद्रित झाले आहे: ते प्रथम नियतकालिक घटक (deterministic factors)—तांत्रिक आरोग्य, स्ट्रक्चर्ड डेटा आणि साइट आर्किटेक्चर—निश्चित करतात, कारण हे घटक स्थिर असतात आणि थेट डेव्हलपरच्या नियंत्रणाखाली असतात. ही पायाभूत रचना मजबूत झाल्यानंतरच ते प्रॉडक्ट कॉपी किंवा इतर intent-संबंधित सिग्नल्सवर प्रयोग करतात आणि त्यानंतरही ते अनेक स्कॅनद्वारे निकालांची पडताळणी करतात.

व्यापाऱ्यांसाठीचे धोके

स्टोअर मालकासाठी, प्रगतीचा खोटा भास वेळ आणि पैशाचा अपव्यय करू शकतो. जर तुम्ही केवळ २ अंकांच्या वाढीचा पाठलाग केला, तर तुम्ही कॉपी पुनर्लेखन, इमेज बदलणे किंवा किंमत प्रयोगांमध्ये गुंतवणूक करू शकता ज्याचा प्रत्यक्षात कोणताही परिणाम होणार नाही. याउलट, एखादा वास्तविक सुधारणा 'नॉइज बँड'मध्ये येत असल्यामुळे त्याकडे दुर्लक्ष करणे म्हणजे एखाद्या यशस्वी बदलावर अधिक भर देण्याची संधी गमावणे ठरू शकते.

प्रतिवाद: सिंगल स्कॅनचे महत्त्व अजूनही आहे

काही तज्ज्ञांचे असे मत आहे की उच्च-स्तरीय देखरेखीसाठी एक सिंगल स्कॅन पुरेसा आहे, विशेषतः जेव्हा संसाधने मर्यादित असतात. ते असे दर्शवतात की नियतकालिक घटक (तांत्रिक, स्कीमा, ट्रस्ट इ.) आधीच विश्वसनीय आहेत आणि intent स्कोअर अस्थिर असला तरी तो दिशादर्शक माहिती देतो. वेगाने बदलणाऱ्या वातावरणात जिथे अनेक स्कॅनची प्रतीक्षा करणे कृतीला विलंब करू शकते, तिथे सिंगल रीडिंग हा एकमेव व्यावहारिक पर्याय असू शकतो.

यातील तडजोड स्पष्ट आहे: सिंगल स्कॅन वेग देतो परंतु 'नॉइज'वर प्रतिक्रिया देण्याचा धोका असतो; अनेक स्कॅन वेळेच्या किंमतीवर आत्मविश्वास देतात. व्यापाऱ्यांना त्यांच्या कार्यप्रणालीला आणि जोखीम सहन करण्याच्या क्षमतेला कोणता समतोल योग्य आहे हे ठरवावे लागेल.

पुढे काय पाहावे

  • टूल पुरवठादार: स्कोअरिंग प्लॅटफॉर्म्स त्यांचे स्वतःचे 'नॉइज एस्टिमेट्स' प्रकाशित करतील का किंवा विश्वसनीय निकालांसाठी किमान किती वेळा स्कॅन करावे लागेल याचे मार्गदर्शन करतील का? मॉडेलमधील तफावतीबाबतची पारदर्शकता ही एक वेगळी ओळख बनू शकते.
  • Shopify इकोसिस्टम: जसजसे अधिक व्यापारी AI स्कोअरिंगचा अवलंब करतील, तसतसे वारंवार चाचणी करण्याबाबत समुदायातील सर्वोत्तम पद्धती (best practices) समोर येतील, कदाचित प्लगइन्सच्या स्वरूपात जे अनेक स्कॅन स्वयंचलित करतील आणि डेटा एकत्रित करतील.

मुख्य सारांश

AI-द्वारे तयार केलेले शॉप रेटिंग हे त्याच्या मूळ मॉडेलच्या सुसंगततेइतकेच विश्वासार्ह असते. Founder Lab च्या सहा-स्कॅनच्या प्रयोगातून असे दिसून येते की, इतर सर्व गोष्टी स्थिर असतानाही "intent" विभागात काही अंकांनी चढ-उतार होऊ शकतो. त्यामुळे, डेव्हलपर्सनी स्कोअरमधील लहान बदल हे 'नॉईज' मानले पाहिजेत, अनेक स्कॅनद्वारे सुधारणांची पडताळणी केली पाहिजे आणि AI-संवेदनशील भागांमध्ये फेरबदल करण्यापूर्वी त्यांच्या स्टोअरमधील निश्चित (deterministic) आणि पूर्णपणे नियंत्रणाखालील पैलू दुरुस्त करण्याला प्राधान्य दिले पाहिजे. आता घेतलेले अतिरिक्त प्रयत्न नंतर काल्पनिक फायद्यांच्या मागे लागण्यापासून वाचवतात.