Founder Lab ના Shopify સ્ટોરને AI-આધારિત સ્કોરિંગ ટૂલ દ્વારા છ વખત સ્કેન કરવામાં આવ્યા હતા, અને સ્કોરનો માત્ર “intent” ઘટક જ બદલાયો હતો—જે 4 અને 6 ની વચ્ચે બદલાતો રહ્યો, જ્યારે એકંદર પરિણામ લગભગ સમાન રહ્યું. આ શોધ દર્શાવે છે કે કોઈ શોપના AI-જનરેટેડ રેટિંગમાં એક-પોઈન્ટનો ફેરફાર એ માત્ર આંકડાકીય અવાજ (statistical noise) હોઈ શકે છે, વાસ્તવિક સુધારો નહીં.
આ પરીક્ષણ શા માટે મહત્વનું હતું
શોપ માલિકો વધુને વધુ એવા ઓટોમેટેડ ટૂલ્સ પર આધાર રાખે છે જે તેમની સાઇટ્સને એક સિંગલ ન્યુમેરિક રેટિંગ આપે છે. તે રેટિંગ્સ ઝડપી હેલ્થ ચેક અને ઓપ્ટિમાઇઝેશન માટે રોડમેપનું વચન આપે છે. ધારણા એ છે કે ઊંચો આંકડો એટલે વધુ સારું સ્ટોર, તેથી કોઈપણ વધારાને એ પુરાવા તરીકે લેવામાં આવે છે કે ફેરફાર સફળ રહ્યો છે. Founder Lab આ ધારણાને ચકાસવા માંગતા હતા. કોઈપણ ફેરફાર વગરના સ્ટોર પર ટૂલ ચલાવીને, ટીમ જોઈ શકી કે સ્કોર આપમેળે કેટલો વધઘટ થાય છે.
પ્રયોગ કેવો હતો
- તારીખ 1 (જુલાઈ 12): એક સ્કેન, કુલ સ્કોર 78, intent 6.
- તારીખ 2 (જુલાઈ 17): પાંચ સ્કેન, દરેક એક મિનિટથી ઓછા સમયમાં, નીચે મુજબના પરિણામો આપ્યા:
- સ્કેન 1: 76 / 4
- સ્કેન 2: 76 / 4
- સ્કેન 3: 78 / 6
- સ્કેન 4: 77 / 5
- સ્કેન 5: 77 / 5
અન્ય તમામ સબ-સ્કોર—visual design, schema markup, trust signals, technical health, pricing, recommendation, અને brand—બધા જ રન દરમિયાન સમાન રહ્યા. માત્ર intent સબ-સ્કોર બદલાયો, અને intent બાદ કર્યા પછીનો કુલ સ્કોર (78 – 6, 76 – 4, 77 – 5) હંમેશા 72 રહ્યો. બીજા શબ્દોમાં કહીએ તો, મૂલ્યાંકનના deterministic (નિશ્ચિત) ભાગો સંપૂર્ણપણે સ્થિર હતા; માત્ર AI-આધારિત intent આકારણી જ બદલાતી હતી.
“intent” ની છુપાયેલી અસ્થિરતા
Intent એ અલ્ગોરિધમનો એ ભાગ છે જે એ માપવાનો પ્રયાસ કરે છે કે સ્ટોર ખરીદનારના હેતુ સાથે કેટલી સારી રીતે સુસંગત છે—પછી ભલે તે પ્રોડક્ટ મિક્સ હોય, કોપી હોય અથવા એકંદર મેસેજિંગ હોય જે ખરીદનાર શોધી રહ્યો છે તેની સાથે મેળ ખાતું હોય. જ્યારે કુલ રેટિંગ એક સિંગલ નંબર તરીકે દેખાય છે, ત્યારે તે તફાવત (variance) ચૂકી જવો સરળ છે. 78 થી 80 પર જતો સ્ટોર સુધારેલો દેખાઈ શકે છે, છતાં તે ફેરફાર Founder Lab ના પરીક્ષણમાં જોવામાં આવેલા 2-પોઈન્ટના સ્વિંગ (swing) થી વધુ કંઈ નથી હોઈ શકે.
ડેવલપર્સ શા માટે મલ્ટીપલ સ્કેન કરવા જોઈએ
પ્રયોગ એક વ્યવહારુ નિયમ સૂચવે છે: જ્યાં સુધી તે ફરીથી સાબિત ન થઈ શકે ત્યાં સુધી એક કે બે પોઈન્ટના કોઈપણ સિંગલ-સ્કેન ફેરફારને શંકાસ્પદ માનો. સાઇટના સમાન સ્નેપશોટ પર ટૂલને ઘણી વખત ચલાવવાથી “noise floor” મળે છે – સ્કોરની તે રેન્જ જે તમે કંઈપણ બદલાયું ન હોય ત્યારે અપેક્ષિત કરી શકો છો. જો નવું ઓપ્ટિમાઇઝેશન સતત તે રેન્જની બહાર સ્કોરને લઈ જાય છે, તો તમારી પાસે મજબૂત પુરાવો છે કે ફેરફાર મહત્વનો હતો.
અમે હવે સિંગલ રિસ્કેન પર વિશ્વાસ કરતા નથી. હવે દરેક વાસ્તવિક ફેરફારને તે નોઈઝ નથી તે સાબિત કરવા માટે મલ્ટીપલ સ્કેનની જરૂર પડે છે. ફોકસ હવે અગાઉના તબક્કા પર ખસેડવામાં આવ્યું છે: તેઓ પહેલા deterministic પરિબળોને સ્થિર કરે છે—technical health, structured data, અને site architecture—કારણ કે આ તત્વો સ્થિર છે અને સીધા ડેવલપરના નિયંત્રણમાં છે. આ પાયા મજબૂત થયા પછી જ તેઓ પ્રોડક્ટ કોપી અથવા અન્ય intent-સંબંધિત સિગ્નલો સાથે પ્રયોગ કરે છે, અને તે પછી પણ તેઓ મલ્ટીપલ સ્કેન સાથે પરિણામોની ચકાસણી કરે છે.
મર્ચન્ટ્સ માટે જોખમ
શોપ માલિક માટે, પ્રગતિનો ખોટો અહેસાસ સમય અને નાણાંનો બગાડ કરી શકે છે. જો તમે માત્ર 2-પોઈન્ટના વધારા પાછળ દોડો છો, તો તમે કોપી રિટાઈટિંગ, ઈમેજ સ્વેપ અથવા પ્રાઇસિંગ પ્રયોગોમાં રોકાણ કરી શકો છો જે વાસ્તવમાં કોઈ મોટો ફેરફાર લાવતા નથી. તેનાથી વિપરીત, જો કોઈ વાસ્તવિક સુધારો 'નોઈઝ બેન્ડ' ની અંદર હોય અને તેને અવગણવામાં આવે, તો તેનો અર્થ એ થઈ શકે કે તમે સફળ ફેરફાર પર વધુ ધ્યાન આપવાની તક ગુમાવી રહ્યા છો.
વિરોધી દલીલ: સિંગલ સ્કેનનું હજુ પણ મૂલ્ય છે
કેટલાક નિષ્ણાતો દલીલ કરે છે કે હાઈ-લેવલ મોનિટરિંગ માટે સિંગલ સ્કેન પૂરતું છે, ખાસ કરીને જ્યારે સંસાધનો મર્યાદિત હોય. તેઓ જણાવે છે કે deterministic ઘટકો (technical, schema, trust, વગેરે) પહેલેથી જ વિશ્વસનીય છે, અને intent સ્કોર, ભલે તે નોઈઝી હોય, તેમ છતાં દિશાસૂચક આંતરદૃષ્ટિ (directional insight) આપે છે. ઝડપથી બદલાતા વાતાવરણમાં જ્યાં મલ્ટીપલ સ્કેન માટે રાહ જોવાથી કામમાં વિલંબ થઈ શકે છે, ત્યાં સિંગલ રીડિંગ એ એકમાત્ર વ્યવહારુ વિકલ્પ હોઈ શકે છે.
સમજૂતી સ્પષ્ટ છે: સિંગલ સ્કેન ઝડપ આપે છે પરંતુ નોઈઝ સામે પ્રતિક્રિયા આપવાનું જોખમ ધરાવે છે; મલ્ટીપલ સ્કેન સમયના ભોગે આત્મવિશ્વાસ આપે છે. મર્ચન્ટ્સ નક્કી કરવાની જરૂર છે કે કયું સંતુલન તેમના વર્કફ્લો અને જોખમ સહન કરવાની ક્ષમતાને અનુરૂપ છે.
આગળ શું જોવું
- ટૂલ પ્રોવાઇડર્સ: શું સ્કોરિંગ પ્લેટફોર્મ્સ તેમના પોતાના નોઈઝ એસ્ટીમેટ પ્રકાશિત કરશે અથવા વિશ્વસનીય પરિણામો માટે લઘુત્તમ રન કરવાની સંખ્યા સૂચવશે? મોડલ વેરિયન્સ (model variance) અંગેની પારદર્શિતા તફાવત લાવી શકે છે.
- Shopify ઇકોસિસ્ટમ: જેમ જેમ વધુ મર્ચન્ટ્સ AI સ્કોરિંગ અપનાવશે, તેમ તેમ રિપીટ ટેસ્ટિંગ અંગેની કોમ્યુનિટી બેસ્ટ પ્રેક્ટિસિસ ઉભરી શકે છે, જે કદાચ એવા પ્લગિન્સના સ્વરૂપમાં હોઈ શકે જે મલ્ટીપલ સ્કેનને ઓટોમેટ કરે અને ડેટાને એગ્રીગેટ કરે.
મુખ્ય વાત
AI- દ્વારા જનરેટ થયેલું શોપ રેટિંગ તેના પાયાના મોડલની સુસંગતતા જેટલું જ વિશ્વસનીય હોય છે. Founder Lab નો છ-સ્કેનનો પ્રયોગ દર્શાવે છે કે જ્યારે બાકી બધું સ્થિર રહે છે, ત્યારે "intent" વિભાગમાં થોડા પોઈન્ટ્સનો ફેરફાર થઈ શકે છે. તેથી, ડેવલપર્સે સ્કોરમાં થતા નાના ફેરફારોને 'નોઈઝ' તરીકે ગણવા જોઈએ, અનેક સ્કેન દ્વારા સુધારાઓની ચકાસણી કરવી જોઈએ, અને AI-સંવેદનશીલ ભાગોમાં ફેરફાર કરતા પહેલા તેમના સ્ટોર્સના નિશ્ચિત (deterministic) અને સંપૂર્ણ રીતે નિયંત્રિત કરી શકાય તેવા પાસાઓને સુધારવાને પ્રાથમિકતા આપવી જોઈએ. અત્યારે કરેલો વધારાનો પ્રયાસ પછીથી કાલ્પનિક લાભો પાછળ દોડતા બચાવશે.