Founder Lab ਦੇ Shopify ਸਟੋਰ ਨੂੰ ਇੱਕ AI-ਅਧਾਰਿਤ ਸਕੋਰਿੰਗ ਟੂਲ ਨਾਲ ਛੇ ਵਾਰ ਸਕੈਨ ਕੀਤਾ ਗਿਆ ਸੀ, ਅਤੇ ਸਕੋਰ ਦਾ ਸਿਰਫ਼ "intent" (ਇੰਟੈਂਟ) ਹਿੱਸਾ ਹੀ ਬਦਲਿਆ—ਜੋ 4 ਅਤੇ 6 ਦੇ ਵਿਚਕਾਰ ਘੁੰਮਦਾ ਰਿਹਾ ਜਦੋਂ ਕਿ ਸਮੁੱਚਾ ਨਤੀਜਾ ਅਸਲ ਵਿੱਚ ਉਹੀ ਰਿਹਾ। ਇਹ ਖੋਜ ਦਰਸਾਉਂਦੀ ਹੈ ਕਿ ਕਿਸੇ ਸ਼ਾਪ ਦੀ AI-ਜਨਰੇਟਡ ਰੇਟਿੰਗ ਵਿੱਚ ਇੱਕ-ਅੰਕ ਦਾ ਬਦਲਾਅ ਸਿਰਫ਼ ਸਟੈਟਿਸਟੀਕਲ ਨੋਇਜ਼ (statistical noise) ਹੋ ਸਕਦਾ ਹੈ, ਕੋਈ ਅਸਲ ਸੁਧਾਰ ਨਹੀਂ।
ਇਹ ਟੈਸਟ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਸੀ
ਸ਼ਾਪ ਮਾਲਕ ਵੱਧ ਤੋਂ ਵੱਧ ਅਜਿਹੇ ਆਟੋਮੇਟਿਡ ਟੂਲਸ 'ਤੇ ਭਰੋਸਾ ਕਰਦੇ ਹਨ ਜੋ ਉਹਨਾਂ ਦੀਆਂ ਸਾਈਟਾਂ ਨੂੰ ਇੱਕ ਸਿੰਗਲ ਨੰਬਰ ਰੇਟਿੰਗ ਦਿੰਦੇ ਹਨ। ਉਹ ਰੇਟਿੰਗਾਂ ਇੱਕ ਤੇਜ਼ ਹੈਲਥ ਚੈੱਕ ਅਤੇ ਆਪਟੀਮਾਈਜ਼ੇਸ਼ਨ ਲਈ ਰੋਡਮੈਪ ਦਾ ਵਾਅਦਾ ਕਰਦੀਆਂ ਹਨ। ਇਹ ਮੰਨ ਲਿਆ ਜਾਂਦਾ ਹੈ ਕਿ ਉੱਚਾ ਨੰਬਰ ਬਿਹਤਰ ਸਟੋਰ ਦੇ ਬਰਾਬਰ ਹੈ, ਇਸ ਲਈ ਕਿਸੇ ਵੀ ਵਾਧੇ ਨੂੰ ਇਸ ਸਬੂਤ ਵਜੋਂ ਲਿਆ ਜਾਂਦਾ ਹੈ ਕਿ ਕੋਈ ਬਦਲਾਅ ਕਾਰਗਰ ਰਿਹਾ। Founder Lab ਇਸ ਅਸੂਲ ਦੀ ਪੁਸ਼ਟੀ ਕਰਨਾ ਚਾਹੁੰਦਾ ਸੀ। ਇੱਕ ਅਣ-ਬਦਲੇ ਸਟੋਰ 'ਤੇ ਟੂਲ ਚਲਾ ਕੇ, ਟੀਮ ਇਹ ਦੇਖ ਸਕੀ ਕਿ ਸਕੋਰ ਆਪਣੇ ਆਪ ਕਿੰਨਾ ਉਤਾਰ-ਚੜ੍ਹਾਅ ਮਾਣਦਾ ਹੈ।
ਪ੍ਰਯੋਗ ਕਿਹੋ ਜਿਹਾ ਸੀ
- ਮਿਤੀ 1 (ਜੁਲਾਈ 12): ਇੱਕ ਸਕੈਨ, ਕੁੱਲ ਸਕੋਰ 78, intent 6.
- ਮਿਤੀ 2 (ਜੁਲਾਈ 17): ਪੰਜ ਸਕੈਨ, ਹਰੇਕ ਇੱਕ ਮਿੰਟ ਤੋਂ ਘੱਟ ਸਮੇਂ ਦਾ, ਜਿਸ ਦੇ ਨਤੀਜੇ ਹੇਠ ਲਿਖੇ ਅਨੁਸਾਰ ਹਨ:
- ਸਕੈਨ 1: 76
ਇੱਕ AI-ਨਿਰਮਿਤ ਸ਼ਾਪ ਰੇਟਿੰਗ ਉਨੀ ਹੀ ਭਰੋਸੇਮੰਦ ਹੁੰਦੀ ਹੈ ਜਿੰਨੀ ਕਿ ਇਸਦੇ ਅਧਾਰਭੂਤ ਮਾਡਲ ਦੀ ਇਕਸਾਰਤਾ। Founder Lab ਦਾ ਛੇ-ਸਕੈਨ ਵਾਲਾ ਪ੍ਰਯੋਗ ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ "intent" ਹਿੱਸੇ ਵਿੱਚ ਕੁਝ ਅੰਕਾਂ ਦਾ ਉਤਾਰ-ਚੜ੍ਹਾਅ ਹੋ ਸਕਦਾ ਹੈ, ਜਦੋਂ ਕਿ ਬਾਕੀ ਸਭ ਕੁਝ ਸਥਿਰ ਰਹਿੰਦਾ ਹੈ। ਇਸ ਲਈ, ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਸਕੋਰ ਵਿੱਚ ਹੋਣ ਵਾਲੇ ਛੋਟੇ ਬਦਲਾਅ ਨੂੰ 'ਨੋਇਜ਼' (noise) ਮੰਨਣਾ ਚਾਹੀਦਾ ਹੈ, ਕਈ ਸਕੈਨਾਂ ਰਾਹੀਂ ਸੁਧਾਰਾਂ ਦੀ ਪੁਸ਼ਟੀ ਕਰਨੀ ਚਾਹੀਦੀ ਹੈ, ਅਤੇ AI-ਸੰਵੇਦਨਸ਼ੀਲ ਹਿੱਸਿਆਂ ਵਿੱਚ ਬਦਲਾਅ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਆਪਣੇ ਸਟੋਰਾਂ ਦੇ ਨਿਰਧਾਰਤ (deterministic) ਅਤੇ ਪੂਰੀ ਤਰ੍ਹਾਂ ਨਿਯੰਤਰਿਤ ਕੀਤੇ ਜਾ ਸਕਣ ਵਾਲੇ ਪਹਿਲੂਆਂ ਨੂੰ ਠੀਕ ਕਰਨ ਨੂੰ ਪਹਿਲ ਦੇਣੀ ਚਾਹੀਦੀ ਹੈ। ਹੁਣ ਕੀਤੀ ਗਈ ਵਾਧੂ ਕੋਸ਼ਿਸ਼ ਬਾਅਦ ਵਿੱਚ ਫ਼ਰਜ਼ੀ ਲਾਭਾਂ (phantom gains) ਦੇ ਪਿੱਛੇ ਭੱਜਣ ਤੋਂ ਬਚਾਉਂਦੀ ਹੈ।