Sklep Shopify należący do Founder Lab został zeskanowany sześciokrotnie za pomocą narzędzia do scoringu opartego na AI, a jedynym elementem, który uległ zmianie, był komponent „intent” – jego wartość wahała się między 4 a 6, podczas gdy ogólny wynik pozostał w praktyce taki sam. Wynik ten pokazuje, że zmiana o jeden punkt w ocenie wygenerowanej przez AI może być czystym szumem statystycznym, a nie realną poprawą.

Dlaczego ten test był istotny

Właściciele sklepów coraz częściej polegają na zautomatyzowanych narzędziach, które przypisują ich witrynom pojedynczą ocenę liczbową. Takie oceny obiecują szybki przegląd kondycji sklepu i mapę drogową optymalizacji. Zakłada się, że wyższa liczba oznacza lepszy sklep, więc każdy wzrost jest traktowany jako dowód na skuteczność wprowadzonych zmian. Founder Lab chciał zweryfikować to założenie. Poprzez uruchomienie narzędzia na niezmienionym sklepie, zespół mógł sprawdzić, jak bardzo wynik waha się sam z siebie.

Jak wyglądał eksperyment

  • Data 1 (12 lipca): Jedno skanowanie, wynik całkowity 78, intent 6.
  • Data 2 (17 lipca): Pięć skanowań, każde trwające poniżej minuty, dających następujące wyniki:
    • Skan 1: 76 / 4
    • Skan 2: 76 / 4
    • Skan 3: 78 / 6
    • Skan 4: 77 / 5
    • Skan 5: 77 / 5

Wszystkie pozostałe podwyniki — projekt wizualny, znaczniki schema, sygnały zaufania, sprawność techniczna, ceny, rekomendacje oraz marka — pozostały identyczne we wszystkich próbach. Zmienił się tylko podwynik „intent”, a wynik całkowity po odjęciu „intent” (78 – 6, 76 – 4, 77 – 5) zawsze wynosił 72. Innymi słowy, deterministyczne części ewaluacji były idealnie stabilne; jedyną zmienną była ocena „intent” oparta na AI.

Ukryta zmienność „intent”

„Intent” to część algorytmu, która próbuje ocenić, jak dobrze sklep wpisuje się w potrzeby kupującego — czy asortyment, teksty czy ogólny przekaz odpowiadają temu, czego szuka nabywca. Gdy całkowita ocena jest prezentowana jako pojedyncza liczba, tę wariancję łatwo przeoczyć. Sklep, którego wynik wzrósł z 78 na 80, może sprawiać wrażenie ulepszonego, podczas gdy zmiana ta może być niczym więcej niż tym samym 2-punktowym wahaniem, które zaobserwowano w teście Founder Lab.

Dlaczego programiści powinni wykonywać wielokrotne skanowania

Eksperyment sugeruje praktyczną zasadę: każdą zmianę o jeden lub dwa punkty przy pojedynczym skanowaniu należy traktować jako podejrzaną, dopóki nie uda się jej powtórzyć. Wielokrotne uruchomienie narzędzia na tym samym „migawce” witryny pozwala wyznaczyć „poziom szumu” (noise floor) – zakres wyników, jakich można się spodziewać, gdy nic nie zostało zmienione. Jeśli nowa optymalizacja konsekwentnie wypycha wynik poza ten zakres, masz silniejszy dowód na to, że zmiana miała znaczenie.

Nie ufamy już pojedynczemu ponownemu skanowaniu. Każda realna zmiana wymaga teraz wielokrotnych skanowań, aby udowodnić, że nie jest szumem. Skupienie przesunęło się również na wcześniejsze etapy: najpierw należy ustabilizować czynniki deterministyczne — sprawność techniczną, dane strukturalne i architekturę strony — ponieważ te elementy są stabilne i znajdują się bezpośrednio pod kontrolą programisty. Dopiero gdy te fundamenty są solidne, można eksperymentować z tekstami produktowymi lub innymi sygnałami związanymi z „intent”, a nawet wtedy wyniki należy weryfikować wielokrotnymi skanowaniami.

Ryzyko dla sprzedawców

Dla właściciela sklepu fałszywe poczucie postępu może prowadzić do marnowania czasu i pieniędzy. Jeśli będziesz gonić za pozornym wzrostem o 2 punkty, możesz zainwestować w przeredagowanie tekstów, wymianę zdjęć lub eksperymenty cenowe, które w rzeczywistości nie przyniosą żadnych efektów. I odwrotnie — ignorowanie realnej poprawy tylko dlatego, że mieści się ona w pasmie szumu, może oznaczać utratę okazji do podwojenia sił w obszarze, który przyniósł sukces.

Kontrargument: pojedyncze skanowania wciąż mają wartość

Niektórzy praktycy twierdzą, że pojedyncze skanowanie jest wystarczające do monitorowania ogólnego poziomu, zwłaszcza gdy zasoby są ograniczone. Wskazują oni, że komponenty deterministyczne (techniczne, schema, zaufanie itp.) są już wiarygodne, a wynik „intent”, mimo że zmienny, wciąż oferuje ogólny kierunek działań. W dynamicznych środowiskach, gdzie czekanie na wielokrotne skanowania mogłoby opóźnić podjęcie decyzji, pojedynczy odczyt może być jedyną praktyczną opcją.

Kompromis jest jasny: pojedyncze skanowanie zapewnia szybkość, ale niesie ryzyko reagowania na szum; wielokrotne skanowania dają pewność kosztem czasu. Sprzedawcy muszą zdecydować, który balans pasuje do ich przepływu pracy i tolerancji na ryzyko.

Na co zwrócić uwagę w przyszłości

  • Dostawcy narzędzi: Czy platformy scoringowe będą publikować własne szacunki szumu lub sugerować minimalną liczbę prób dla uzyskania wiarygodnych wyników? Transparentność w zakresie wariancji modelu może stać się wyróżnikiem rynkowym.
  • Ekosystem Shopify: W miarę jak coraz większa liczba sprzedawców wdraża scoring AI, mogą pojawić się najlepsze praktyki społeczności dotyczące powtarzalnych testów, być może w formie wtyczek automatyzujących wielokrotne skanowania i agregujących dane.

Podsumowanie

Ocena sklepu generowana przez AI jest tak wiarygodna, jak spójność modelu, na którym się opiera. Sześcioskanowy eksperyment przeprowadzony przez Founder Lab pokazuje, że część dotycząca „intencji” może wahać się o kilka punktów, podczas gdy wszystkie pozostałe elementy pozostają niezmienne. Deweloperzy powinni zatem traktować niewielkie zmiany wyników jako szum, weryfikować ulepszenia za pomocą wielu skanów oraz priorytetyzować naprawę deterministycznych, w pełni kontrolowalnych aspektów swoich sklepów, zanim zaczną wprowadzać zmiany w elementach wrażliwych na działanie AI. Dodatkowy wysiłek włożony teraz zapobiegnie pogoni za fantomowymi zyskami w przyszłości.