A loja Shopify da Founder Lab foi escaneada seis vezes com uma ferramenta de pontuação baseada em IA, e apenas o componente de “intenção” da pontuação variou — oscilando entre 4 e 6, enquanto o resultado geral permaneceu efetivamente o mesmo. O achado mostra que uma mudança de um único ponto na classificação gerada por IA de uma loja pode ser puro ruído estatístico, não uma melhoria real.

Por que o teste foi importante

Os proprietários de lojas dependem cada vez mais de ferramentas automatizadas que atribuem uma única classificação numérica aos seus sites. Essas classificações prometem um check-up rápido de saúde e um roteiro para otimização. A suposição é que um número mais alto equivale a uma loja melhor, portanto, qualquer aumento é visto como evidência de que uma mudança funcionou. A Founder Lab queria verificar essa premissa. Ao executar a ferramenta em uma loja inalterada, a equipe pôde ver o quanto a pontuação flutua por conta própria.

Como foi o experimento

  • Data 1 (12 de julho): Um escaneamento, pontuação total 78, intenção 6.
  • Data 2 (17 de julho): Cinco escaneamentos, cada um com menos de um minuto, produzindo os seguintes resultados:
    • Escaneamento 1: 76 / 4
    • Escaneamento 2: 76 / 4
    • Escaneamento 3: 78 / 6
    • Escaneamento 4: 77 / 5
    • Escaneamento 5: 77 / 5

Todas as outras subpontuações — design visual, marcação de schema, sinais de confiança, saúde técnica, precificação, recomendação e marca — permaneceram idênticas em todas as execuções. Apenas a subpontuação de intenção mudou, e a pontuação total após subtrair a intenção (78 – 6, 76 – 4, 77 – 5) sempre resultou em 72. Em outras palavras, as partes determinísticas da avaliação foram perfeitamente estáveis; a única variável foi a avaliação de intenção baseada em IA.

A volatilidade oculta da “intenção”

A intenção é a parte do algoritmo que tenta medir o quão bem uma loja se alinha ao propósito do comprador — se o mix de produtos, o texto ou a mensagem geral correspondem ao que o comprador procura. Quando a classificação total aparece como um único número, essa variação é fácil de ignorar. Uma loja que passa de 78 para 80 pode parecer melhorada, mas a mudança pode não ser nada mais do que a mesma oscilação de 2 pontos que o teste da Founder Lab observou.

Por que os desenvolvedores devem realizar múltiplos escaneamentos

O experimento sugere uma regra prática: trate qualquer mudança de um ou dois pontos em um único escaneamento como suspeita até que possa ser reproduzida. Executar a ferramenta várias vezes no mesmo snapshot de um site fornece um “piso de ruído” — a faixa de pontuações que você pode esperar quando nada mudou. Se uma nova otimização empurrar a pontuação para fora dessa faixa de forma consistente, você terá evidências mais fortes de que a mudança importou.

Não confiamos mais em um único novo escaneamento. Cada mudança real agora exige múltiplos escaneamentos para provar que não é ruído. O foco também mudou para o início do processo: eles primeiro consolidam os fatores determinísticos — saúde técnica, dados estruturados e arquitetura do site — porque esses elementos são estáveis e estão diretamente sob o controle do desenvolvedor. Somente após essas bases estarem sólidas é que eles experimentam com o texto do produto ou outros sinais relacionados à intenção e, mesmo assim, verificam os resultados com múltiplos escaneamentos.

O que está em jogo para os lojistas

Para um proprietário de loja, uma falsa sensação de progresso pode levar a desperdício de tempo e dinheiro. Se você perseguir um aumento percebido de 2 pontos, pode investir em reescritas de textos, trocas de imagens ou experimentos de preços que não geram impacto real. Por outro lado, ignorar uma melhoria real porque ela cai dentro da faixa de ruído pode significar perder a oportunidade de intensificar uma mudança vencedora.

Contra-argumento: escaneamentos únicos ainda têm valor

Alguns profissionais argumentam que um único escaneamento é suficiente para um monitoramento de alto nível, especialmente quando os recursos são limitados. Eles apontam que os componentes determinísticos (técnicos, schema, confiança, etc.) já são confiáveis, e a pontuação de intenção, embora ruidosa, ainda oferece uma visão direcional. Em ambientes de ritmo acelerado, onde esperar por múltiplos escaneamentos pode atrasar a ação, uma única leitura pode ser a única opção prática.

A troca é clara: um único escaneamento oferece velocidade, mas traz o risco de reagir ao ruído; múltiplos escaneamentos oferecem confiança ao custo de tempo. Os lojistas precisam decidir qual equilíbrio se adapta ao seu fluxo de trabalho e tolerância ao risco.

O que observar a seguir

  • Provedores de ferramentas: As plataformas de pontuação publicarão suas próprias estimativas de ruído ou sugerirão um número mínimo de execuções para resultados confiáveis? A transparência em torno da variância do modelo pode se tornar um diferencial.
  • Ecossistema Shopify: À medida que mais lojistas adotam a pontuação por IA, podem surgir melhores práticas da comunidade em torno de testes repetidos, possivelmente na forma de plugins que automatizam múltiplos escaneamentos e agregam os dados.

Conclusão

Uma avaliação de loja gerada por IA é tão confiável quanto a consistência de seu modelo subjacente. O experimento de seis varreduras do Founder Lab mostra que a parte de "intenção" pode oscilar alguns pontos enquanto todo o resto permanece inalterado. Portanto, os desenvolvedores devem tratar pequenas mudanças na pontuação como ruído, verificar melhorias com várias varreduras e priorizar a correção dos aspectos determinísticos e totalmente controláveis de suas lojas antes de ajustar as partes sensíveis à IA. O esforço extra agora evita a busca por ganhos fantasmas mais tarde.