ਮਾਰਕੀਟਪਲੇਸ ਦੀ SEO ਟੀਮ ਨੇ ਆਪਣਾ ਇੰਡੈਕਸਿੰਗ ਨਿਯਮ ਦੁਬਾਰਾ ਲਿਖਿਆ ਕਿਉਂਕਿ ਇੱਕ ਸਧਾਰਨ “fewer-than-3-listings = noindex” ਨੀਤੀ ਕਾਰਨ ਕੈਟੇਗਰੀ ਪੇਜ Google ਤੋਂ ਗਾਇਬ ਹੋ ਗਏ ਸਨ ਅਤੇ ਵਾਪਸ ਆਉਣ ਵਿੱਚ ਹਫ਼ਤੇ ਲੱਗ ਗਏ ਸਨ। ਇੱਕ ਇੱਕ-ਤਰਫਾ “unlock” ਰਿਕਾਰਡ ਜੋੜ ਕੇ, ਜੋ ਇੱਕ ਪੇਜ ਨੂੰ noindex ਤੋਂ index ਵਿੱਚ ਜਾਣ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦਾ ਹੈ ਪਰ ਕਦੇ ਵਾਪਸ ਨਹੀਂ, ਸਾਈਟ ਨੇ ਇਸ ਉਥਲ-ਪੁਥਲ ਨੂੰ ਰੋਕ ਦਿੱਤਾ।

ਅਸਲ ਨਿਯਮ ਉਲਟ ਕਿਉਂ ਪੈ ਗਿਆ

ਕਲਾਸੀਫਾਈਡ ਪਲੇਟਫਾਰਮ ਬਹੁਤ ਸਾਰੇ category-and-location ਪੇਜ ਬਣਾਉਂਦਾ ਹੈ। ਜਦੋਂ ਕੋਈ ਪੇਜ ਪਹਿਲੀ ਵਾਰ ਦਿਖਾਈ ਦਿੰਦਾ ਹੈ, ਤਾਂ ਇਸ ਵਿੱਚ ਅਕਸਰ ਸਿਰਫ਼ ਕੁਝ ਹੀ ਲਿਸਟਿੰਗ ਹੁੰਦੀਆਂ ਹਨ, ਇਸ ਲਈ ਟੀਮ ਨੇ ਤੈਅ ਕੀਤਾ ਕਿ ਜਦੋਂ ਤੱਕ ਇਹ ਤਿੰਨ ਵਸਤੂਆਂ ਦੀ ਘੱਟੋ-ਘੱਟ ਸੀਮਾ ਤੱਕ ਨਹੀਂ ਪਹੁੰਚ ਜਾਂਦੀ, ਉਦੋਂ ਤੱਕ ਇਸਨੂੰ ਸਰਚ ਤੋਂ ਲੁਕਾ ਕੇ ਰੱਖਿਆ ਜਾਵੇ। ਤਰਕ ਸਪੱਸ਼ਟ ਸੀ:

  • < 3 listings → ਇੱਕ noindex ਮੈਟਾ ਟੈਗ ਜੋੜੋ
  • ≥ 3 listings → ਟੈਗ ਹਟਾਓ (ਇੰਡੈਕਸਿੰਗ ਦੀ ਇਜਾਜ਼ਤ ਦਿਓ)

ਸ਼ੁਰੂ ਵਿੱਚ ਇਸ ਨੇ Google ਦੇ ਨਤੀਜਿਆਂ ਵਿੱਚੋਂ ਘੱਟ ਮੁੱਲ ਵਾਲੇ (thin) ਪੇਜਾਂ ਨੂੰ ਬਾਹਰ ਰੱਖਿਆ। ਸਮੱਸਿਆ ਉਦੋਂ ਆਈ ਜਦੋਂ ਲਿਸਟਿੰਗਾਂ ਦੀ ਮਿਆਦ ਖਤਮ ਹੋਣ ਲੱਗੀ। ਇੱਕ ਪੇਜ ਜਿਸ ਵਿੱਚ ਇੱਕ ਦਿਨ ਪੰਜ ਲਿਸਟਿੰਗਾਂ ਸਨ, ਉਹ ਅਗਲੇ ਦਿਨ ਦੋ 'ਤੇ ਡਿੱਗ ਸਕਦੀਆਂ ਸਨ, ਜਿਸ ਨਾਲ ਉਹ ਤੁਰੰਤ noindex ਵਿੱਚ ਬਦਲ ਜਾਂਦੀਆਂ ਸਨ। Google ਨੇ ਇਸ ਦੀ ਪਾਲਣਾ ਕੀਤੀ, URL ਨੂੰ ਆਪਣੇ ਇੰਡੈਕਸ ਤੋਂ ਹਟਾ ਦਿੱਤਾ, ਅਤੇ ਪੇਜ ਨੇ ਆਪਣੀ ਸਾਰੀ ਰੈਂਕਿੰਗ ਗੁਆ ਦਿੱਤੀ ਜੋ ਉਸਨੇ ਬਣਾਈ ਸੀ। ਜਦੋਂ ਕੋਈ ਨਵੀਂ ਲਿਸਟਿੰਗ ਆਉਂਦੀ ਸੀ, ਤਾਂ ਪੇਜ ਦੁਬਾਰਾ ਇੰਡੈਕਸ ਕਰਨ ਯੋਗ ਹੋ ਜਾਂਦੀ ਸੀ, ਪਰ ਦੁਬਾਰਾ ਸ਼ਾਮਲ ਹੋਣ ਦੀ ਪ੍ਰਕਿਰਿਆ ਵਿੱਚ ਹਫ਼ਤੇ ਲੱਗ ਜਾਂਦੇ ਸਨ।

ਨਤੀਜਾ ਇੱਕ ਲਗਾਤਾਰ “on-off” ਚੱਕਰ ਸੀ: ਪੇਜ ਇੰਡੈਕਸ ਵਿੱਚ ਦਾਖਲ ਹੁੰਦੇ, ਗਾਇਬ ਹੋ ਜਾਂਦੇ, ਦੁਬਾਰਾ ਦਾਖਲ ਹੁੰਦੇ, ਅਤੇ ਇਹੀ ਚਲਦਾ ਰਹਿੰਦਾ।

ਇੱਕ-ਤਰਫਾ “unlock” ਫਿਕਸ

ਮੁੱਖ 결ਣ (flaw) ਇਹ ਸੀ ਕਿ ਨਿਯਮ ਕੋਲ ਕੋਈ ਯਾਦਦਾਸ਼ਤ ਨਹੀਂ ਸੀ; ਇਹ ਹਰ ਬੇਨਤੀ (request) 'ਤੇ ਸੀਮਾ ਦੀ ਮੁੜ-ਗਣਨਾ ਕਰਦਾ ਸੀ। ਟੀਮ ਨੇ ਇੱਕ ਛੋਟੀ ਡੇਟਾਬੇਸ ਟੇਬਲ—seo_unlocks—ਸ਼ੁਰੂ ਕੀਤਾ ਜੋ ਰਿਕਾਰਡ ਕਰਦਾ ਹੈ ਕਿ ਪੇਜ ਪਹਿਲੀ ਵਾਰ ਤਿੰਨ ਲਿਸਟਿੰਗਾਂ ਦੇ ਅੰਕ ਤੱਕ ਕਦੋਂ ਪਹੁੰਚਿਆ। ਨਵਾਂ ਵਰਕਫਲੋਅ ਇਹ ਹੈ:

  1. ਲਿਸਟਿੰਗ ਦੀ ਗਿਣਤੀ ਦੀ ਜਾਂਚ ਕਰੋ। ਜੇਕਰ ਪੇਜ ਵਿੱਚ ਤਿੰਨ ਜਾਂ ਇਸ ਤੋਂ ਵੱਧ ਸਰਗਰਮ ਲਿਸਟਿੰਗਾਂ ਹਨ, ਤਾਂ ਅੱਗੇ ਵਧੋ।
  2. ਇੱਕ unlock ਰੋਅ (row) ਲਿਖੋ। seo_unlocks ਵਿੱਚ ਉਸ ਪੇਜ ਲਈ ਇੱਕ ਰਿਕਾਰਡ ਦਰਜ ਕਰੋ।
  3. ਪੇਜ ਨੂੰ ਸਥਾਈ ਤੌਰ 'ਤੇ ਇੰਡੈਕਸ ਕਰਨ ਯੋਗ ਮੰਨੋ। ਭਾਵੇਂ ਬਾਅਦ ਵਿੱਚ ਗਿਣਤੀ ਤਿੰਨ ਤੋਂ ਘੱਟ ਹੋ ਜਾਵੇ, ਇੱਕ unlock ਰੋਅ ਦੀ ਮੌਜੂਦਗੀ ਪੇਜ ਨੂੰ noindex ਪ੍ਰਕਿਰਿਆ ਤੋਂ ਬਾਹਰ ਰੱਖਦੀ ਹੈ।

ਕਿਉਂਕਿ unlock ਸਿਰਫ਼ ਇੱਕ ਵਾਰ ਹੀ ਲਿਖਿਆ ਜਾ ਸਕਦਾ ਹੈ, ਇਸ ਲਈ ਇੱਕ ਪੇਜ “noindex” ਤੋਂ “index” ਵਿੱਚ ਜਾ ਸਕਦਾ ਹੈ ਪਰ ਕਦੇ ਵਾਪਸ ਨਹੀਂ। ਟੀਮ ਨੇ ਸੁਰੱਖਿਆ ਉਪਾਅ (safeguards) ਜੋੜੇ ਤਾਂ ਜੋ ਫਿਲਟਰ ਕੀਤੇ ਗਏ URL (ਜਿਵੇਂ ਕਿ ਕੀਮਤ ਸੀਮਾ ਵਾਲੇ ਸਰਚ ਨਤੀਜੇ) ਆਪਣੇ ਮਾਪੀ (parent) ਕੈਟੇਗਰੀਆਂ ਲਈ unlock ਨਾ ਬਣਾ ਸਕਣ, ਅਤੇ ਡੇਟਾਬੇਸ ਦੀ विफलता (failure) ਕਾਰਨ ਪੂਰੀ ਸਾਈਟ ਨੂੰ ਕਰੈਸ਼ ਹੋਣ ਤੋਂ ਰੋਕਣ ਲਈ ਡੇਟਾਬੇਸ ਕਾਲ ਨੂੰ try/catch ਬਲਾਕ ਵਿੱਚ ਲਪੇਟਿਆ ਗਿਆ।

ਕ੍ਰੌਲ ਬਜਟ (crawl budget) ਅਤੇ ਥਿਨ ਪੇਜਾਂ ਲਈ ਇਸਦਾ ਕੀ ਮਤਲਬ ਹੈ

ਇੱਕ ਆਮ ਗਲਤਫਹਿਮੀ ਇਹ ਹੈ ਕਿ noindex ਕ੍ਰੌਲ ਬਜਟ ਬਚਾਉਂਦਾ ਹੈ। Google ਨੂੰ ਅਜੇ ਵੀ ਪੇਜ ਨੂੰ fetch ਕਰਨਾ ਪੈਂਦਾ ਹੈ, ਟੈਗ ਨੂੰ ਪੜ੍ਹਨਾ ਪੈਂਦਾ ਹੈ, ਅਤੇ ਫਿਰ ਇਸਨੂੰ ਇੰਡੈਕਸ ਤੋਂ ਹਟਾਉਣਾ ਪੈਂਦਾ ਹੈ। ਜੇਕਰ ਉਦੇਸ਼ Google ਨੂੰ ਪੂਰੇ URL ਪੈਟਰਨ ਦੀ ਬੇਨਤੀ ਕਰਨ ਤੋਂ ਰੋਕਣਾ ਹੈ, ਤਾਂ ਸਹੀ ਸਾਧਨ robots.txt ਹੈ। noindex ਦੀ ਵਰਤੋਂ ਉਦੋਂ ਹੀ ਕਰੋ ਜਦੋਂ ਤੁਸੀਂ ਚਾਹੁੰਦੇ ਹੋ ਕਿ Google ਪੇਜ ਨੂੰ ਦੇਖੇ ਪਰ ਉਸਨੂੰ ਸਰਚ ਨਤੀਜਿਆਂ ਵਿੱਚ ਦਿਖਾਵੇ ਨਹੀਂ।

ਡਾਇਰੈਕਟਰੀਆਂ, ਜੌਬ ਬੋਰਡਾਂ, ਅਤੇ ਮਾਰਕੀਟਪਲੇਸਾਂ ਲਈ ਜੋ ਵੱਡੀ ਗਿਣਤੀ ਵਿੱਚ ਆਟੋ-ਜਨਰੇਟਡ ਪੇਜਾਂ 'ਤੇ ਨਿਰਭਰ ਕਰਦੇ ਹਨ, ਸਬਕ ਸਪੱਸ਼ਟ ਹੈ: ਥਿਨ-ਪੇਜ ਨਿਯਮਾਂ ਨੂੰ ਇੱਕ ਪਰਸਿਸਟੈਂਸ ਲੇਅਰ (persistence layer) ਦੇ ਨਾਲ ਜੋੜਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ ਜੋ ਯਾਦ ਰੱਖੇ ਕਿ ਪੇਜ ਨੇ ਇੰਡੈਕਸ ਵਿੱਚ ਆਪਣੀ ਜਗ੍ਹਾ ਕਦੋਂ ਬਣਾਈ ਹੈ। ਉਸ ਯਾਦਦਾਸ਼ਤ ਤੋਂ ਬਿਨਾਂ, ਕੰਟੈਂਟ ਵਿੱਚ ਇੱਕ ਅਸਥਾਈ ਗਿਰਾਵਟ ਕਾਰਨ ਪੇਜ ਆਪਣੀ ਬਣਾਈ ਹੋਈ ਰੈਂਕਿੰਗ ਗੁਆ ਸਕਦਾ ਹੈ, ਅਤੇ ਦੁਬਾਰਾ ਸ਼ਾਮਲ ਹੋਣ ਵਿੱਚ ਹਫ਼ਤੇ ਲੱਗ ਸਕਦੇ ਹਨ।

ਸਿੱਖਿਆ (Takeaway)

ਇੱਕ ਸਥਿਰ “if count < 3 then noindex” ਨਿਯਮ ਡਾਇਨਾਮਿਕ ਲਿਸਟਿੰਗ ਸਾਈਟਾਂ ਲਈ SEO ਅਸਥਿਰਤਾ ਪੈਦਾ ਕਰਦਾ ਹੈ। ਇੱਕ ਇੱਕ-ਤਰਫਾ unlock ਰਿਕਾਰਡ ਜੋੜਨ ਨਾਲ ਨਿਯਮ ਨੂੰ ਯਾਦਦਾਸ਼ਤ ਮਿਲਦੀ ਹੈ, ਜਿਸ ਨਾਲ ਪੇਜਾਂ ਨੂੰ ਲਿਸਟਿੰਗਾਂ ਵਿੱਚ ਉਤਾਰ-ਚੜ੍ਹਾਅ ਹੋਣ ਦੇ ਬਾਵਜੂਦ ਆਪਣੀ ਇੰਡੈਕਸ ਸਥਿਤੀ ਕਮਾਉਣ ਅਤੇ ਬਣਾਈ ਰੱਖਣ ਦੀ ਇਜਾਜ਼ਤ ਮਿਲਦੀ ਹੈ। ਅਸਲ ਕ੍ਰੌਲ-ਬਜਟ ਬਚਤ ਲਈ ਇਸਨੂੰ robots.txt ਦੀ ਸਹੀ ਵਰਤੋਂ ਨਾਲ ਜੋੜੋ, ਅਤੇ ਤੁਸੀਂ ਰੈਂਕਿੰਗ ਅਤੇ ਸਰਵਰ ਸਰੋਤਾਂ ਦੋਵਾਂ ਦੀ ਰੱਖਿਆ ਕਰ ਸਕਦੇ ਹੋ।