ਮੈਂ ਇੱਕ ਅਜਿਹੀ ਵੈੱਬਸਾਈਟ ਬਣਾਈ ਹੈ ਜਿਸਦਾ ਮਕਸਦ AI ਸਹਾਇਕਾਂ (assistants) ਦੁਆਰਾ ਹਵਾਲਾ ਦਿੱਤਾ ਜਾਣਾ ਹੈ ਅਤੇ, ਅੰਦਾਜ਼ਾ ਲਗਾਉਣ ਦੀ ਬਜਾਏ, ਮੈਂ ਤਿੰਨ ਵਿਆਪਕ ਤੌਰ 'ਤੇ ਸਿਫਾਰਸ਼ ਕੀਤੇ ਗਏ ਸਿਗਨਲਾਂ ਨੂੰ ਲਾਗੂ ਕੀਤਾ: ਇੱਕ robots.txt ਐਂਟਰੀ ਜੋ GPT-ਸਟਾਈਲ crawlers ਨੂੰ ਅੰਦਰ ਆਉਣ ਦਿੰਦੀ ਹੈ, ਇੱਕ llms.txt ਫਾਈਲ ਜੋ ਹਰ ਪੇਜ ਦੀ ਸੂਚੀ ਦਿੰਦੀ ਹੈ, ਅਤੇ JSON-LD schema ਜੋ ਸਮੱਗਰੀ ਦਾ ਵਰਣਨ ਕਰਦਾ ਹੈ। ਹਰੇਕ ਦੀ ਜਾਂਚ ਕਰਨ ਤੋਂ ਬਾਅਦ, ਮੈਂ ਪਾਇਆ ਕਿ ਸਿਰਫ਼ ਇੱਕ ਹੀ ਬਿਨਾਂ ਕਿਸੇ ਚੇਤਾਵਨੀ ਦੇ ਫੇਲ ਹੋ ਸਕਦਾ ਹੈ, ਅਤੇ ਬਾਕੀ ਉਹ ਨਹੀਂ ਕਰਦੇ ਜੋ ਜ਼ਿਆਦਾਤਰ ਲੋਕ ਦਾਅਵਾ ਕਰਦੇ ਹਨ।
ਇਹ ਤਿੰਨ ਸਿਗਨਲ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹਨ
ਵੈੱਬਮਾਸਟਰਾਂ ਨੂੰ ਦੱਸਿਆ ਗਿਆ ਹੈ ਕਿ AI-ਕੇਂਦਰਿਤ crawlers ਨੂੰ ਸਪੱਸ਼ਟ ਇਜਾਜ਼ਤ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ, ਇੱਕ ਪਲੇਨ-ਟੈਕਸਟ "llms.txt" ਇੰਡੈਕਸ ਲਾਰਜ ਲੈਂਗੂਏਜ ਮਾਡਲਾਂ (LLMs) ਨੂੰ ਢੁਕਵੇਂ ਪੈਰੇ ਲੱਭਣ ਵਿੱਚ ਮਦਦ ਕਰਦਾ ਹੈ, ਅਤੇ JSON-LD ਸਟ੍ਰਕਚਰਡ ਡੇਟਾ ਹਵਾਲਾ ਦਿੱਤੇ ਜਾਣ ਦੀ ਸੰਭਾਵਨਾ ਨੂੰ ਵਧਾਉਂਦਾ ਹੈ। ਵਾਅਦਾ ਸਧਾਰਨ ਹੈ: ਇਹ ਫਾਈਲਾਂ ਜੋੜੋ, ਅਤੇ ਤੁਹਾਡੀ ਸਾਈਟ AI-ਨਿਰਮਿਤ ਜਵਾਬਾਂ ਵਿੱਚ ਦਿਖਾਈ ਦੇਣ ਲੱਗ ਜਾਵੇਗੀ, ਜਿਸ ਨਾਲ ਟ੍ਰੈਫਿਕ ਅਤੇ ਬ੍ਰਾਂਡ ਦੀ ਦਿੱਖ ਵਧੇਗੀ।
1. robots.txt ਵਿੱਚ AI crawlers ਨੂੰ ਇਜਾਜ਼ਤ ਦੇਣਾ
robots.txt ਦੀ ਉਹ ਲਾਈਨ ਜੋ GPTBot (ਜਾਂ ਕੋਈ ਹੋਰ AI ਬੋਟ) ਦਾ ਜ਼ਿਕਰ ਕਰਦੀ ਹੈ, ਉਹ ਸਿਰਫ਼ ਇੱਕ ਬੇਨਤੀ ਹੈ। ਜੇਕਰ ਕੋਈ ਕੰਟੈਂਟ ਡਿਲੀਵਰੀ ਨੈੱਟਵਰਕ (CDN) ਜਾਂ ਫਾਇਰਵਾਲ ਬੋਟ ਨੂੰ ਰੋਕ ਦਿੰਦੀ ਹੈ, ਤਾਂ ਬੇਨਤੀ ਸਾਈਟ ਤੱਕ ਕਦੇ ਪਹੁੰਚਦੀ ਹੀ ਨਹੀਂ ਹੈ, ਅਤੇ ਕਰੌਲਰ ਫਾਈਲ ਨੂੰ ਪੜ੍ਹ ਹੀ ਨਹੀਂ ਸਕਦਾ। ਇਹ ਜਾਣਨ ਦਾ ਇੱਕੋ ਇੱਕ ਭਰੋਸੇਮੰਦ ਤਰੀਕਾ ਕਿ ਕੀ ਬੋਟ ਤੁਹਾਨੂੰ ਐਕਸੈਸ ਕਰ ਸਕਦਾ ਹੈ, ਹਰੇਕ ਮੁੱਖ ਬੋਟ ਲਈ HTTP ਸਟੇਟਸ ਕੋਡ ਦੀ ਜਾਂਚ ਕਰਨਾ ਹੈ। 403 (forbidden) ਜਾਂ 503 (service unavailable) ਜਵਾਬ ਦਾ ਮਤਲਬ ਹੈ ਕਿ ਬਾਕੀ ਸਾਰਾ ਪ੍ਰਬੰਧ ਵਿਅਰਥ ਹੈ—ਨਾ ਬੋਟ ਹੋਵੇਗਾ, ਨਾ ਇੰਡੈਕਸਿੰਗ, ਅਤੇ ਨਾ ਹੀ ਕੋਈ ਹਵਾਲਾ।
2. llms.txt ਫਾਈਲ
ਇੱਕ llms.txt ਫਾਈਲ ਸਿਰਫ਼ URL ਦੀ ਇੱਕ markdown ਸੂਚੀ ਹੈ, ਜਿਸਦਾ ਮਕਸਦ LLMs ਨੂੰ ਸਾਈਟ ਦਾ ਇੱਕ ਸਾਫ਼ ਨਕਸ਼ਾ ਦੇਣਾ ਹੈ ਤਾਂ ਜੋ ਉਹਨਾਂ ਨੂੰ ਸਿਰਫ਼ HTML ਤੋਂ ਨੈਵੀਗੇਸ਼ਨ ਦਾ ਅੰਦਾਜ਼ਾ ਨਾ ਲਗਾਉਣਾ ਪਵੇ। ਅਸਲ ਵਿੱਚ, Google ਦਾ ਦਸਤਾਵੇਜ਼ ਕਹਿੰਦਾ ਹੈ ਕਿ ਇਹ ਫਾਈਲ ਨੂੰ ਨਜ਼ਰਅੰਦਾਜ਼ ਕਰਦਾ ਹੈ, ਅਤੇ ਕਿਸੇ ਵੀ ਵੱਡੇ ਸਰਚ ਇੰਜਣ ਨੇ ਹਵਾਲੇ ਦੇ ਉਦੇਸ਼ਾਂ ਲਈ ਇਸਦੀ ਵਰਤੋਂ ਕਰਨ ਦਾ ਵਾਅਦਾ ਨਹੀਂ ਕੀਤਾ ਹੈ। ਇਸਨੂੰ ਰੱਖਣ ਵਿੱਚ ਲਗਭਗ ਕੁਝ ਵੀ ਖਰਚ ਨਹੀਂ ਹੁੰਦਾ, ਅਤੇ ਇਹ ਕਸਟਮ AI agents ਲਈ ਸਹਾਈ ਹੋ ਸਕਦਾ ਹੈ, ਪਰ ਇਸਨੂੰ ਵਧੇਰੇ AI ਹਵਾਲਿਆਂ ਲਈ ਇੱਕ ਸ਼ਾਰਟਕੱਟ ਵਜੋਂ ਨਹੀਂ ਮਸ਼ਹੂਰ ਕਰਨਾ ਚਾਹੀਦਾ।
3. JSON-LD schema
JSON-LD ਸਟ੍ਰਕਚਰਡ ਡੇਟਾ—ਲੇਖਕ ਦੇ ਨਾਮ, ਪ੍ਰਕਾਸ਼ਨ ਦੀਆਂ ਮਿਤੀਆਂ, ਉਤਪਾਦ ID—ਸਿੱਧੇ ਪੇਜ ਵਿੱਚ ਇਨਬੈਡ ਕਰਦਾ ਹੈ। ਬਹੁਤ ਸਾਰੇ ਮਾਰਕੀਟਰ ਮੰਨਦੇ ਹਨ ਕਿ schema ਜੋੜਨ ਨਾਲ ਉਹਨਾਂ ਦੇ ਪੇਜ AI ਜਵਾਬਾਂ ਵਿੱਚ ਵਧੇਰੇ ਵਾਰ ਦਿਖਾਈ ਦੇਣਗੇ, ਪਰ 1,885 ਪੇਜਾਂ ਦੇ ਅਧਿਐਨ ਵਿੱਚ ਸਿਰਫ਼ schema markup ਤੋਂ ਹਵਾਲਿਆਂ ਵਿੱਚ ਕੋਈ ਮਾਪਣਯੋਗ ਵਾਧਾ ਨਹੀਂ ਪਾਇਆ ਗਿਆ। JSON-LD ਦੀ ਅਸਲ ਕੀਮਤ entity resolution ਵਿੱਚ ਹੈ: ਇਹ ਮਸ਼ੀਨ ਨੂੰ ਦੱਸਦਾ ਹੈ ਕਿ ਇੱਕ ਪੇਜ 'ਤੇ "Jane Doe" ਦੂਜੇ ਪੇਜ 'ਤੇ ਉਹੀ "Jane Doe" ਹੈ, ਜਿਸ ਨਾਲ ਸਮਾਨ ਨਾਮ ਵਾਲੇ ਲੋਕਾਂ ਜਾਂ ਉਤਪਾਦਾਂ ਵਿਚਕਾਰ ਉਲਝਣ ਤੋਂ ਬਚਿਆ ਜਾ ਸਕਦਾ ਹੈ।
ਅਸਲ ਰੁਕਾਵਟ: indexing
ਤਿੰਨੋਂ ਸਿਗਨਲ ਸਿਰਫ਼ ਬੁਨਿਆਦੀ ਪ੍ਰਬੰਧ ਹਨ; ਉਹ ਉਦੋਂ ਹੀ ਕੰਮ ਕਰਦੇ ਹਨ ਜੇਕਰ ਪੇਜ ਪਹਿਲਾਂ ਹੀ ਇੰਡੈਕਸ ਕੀਤਾ ਗਿਆ ਹੋਵੇ। ਇੱਕ ਪੇਜ ਜੋ ਕਦੇ ਵੀ ਇੰਡੈਕਸ ਵਿੱਚ ਨਹੀਂ ਆਉਂਦਾ, ਉਸਨੂੰ ਪ੍ਰਾਪਤ ਨਹੀਂ ਕੀਤਾ ਜਾ ਸਕਦਾ, ਚਾਹੇ ਤੁਸੀਂ ਕਿੰਨੇ ਵੀ ਕਰੌਲਰ ਅਨੁਮਤੀਆਂ ਜਾਂ schema ਟੈਗ ਜੋੜ ਲਵੋ। ਇੰਡੈਕਸਿੰਗ ਦੀ ਸਿਹਤ ਦਾ ਸਭ ਤੋਂ ਭਰੋਸੇਮੰਦ ਸੂਚਕ Google Search Console (ਜਾਂ ਹੋਰ ਇੰਜਣਾਂ ਲਈ ਸਮਾਨ ਸਾਧਨ) ਵਿੱਚ ਕਵਰੇਜ ਰਿਪੋਰਟ ਹੈ। ਜੇਕਰ ਕੋਈ ਪੇਜ "not indexed" ਵਜੋਂ ਦਿਖਾਈ ਦਿੰਦਾ ਹੈ, ਤਾਂ ਤੁਹਾਨੂੰ ਕਿਸੇ ਵੀ AI-ਵਿਸ਼ੇਸ਼ ਸਿਗਨਲ ਬਾਰੇ ਚਿੰਤਾ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਉਸਨੂੰ ਠੀਕ ਕਰਨ ਦੀ ਲੋੜ ਹੈ।
ਇੱਕ ਵਿਹਾਰਕ ਚੈੱਕਲਿਸਟ
- Verify crawler access – GPTBot, ClaudeBot, ਜਾਂ ਕਿਸੇ ਹੋਰ AI ਕਰੌਲਰ ਲਈ HTTP ਰਿਸਪਾਂਸ ਦੀ ਜਾਂਚ ਕਰੋ ਜਿਸਦੀ ਤੁਹਾਨੂੰ ਚਿੰਤਾ ਹੈ। ਇਹ ਕਦਮ ਚੁੱਪਚਾਪ ਫੇਲ ਹੋ ਸਕਦਾ ਹੈ; ਬਲਾਕ ਕਰਨ ਨਾਲ ਤੁਹਾਡੇ ਐਨਾਲਿਟਿਕਸ ਵਿੱਚ ਕੋਈ ਚੇਤਾਵਨੀ ਨਹੀਂ ਆਵੇਗੀ।
- Confirm index coverage – ਇਹ ਦੇਖਣ ਲਈ Search Console ਦੀ ਵਰਤੋਂ ਕਰੋ ਕਿ ਕਿਹੜੇ ਪੇਜ ਇੰਡੈਕਸ ਕੀਤੇ ਗਏ ਹਨ, ਕਿਹੜੇ ਬਾਹਰ ਰੱਖੇ ਗਏ ਹਨ, ਅਤੇ ਕਿਉਂ। ਪਹਿਲਾਂ ਕਿਸੇ ਵੀ “crawl errors” ਜਾਂ “noindex” ਨਿਰਦੇਸ਼ਾਂ ਨੂੰ ਹੱਲ ਕਰੋ।
- Add the plumbing – ਇੱਕ ਵਾਰ ਐਕਸੈਸ ਅਤੇ ਇੰਡੈਕਸਿੰਗ ਪੱਕੀ ਹੋ ਜਾਣ ਤੋਂ ਬਾਅਦ, llms.txt ਅਤੇ JSON-LD ਨੂੰ ਸ਼ਾਮਲ ਕਰੋ। ਉਹਨਾਂ ਨੂੰ ਹਵਾਲੇ ਦੀ ਗਾਰੰਟੀ ਦੇਣ ਦੀ ਬਜਾਏ ਘੱਟ ਰੱਖ-ਰਖਾਅ ਵਾਲੇ ਸਹਾਇਕਾਂ ਵਜੋਂ ਮੰਨੋ।
ਵਿਰੋਧੀ ਵਿਚਾਰ
ਕੁਝ ਵਿਕਰੇਤਾ ਅਜੇ ਵੀ llms.txt ਜਨਰੇਟਰਾਂ ਅਤੇ schema ਪਲੱਗਇਨਾਂ ਨੂੰ AI ਲਈ SEO ਬੂਸਟਰ ਵਜੋਂ ਮਾਰਕੀਟ ਕਰਦੇ ਹਨ। ਮੇਰੇ ਦੁਆਰਾ ਇਕੱਠਾ ਕੀਤਾ ਗਿਆ ਡੇਟਾ, ਅਤੇ ਪ੍ਰਮੁੱਖ ਸਰਚ ਇੰਜਣਾਂ ਦਾ ਅਧਿਕਾਰਤ ਰੁਖ, ਸੁਝਾਅ ਦਿੰਦਾ ਹੈ ਕਿ ਉਹ ਦਾਅਵੇ ਵਧਾ-ਚੜ੍ਹਾ ਕੇ ਕੀਤੇ ਗਏ ਹਨ। ਇਹ ਟੂਲ ਨੁਕਸਾਨਦੇਹ ਨਹੀਂ ਹਨ, ਪਰ ਉਹਨਾਂ ਨੂੰ AI-citation ਰਣਨੀਤੀ ਦਾ ਮੁੱਖ ਕੇਂਦਰ ਨਹੀਂ ਹੋਣਾ ਚਾਹੀਦਾ।
ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ
ਕਰੌਲਰ ਲੌਗਸ ਦੀ ਨਿਗਰਾਨੀ ਕਰੋ, Search Console ਅਲਰਟਾਂ 'ਤੇ ਨਜ਼ਰ ਰੱਖੋ, ਅਤੇ ਪਾਈਪਲਾਈਨ ਨੂੰ ਚਲਦਾ ਰੱਖਣ ਲਈ ਸਮੇਂ-ਸਮੇਂ 'ਤੇ ਵੈਲੀਡੇਸ਼ਨ ਟੂਲਸ ਨਾਲ ਆਪਣੇ JSON-LD ਦੀ ਜਾਂਚ ਕਰੋ।
Takeaway: ਜੇਕਰ ਤੁਸੀਂ ਚਾਹੁੰਦੇ ਹੋ ਕਿ ਤੁਹਾਡੀ ਸਾਈਟ ਦਾ AI ਦੁਆਰਾ ਹਵਾਲਾ ਦਿੱਤਾ ਜਾਵੇ, ਤਾਂ llms.txt ਅਤੇ schema ਨੂੰ ਜਾਦੂਈ ਟਿਕਟਾਂ ਵਜੋਂ ਦੇਖਣਾ ਬੰਦ ਕਰੋ। ਯਕੀਨੀ ਬਣਾਓ ਕਿ ਬੋਟ ਅਸਲ ਵਿੱਚ ਤੁਹਾਡੇ ਤੱਕ ਪਹੁੰਚ ਸਕਦੇ ਹਨ ਅਤੇ ਤੁਹਾਡੇ ਪੇਜ ਇੰਡੈਕਸ ਕੀਤੇ ਗਏ ਹਨ; ਸਿਰਫ਼ ਉਦੋਂ ਹੀ ਵਾਧੂ ਫਾਈਲਾਂ ਆਪਣੀ ਨਿਮਾਣੀ, ਸਹਾਇਕ ਭੂਮਿਕਾ ਨਿਭਾਉਣਗੀਆਂ।
ਸਰੋਤ: dev.to 'ਤੇ ਅਸਲ ਪੋਸਟ
