GPTBot ਨੂੰ ਬਲਾਕ ਕਰਨ ਨਾਲ ਤੁਹਾਡੀ ਸਾਈਟ ChatGPT ਦੇ ਜਵਾਬ ਵਾਲੇ ਪੈਨ (answer pane) ਤੋਂ ਗਾਇਬ ਨਹੀਂ ਹੁੰਦੀ। ਉਹ ਸਾਈਟ ਮਾਲਕ ਜਿਨ੍ਹਾਂ ਨੇ ਬੋਟ ਦੇ ਵਿਰੁੱਧ robots.txt ਨਿਯਮ ਜੋੜੇ ਸਨ, ਉਹ ਇਹ ਦੇਖ ਕੇ ਹੈਰਾਨ ਰਹਿ ਗਏ ਕਿ ਜਦੋਂ ਉਪਭੋਗਤਾ ChatGPT ਨੂੰ ਵਿਸ਼ੇ ਬਾਰੇ ਪੁੱਛਦੇ ਹਨ, ਤਾਂ ਉਨ੍ਹਾਂ ਦੇ ਲੇਖ ਅਜੇ ਵੀ ਲਿੰਕਾਂ ਅਤੇ ਅੰਸ਼ਾਂ (excerpts) ਦੇ ਨਾਲ ਦਿਖਾਈ ਦਿੰਦੇ ਹਨ। ਬਲਾਕ ਕੰਮ ਕਰ ਰਿਹਾ ਸੀ – ਬੱਸ ਇਹ ਗਲਤ ਕਰੌਲਰ ਨੂੰ ਰੋਕ ਰਿਹਾ ਸੀ।
ਟ੍ਰੇਨਿੰਗ ਬੋਟਸ ਬਨਾਮ ਸਿਟੇਸ਼ਨ ਬੋਟਸ (Training bots vs. citation bots)
AI ਪ੍ਰੋਵਾਈਡਰ ਦੋ ਵੱਖ-ਵੱਖ ਕਿਸਮਾਂ ਦੇ ਕਰੌਲਰ ਚਲਾਉਂਦੇ ਹਨ:
- Training bots ਜਨਤਕ ਤੌਰ 'ਤੇ ਉਪਲਬਧ ਪੇਜਾਂ ਨੂੰ ਸਕ੍ਰੈਪ ਕਰਦੇ ਹਨ, ਟੈਕਸਟ ਨੂੰ ਅੰਦਰ ਲੈਂਦੇ ਹਨ, ਅਤੇ ਇਸਦੀ ਵਰਤੋਂ ਲਾਰਜ ਲੈਂਗੂਏਜ ਮਾਡਲਾਂ ਨੂੰ ਫਾਈਨ-ਟਿਊਨ ਕਰਨ ਲਈ ਕਰਦੇ ਹਨ। ਉਹ ਕਦੇ ਵੀ ਸਰੋਤ ਦਾ ਲਿੰਕ ਵਾਪਸ ਨਹੀਂ ਕਰਦੇ, ਅਤੇ ਉਹ ਸਾਈਟ ਲਈ ਕੋਈ ਟ੍ਰੈਫਿਕ ਪੈਦਾ ਨਹੀਂ ਕਰਦੇ।
- Citation bots ਕੁਐਰੀ (query) ਦੇ ਸਮੇਂ ਕੰਮ ਕਰਦੇ ਹਨ। ਜਦੋਂ ਕੋਈ ਉਪਭੋਗਤਾ ਸਵਾਲ ਪੁੱਛਦਾ ਹੈ, ਤਾਂ ਬੋਟ ਵੈੱਬ 'ਤੇ ਖੋਜ ਕਰਦਾ ਹੈ, ਇੱਕ ਪ੍ਰਸੰਗਿਕ ਸਨਿਪੈਟ (snippet) ਕੱਢਦਾ ਹੈ, ਸਰੋਤ ਦਾ ਨਾਮ ਅਤੇ URL ਜੋੜਦਾ ਹੈ, ਅਤੇ ਇਸਨੂੰ ਚੈਟ ਵਿੰਡੋ ਵਿੱਚ ਪੇਸ਼ ਕਰਦਾ ਹੈ। ਉਹ ਵਿਜ਼ਿਟਰਾਂ ਨੂੰ ਤੁਹਾਡੀ ਸਾਈਟ 'ਤੇ ਲਿਆ ਸਕਦੇ ਹਨ।
ਜੇਕਰ ਤੁਸੀਂ ਟ੍ਰੇਨਿੰਗ ਬੋਟ ਨੂੰ ਬਲਾਕ ਕਰਦੇ ਹੋ, ਤਾਂ ਮਾਡਲ ਹੁਣ ਤੁਹਾਡੇ ਪੇਜਾਂ ਤੋਂ ਨਹੀਂ ਸਿੱਖ ਸਕਦਾ। ਜੇਕਰ ਤੁਸੀਂ ਸਿਟੇਸ਼ਨ ਬੋਟ ਨੂੰ ਬਲਾਕ ਕਰਦੇ ਹੋ, ਤਾਂ ਪੇਜ ChatGPT ਦੇ ਲਾਈਵ ਜਵਾਬਾਂ ਤੋਂ ਗਾਇਬ ਹੋ ਜਾਂਦਾ ਹੈ। ਉਲਝਣ ਇਸ ਲਈ ਪੈਦਾ ਹੁੰਦੀ ਹੈ ਕਿਉਂਕਿ ਬਹੁਤ ਸਾਰੀਆਂ ਸਾਈਟਾਂ "GPTBot" ਨੂੰ ਬਲਾਕ ਕਰ ਦਿੰਦੀਆਂ ਹਨ ਬਿਨਾਂ ਇਹ ਜਾਣੇ ਕਿ ਉਹੀ ਨਾਮ ਸਿਟੇਸ਼ਨ ਵਰਕਫਲੋ ਵਿੱਚ ਨਹੀਂ ਆਉਂਦਾ।
ਵੱਡੇ ਖਿਡਾਰੀ ਆਪਣੇ ਕਰੌਲਰ ਕਿਵੇਂ ਵੰਡਦੇ ਹਨ
| ਪ੍ਰੋਵਾਈਡਰ | ਟ੍ਰੇਨਿੰਗ-ਬੋਟ ਦਾ ਨਾਮ | ਸਿਟੇਸ਼ਨ-ਬੋਟ ਦੇ ਨਾਮ |
|---|---|---|
| OpenAI | GPTBot | OAI-SearchBot, ChatGPT-User |
| Anthropic | ClaudeBot | Claude-SearchBot, Claude-User |
| Google-Extended | Googlebot | |
| Perplexity | — (ਦੋਵੇਂ ਸਿਟੇਸ਼ਨਾਂ ਲਈ ਵਰਤੇ ਜਾਂਦੇ ਹਨ) | PerplexityBot, Perplexity-User |
ਜੇਕਰ ਤੁਸੀਂ ਆਪਣੇ ਕੰਟੈਂਟ ਨੂੰ ਭਵਿੱਖ ਦੇ ਮਾਡਲ ਟ੍ਰੇਨਿੰਗ ਤੋਂ ਦੂਰ ਰੱਖਣਾ ਚਾਹੁੰਦੇ ਹੋ, ਤਾਂ ਸਿਰਫ਼ “Training-bot name” ਦੇ ਅਧੀਨ ਐਂਟਰੀਆਂ ਨੂੰ ਹੀ ਰੋਕਣ ਦੀ ਲੋੜ ਹੈ। ਜੇਕਰ ਤੁਸੀਂ ChatGPT ਦੇ ਰੀਅਲ-ਟਾਈਮ ਜਵਾਬਾਂ ਵਿੱਚ ਦਿਖਾਈ ਦੇਣਾ ਚਾਹੁੰਦੇ ਹੋ, ਤਾਂ ਸਿਟੇਸ਼ਨ ਬੋਟਸ ਨੂੰ ਅਨੁਮਤੀ ਦੇਣੀ ਚਾਹੀਦੀ ਹੈ।
robots.txt ਨੂੰ ਸਹੀ ਤਰੀਕੇ ਨਾਲ ਕੌਂਫਿਗਰ ਕਰਨਾ
ਇੱਕ ਆਮ Disallow: / ਲਾਈਨ ਜੋ “GPTBot” ਨੂੰ ਨਿਸ਼ਾਨਾ ਬਣਾਉਂਦੀ ਹੈ, ਉਹ ਟ੍ਰੇਨਿੰਗ ਕਰੌਲਰ ਨੂੰ ਬਲਾਕ ਕਰਦੀ ਹੈ ਪਰ ਸਿਟੇਸ਼ਨ ਬੋਟਸ ਨੂੰ ਅਛੂਤਾ ਛੱਡ ਦਿੰਦੀ ਹੈ। ਸਪੱਸ਼ਟ ਹੋਣ ਲਈ, ਅਜਿਹੇ ਨਿਯਮ ਜੋੜੋ ਜੋ ਹਰੇਕ ਟ੍ਰੇਨਿੰਗ ਬੋਟ ਨੂੰ ਰੋਕਦੇ ਹਨ ਅਤੇ ਸਿਟੇਸ਼ਨ ਬੋਟਸ ਨੂੰ ਇਜਾਜ਼ਤ ਦਿੰਦੇ ਹਨ:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
# Allow citation bots
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Googlebot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Perplexity-User
Allow: /
ਸਿਰਫ਼ ਆਮ "*" ਨੂੰ ਬਲਾਕ ਕਰਨ ਵਾਲੇ ਡਿਫੌਲਟ robots.txt 'ਤੇ ਭਰੋਸਾ ਨਾ ਕਰੋ। ਅੰਤਰ ਮਹੱਤਵਪੂਰਨ ਹੈ ਕਿਉਂਕਿ ਇੱਕ ਬਲੈਂਕੇਟ ਬਲਾਕ (blanket block) ਟ੍ਰੇਨਿੰਗ ਅਤੇ ਸਿਟੇਸ਼ਨ ਦੋਵਾਂ ਬੋਟਸ ਨੂੰ ਬਾਹਰ ਰੱਖੇਗਾ, ਜਿਸ ਨਾਲ ਉਹ ਟ੍ਰੈਫਿਕ ਕੱਟ ਜਾਵੇਗਾ ਜੋ AI-ਡਰਾਈਵਨ ਸਰਚ ਪ੍ਰਦਾਨ ਕਰ ਸਕਦਾ ਹੈ।
Cloudflare ਉਪਭੋਗਤਾਵਾਂ ਲਈ: AI Crawl Control ਪੈਨਲ ਦੀ ਵਰਤੋਂ ਕਰੋ
ਜੇਕਰ ਤੁਹਾਡਾ ਡੋਮੇਨ Cloudflare ਦੇ ਪਿੱਛੇ ਹੈ, ਤਾਂ ਤੁਹਾਨੂੰ robots.txt ਫਾਈਲ ਦੇ ਅੰਦਰ "Cloudflare management marker" ਦਿਖਾਈ ਦੇ ਸਕਦਾ ਹੈ। ਫਾਈਲ ਨੂੰ ਮੈਨੂਅਲੀ ਐਡਿਟ ਕਰਨ ਨਾਲ ਅਗਲੇ Cloudflare ਅਪਡੇਟ ਵੇਲੇ ਬਦਲਾਅ ਮਿਟ ਸਕਦੇ ਹਨ। ਇਸ ਦੀ ਬਜਾਏ, Cloudflare AI Crawl Control ਇੰਟਰਫੇਸ 'ਤੇ ਜਾਓ ਅਤੇ ਸਬੰਧਤ ਬੋਟਸ ਲਈ ਸਵਿੱਚਾਂ ਨੂੰ ਟੌਗਲ ਕਰੋ। ਪੈਨਲ ਪਿੱਛੇ ਕੰਮ ਕਰਦੇ ਹੋਏ ਸਹੀ ਡਾਇਰੈਕਟਿਵ ਲਿਖਦਾ ਹੈ ਅਤੇ ਉਹਨਾਂ ਨੂੰ ਸਥਾਈ ਰੱਖਦਾ ਹੈ।
ਇਹ ਸੂਖਮ ਅੰਤਰ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ
- ਬੌਧਿਕ-ਸੰਪੱਤੀ ਦੀ ਸੁਰੱਖਿਆ (Intellectual-property protection) – ਟ੍ਰੇਨਿੰਗ ਬੋਟਸ ਨੂੰ ਬਲਾਕ ਕਰਨ ਨਾਲ ਤੁਹਾਡੇ ਲਿਖੇ ਹੋਏ ਟੈਕਸਟ ਨੂੰ ਮੁਫ਼ਤ ਵਿੱਚ ਇਕੱਠਾ ਕਰਨ ਅਤੇ ਭਵਿੱਖ ਦੇ ਮਾਡਲਾਂ ਵਿੱਚ ਸ਼ਾਮਲ ਕਰਨ ਤੋਂ ਰੋਕਿਆ ਜਾ ਸਕਦਾ ਹੈ।
- ਰੈਫਰਲ ਟ੍ਰੈਫਿਕ (Referral traffic) – ਸਿਟੇਸ਼ਨ ਬੋਟਸ ਨੂੰ ਇਜਾਜ਼ਤ ਦੇਣ ਦਾ ਮਤਲਬ ਹੈ ਕਿ ChatGPT ਵਿੱਚ ਸਨਿਪੈਟ ਦੇਖਣ ਵਾਲੇ ਉਪਭੋਗਤਾ ਤੁਹਾਡੀ ਸਾਈਟ 'ਤੇ ਕਲਿੱਕ ਕਰ ਸਕਦੇ ਹਨ, ਜਿਸ ਨਾਲ ਅਸਲ ਵਿਜ਼ਿਟਰ ਆਉਂਦੇ ਹਨ।
- ਬ੍ਰਾਂਡ ਦੀ ਦਿੱਖ (Brand visibility) – AI-ਅਧਾਰਿਤ ਸਰਚ ਵਿੱਚ ਮੌਜੂਦਗੀ ਤੁਹਾਡੇ ਕੰਟੈਂਟ ਨੂੰ ਲੱਭਣਯੋਗ ਰੱਖਦੀ ਹੈ ਕਿਉਂਕਿ AI ਸਹਾਇਕ ਕਈ ਉਪਭੋਗਤਾਵਾਂ ਲਈ ਪ੍ਰਾਇਮਰੀ ਜਾਣਕਾਰੀ ਸਰੋਤ ਬਣ ਰਹੇ ਹਨ।
ਵਿਰੋਧੀ ਦਲੀਲ
ਕੁਝ ਪ੍ਰਕਾਸ਼ਕ ਦਾਅਵਾ ਕਰਦੇ ਹਨ ਕਿ ਉਹਨਾਂ ਦੇ ਟੈਕਸਟ ਦੀ ਕੋਈ ਵੀ ਵਰਤੋਂ, ਇੱਥੋਂ ਤੱਕ ਕਿ ਸਿਟੇਸ਼ਨ ਲਈ ਵੀ, ਵਿਆਪਕ AI ਈਕੋਸਿਸਟਮ ਵਿੱਚ ਯੋਗਦਾਨ ਪਾਉਂਦੀ ਹੈ ਅਤੇ ਸਿਟੇਸ਼ਨ ਬੋਟਸ ਨੂੰ ਇਨਕਾਰ ਕਰਨ ਨਾਲ ਉਹਨਾਂ ਦੀ ਪਹੁੰਚ ਨੂੰ ਨੁਕਸਾਨ ਹੋ ਸਕਦਾ ਹੈ। ਸਮਝੌਤਾ ਸਪੱਸ਼ਟ ਹੈ: ਜਾਂ ਤਾਂ ਤੁਸੀਂ ਮਾਡਲ ਨੂੰ ਬਿਨਾਂ ਕਿਸੇ ਕ੍ਰੈਡਿਟ ਦੇ ਆਪਣੇ ਕੰਮ ਤੋਂ ਸਿੱਖਣ ਦਿਓ, ਜਾਂ ਤੁਸੀਂ ਇਸਨੂੰ ਤੁਹਾਨੂੰ ਕੋਟ (quote) ਕਰਨ ਦਿਓ ਅਤੇ ਟ੍ਰੈਫਿਕ ਲਿਆਉਣ ਦਿਓ। ਚੋਣ ਇਸ ਗੱਲ 'ਤੇ ਨਿਰਭਰ ਕਰਦੀ ਹੈ ਕਿ ਤੁਸੀਂ ਆਪਣੇ ਸ਼ਬਦਾਂ ਦੇ ਦੁਬਾਰਾ ਵਰਤੋਂ 'ਤੇ ਲੰਬੇ ਸਮੇਂ ਦੇ ਕੰਟਰੋਲ ਦੇ ਬਨਾਮ ਤੁਰੰਤ ਕਲਿੱਕਸ ਨੂੰ ਕਿੰਨੀ ਅਹਿਮੀਅਤ ਦਿੰਦੇ ਹੋ।
ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ
AI ਕੰਪਨੀਆਂ ਅਜੇ ਵੀ ਇਸ ਗੱਲ 'ਤੇ ਕੰਮ ਕਰ ਰਹੀਆਂ ਹਨ ਕਿ ਉਹ ਆਪਣੇ ਕਰੌਲਰਾਂ ਨੂੰ ਕੀ ਨਾਮ ਦੇਣ ਅਤੇ ਕਿਵੇਂ ਰੂਟ ਕਰਨ। ਉਹਨਾਂ ਦੇ ਡਿਵੈਲਪਰ ਦਸਤਾਵੇਜ਼ਾਂ (developer documentation) ਵਿੱਚ user-agent ਸਟ੍ਰਿੰਗਾਂ ਦੇ ਅਪਡੇਟਾਂ 'ਤੇ ਨਜ਼ਰ ਰੱਖੋ। ਇੱਕ ਨਵਾਂ ਸਿਟੇਸ਼ਨ ਬੋਟ ਕਿਸੇ ਹੋਰ ਨਾਮ ਹੇਠ ਆ ਸਕਦਾ ਹੈ, ਅਤੇ ਪਹਿਲਾਂ ਬਲਾਕ ਕੀਤਾ ਗਿਆ ਟ੍ਰੇਨਿੰਗ ਬੋਟ ਮੁੜ ਨਾਮ ਬਦਲ ਸਕਦਾ ਹੈ। ਨਵੇਂ ਕਰੌਲਰਾਂ ਦੀ ਸੂਚੀ ਨਾਲ ਅਪ-ਟੂ-ਡੇਟ ਰਹਿਣ ਲਈ ਨਿਯਮਤ ਤੌਰ 'ਤੇ ਆਪਣੇ robots.txt ਅਤੇ Cloudflare ਸੈਟਿੰਗਾਂ ਦੀ ਜਾਂਚ ਕਰੋ।
ਸਿੱਖਿਆ (Takeaway): ਆਪਣੇ ਕੰਟੈਂਟ ਨੂੰ ਭਵਿੱਖ ਦੇ ਮਾਡਲ ਟ੍ਰੇਨਿੰਗ ਤੋਂ ਦੂਰ ਰੱਖਣ ਲਈ ਸਿਰਫ਼ ਟ੍ਰੇਨਿੰਗ-ਬੋਟ user agents ਨੂੰ ਹੀ ਬਲਾਕ ਕਰੋ, ਪਰ ਸਿਟੇਸ਼ਨ ਬੋਟਸ ਨੂੰ ਚਾਲੂ ਰੱਖੋ ਤਾਂ ਜੋ ChatGPT ਅਜੇ ਵੀ ਉਪਭੋਗਤਾਵਾਂ ਨੂੰ ਤੁਹਾਡੇ ਵੱਲ ਮੋੜ ਸਕੇ। ਸਹੀ robots.txt ਨਿਯਮ, ਜਦੋਂ ਲੋੜ ਹੋਵੇ Cloudflare ਦੇ AI Crawl Control ਰਾਹੀਂ ਲਾਗੂ ਕੀਤੇ ਜਾਣ, ਤੁਹਾਨੂੰ ਆਪਣੀ IP ਦੀ ਰੱਖਿਆ ਕਰਨ ਦੇ ਨਾਲ-ਨਾਲ AI-ਡਰਾਈਵਨ ਟ੍ਰੈਫਿਕ ਪ੍ਰਾਪਤ ਕਰਨ
