GPTBot ಅನ್ನು ಬ್ಲಾಕ್ ಮಾಡುವುದು ನಿಮ್ಮ ಸೈಟ್ ಅನ್ನು ChatGPT ನ ಉತ್ತರ ಪ್ಯಾನಲ್ನಿಂದ ಅಳಿಸಿಹಾಕುವುದಿಲ್ಲ. ತಮ್ಮ ಲೇಖನಗಳು ಬಳಕೆದಾರರು ChatGPT ಯಲ್ಲಿ ವಿಷಯದ ಬಗ್ಗೆ ಕೇಳಿದಾಗ ಇಂದಿಗೂ ಲಿಂಕ್ಗಳು ಮತ್ತು ಸಾರಾಂಶಗಳೊಂದಿಗೆ ಕಾಣಿಸಿಕೊಳ್ಳುತ್ತಿರುವುದನ್ನು ಕಂಡು, robots.txt ನಿಯಮವನ್ನು ಬಳಸಿದ ಸೈಟ್ ಮಾಲೀಕರು ಆಶ್ಚರ್ಯಚಕಿತರಾಗಿದ್ದಾರೆ. ಬ್ಲಾಕ್ ಕೆಲಸ ಮಾಡಿದೆ – ಆದರೆ ಅದು ತಪ್ಪು ಕ್ರಾಲರ್ ಅನ್ನು ತಡೆದಿದೆ.
ಟ್ರೈನಿಂಗ್ ಬಾಟ್ಗಳು ಮತ್ತು ಸೈಟೇಶನ್ ಬಾಟ್ಗಳ ನಡುವಿನ ವ್ಯತ್ಯಾಸ (Training bots vs. citation bots)
AI ಪ್ರೊವೈಡರ್ಗಳು ಎರಡು ವಿಭಿನ್ನ ರೀತಿಯ ಕ್ರಾಲರ್ಗಳನ್ನು ನಡೆಸುತ್ತವೆ:
- Training bots ಸಾರ್ವಜನಿಕವಾಗಿ ಲಭ್ಯವಿರುವ ಪುಟಗಳನ್ನು ಸ್ಕ್ಯಾಪ್ (scrape) ಮಾಡುತ್ತವೆ, ಪಠ್ಯವನ್ನು ಪಡೆದುಕೊಳ್ಳುತ್ತವೆ ಮತ್ತು ದೊಡ್ಡ ಭಾಷಾ ಮಾದರಿಗಳನ್ನು (large language models) ಸುಧಾರಿಸಲು (fine-tune) ಬಳಸುತ್ತವೆ. ಇವು ಎಂದಿಗೂ ಮೂಲದ ಲಿಂಕ್ ಅನ್ನು ಹಿಂತಿರುಗಿಸುವುದಿಲ್ಲ ಮತ್ತು ಸೈಟ್ಗೆ ಯಾವುದೇ ಟ್ರಾಫಿಕ್ ಅನ್ನು ತರುವುದಿಲ್ಲ.
- Citation bots ಬಳಕೆದಾರರ ಪ್ರಶ್ನೆಗೆ ಉತ್ತರಿಸುವ ಸಮಯದಲ್ಲಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತವೆ. ಬಳಕೆದಾರರು ಪ್ರಶ್ನೆಯನ್ನು ಕೇಳಿದಾಗ, ಬಾಟ್ ವೆಬ್ ಅನ್ನು ಹುಡುಕಿ, ಸಂಬಂಧಿತ ಸಾರಾಂಶವನ್ನು (snippet) ತೆಗೆದುಕೊಂಡು, ಮೂಲದ ಹೆಸರು ಮತ್ತು URL ಅನ್ನು ಸೇರಿಸಿ, ಚಾಟ್ ವಿಂಡೋದಲ್ಲಿ ಪ್ರಸ್ತುತಪಡಿಸುತ್ತದೆ. ಈ ಮೂಲಕ ಸೈಟ್ಗೆ ನಿಜವಾದ ವೀಕ್ಷಕರು ಬರಬಹುದು.
ನೀವು ಟ್ರೈನಿಂಗ್ ಬಾಟ್ ಅನ್ನು ಬ್ಲಾಕ್ ಮಾಡಿದರೆ, ಮಾಡೆಲ್ ನಿಮ್ಮ ಪುಟಗಳಿಂದ ಕಲಿಯಲು ಸಾಧ್ಯವಾಗುವುದಿಲ್ಲ. ನೀವು ಸೈಟೇಶನ್ ಬಾಟ್ ಅನ್ನು ಬ್ಲಾಕ್ ಮಾಡಿದರೆ, ChatGPT ನ ಲೈವ್ ಉತ್ತರಗಳಿಂದ ನಿಮ್ಮ ಪುಟವು ಮಾಯವಾಗುತ್ತದೆ. ಅನೇಕ ಸೈಟ್ಗಳು "GPTBot" ಅನ್ನು ಬ್ಲಾಕ್ ಮಾಡುತ್ತವೆ, ಆದರೆ ಅದೇ ಹೆಸರನ್ನು ಸೈಟೇಶನ್ ವರ್ಕ್ಫ್ಲೋದಲ್ಲಿ ಬಳಸುವುದಿಲ್ಲ ಎಂಬುದು ಅವರಿಗೆ ತಿಳಿದಿರುವುದಿಲ್ಲ, ಇದರಿಂದಾಗಿ ಈ ಗೊಂದಲ ಉಂಟಾಗುತ್ತದೆ.
ದೊಡ್ಡ ಕಂಪನಿಗಳು ತಮ್ಮ ಕ್ರಾಲರ್ಗಳನ್ನು ಹೇಗೆ ವಿಂಗಡಿಸಿವೆ
| ಪ್ರೊವೈಡರ್ (Provider) | ಟ್ರೈನಿಂಗ್-ಬಾಟ್ ಹೆಸರು (Training-bot name) | ಸೈಟೇಶನ್-ಬಾಟ್ ಹೆಸರುಗಳು (Citation-bot names) |
|---|---|---|
| OpenAI | GPTBot | OAI-SearchBot, ChatGPT-User |
| Anthropic | ClaudeBot | Claude-SearchBot, Claude-User |
| Google-Extended | Googlebot | |
| Perplexity | — (ಸೈಟೇಶನ್ಗಳಿಗಾಗಿ ಎರಡನ್ನೂ ಬಳಸಲಾಗುತ್ತದೆ) | PerplexityBot, Perplexity-User |
ನಿಮ್ಮ ಕಂಟೆಂಟ್ ಅನ್ನು ಭವಿಷ್ಯದ ಮಾಡೆಲ್ ಟ್ರೈನಿಂಗ್ನಿಂದ ದೂರವಿಡಲು ನೀವು ಬಯಸಿದರೆ, "Training-bot name" ಅಡಿಯಲ್ಲಿರುವ ಎಂಟ್ರಿಗಳನ್ನು ಮಾತ್ರ ನಿರಾಕರಿಸಬೇಕಾಗುತ್ತದೆ (deny). ನೀವು ChatGPT ನ ರಿಯಲ್-ಟೈಮ್ ಉತ್ತರಗಳಲ್ಲಿ ಕಾಣಿಸಿಕೊಳ್ಳಲು ಬಯಸಿದರೆ, ಸೈಟೇಶನ್ ಬಾಟ್ಗಳನ್ನು ಅನುಮತಿಸಬೇಕು.
robots.txt ಅನ್ನು ಸರಿಯಾದ ರೀತಿಯಲ್ಲಿ ಕಾನ್ಫಿಗರ್ ಮಾಡುವುದು
"GPTBot" ಅನ್ನು ಗುರಿಯಾಗಿಸಿಕೊಂಡಿರುವ ಸಾಮಾನ್ಯ Disallow: / ಸಾಲು ಟ್ರೈನಿಂಗ್ ಕ್ರಾಲರ್ ಅನ್ನು ಬ್ಲಾಕ್ ಮಾಡುತ್ತದೆ ಆದರೆ ಸೈಟೇಶನ್ ಬಾಟ್ಗಳನ್ನು ಮುಟ್ಟುವುದಿಲ್ಲ. ಸ್ಪಷ್ಟವಾಗಿರಲು, ಪ್ರತಿ ಟ್ರೈನಿಂಗ್ ಬಾಟ್ ಅನ್ನು ನಿರಾಕರಿಸುವ ಮತ್ತು ಸೈಟೇಶನ್ ಬಾಟ್ಗಳನ್ನು ಅನುಮತಿಸುವ ನಿಯಮಗಳನ್ನು ಸೇರಿಸಿ:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
# Allow citation bots
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Googlebot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Perplexity-User
Allow: /
ಕೇವಲ ಸಾಮಾನ್ಯ "*" ಅನ್ನು ಬ್ಲಾಕ್ ಮಾಡುವ ಡಿಫಾಲ್ಟ್ robots.txt ಅನ್ನು ಅವಲಂಬಿಸಬೇಡಿ. ಈ ವ್ಯತ್ಯಾಸವು ಮುಖ್ಯವಾಗಿದೆ ಏಕೆಂದರೆ ಒಟ್ಟಾರೆ ಬ್ಲಾಕ್ (blanket block) ಮಾಡುವುದರಿಂದ ಟ್ರೈನಿಂಗ್ ಮತ್ತು ಸೈಟೇಶನ್ ಎರಡೂ ಬಾಟ್ಗಳು ತಡೆಯಲ್ಪಡುತ್ತವೆ, ಇದರಿಂದ AI-ಚಾಲಿತ ಸರ್ಚ್ ನೀಡಬಹುದಾದ ಟ್ರಾಫಿಕ್ ಕಡಿತಗೊಳ್ಳುತ್ತದೆ.
Cloudflare ಬಳಕೆದಾರರು: AI Crawl Control ಪ್ಯಾನಲ್ ಬಳಸಿ
ನಿಮ್ಮ ಡೊಮೇನ್ Cloudflare ಹಿಂದೆ ಇದ್ದರೆ, ನೀವು robots.txt ಫೈಲ್ನ ಒಳಗೆ "Cloudflare management marker" ಅನ್ನು ನೋಡಬಹುದು. ಫೈಲ್ ಅನ್ನು ಮ್ಯಾನುಯಲ್ ಆಗಿ ಎಡಿಟ್ ಮಾಡುವುದರಿಂದ ಮುಂದಿನ Cloudflare ಅಪ್ಡೇಟ್ನಲ್ಲಿ ಬದಲಾವಣೆಗಳು ಅಳಿಸಿಹೋಗಬಹುದು. ಬದಲಾಗಿ, Cloudflare AI Crawl Control ಇಂಟರ್ಫೇಸ್ಗೆ ಹೋಗಿ ಸಂಬಂಧಿತ ಬಾಟ್ಗಳ ಸ್ವಿಚ್ಗಳನ್ನು ಆನ್/ಆಫ್ ಮಾಡಿ. ಈ ಪ್ಯಾನಲ್ ತೆರೆಯ ಹಿಂದೆ ಸರಿಯಾದ ನಿರ್ದೇಶನಗಳನ್ನು ಬರೆಯುತ್ತದೆ ಮತ್ತು ಅವುಗಳನ್ನು ಶಾಶ್ವತವಾಗಿರಿಸುತ್ತದೆ.
ಈ ಸೂಕ್ಷ್ಮ ವ್ಯತ್ಯಾಸ ಏಕೆ ಮುಖ್ಯ
- ಬೌದ್ಧಿಕ ಆಸ್ತಿ ರಕ್ಷಣೆ (Intellectual-property protection) – ಟ್ರೈನಿಂಗ್ ಬಾಟ್ಗಳನ್ನು ಬ್ಲಾಕ್ ಮಾಡುವುದರಿಂದ ನಿಮ್ಮ ಬರಹಗಳನ್ನು ಉಚಿತವಾಗಿ ಬಳಸಿಕೊಳ್ಳುವುದನ್ನು ಮತ್ತು ಭವಿಷ್ಯದ ಮಾಡೆಲ್ಗಳಲ್ಲಿ ಸೇರಿಸುವುದನ್ನು ತಡೆಯಬಹುದು.
- ರೆಫರಲ್ ಟ್ರಾಫಿಕ್ (Referral traffic) – ಸೈಟೇಶನ್ ಬಾಟ್ಗಳನ್ನು ಅನುಮತಿಸುವುದರಿಂದ, ChatGPT ನಲ್ಲಿ ಸಾರಾಂಶವನ್ನು ನೋಡುವ ಬಳಕೆದಾರರು ನಿಮ್ಮ ಸೈಟ್ಗೆ ಕ್ಲಿಕ್ ಮಾಡಬಹುದು, ಇದು ನಿಜವಾದ ವೀಕ್ಷಕರನ್ನು ತರುತ್ತದೆ.
- ಬ್ರ್ಯಾಂಡ್ ದೃಶ್ಯತೆ (Brand visibility) – AI ಸಹಾಯಕರು ಅನೇಕ ಬಳಕೆದಾರರಿಗೆ ಪ್ರಮುಖ ಮಾಹಿತಿ ಮೂಲವಾಗುತ್ತಿರುವಂತೆ, AI-ವರ್ಧಿತ ಸರ್ಚ್ನಲ್ಲಿ ನಿಮ್ಮ ಕಂಟೆಂಟ್ ಲಭ್ಯವಿರುವುದು ನಿಮ್ಮ ಬ್ರ್ಯಾಂಡ್ ಅನ್ನು ಗುರುತಿಸಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ.
ವಿರೋಧಾತ್ಮಕ ವಾದ (The counter-argument)
ಕೆಲವು ಪ್ರಕಾಶಕರು ತಮ್ಮ ಪಠ್ಯದ ಯಾವುದೇ ಬಳಕೆ, ಸೈಟೇಶನ್ಗಾಗಿ ಆಗಿದ್ದರೂ ಸಹ, ವಿಶಾಲವಾದ AI ಪರಿಸರ ವ್ಯವಸ್ಥೆಗೆ ಕೊಡುಗೆ ನೀಡುತ್ತದೆ ಮತ್ತು ಸೈಟೇಶನ್ ಬಾಟ್ಗಳನ್ನು ನಿರಾಕರಿಸುವುದು ಅವರ ವ್ಯಾಪ್ತಿಯನ್ನು ಕಡಿಮೆ ಮಾಡಬಹುದು ಎಂದು ವಾದಿಸುತ್ತಾರೆ. ಇಲ್ಲಿನ ವಿನಿಮಯ ಸ್ಪಷ್ಟವಾಗಿದೆ: ನೀವು ಮಾಡೆಲ್ ನಿಮ್ಮ ಕೆಲಸದಿಂದ ಕ್ರೆಡಿಟ್ ಇಲ್ಲದೆ ಕಲಿಯಲು ಬಿಡಬಹುದು ಅಥವಾ ಅದು ನಿಮ್ಮನ್ನು ಉಲ್ಲೇಖಿಸಲು (quote) ಮತ್ತು ಟ್ರಾಫಿಕ್ ತರಲು ಬಿಡಬಹುದು. ನಿಮ್ಮ ಪದಗಳನ್ನು ಹೇಗೆ ಮರುಬಳಕೆ ಮಾಡಲಾಗುತ್ತದೆ ಎಂಬ ವಿಷಯದಲ್ಲಿ ತಕ್ಷಣದ ಕ್ಲಿಕ್ಗಳು ಮತ್ತು ದೀರ್ಘಾವಧಿಯ ನಿಯಂತ್ರಣದ ನಡುವೆ ನೀವು ಯಾವುದಕ್ಕೆ ಹೆಚ್ಚಿನ ಮೌಲ್ಯ ನೀಡುತ್ತೀರಿ ಎಂಬುದರ ಮೇಲೆ ನಿಮ್ಮ ಆಯ್ಕೆ ಅವಲಂಬಿತವಾಗಿರುತ್ತದೆ.
ಮುಂದೆ ಗಮನಿಸಬೇಕಾದವುಗಳು
AI ಕಂಪನಿಗಳು ತಮ್ಮ ಕ್ರಾಲರ್ಗಳಿಗೆ ಹೆಸರಿಸುವ ಮತ್ತು ಅವುಗಳನ್ನು ನಿರ್ದೇಶಿಸುವ ವಿಧಾನದಲ್ಲಿ ಇನ್ನೂ ಬದಲಾವಣೆಗಳನ್ನು ಮಾಡುತ್ತಿವೆ. ಅವರ ડેವಲಪರ್ ಡಾಕ್ಯುಮೆಂಟೇಶನ್ನಲ್ಲಿರುವ user-agent ಸ್ಟ್ರಿಂಗ್ಗಳ ಅಪ್ಡೇಟ್ಗಳ ಮೇಲೆ ಕಣ್ಣಿಡಿ. ಹೊಸ ಸೈಟೇಶನ್ ಬಾಟ್ ಬೇರೆ ಹೆಸರಿನಲ್ಲಿ ಕಾಣಿಸಿಕೊಳ್ಳಬಹುದು ಮತ್ತು ಈ ಹಿಂದೆ ಬ್ಲಾಕ್ ಮಾಡಲಾದ ಟ್ರೈನಿಂಗ್ ಬಾಟ್ ಅನ್ನು ಮರುನಾಮಕರಣ ಮಾಡಬಹುದು. ಇತ್ತೀಚಿನ ಕ್ರಾಲರ್ ಪಟ್ಟಿಯೊಂದಿಗೆ ಹೊಂದಿಕೆಯಾಗಲು ನಿಮ್ಮ robots.txt ಮತ್ತು Cloudflare ಸೆಟ್ಟಿಂಗ್ಗಳನ್ನು ನಿಯಮಿತವಾಗಿ ಪರಿಶೀಲಿಸಿ.
ಸಾರಾಂಶ (Takeaway): ನಿಮ್ಮ ಕಂಟೆಂಟ್ ಅನ್ನು ಭವಿಷ್ಯದ ಮಾಡೆಲ್ ಟ್ರೈನಿಂಗ್ನಿಂದ ದೂರವಿಡಲು ಕೇವಲ ಟ್ರೈನಿಂಗ್-ಬಾಟ್ user agents ಅನ್ನು ಮಾತ್ರ ಬ್ಲಾಕ್ ಮಾಡಿ, ಆದರೆ ChatGPT ಬಳಕೆದಾರರನ್ನು ನಿಮ್ಮ ಸೈಟ್ಗೆ ಮತ್ತೆ ಕರೆದೊಯ್ಯಲು ಸೈಟೇಶನ್ ಬಾಟ್ಗಳನ್ನು ಸಕ್ರಿಯವಾಗಿರಿಸಲು ಬಿಡಿ. ಸರಿಯಾದ robots.txt ನಿಯಮಗಳನ್ನು, ಅಗತ್ಯವಿದ್ದಾಗ Cloudflare ನ AI Crawl Control ಮೂಲಕ ಅನ್ವಯಿಸುವುದರಿಂದ, ನಿಮ್ಮ IP ಅನ್ನು ರಕ್ಷಿಸುವ ಜೊತೆಗೆ AI-ಚಾಲಿತ ಟ್ರಾಫಿಕ್ ಅನ್ನು ಪಡೆಯಬಹುದು.
