Cloudflare ਇਸ ਸਤੰਬਰ ਤੋਂ ਡਿਫੌਲਟ ਰੂਪ ਵਿੱਚ AI Agent Crawlers ਨੂੰ ਰੋਕ ਦੇਵੇਗਾ
ਆਰਟੀਫੀਸ਼ੀਅਲ ਇੰਟੈਲੀਜੈਂਸ ਦੁਆਰਾ ਬਿਨਾਂ ਕਿਸੇ ਰੋਕ-ਟੋਕ ਦੇ ਵੈੱਬ ਸਕ੍ਰੇਪਿੰਗ (web scraping) ਦਾ ਯੁੱਗ ਖਤਮ ਹੋ ਰਿਹਾ ਹੈ। 15 ਸਤੰਬਰ ਤੋਂ, Cloudflare ਇੱਕ ਵੱਡੀ ਨੀਤੀਗਤ ਤਬਦੀਲੀ ਲਾਗੂ ਕਰੇਗਾ ਜੋ ਡਿਫੌਲਟ ਰੂਪ ਵਿੱਚ AI agent crawlers ਨੂੰ ਰੋਕ ਦੇਵੇਗੀ, ਜਿਸ ਨਾਲ ਇਜਾਜ਼ਤ-ਅਧਾਰਤ ਡੇਟਾ ਐਕਸੈਸ (permission-based data access) ਦੇ ਇੱਕ ਨਵੇਂ ਯੁੱਗ ਦੀ ਸ਼ੁਰੂਆਤ ਹੋਵੇਗੀ।
ਪੈਸਿਵ ਸਕ੍ਰੇਪਿੰਗ ਤੋਂ ਐਕਟਿਵ ਇਜਾਜ਼ਤ ਵੱਲ ਤਬਦੀਲੀ
ਸਾਲਾਂ ਤੋਂ, AI ਮਾਡਲ ਅਤੇ ਆਟੋਨੋਮਸ ਏਜੰਟ ਖੁੱਲ੍ਹੇ ਵੈੱਬ ਰਾਹੀਂ ਘੁੰਮ ਕੇ, ਉਪਭੋਗਤਾਵਾਂ ਨੂੰ ਰੀਅਲ-ਟਾਈਮ ਜਵਾਬ ਦੇਣ ਲਈ ਡੇਟਾ ਸਕ੍ਰੇਪ ਕਰਕੇ ਕੰਮ ਕਰਦੇ ਆ ਰਹੇ ਹਨ। ਹਾਲਾਂਕਿ, Cloudflare ਦੀ ਤਾਜ਼ਾ ਘੋਸ਼ਣਾ ਇਸ ਗੱਲ ਵਿੱਚ ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਮੋੜ ਹੈ ਕਿ ਵੈੱਬ ਇਨਫਰਾਸਟ੍ਰਕਚਰ ਇਹਨਾਂ "agentic" ਬੋਟਸ ਨੂੰ ਕਿਵੇਂ ਸੰਭਾਲਦਾ ਹੈ। ਰਵਾਇਤੀ ਸਰਚ ਇੰਜਣ ਕਰਲਰਾਂ ਦੇ ਉਲਟ, ਜੋ ਡਾਟਾ ਪ੍ਰਾਪਤ ਕਰਨ ਲਈ ਪੇਜਾਂ ਨੂੰ ਇੰਡੈਕਸ ਕਰਦੇ ਹਨ, AI agent crawlers ਕਿਸੇ ਉਪਭੋਗਤਾ ਦੀ ਤਰਫੋਂ ਖਾਸ ਕੰਮ ਕਰਨ ਜਾਂ ਗੁੰਝਲਦਾਰ ਸਵਾਲਾਂ ਦੇ ਜਵਾਬ ਦੇਣ ਲਈ ਰੀਅਲ-ਟਾਈਮ ਵਿੱਚ ਸਮੱਗਰੀ ਪ੍ਰਾਪਤ ਕਰਦੇ ਹਨ।
15 ਸਤੰਬਰ ਤੋਂ ਬਾਅਦ, Cloudflare ਦੁਆਰਾ ਸੁਰੱਖਿਅਤ ਵੈੱਬ ਦਾ ਇੱਕ ਵੱਡਾ ਹਿੱਸਾ ਆਪਣੇ ਆਪ ਇਹਨਾਂ ਏਜੰਟਾਂ 'ਤੇ ਪਾਬੰਦੀ ਲਗਾ ਦੇਵੇਗਾ। ਇਹ ਕਦਮ ਵੈੱਬਸਾਈਟ ਮਾਲਕਾਂ ਅਤੇ ਪ੍ਰਕਾਸ਼ਕਾਂ ਨੂੰ ਇਹ ਨਿਰਧਾਰਤ ਕਰਨ ਲਈ ਵਧੇਰੇ ਨਿਯੰਤਰਣ ਦੇਣ ਲਈ ਤਿਆਰ ਕੀਤਾ ਗਿਆ ਹੈ ਕਿ ਕਿਵੇਂ ਉਹਨਾਂ ਦਾ ਮਾਲਕਾਨਾ ਡੇਟਾ ਅਤੇ ਰਚਨਾਤਮਕ ਸਮੱਗਰੀ Large Language Models (LLMs) ਅਤੇ ਆਟੋਨੋਮਸ ਏਜੰਟਾਂ ਦੁਆਰਾ ਵਰਤੀ ਜਾਂਦੀ ਹੈ। ਇੱਕ "ਖੁੱਲ੍ਹੇ ਮੈਦਾਨ" ਦੀ ਬਜਾਏ, ਵੈੱਬ ਹੁਣ ਇੱਕ ਅਜਿਹੇ ਗੇਟਡ ਮਾਡਲ (gated model) ਵੱਲ ਵਧ ਰਿਹਾ ਹੈ ਜਿੱਥੇ ਬੋਟਸ ਨੂੰ ਸਪੱਸ਼ਟ ਤੌਰ 'ਤੇ ਐਕਸੈਸ ਦੀ ਬੇਨਤੀ ਕਰਨੀ ਪਵੇਗੀ।
ਡਿਵੈਲਪਰ ਅਤੇ ਸਾਈਟ ਮਾਲਕ ਐਕਸੈਸ ਕਿਵੇਂ ਦੇ ਸਕਦੇ ਹਨ
ਹਾਲਾਂਕਿ ਡਿਫੌਲਟ ਸੈਟਿੰਗ ਪਾਬੰਦੀਸ਼ੁਦਾ ਹੈ, Cloudflare ਦਾ ਉਦੇਸ਼ ਲਾਭਦਾਇਕ AI ਟੂਲਜ਼ ਦੀ ਕਾਰਜਸ਼ੀਲਤਾ ਨੂੰ ਖਰਾਬ ਕਰਨਾ ਨਹੀਂ ਹੈ। ਇਸ ਦੀ ਬਜਾਏ, ਟੀਚਾ ਕਰਲਰ ਅਤੇ ਹੋਸਟ ਦੇ ਵਿਚਕਾਰ ਇੱਕ ਸੰਗਠਿਤ ਤਰੀਕਾ (structured handshake) ਸਥਾਪਤ ਕਰਨਾ ਹੈ। ਡਿਵੈਲਪਰਾਂ ਅਤੇ ਸਾਈਟ ਪ੍ਰਸ਼ਾਸਕਾਂ ਲਈ, ਇਸਦਾ ਮਤਲਬ "ਸਭ ਕੁਝ ਸਕ੍ਰੇਪ ਕਰੋ" ਵਾਲੀ ਮਾਨਸਿਕਤਾ ਤੋਂ ਦੂਰ ਹੋ ਕੇ ਇੱਕ ਪ੍ਰਬੰਧਿਤ ਪਹੁੰਚ ਵੱਲ ਵਧਣਾ ਹੈ।
ਇਹ ਯਕੀਨੀ ਬਣਾਉਣ ਲਈ ਕਿ ਜਾਇਜ਼, ਉੱਚ-ਮੁੱਲ ਵਾਲੇ AI ਏਜੰਟ ਅਜੇ ਵੀ ਵੈੱਬਸਾਈਟ ਦੇ ਖਾਸ ਹਿੱਸਿਆਂ ਤੱਕ ਪਹੁੰਚ ਸਕਦੇ ਹਨ, ਮਾਲਕਾਂ ਨੂੰ ਖਾਸ ਇਜਾਜ਼ਤਾਂ ਲਾਗੂ ਕਰਨੀ ਪਵੇਗੀ। ਇਹ ਕਾਰੋਬਾਰਾਂ ਨੂੰ ਇਹ ਚੁਣਨ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦਾ ਹੈ ਕਿ ਕਿਹੜੇ AI ਏਜੰਟ—ਜਿਵੇਂ ਕਿ OpenAI, Anthropic, ਜਾਂ Google ਦੁਆਰਾ ਚਲਾਏ ਜਾਣ ਵਾਲੇ—ਉਹਨਾਂ ਦੀ ਸਮੱਗਰੀ ਪੜ੍ਹ ਸਕਦੇ ਹਨ, ਅਤੇ ਸੰਭਵ ਤੌਰ 'ਤੇ ਕਿਹੜੀਆਂ ਸ਼ਰਤਾਂ ਦੇ ਅਧੀਨ। ਵਿਆਪਕ AI ਲੈਂਡਸਕੇਪ ਲਈ, ਇਹ ਏਜੰਟ ਡਿਵੈਲਪਰਾਂ ਲਈ ਵੈੱਬ ਸਰਵਰਾਂ ਨੂੰ ਆਪਣੀ ਪਛਾਣ ਦੱਸਣ ਅਤੇ ਆਪਣੀ ਜਾਇਜ਼ਤਾ ਸਾਬਤ ਕਰਨ ਲਈ ਇੱਕ ਵਧੇਰੇ ਉੱਨਤ ਤਰੀਕੇ ਦੀ ਮੰਗ ਕਰਦਾ ਹੈ।
AI Ecosystem ਲਈ ਇਹ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ
ਇਹ ਵਿਕਾਸ ਸਮੱਗਰੀ ਬਣਾਉਣ ਵਾਲਿਆਂ ਅਤੇ AI ਕੰਪਨੀਆਂ ਦੋਵਾਂ ਲਈ ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਮੋੜ ਹੈ। ਪ੍ਰਕਾਸ਼ਕਾਂ ਲਈ, ਇਹ "ਡਾਟਾ ਸਕ੍ਰੇਪਿੰਗ ਫੈਟੀਗ" (data scraping fatigue) ਵਿਰੁੱਧ ਇੱਕ ਬਹੁਤ ਜ਼ਰੂਰੀ ਰੱਖਿਆ ਪ੍ਰਣਾਲੀ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ, ਜਿੱਥੇ ਸਮੱਗਰੀ ਦੀ ਵਰਤੋਂ ਅਜਿਹੇ ਮਾਡਲਾਂ ਨੂੰ ਸਿਖਲਾਈ ਦੇਣ ਲਈ ਕੀਤੀ ਜਾਂਦੀ ਹੈ ਜੋ ਅੰਤ ਵਿੱਚ ਅਸਲ ਨਿਰਮਾਤਾਵਾਂ ਨਾਲ ਮੁਕਾਬਲਾ ਕਰ ਸਕਦੇ ਹਨ। ਨਿਯੰਤਰਣ ਵਾਪਸ ਪ੍ਰਾਪਤ ਕਰਕੇ, ਪ੍ਰਕਾਸ਼ਕ ਆਪਣੀ ਬੌਧਿਕ ਜਾਇਦਾਦ ਦੀ ਰੱਖਿਆ ਕਰ ਸਕਦੇ ਹਨ ਅਤੇ ਸੰਭਵ ਤੌਰ 'ਤੇ AI ਐਕਸੈਸ ਲਈ ਨਵੇਂ ਮੁਦਰਾਕਰਨ ਮਾਡਲਾਂ (monetization models) ਦੀ ਪੜਚੋਲ ਕਰ ਸਕਦੇ ਹਨ।
ਏਜੈਂਟਿਕ ਵਰਕਫਲੋ (agentic workflows) ਬਣਾਉਣ ਵਾਲੇ AI ਡਿਵੈਲਪਰਾਂ ਅਤੇ ਸੰਸਥਾਪਕਾਂ ਲਈ, ਇਹ ਤਬਦੀਲੀ ਗੁੰਝਲਦਾਰਤਾ ਦੀ ਇੱਕ ਨਵੀਂ ਪਰਤ ਜੋੜਦੀ ਹੈ। ਏਜੰਟ ਹੁਣ ਇਸ ਅੰਦਾਜ਼ੇ 'ਤੇ ਭਰੋਸਾ ਨਹੀਂ ਕਰ ਸਕਦੇ ਕਿ ਸਾਰਾ ਜਨਤਕ HTML ਉਪਲਬਧ ਹੈ। AI ਏਜੰਟਾਂ ਨੂੰ ਭਵਿੱਖ ਲਈ ਤਿਆਰ ਕਰਨ ਲਈ ਉਹਨਾਂ ਦਾ "compliance-aware" ਹੋਣਾ ਜ਼ਰੂਰੀ ਹੋਵੇਗਾ, ਜੋ ਇਜਾਜ਼ਤ ਦੀਆਂ ਪਰਤਾਂ ਨੂੰ ਸਮਝਣ ਅਤੇ Cloudflare ਵਰਗੇ ਪ੍ਰਮੁੱਖ ਇਨਫਰਾਸਟ੍ਰਕਚਰ ਪ੍ਰਦਾਤਾਵਾਂ ਦੁਆਰਾ ਸਥਾਪਿਤ ਨਵੇਂ ਪ੍ਰੋਟੋਕੋਲ ਦਾ ਸਤਿਕਾਰ ਕਰਨ ਦੇ ਯੋਗ ਹੋਣ।
ਮੁੱਖ ਗੱਲਾਂ
- ਡਿਫੌਲਟ ਬਲੌਕਿੰਗ: 15 ਸਤੰਬਰ ਤੋਂ, Cloudflare ਸੁਰੱਖਿਅਤ ਸਾਈਟਾਂ 'ਤੇ AI agent crawlers ਨੂੰ ਆਪਣੇ ਆਪ ਰੋਕ ਦੇਵੇਗਾ ਜਦੋਂ ਤੱਕ ਸਪੱਸ਼ਟ ਇਜਾਜ਼ਤ ਨਹੀਂ ਦਿੱਤੀ ਜਾਂਦੀ।
- ਪ੍ਰਕਾਸ਼ਕਾਂ ਲਈ ਨਿਯੰਤਰਣ: ਇਹ ਕਦਮ ਸ਼ਕਤੀ ਵਾਪਸ ਵੈੱਬਸਾਈਟ ਮਾਲਕਾਂ ਨੂੰ ਦਿੰਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਉਹ ਇਹ ਫੈਸਲਾ ਕਰ ਸਕਦੇ ਹਨ ਕਿ ਕਿਹੜੀਆਂ ਖਾਸ AI ਇਕਾਈਆਂ ਉਹਨਾਂ ਦਾ ਰੀਅਲ-ਟਾਈਮ ਡੇਟਾ ਵਰਤ ਸਕਦੀਆਂ ਹਨ।
- ਏਜੰਟਾਂ ਲਈ ਨਵਾਂ ਮਿਆਰ: AI ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਆਪਣੇ ਏਜੰਟਾਂ ਨੂੰ ਵੈੱਬ ਇਜਾਜ਼ਤਾਂ ਦਾ ਵਧੇਰੇ ਸਤਿਕਾਰ ਕਰਨ ਲਈ ਅਨੁਕੂਲ ਬਣਾਉਣਾ ਪਵੇਗਾ, ਅਤੇ ਇੱਕ ਸੰਗਠਿਤ, ਇਜਾਜ਼ਤ-ਅਧਾਰਤ ਕਰਲਿੰਗ ਮਾਡਲ ਵੱਲ ਵਧਣਾ ਪਵੇਗਾ।
