Cloudflare Akan Menyekat Crawler Ejen AI Secara Lalai pada September Ini
Era pengumpulan data web (web scraping) tanpa sekatan oleh kecerdasan buatan bakal berakhir. Bermula 15 September, Cloudflare akan melaksanakan peralihan polisi besar yang menyekat crawler ejen AI secara lalai, sekali gus memaksa era baharu akses data berasaskan kebenaran.
Peralihan daripada Pengumpulan Data Pasif kepada Kebenaran Aktif
Selama bertahun-tahun, model AI dan ejen autonomi telah berfungsi dengan merentasi web terbuka, mengumpul data untuk memberikan jawapan masa nyata kepada pengguna. Walau bagaimanapun, pengumuman terbaharu Cloudflare menandakan peralihan ketara dalam cara infrastruktur web mengendalikan bot "ejenik" ini. Tidak seperti crawler enjin carian tradisional yang mengindeks halaman untuk capaian, crawler ejen AI mengambil kandungan secara masa nyata untuk melaksanakan tugas khusus atau menjawab pertanyaan kompleks bagi pihak pengguna.
Bermula 15 September dan seterusnya, sebahagian besar web yang dilindungi oleh Cloudflare akan menyekat ejen-ejen ini secara automatik. Langkah ini direka untuk memberi pemilik laman web dan penerbit lebih kawalan terhadap bagaimana data proprietari dan kandungan kreatif mereka diambil oleh Model Bahasa Besar (LLM) dan ejen autonomi. Daripada menjadi "bebas untuk semua," web kini sedang beralih ke arah model berpagar di mana bot mesti meminta akses secara eksplisit.
Cara Pembangun dan Pemilik Tapak Boleh Memberi Akses
Walaupun tetapan lalai adalah menyekat, Cloudflare tidak bertujuan untuk merosakkan fungsi alatan AI yang bermanfaat. Sebaliknya, matlamatnya adalah untuk mewujudkan "jabat tangan" (handshake) yang berstruktur antara crawler dan hos. Bagi pembangun dan pentadbir tapak, ini bermakna beralih daripada mentaliti "kumpul semua" kepada pendekatan yang diuruskan.
Untuk memastikan ejen AI yang sah dan bernilai tinggi masih boleh mengakses bahagian tertentu laman web, pemilik perlu melaksanakan kebenaran khusus. Ini membolehkan perniagaan memilih ejen AI mana—seperti yang dikuasakan oleh OpenAI, Anthropic, atau Google—yang boleh membaca kandungan mereka, dan berpotensi di bawah terma tertentu. Bagi landskap AI yang lebih luas, ini memerlukan cara yang lebih canggih bagi pembangun ejen untuk mengenal pasti diri mereka dan membuktikan kesahihan mereka kepada pelayan web.
Mengapa Ini Penting untuk Ekosistem AI
Perkembangan ini mewakili titik perubahan kritikal bagi pencipta kandungan dan syarikat AI. Bagi penerbit, ia menyediakan mekanisme pertahanan yang sangat diperlukan terhadap "keletihan pengumpulan data" (data scraping fatigue), di mana kandungan digunakan untuk melatih model yang akhirnya mungkin bersaing dengan pencipta asal. Dengan mendapatkan semula kawalan, penerbit boleh melindungi harta intelek mereka dan berpotensi meneroka model pengewangan baharu untuk akses AI.
Bagi pembangun AI dan pengasas yang membina aliran kerja ejenik (agentic workflows), perubahan ini memperkenalkan lapisan kerumitan baharu. Ejen tidak lagi boleh bergantung kepada andaian bahawa semua HTML yang menghadap awam boleh diakses. Untuk memastikan ejen AI kekal relevan pada masa hadapan, mereka perlu "sedar pematuhan" (compliance-aware), mampu mengemudi lapisan kebenaran dan menghormati protokol baharu yang ditetapkan oleh penyedia infrastruktur utama seperti Cloudflare.
Ringkasan Utama
- Sekatan Lalai: Bermula 15 September, Cloudflare akan menyekat crawler ejen AI secara automatik pada tapak yang dilindungi melainkan kebenaran eksplisit diberikan.
- Kawalan untuk Penerbit: Langkah ini mengembalikan kuasa kepada pemilik laman web, membolehkan mereka memutuskan entiti AI khusus mana yang boleh mengambil data masa nyata mereka.
- Standard Baharu untuk Ejen: Pembangun AI mesti menyesuaikan ejen mereka agar lebih menghormati kebenaran web, beralih ke arah model pengumpulan data berasaskan kebenaran yang berstruktur.
