Đội ngũ kỹ thuật của Wikimedia cho biết các trình thu thập dữ liệu (crawler) chạy bằng AI tạo ra 65% lượng lưu lượng truy cập tốn kém nhất của nền tảng, biến một sự gia tăng bot có vẻ vô hại thành một khoản mục cụ thể trong hóa đơn máy chủ. Mô hình tương tự hiện cũng đang xuất hiện trên các blog nhỏ và các trang web cá nhân.
Tại sao sự gia tăng này lại quan trọng
Người dùng thực thường dừng lại ở các trang phổ biến—trang chủ, các bài viết nổi bật và các nội dung nổi tiếng khác. Các CDN lưu trữ (cache) những trang đó tại các vị trí biên (edge locations), vì vậy máy chủ gốc (origin server) hiếm khi phải xử lý nặng. Ngược lại, các crawler AI quét hàng nghìn URL ít người biết đến chỉ trong một lần chạy. Những trang này hiếm khi được lưu bộ nhớ đệm, vì vậy mọi yêu cầu đều phải truyền thẳng về hạ tầng gốc của Wikimedia. Kết quả là: một lượng tài nguyên tính toán, lưu trữ và băng thông sử dụng không tương xứng so với một phần nhỏ trong tổng lưu lượng truy cập.
Blog kỹ thuật công bố dữ liệu này lưu ý rằng mặc dù bot chỉ chiếm một phần khiêm tốn trong tổng số yêu cầu, nhưng chúng lại chiếm ưu thế trong nhóm các yêu cầu "tốn kém".
Ai là người chịu ảnh hưởng
Các nhà vận hành nhỏ hơn không có được sự đệm đỡ đó. Chi phí ẩn không chỉ là tiền bạc; nó còn tiềm ẩn rủi ro làm giảm hiệu suất đối với những khách truy cập hợp lệ.
Chủ sở hữu trang web có thể làm gì
- Bắt đầu với giới hạn tốc độ (rate-limiting) – kiểm soát số lượng yêu cầu mà một địa chỉ IP đơn lẻ có thể thực hiện trong một khoảng thời gian ngắn. Điều này làm chậm các crawler hung hãn mà không cần từ chối quyền truy cập của chúng một cách hoàn toàn.
- Cân nhắc giữa khả năng hiển thị và chi phí – việc chặn một bot của công cụ tìm kiếm có thể cắt giảm lưu lượng truy cập, nhưng nó cũng có thể khiến các trang của bạn bị loại khỏi chỉ mục (index), gây ảnh hưởng đến khả năng được tìm thấy một cách tự nhiên.
- Phân loại bot – không phải tất cả các crawler đều giống nhau. Một số thuộc về các công cụ tìm kiếm hợp lệ giúp mang lại lưu lượng truy cập; số khác chỉ thuần túy là các trình thu thập dữ liệu (scrapers) không mang lại giá trị gì.
- Triển khai các thử thách chứng minh công việc (proof-of-work) – yêu cầu giải một câu đố tính toán nhỏ trước khi cung cấp trang web. Trình duyệt của con người sẽ giải quyết nó ngay lập tức; trong khi bot phải tiêu tốn thêm chu kỳ xử lý, từ đó làm tăng chi phí của chúng.
- Sử dụng phân tích CDN – hầu hết các CDN đều cung cấp các chỉ số yêu cầu theo từng bot. Hãy xác định xem tác nhân (agent) nào truy cập vào máy chủ gốc thường xuyên nhất và điều chỉnh các quy tắc cho phù hợp.
Bài học rút ra rất đơn giản: các crawler AI không còn là một sự tò mò "ăn bám" nữa; chúng là một trung tâm chi phí có thể đo lường được. Cho dù bạn đang vận hành một bách khoa toàn thư toàn cầu hay một trang hồ sơ năng lực (portfolio) chỉ có một trang, việc coi lưu lượng truy cập của bot như một khoản mục trong ngân sách hạ tầng có thể giúp ngăn chặn các hóa đơn bất ngờ và giữ cho trang web của bạn luôn phản hồi nhanh chóng cho người dùng thực.
