Cách scrape mà không bị chặn — tốc độ, phiên làm việc và IP sạch
Trong bài này
Câu hỏi phổ biến nhất khi scrape là "làm sao để không bị chặn?". Người ta tìm thêm proxy, rồi proxy tốt hơn, mà vẫn đụng tường. Sự thật khó nghe là: IP sạch là cần nhưng chưa đủ — phần lớn việc bị chặn đến từ cách bạn gửi yêu cầu, không phải từ đâu. Bài này nói về điều thật sự kích hoạt việc chặn và cách cư xử như một khách bình thường — proxy làm phần của nó, không gánh toàn bộ.
Bị chặn đến từ hành vi, không chỉ từ IP
Một trang kết luận bạn là bot từ tổ hợp nhiều tín hiệu:
- Tốc độ và khối lượng — những đợt request không người nào làm nổi.
- Khuôn mẫu — cùng một đường dẫn, cùng khoảng cách thời gian, không chút biến thiên.
- Nhiều danh tính trên một IP — mười tài khoản đăng nhập từ một địa chỉ.
- Vân tay không khớp — header, múi giờ hay trình duyệt không ăn khớp nhau.
Một IP sạch (xem proxy sạch và blacklist) tạo điểm xuất phát tốt. Nó không cứu được hành vi hét lên "tự động".
Giãn tốc độ và lùi lại
Tốc độ là đòn bẩy lớn nhất:
- Nghỉ giữa các request — vài giây, có chút ngẫu nhiên, không phải nhịp đều như máy.
- Giới hạn kết nối song song — vài cái một lúc, không phải hàng trăm.
- Tôn trọng
Retry-Afterkhi gặp 429 và 503, và lùi lại lâu dần (5, 10, 20 giây…) khi không có header. - Chạy vào giờ thấp điểm của trang nếu có thể.
Chậm hơn hầu như luôn thắng rộng hơn.
Một danh tính cho mỗi IP và phiên
Hãy coi một IP như một con người:
- Giữ cookie khớp với IP — một phiên ở trên một IP; đổi IP nghĩa là phiên mới.
- Đừng chạy nhiều tài khoản qua một IP cùng lúc.
- Chỉ đổi IP khi thật sự bị giới hạn, không phải mỗi request (mỗi proxy 65Proxy đổi IP tối đa một lần mỗi 5 phút).
- Đừng đổi IP giữa phiên — nó làm hỏng đăng nhập và trông đáng ngờ.
Trông như một khách bình thường
- Gửi User-Agent và header hợp lý, kèm
Accept-Languagekhớp với vùng bạn đang xuất hiện. - Đừng giả quá đà. Một vân tay ngẫu nhiên ở mỗi request tự nó là một dấu hiệu; hãy bình thường một cách nhất quán.
- Dùng trình duyệt thật khi trang cần — các trang nặng JavaScript có trong bài scrape trang JavaScript.
- Đọc thông báo lỗi để biết cần đổi gì — bài các lỗi proxy thường gặp phân biệt 407, 429 và lỗi kết nối.
Tôn trọng robots.txt, điều khoản và dữ liệu cá nhân
Không bị chặn và chơi đẹp trùng nhau nhiều hơn người ta tưởng:
- Đọc
robots.txtvà điều khoản của trang, và tôn trọng những phần họ không cho phép. - Chỉ thu thập dữ liệu công khai; đừng đăng nhập để lấy nó, và đừng vượt CAPTCHA.
- Cẩn trọng với dữ liệu cá nhân — tên, số điện thoại, email được bảo vệ bởi các luật như PDPA của Singapore.
- Đừng làm quá tải trang — nếu bạn làm chậm trang của ai đó, hãy chờ bị chặn, và biết rằng bạn đang gây hại cho họ.
65Proxy hợp ở đâu
Proxy 4G Singapore của chúng tôi cho bạn hai thứ trong danh sách trên: một IP di động sạch để bắt đầu, và một IP mới theo yêu cầu khi trang giới hạn bạn (bằng link, áp quy tắc 5 phút). 200GB mỗi gói, giá 1 ngày $4, 7 ngày $13, 1 tháng $40. Tốc độ, phiên và vân tay là phần bạn phải làm đúng — và bài này chỉ cách. Xem proxy cho thu thập dữ liệu web và bảng giá.
Câu hỏi thường gặp
Tôi đổi IP rồi mà vẫn bị chặn — vì sao?
Vì việc bị chặn là chuyện hành vi, không phải IP. Hãy giãn tốc độ, giữ một danh tính mỗi phiên, sửa vân tay không khớp, và tôn trọng giới hạn của trang. Chỉ một IP mới sẽ không giúp nếu khuôn mẫu vẫn như cũ.
Nhiều IP hơn thì ít bị chặn hơn à?
Thường là không. Tốc độ hợp lý trên vài IP tốt thắng một trận lụt request trải trên nhiều IP. Thêm IP chỉ rải cùng một hành vi xấu ra khắp nơi; xem proxy sạch và blacklist.
Có nên ngẫu nhiên hoá mọi thứ cho giống người?
Không. Sự thiếu nhất quán — trình duyệt, múi giờ và ngôn ngữ mới ở mỗi request — tự nó đã đáng ngờ. Hãy trông như một khách bình thường, nhất quán, không phải một người khác mỗi lần.