Scrape kết quả tìm kiếm Google và Bing bằng proxy — và khi nào nên dùng API thay thế
Trong bài này
Đọc kết quả tìm kiếm bằng chương trình — để theo dõi thứ hạng, nghiên cứu từ khoá hay nghiên cứu thị trường — là một trong những việc scrape khó nhất. Công cụ tìm kiếm chặn rất mạnh, và kết quả hiển thị phụ thuộc nhiều vào nơi phát ra yêu cầu. Proxy đổi được "nơi bạn xuất hiện", điều quan trọng với kết quả theo vùng, nhưng không biến Google thành nguồn dữ liệu mở. Bài này nói thẳng: khi nào nên scrape SERP, khi nào nên dùng API chính thức, và làm sao để không dội bom máy chủ của ai.
Vì sao công cụ tìm kiếm khó scrape
Kết quả tìm kiếm không được thiết kế cho bot đọc, và điều đó thể hiện rõ:
- Hệ thống chống bot mạnh tung CAPTCHA và chặn ngay khi lưu lượng trông giống tự động.
- Kết quả theo vùng và cá nhân hoá — theo quốc gia, ngôn ngữ, đôi khi theo lịch sử — nên không có "thứ hạng duy nhất".
- HTML thay đổi thường xuyên, nên bộ phân tích chạy tốt tháng trước có thể hỏng.
- Vi phạm điều khoản của các công cụ tìm kiếm khi scrape kết quả, kèm rủi ro riêng của nó.
Đổi IP giúp phần "ở đâu" nhưng không giải quyết tốc độ, việc phân tích hay điều khoản. Nó là một mảnh, không phải lời giải.
Thử API chính thức trước
Trước khi scrape, hãy xem API có cho bạn thứ cần không — ổn định và hợp lệ hơn nhiều:
- Google Programmable Search / Custom Search JSON API trả kết quả có cấu trúc cho phạm vi đã cấu hình.
- Bing Web Search API trả kết quả và dữ liệu đi kèm trực tiếp.
- Google Ads Keyword Planner cho lượng tìm kiếm và gợi ý từ khoá.
- Google Search Console cho thứ hạng và lượt nhấp thật của chính website bạn — nguồn tốt nhất cho thứ hạng của bạn.
Nếu một trong số này phù hợp, bạn tránh được toàn bộ bài toán bị chặn.
Khi nào proxy thật sự giúp ích
Proxy xứng đáng khi bạn cần kết quả đúng như người tìm kiếm ở Singapore thấy:
- Theo dõi thứ hạng tại địa phương cho các từ khoá của bạn trên thị trường Singapore.
- Xem local pack và đối thủ địa phương vốn chỉ hiện với người dùng Singapore.
- Kiểm tra quảng cáo — xem quảng cáo nào chạy trên từ khoá của bạn ở Singapore (xem proxy cho quảng cáo).
IP Singapore với ngôn ngữ/vùng Singapore cho bạn SERP địa phương thay vì SERP ở nước bạn.
Làm sao để không bị chặn
Tốc độ và sự nhất quán quan trọng hơn nhiều so với số lượng IP:
- Mỗi lần một truy vấn, với tốc độ như người thật — cách nhau vài giây, không phải hàng trăm lần mỗi phút.
- Đặt ngôn ngữ/vùng nhất quán (quốc gia và ngôn ngữ) để kết quả ổn định và so sánh được.
- Giữ một phiên trên một IP, và chỉ đổi IP khi thật sự bị giới hạn (mỗi proxy 65Proxy đổi IP tối đa một lần mỗi 5 phút).
- Phân tích phòng thủ và lường trước việc đổi bố cục.
Cẩm nang chung có trong bài cách scrape mà không bị chặn và proxy cho thu thập dữ liệu web.
Proxy 4G Singapore của 65Proxy cho việc kiểm tra SERP
Chúng tôi bán IP di động Singapore thật — hợp để xem kết quả Singapore địa phương và theo dõi từ khoá của chính bạn với tốc độ vừa phải. Hỗ trợ HTTP và SOCKS5, đổi IP bằng link, 200GB mỗi gói, giá 1 ngày $4, 7 ngày $13, 1 tháng $40. Nếu cần dữ liệu SERP quy mô lớn ở nhiều quốc gia, một API SERP chuyên dụng thường kinh tế và đáng tin hơn — chúng tôi nói thẳng thay vì bán sai công cụ. Xem bảng giá.
Câu hỏi thường gặp
Scrape kết quả Google có hợp pháp không?
Việc này vi phạm điều khoản của Google, và bức tranh pháp lý khác nhau theo từng nước. Kết quả công khai đọc với tốc độ hợp lý ít rủi ro hơn, nhưng API chính thức vừa an toàn vừa ổn định hơn — ưu tiên dùng khi phù hợp.
Vì sao tôi thấy kết quả khác với khách hàng?
Kết quả theo vùng và cá nhân hoá. Một phiên mới trên IP Singapore, với ngôn ngữ/vùng Singapore, cho bạn góc nhìn địa phương trung lập hơn so với trình duyệt đang đăng nhập của bạn.
Tôi chạy được bao nhiêu truy vấn?
Không có con số cố định — tốc độ quan trọng hơn số IP. Hãy giãn truy vấn ra và lùi lại ngay khi có dấu hiệu bị giới hạn; xem cách scrape mà không bị chặn.