Bỏ qua, tới nội dung chính
Esc

Bài viết

Proxy 4G là gì? Cách hoạt động, ưu nhược điểm và khi nào nên dùngProxy xoay là gì? Các kiểu xoay IP và cách đổi IP proxy bằng linkSOCKS5 và HTTP proxy khác nhau thế nào? Nên chọn loại nàoProxy và VPN khác nhau thế nào? Khi nào nên dùng cái nàoProxy tĩnh và proxy xoay khác nhau thế nào? Ưu nhược điểm và khi nào dùng loại nàoProxy riêng và proxy dùng chung — khác nhau thế nào, và với proxy 4G thì "riêng" nghĩa là gìProxy IPv4 và IPv6 khác nhau thế nào? Vì sao proxy IPv6 rẻ và khi nào nó không dùng đượcWebsite phát hiện proxy bằng cách nào? 8 tín hiệu mà hệ thống chống bot nhìn vàoProxy cho Facebook — quản lý nhiều tài khoản ổn định hơn với IP 4GProxy cho TikTok — khi nào cần IP Singapore và cách dùng cho đúngProxy cho quảng cáo — kiểm tra và quản lý quảng cáo nhắm thị trường SingaporeProxy cho Shopee, Lazada Singapore — xem giá, theo dõi đối thủ và vận hành gian hàngProxy cho thu thập dữ liệu web — chọn loại nào, xoay IP ra sao và làm đúng luật chơiCó cần proxy để mua vé concert, sự kiện trên ThaiTicketMajor, Ticketmelon, SISTIC?Scrape kết quả tìm kiếm Google và Bing bằng proxy — và khi nào nên dùng API thay thếCách scrape mà không bị chặn — tốc độ, phiên làm việc và IP sạchProxy cho theo dõi giá — bám giá đối thủ và giá bán lẻ theo từng vùngScrape website có chống bot, chống proxy (Cloudflare, Akamai, DataDome) — điều gì hiệu quả, đâu là giới hạnScrape dữ liệu có hợp pháp không? Robots.txt, điều khoản, dữ liệu cá nhân và bản quyền (Việt Nam, Singapore)Cách cài proxy trên Windows, macOS, iPhone và Android (có tài khoản, mật khẩu)Cách gắn proxy vào GoLogin, AdsPower, Hidemyacc, GenLogin và MultiloginTự động đổi IP proxy bằng API — ví dụ curl, Python và Node.jsCách kiểm tra proxy — IP, quốc gia, nhà mạng, tốc độ và rò rỉ DNS, WebRTCCác lỗi proxy thường gặp và cách khắc phục — 407, timeout, ERR_PROXY_CONNECTION_FAILEDScrape các trang render bằng JavaScript với trình duyệt headless và proxyLỗi 403, 429, 503 khi scrape — nguyên nhân và cách xử lý đúng (có code Python)Dùng proxy với Scrapy — cấu hình có mật khẩu, giới hạn tốc độ, xử lý lỗi và đổi IP giữa các lần chạyProxy 4G, proxy dân cư và proxy datacenter — so sánh chi tiết và cách chọnProxy Singapore — khi nào cần IP Singapore và nên chọn loại nàoProxy sạch và blacklist: "IP sạch" thật ra là gì, và vì sao "không bao giờ bị chặn" là hoang đườngProxy mobile xoay (proxy 4G xoay) — thế nào là "xoay sạch" và cách chọn cho đúngCách nhận biết proxy 4G thật hay giả — kiểm tra nhà mạng, loại IP, độ trễ và cách đổi IPProxy miễn phí và proxy trả phí — rủi ro thật sự của proxy free và khi nào đáng trả tiềnProxy 4G riêng, không share — vì sao proxy chỉ mình bạn dùng lại quan trọng, và cách tự kiểm traProxy 4G giá rẻ — $4 có ngay 200GB, và cách tính giá proxy mobile cho đúng trước khi muaGiới thiệu proxy nhận 10% hoa hồng mỗi đơn — cách chương trình giới thiệu của 65Proxy hoạt độngHướng dẫn và kiến thức về proxy 4G

Scrape dữ liệu có hợp pháp không? Robots.txt, điều khoản, dữ liệu cá nhân và bản quyền (Việt Nam, Singapore)

Theo nhu cầu 5 phút đọc

Trong bài này
  1. 01 Câu trả lời ngắn
  2. 02 Dữ liệu công khai và dữ liệu sau đăng nhập
  3. 03 Điều khoản sử dụng và robots.txt
  4. 04 Dữ liệu cá nhân: PDPA, Nghị định 13 và GDPR
  5. 05 Bản quyền và cơ sở dữ liệu
  6. 06 Vượt rào kỹ thuật là vùng rủi ro nhất
  7. 07 Checklist trước khi scrape
  8. 08 Vai trò của proxy trong chuyện này
  9. 09 Câu hỏi thường gặp

"Scrape có phạm pháp không?" không có một câu trả lời có hoặc không. Cùng một đoạn code có thể hoàn toàn bình thường khi lấy giá sản phẩm công khai, nhưng lại rủi ro khi lấy số điện thoại khách hàng hay khi chạy tiếp sau khi trang đã chặn bạn. Bài này tóm tắt những yếu tố quyết định mức rủi ro, với ví dụ từ Việt Nam, Singapore và vài vụ việc nổi tiếng ở nước ngoài.

Lưu ý: đây là thông tin chung để bạn biết nên đặt câu hỏi gì, không phải tư vấn pháp lý. Với dự án có giá trị lớn hoặc dính tới dữ liệu cá nhân, hãy hỏi luật sư ở nước bạn hoạt động.

Câu trả lời ngắn

Mức rủi ro phụ thuộc vào bốn câu hỏi:

  1. Dữ liệu gì? Dữ liệu công khai, không mang tính cá nhân (giá, mô tả sản phẩm, lịch sự kiện) ít rủi ro nhất. Dữ liệu cá nhân và nội dung có bản quyền rủi ro hơn.
  2. Lấy bằng cách nào? Truy cập như một khách bình thường khác hẳn việc đăng nhập, vượt CAPTCHA hay lách lệnh chặn.
  3. Dùng làm gì? Phân tích nội bộ khác với đăng lại nguyên văn hay bán lại dữ liệu.
  4. Ở đâu? Luật của nước bạn, nước của trang và nước của những người có dữ liệu đều có thể áp dụng.

Dữ liệu công khai và dữ liệu sau đăng nhập

  • Dữ liệu ai cũng xem được mà không cần tài khoản là vùng ít rủi ro nhất.
  • Dữ liệu sau đăng nhập gắn với điều khoản bạn đã đồng ý khi tạo tài khoản. Phần lớn nền tảng cấm thu thập tự động trong điều khoản, và vi phạm có thể dẫn tới khoá tài khoản hoặc kiện vi phạm hợp đồng.
  • Tạo tài khoản giả để lấy dữ liệu gần như chắc chắn vi phạm điều khoản, và làm mọi thứ khác trở nên rủi ro hơn.

Ở Mỹ, vụ hiQ kiện LinkedIn thường được nhắc tới: toà phúc thẩm cho rằng scrape hồ sơ công khai khó bị coi là "truy cập trái phép" theo luật chống xâm nhập máy tính. Nhưng hiQ sau đó vẫn thua ở phần vi phạm điều khoản sử dụng và phải ngừng thu thập. Bài học: "công khai" không có nghĩa là "muốn làm gì cũng được".

Điều khoản sử dụng và robots.txt

  • Điều khoản sử dụng là hợp đồng giữa bạn và trang (rõ ràng nhất khi bạn đã đăng ký tài khoản). Nếu điều khoản cấm thu thập tự động, bạn đang chấp nhận rủi ro hợp đồng khi làm điều đó.
  • robots.txt là file trang dùng để nói với các chương trình tự động phần nào được và không được truy cập. Ở nhiều nơi nó không phải là luật, nhưng nó là bằng chứng rõ ràng về ý muốn của chủ trang — và bỏ qua nó sẽ bị nhìn nhận không tốt nếu có tranh chấp.

Cách đơn giản và an toàn: đọc cả hai, và làm theo.

Dữ liệu cá nhân: PDPA, Nghị định 13 và GDPR

Đây là vùng rủi ro lớn nhất, và "dữ liệu công khai" không phải tấm khiên:

  • Việt Nam: Nghị định 13/2023/NĐ-CP về bảo vệ dữ liệu cá nhân, và Luật Bảo vệ dữ liệu cá nhân được thông qua năm 2025, có hiệu lực từ ngày 1/1/2026. Thu thập, xử lý dữ liệu cá nhân cần có cơ sở hợp pháp, và mua bán dữ liệu cá nhân bị cấm.
  • Singapore: Đạo luật Bảo vệ Dữ liệu Cá nhân (PDPA) quy định cách tổ chức thu thập, sử dụng và tiết lộ dữ liệu cá nhân. Có ngoại lệ cho dữ liệu công khai, nhưng không phải là tự do hoàn toàn.
  • Liên minh châu Âu: GDPR coi dữ liệu cá nhân công khai vẫn là dữ liệu cá nhân, và việc scrape nó cần cơ sở pháp lý. Nhiều cơ quan bảo vệ dữ liệu đã ra tuyên bố chung cảnh báo về việc scrape dữ liệu cá nhân trên mạng xã hội.

Quy tắc thực tế: nếu không thật sự cần dữ liệu cá nhân, đừng thu thập nó. Lọc bỏ tên, số điện thoại, email ngay từ lúc lấy.

  • Sự kiện và con số (giá, ngày, thông số) thường không được bảo hộ bản quyền.
  • Nội dung sáng tạo — bài viết, ảnh, video, đánh giá của người dùng — thì có. Đăng lại nguyên văn là vấn đề bản quyền, bất kể bạn lấy bằng tay hay bằng code.
  • Một số nước có ngoại lệ cho phân tích dữ liệu bằng máy tính. Ví dụ Singapore có ngoại lệ cho phân tích dữ liệu tính toán trong Luật Bản quyền 2021 — với điều kiện bạn truy cập tác phẩm một cách hợp pháp.
  • Liên minh châu Âu còn bảo hộ riêng cho cơ sở dữ liệu mà chủ sở hữu đầu tư đáng kể để xây dựng.

Phân tích, thống kê và trích dẫn ngắn có nguồn rủi ro thấp hơn nhiều so với sao chép và đăng lại.

Vượt rào kỹ thuật là vùng rủi ro nhất

Một khi trang đã chủ động ngăn bạn — chặn IP, đặt CAPTCHA, yêu cầu đăng nhập, gửi yêu cầu dừng — thì việc tiếp tục bằng cách lách những rào chắn đó thay đổi hẳn bản chất câu chuyện.

Ví dụ hay được trích dẫn là vụ Craigslist kiện 3Taps ở Mỹ: sau khi Craigslist gửi yêu cầu dừng và chặn IP, 3Taps tiếp tục truy cập bằng proxy, và toà án cho rằng việc đó có thể cấu thành truy cập trái phép. Ở Việt Nam, Bộ luật Hình sự có tội danh về xâm nhập trái phép vào mạng máy tính, phương tiện điện tử của người khác (Điều 289), áp dụng cho việc vượt qua cảnh báo, mã truy cập hay tường lửa.

Nói thẳng, với tư cách người bán proxy: dùng proxy để tiếp tục sau khi đã bị chặn hoặc được yêu cầu dừng là đúng kiểu việc khiến các vụ kiện thua. Proxy không biến một việc rủi ro thành hợp pháp.

Checklist trước khi scrape

  • Có API hay dữ liệu mở cho việc này không?
  • Dữ liệu có công khai không, có cần đăng nhập không?
  • Điều khoản và robots.txt nói gì?
  • Có dữ liệu cá nhân không? Nếu có, bạn có thật sự cần và có cơ sở pháp lý không?
  • Bạn sẽ đăng lại nội dung hay chỉ phân tích?
  • Tốc độ của bạn có ảnh hưởng tới trang không?
  • Trang có đang chặn bạn hay đã yêu cầu bạn dừng không? Nếu có — dừng lại.

Vai trò của proxy trong chuyện này

Proxy là công cụ mạng, giống trình duyệt hay VPN. Những cách dùng chính đáng khi thu thập dữ liệu:

  • xem dữ liệu như người dùng ở một quốc gia — giá và kết quả ở Singapore,
  • truy cập dữ liệu công khai trên trang chặn cả dải IP máy chủ dù không cấm việc truy cập,
  • chia tải nhẹ nhàng cho một công việc vốn đã được phép.

Proxy không thay đổi việc bạn được phép làm gì. Xem cách làm đúng trong bài proxy cho thu thập dữ liệu web và scrape website có chống bot.

Câu hỏi thường gặp

Scrape giá sản phẩm của đối thủ có hợp pháp không?

Giá công khai thường là vùng ít rủi ro nhất: là sự kiện, không phải dữ liệu cá nhân, không cần đăng nhập. Vẫn nên đọc điều khoản, đi chậm và không đăng lại nội dung của họ. Xem proxy theo dõi giá.

Dữ liệu đã công khai trên mạng xã hội thì lấy thoải mái được không?

Không. Tên, ảnh, số điện thoại công khai vẫn là dữ liệu cá nhân theo Nghị định 13, PDPA hay GDPR, và điều khoản của các nền tảng thường cấm thu thập tự động.

Dùng proxy có giúp tôi tránh trách nhiệm không?

Không. Proxy chỉ thay IP, không thay người chịu trách nhiệm. Dùng proxy để lách lệnh chặn còn có thể bị xem là bằng chứng bạn biết mình không được phép.