Scrape dữ liệu có hợp pháp không? Robots.txt, điều khoản, dữ liệu cá nhân và bản quyền (Việt Nam, Singapore)
Trong bài này
- 01 Câu trả lời ngắn
- 02 Dữ liệu công khai và dữ liệu sau đăng nhập
- 03 Điều khoản sử dụng và robots.txt
- 04 Dữ liệu cá nhân: PDPA, Nghị định 13 và GDPR
- 05 Bản quyền và cơ sở dữ liệu
- 06 Vượt rào kỹ thuật là vùng rủi ro nhất
- 07 Checklist trước khi scrape
- 08 Vai trò của proxy trong chuyện này
- 09 Câu hỏi thường gặp
"Scrape có phạm pháp không?" không có một câu trả lời có hoặc không. Cùng một đoạn code có thể hoàn toàn bình thường khi lấy giá sản phẩm công khai, nhưng lại rủi ro khi lấy số điện thoại khách hàng hay khi chạy tiếp sau khi trang đã chặn bạn. Bài này tóm tắt những yếu tố quyết định mức rủi ro, với ví dụ từ Việt Nam, Singapore và vài vụ việc nổi tiếng ở nước ngoài.
Lưu ý: đây là thông tin chung để bạn biết nên đặt câu hỏi gì, không phải tư vấn pháp lý. Với dự án có giá trị lớn hoặc dính tới dữ liệu cá nhân, hãy hỏi luật sư ở nước bạn hoạt động.
Câu trả lời ngắn
Mức rủi ro phụ thuộc vào bốn câu hỏi:
- Dữ liệu gì? Dữ liệu công khai, không mang tính cá nhân (giá, mô tả sản phẩm, lịch sự kiện) ít rủi ro nhất. Dữ liệu cá nhân và nội dung có bản quyền rủi ro hơn.
- Lấy bằng cách nào? Truy cập như một khách bình thường khác hẳn việc đăng nhập, vượt CAPTCHA hay lách lệnh chặn.
- Dùng làm gì? Phân tích nội bộ khác với đăng lại nguyên văn hay bán lại dữ liệu.
- Ở đâu? Luật của nước bạn, nước của trang và nước của những người có dữ liệu đều có thể áp dụng.
Dữ liệu công khai và dữ liệu sau đăng nhập
- Dữ liệu ai cũng xem được mà không cần tài khoản là vùng ít rủi ro nhất.
- Dữ liệu sau đăng nhập gắn với điều khoản bạn đã đồng ý khi tạo tài khoản. Phần lớn nền tảng cấm thu thập tự động trong điều khoản, và vi phạm có thể dẫn tới khoá tài khoản hoặc kiện vi phạm hợp đồng.
- Tạo tài khoản giả để lấy dữ liệu gần như chắc chắn vi phạm điều khoản, và làm mọi thứ khác trở nên rủi ro hơn.
Ở Mỹ, vụ hiQ kiện LinkedIn thường được nhắc tới: toà phúc thẩm cho rằng scrape hồ sơ công khai khó bị coi là "truy cập trái phép" theo luật chống xâm nhập máy tính. Nhưng hiQ sau đó vẫn thua ở phần vi phạm điều khoản sử dụng và phải ngừng thu thập. Bài học: "công khai" không có nghĩa là "muốn làm gì cũng được".
Điều khoản sử dụng và robots.txt
- Điều khoản sử dụng là hợp đồng giữa bạn và trang (rõ ràng nhất khi bạn đã đăng ký tài khoản). Nếu điều khoản cấm thu thập tự động, bạn đang chấp nhận rủi ro hợp đồng khi làm điều đó.
- robots.txt là file trang dùng để nói với các chương trình tự động phần nào được và không được truy cập. Ở nhiều nơi nó không phải là luật, nhưng nó là bằng chứng rõ ràng về ý muốn của chủ trang — và bỏ qua nó sẽ bị nhìn nhận không tốt nếu có tranh chấp.
Cách đơn giản và an toàn: đọc cả hai, và làm theo.
Dữ liệu cá nhân: PDPA, Nghị định 13 và GDPR
Đây là vùng rủi ro lớn nhất, và "dữ liệu công khai" không phải tấm khiên:
- Việt Nam: Nghị định 13/2023/NĐ-CP về bảo vệ dữ liệu cá nhân, và Luật Bảo vệ dữ liệu cá nhân được thông qua năm 2025, có hiệu lực từ ngày 1/1/2026. Thu thập, xử lý dữ liệu cá nhân cần có cơ sở hợp pháp, và mua bán dữ liệu cá nhân bị cấm.
- Singapore: Đạo luật Bảo vệ Dữ liệu Cá nhân (PDPA) quy định cách tổ chức thu thập, sử dụng và tiết lộ dữ liệu cá nhân. Có ngoại lệ cho dữ liệu công khai, nhưng không phải là tự do hoàn toàn.
- Liên minh châu Âu: GDPR coi dữ liệu cá nhân công khai vẫn là dữ liệu cá nhân, và việc scrape nó cần cơ sở pháp lý. Nhiều cơ quan bảo vệ dữ liệu đã ra tuyên bố chung cảnh báo về việc scrape dữ liệu cá nhân trên mạng xã hội.
Quy tắc thực tế: nếu không thật sự cần dữ liệu cá nhân, đừng thu thập nó. Lọc bỏ tên, số điện thoại, email ngay từ lúc lấy.
Bản quyền và cơ sở dữ liệu
- Sự kiện và con số (giá, ngày, thông số) thường không được bảo hộ bản quyền.
- Nội dung sáng tạo — bài viết, ảnh, video, đánh giá của người dùng — thì có. Đăng lại nguyên văn là vấn đề bản quyền, bất kể bạn lấy bằng tay hay bằng code.
- Một số nước có ngoại lệ cho phân tích dữ liệu bằng máy tính. Ví dụ Singapore có ngoại lệ cho phân tích dữ liệu tính toán trong Luật Bản quyền 2021 — với điều kiện bạn truy cập tác phẩm một cách hợp pháp.
- Liên minh châu Âu còn bảo hộ riêng cho cơ sở dữ liệu mà chủ sở hữu đầu tư đáng kể để xây dựng.
Phân tích, thống kê và trích dẫn ngắn có nguồn rủi ro thấp hơn nhiều so với sao chép và đăng lại.
Vượt rào kỹ thuật là vùng rủi ro nhất
Một khi trang đã chủ động ngăn bạn — chặn IP, đặt CAPTCHA, yêu cầu đăng nhập, gửi yêu cầu dừng — thì việc tiếp tục bằng cách lách những rào chắn đó thay đổi hẳn bản chất câu chuyện.
Ví dụ hay được trích dẫn là vụ Craigslist kiện 3Taps ở Mỹ: sau khi Craigslist gửi yêu cầu dừng và chặn IP, 3Taps tiếp tục truy cập bằng proxy, và toà án cho rằng việc đó có thể cấu thành truy cập trái phép. Ở Việt Nam, Bộ luật Hình sự có tội danh về xâm nhập trái phép vào mạng máy tính, phương tiện điện tử của người khác (Điều 289), áp dụng cho việc vượt qua cảnh báo, mã truy cập hay tường lửa.
Nói thẳng, với tư cách người bán proxy: dùng proxy để tiếp tục sau khi đã bị chặn hoặc được yêu cầu dừng là đúng kiểu việc khiến các vụ kiện thua. Proxy không biến một việc rủi ro thành hợp pháp.
Checklist trước khi scrape
- Có API hay dữ liệu mở cho việc này không?
- Dữ liệu có công khai không, có cần đăng nhập không?
- Điều khoản và robots.txt nói gì?
- Có dữ liệu cá nhân không? Nếu có, bạn có thật sự cần và có cơ sở pháp lý không?
- Bạn sẽ đăng lại nội dung hay chỉ phân tích?
- Tốc độ của bạn có ảnh hưởng tới trang không?
- Trang có đang chặn bạn hay đã yêu cầu bạn dừng không? Nếu có — dừng lại.
Vai trò của proxy trong chuyện này
Proxy là công cụ mạng, giống trình duyệt hay VPN. Những cách dùng chính đáng khi thu thập dữ liệu:
- xem dữ liệu như người dùng ở một quốc gia — giá và kết quả ở Singapore,
- truy cập dữ liệu công khai trên trang chặn cả dải IP máy chủ dù không cấm việc truy cập,
- chia tải nhẹ nhàng cho một công việc vốn đã được phép.
Proxy không thay đổi việc bạn được phép làm gì. Xem cách làm đúng trong bài proxy cho thu thập dữ liệu web và scrape website có chống bot.
Câu hỏi thường gặp
Scrape giá sản phẩm của đối thủ có hợp pháp không?
Giá công khai thường là vùng ít rủi ro nhất: là sự kiện, không phải dữ liệu cá nhân, không cần đăng nhập. Vẫn nên đọc điều khoản, đi chậm và không đăng lại nội dung của họ. Xem proxy theo dõi giá.
Dữ liệu đã công khai trên mạng xã hội thì lấy thoải mái được không?
Không. Tên, ảnh, số điện thoại công khai vẫn là dữ liệu cá nhân theo Nghị định 13, PDPA hay GDPR, và điều khoản của các nền tảng thường cấm thu thập tự động.
Dùng proxy có giúp tôi tránh trách nhiệm không?
Không. Proxy chỉ thay IP, không thay người chịu trách nhiệm. Dùng proxy để lách lệnh chặn còn có thể bị xem là bằng chứng bạn biết mình không được phép.