Amazon nhận sách hiếm để huấn luyện AI: cần làm rõ nguồn sách, quyền sử dụng và quy trình đưa dữ liệu vào mô hình
Amazon bị điều tra vì cắt gáy, số hóa sách hiếm rồi hủy bản gốc để huấn luyện AI. Vấn đề không chỉ là dùng sách, mà là thiếu minh bạch về nguồn và quyền.

Amazon nhận sách hiếm nào, từ đâu, và điều gì đã được xác nhận?
Câu chuyện bắt đầu từ một cuộc điều tra của nhà báo Emanuel Maiberg trên 404 Media. Theo báo cáo này, Amazon đã mua khoảng 1.000 cuốn sách hiếm qua các kênh thương mại thông thường, rồi chuyển chúng đến một cơ sở của công ty tại Las Vegas — được xác định là LAS8/VGT3.
Chi tiết đáng chú ý nhất là cách sự việc bị phát hiện: một đơn hàng sách hiếm đặt qua nền tảng bán sách cũ Biblio được gắn AirTag để theo dõi. Thiết bị này cho thấy lô sách kết thúc hành trình ngay tại cơ sở của Amazon, không phải nơi người mua ban đầu kỳ vọng.
Theo Maiberg, tại cơ sở này, nhân viên cắt bỏ gáy sách, quét từng trang, sau đó tiêu hủy bản gốc vật lý. Đơn hàng được đặt vào tháng 7/2026, và bài điều tra được công bố vào giữa tháng 8/2026.
Amazon đã phản hồi, nhưng chỉ bằng một câu nói chung: công ty mua sách qua các kênh thương mại để cải thiện sản phẩm và dịch vụ mà khách hàng sử dụng. Amazon không xác nhận việc sách được dùng để huấn luyện AI, cũng không giải thích vì sao bản gốc bị hủy sau khi số hóa.
Điều chưa được xác nhận công khai cũng cần nói rõ: báo cáo hiện tại không xác định được chủ sở hữu gốc của từng cuốn sách, ngoài người bán trên Biblio và Amazon là bên mua. Chuỗi lưu ký (chain of custody) đầy đủ của toàn bộ lô sách cũng chưa được công khai.
Sách hiếm biến thành dữ liệu huấn luyện AI qua quy trình nào?
Trước khi trở thành dữ liệu huấn luyện, một cuốn sách vật lý phải đi qua ba bước cơ bản: số hóa, trích xuất văn bản và tiền xử lý.
Ở bước số hóa, sách được quét thành ảnh từng trang. Cách quét nhanh và triệt để nhất — như mô tả trong báo cáo của Maiberg — là cắt bỏ gáy sách để đưa từng trang rời qua máy quét, thay vì quét sách còn nguyên bìa. Đây là lý do bản gốc bị phá hủy sau khi số hóa.
Sau đó, phần mềm nhận diện ký tự quang học (OCR) chuyển ảnh trang sách thành văn bản có thể xử lý được. Văn bản này tiếp tục qua các bước làm sạch: loại bỏ lỗi OCR, khử trùng lặp, lọc nội dung không phù hợp, gắn nhãn metadata.
Chỉ sau khi hoàn tất các bước này, văn bản mới được đưa vào tập dữ liệu huấn luyện — tức là dùng để cập nhật trọng số của mô hình AI trong quá trình huấn luyện hoặc tinh chỉnh.
Điều này khác hoàn toàn với việc AI tra cứu sách theo yêu cầu (retrieval), nơi văn bản được truy xuất tạm thời để trả lời một câu hỏi cụ thể mà không đi vào bộ trọng số mô hình. Nếu sách thực sự được dùng để huấn luyện, nội dung của nó — theo một nghĩa nào đó — trở thành một phần cấu trúc bên trong của mô hình, không thể tách rời hay xóa bỏ dễ dàng sau này.
Vì sao sách hiếm là loại dữ liệu khác biệt so với văn bản phổ biến trên internet?
Theo lập luận trong bài điều tra của Maiberg, sách in hiếm có giá trị đặc biệt cho huấn luyện AI vì hai lý do: chúng chứa văn bản chưa bị crawl từ internet, và chúng không lẫn văn bản do AI tạo ra một vấn đề ngày càng nghiêm trọng khi mô hình AI học từ dữ liệu do chính AI khác sinh ra.
Nhưng chính sự khan hiếm đó cũng khiến loại tài liệu này nhạy cảm hơn. Một cuốn sách phổ biến có thể tồn tại ở hàng nghìn bản in, nhiều bản đã ở dạng số hóa công khai, thuộc phạm vi công cộng hoặc có giấy phép rõ ràng. Sách hiếm thường chỉ còn vài bản, tình trạng bản quyền không rõ ràng, và chủ sở hữu nếu còn tồn tại có quyền kiểm soát chặt việc sao chép hoặc số hóa.
Việc phá hủy bản gốc sau khi quét làm mất đi khả năng kiểm chứng độc lập. Không còn cuốn sách vật lý, không ai có thể xác minh lại nội dung đã quét có chính xác hay không, hoặc liệu bản gốc có từng bị hạn chế sử dụng theo hợp đồng, di sản, hay thỏa thuận với tác giả/nhà xuất bản.
Nói cách khác, dùng một bài blog công khai để huấn luyện AI và dùng một cuốn sách hiếm chỉ còn vài bản là hai rủi ro pháp lý và đạo đức hoàn toàn khác cấp độ — dù về mặt kỹ thuật, quy trình xử lý dữ liệu có thể giống nhau.
Amazon cần công khai điều gì để chứng minh việc sử dụng sách là hợp pháp?
Các phán quyết gần đây tại tòa liên bang Mỹ (khu vực Bắc California) cho thấy việc quét sách đã mua hợp pháp để huấn luyện AI có thể được xem là fair use kể cả khi bản gốc bị phá hủy sau khi số hóa. Nhưng các tòa cũng nhấn mạnh: sách có được từ nguồn lậu hoặc bất hợp pháp không được bảo vệ bởi fair use, dù mục đích sử dụng sau đó là gì.
Điều này đặt ra một danh sách cụ thể mà Amazon cần làm rõ, dựa trên các thực hành chuẩn về minh bạch dữ liệu huấn luyện AI:
- Nguồn gốc từng cuốn sách: mua từ ai, qua kênh nào, có hóa đơn hợp lệ hay không
- Tình trạng bản quyền: sách thuộc phạm vi công cộng, có giấy phép, hay vẫn còn bản quyền hiệu lực
- Cơ sở pháp lý cho việc sử dụng: dựa vào fair use, giấy phép trả phí, hay ngoại lệ khai thác dữ liệu văn bản (text-and-data-mining)
- Mục đích sử dụng cụ thể: huấn luyện mô hình nào, phiên bản nào, có công khai hay nội bộ
- Biện pháp bảo toàn bản sao: có lưu trữ bản số hóa gốc để kiểm chứng sau này hay không, thay vì chỉ giữ dữ liệu đã qua xử lý
- Cơ chế phản đối và bồi thường: tác giả, nhà xuất bản, hoặc chủ sở hữu bản quyền có thể yêu cầu loại trừ hoặc khiếu nại theo cách nào
Hiện tại, phát ngôn duy nhất của Amazon — mua sách để “cải thiện sản phẩm và dịch vụ” — không trả lời được bất kỳ điểm nào trong danh sách trên. Đó chính là khoảng trống khiến câu chuyện chuyển từ một chi tiết kỹ thuật thành một vấn đề về trách nhiệm giải trình.
Sau cuộc điều tra, ngành xuất bản và người đọc nên theo dõi điều gì tiếp theo?
Câu hỏi lớn nhất còn bỏ ngỏ là liệu Amazon sẽ đưa ra phản hồi chi tiết hơn, hay tiếp tục giữ nguyên phát ngôn chung như hiện tại. Một tuyên bố mơ hồ có thể là chiến lược pháp lý có chủ đích — tránh xác nhận bất cứ điều gì có thể bị dùng làm chứng cứ trong tranh chấp sau này.
Bên cạnh đó, người bán sách trên Biblio và các nhà cung cấp sách hiếm khác cần được hỏi: họ có biết người mua cuối cùng là Amazon, và mục đích sử dụng thực sự là gì, hay chỉ đơn giản bán sách như một giao dịch thương mại thông thường?
Với tác giả và nhà xuất bản đang còn giữ bản quyền, câu hỏi thực tế hơn: liệu họ có quyền yêu cầu Amazon xác nhận danh sách đầu sách cụ thể đã bị số hóa, và có cơ chế nào để phản đối hoặc đàm phán cấp phép hồi tố?
Về mặt pháp lý, các án lệ hiện tại tại Mỹ nghiêng về hướng có lợi cho việc huấn luyện AI trên sách mua hợp pháp, nhưng chưa giải quyết dứt điểm các vấn đề về thiệt hại, khả năng thay thế thị trường gốc của sách, và các tình huống thực tế nằm ngoài phạm vi những vụ kiện đã có phán quyết. Nếu có tranh chấp phát sinh từ lô sách này, nó có thể trở thành một phép thử mới cho ranh giới giữa fair use và vi phạm bản quyền trong huấn luyện AI.
Vấn đề thực sự không nằm ở việc AI có được học từ sách hiếm hay không — công nghệ này sẽ tiếp tục cần dữ liệu chất lượng cao, và sách in vẫn là một trong những nguồn tốt nhất. Vấn đề là các công ty AI có sẵn sàng công khai toàn bộ chuỗi cung ứng dữ liệu của mình, hay tiếp tục coi sự mơ hồ về nguồn gốc là một lợi thế cạnh tranh cần được bảo vệ.
Related in AI

Cảnh báo AI diệt vong: Vì sao xác suất hơn 10% buộc chính phủ phải hành động?

iPhone 18 Pro Max: Tìm kiếm tăng 500%, giá cao chưa từng có

Gemini Enterprise for Legal: AI tăng tốc hồ sơ, nhưng trách nhiệm vẫn thuộc về luật sư
