An toàn AIKinh doanh & Thị trường 🇷🇺 07.08.2026 17:01

Tải nhầm tệp lên AI — Bị sa thải. Bảo mật dữ liệu trong AI hoạt động như thế nào

DeepSeekDeepSeek OpenAIOpenAI Google/DeepMindGoogle/DeepMind
Nhân viên đang tải dữ liệu doanh nghiệp lên các dịch vụ AI công cộng với số lượng ngày càng tăng, thường không có quy định hoặc hiểu biết về luồng dữ liệu. Ví dụ gần đây: một quản lý cấp cao bị sa thải vì tải tài liệu công việc lên DeepSeek. Bài viết giải thích dữ liệu đi đâu, ai có thể thấy, và tại sao việc xóa thường không thể khôi phục.
Bài viết của Daria Lushkina đăng trên RuNet Rating xem xét vấn đề an toàn dữ liệu khi sử dụng mạng nơ-ron (neural network). Bài viết dẫn một nghiên cứu cho thấy nhân viên tại 150 công ty Nga đã tải lên các dịch vụ AI công cộng lượng dữ liệu doanh nghiệp nhiều gấp 30 lần vào năm 2025 so với một năm trước đó, và 60% doanh nghiệp không có bất kỳ quy định nào về việc sử dụng AI. Vào tháng 7, một quản lý cấp cao của một công ty kỹ thuật ở Moscow đã bị sa thải vì tải các tài liệu công việc lên DeepSeek, và tòa án đã đứng về phía nhà tuyển dụng. Bài viết mô tả chi tiết quy trình xử lý dữ liệu: các tệp được phân tích cú pháp (parse), văn bản được trích xuất, chia thành các đoạn nhỏ, rồi chuyển đổi thành các vector nhúng (embedding), để lại dấu vết trong nhật ký hệ thống (log) và bộ nhớ lưu trữ. Dữ liệu có thể gặp rủi ro ở nhiều khâu: khi lưu trữ, trong nhật ký hệ thống, trong chuỗi các bên thứ ba tham gia xử lý, và trong quá trình huấn luyện mô hình. Việc xóa dữ liệu khá phức tạp: xóa một cuộc hội thoại không có nghĩa là xóa hết mọi bản sao, và nếu dữ liệu đó đã được dùng để huấn luyện mô hình thì ảnh hưởng của nó gần như không thể đảo ngược. Bài viết cũng đề cập đến “machine unlearning” (làm cho máy quên dữ liệu) như một hướng nghiên cứu đang được phát triển. Bài viết lưu ý rằng các cuộc hội thoại đôi khi có thể được con người kiểm duyệt xem xét, như trường hợp của Gemini (Google), và rằng các đối tác hạ tầng như nhà cung cấp dịch vụ đám mây (cloud) cũng có quyền truy cập dữ liệu. Bài viết nhắc đến vụ rò rỉ dữ liệu của DeepSeek năm 2023, trong đó hơn một triệu dòng nhật ký trò chuyện và các khóa truy cập (key) đã bị lộ. Ngoài ra, các kỹ sư của Samsung từng gửi mã nguồn cho ChatGPT, còn người đứng đầu một cơ quan an ninh mạng của Hoa Kỳ từng tải lên các tài liệu nhạy cảm. Tác giả khuyến nghị người dùng nên thận trọng và tìm hiểu kỹ các chính sách xử lý dữ liệu trước khi sử dụng các dịch vụ AI.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới