Bỏ qua điều hướng
CÔNG TY CỔ PHẦN GIẢI PHÁP CÔNG NGHỆ HQG
Giai đoạn 9 · Bảo mậtCơ bản

Bảo mật dữ liệu khi dùng AI: chạy on-prem, phân quyền, nhật ký, giấy phép mô hình và tuân thủ

Khung việc cần làm để dùng AI với dữ liệu nhạy cảm: phân loại dữ liệu, chạy on-prem, phân quyền, nhật ký truy cập, quản lý bí mật, kiểm tra giấy phép mô hình khi dùng thương mại và lưu ý tổng quát về pháp luật bảo vệ dữ liệu cá nhân tại Việt Nam.

Khoảng 6 phút đọcCập nhật: 09/20268 bước
Mục tiêu

Có danh sách kiểm soát tối thiểu trước khi đưa dữ liệu thật của doanh nghiệp vào hệ thống AI, và biết khi nào cần tham vấn pháp lý.

Dành cho ai
  • Chủ doanh nghiệp, ban giám đốc ra quyết định dùng AI
  • Trưởng phòng IT, an toàn thông tin
  • Kỹ sư triển khai AI
Yêu cầu
  • Không yêu cầu phần cứng riêng — áp dụng cho mọi hệ thống AI của doanh nghiệp
  • Nắm sơ đồ hệ thống AI dự định triển khai (xem triển khai suy luậnRAG)
Mục lục bài

Rủi ro chính khi đưa dữ liệu vào AI

Rủi roVí dụKiểm soát
Dữ liệu ra ngoàiNhân viên dán hợp đồng vào dịch vụ AI công cộngChính sách sử dụng, cung cấp công cụ nội bộ thay thế, chặn/giám sát ở gateway
Truy cập vượt quyềnChatbot RAG trả lời bằng tài liệu lương cho người không được xemLọc quyền ở tầng truy xuất, đồng bộ quyền
Dữ liệu nằm lại trong mô hìnhFine-tune bằng dữ liệu có thông tin cá nhân, mô hình lặp lại nguyên vănẨn danh hoá trước khi huấn luyện, kiểm thử rò rỉ
Tấn công qua promptTài liệu chứa câu lệnh ẩn khiến mô hình làm sai chỉ dẫnKhông cho LLM quyền hành động nhạy cảm, kiểm tra đầu vào/đầu ra
Vi phạm giấy phépDùng mô hình giấy phép phi thương mại cho sản phẩm bán raKiểm tra giấy phép trước khi chọn mô hình

Các bước thực hiện

Tiến độ của bạn
0/8

Tiến độ chỉ lưu trên trình duyệt này.

  1. Bước 1: Phân loại dữ liệu trước khi chọn kiến trúc

    • Chia tối thiểu 3–4 mức: công khai, nội bộ, mật, dữ liệu cá nhân/nhạy cảm.
    • Xác định mức nào được phép gửi tới dịch vụ AI bên ngoài, mức nào bắt buộc xử lý on-prem.
    • Ghi rõ chủ sở hữu dữ liệu (phòng ban) — người quyết định ai được dùng dữ liệu cho AI.
  2. Bước 2: Chạy on-prem cho dữ liệu nhạy cảm

    • Mô hình, vector DB, nhật ký, checkpoint đặt trên hạ tầng doanh nghiệp kiểm soát.
    • Tách mạng: máy AI nằm trong phân vùng riêng, chỉ mở cổng cần thiết qua reverse proxy.
    • Kiểm tra các thành phần có "gọi về nhà" hay không (telemetry, tải mô hình, theo dõi thí nghiệm cloud) và tắt/khoá theo chính sách.
    • Máy không cần Internet khi vận hành: tải mô hình và gói qua kho nội bộ hoặc máy trung gian.
  3. Bước 3: Phân quyền và xác thực

    • Đăng nhập tập trung (SSO/OIDC, LDAP) cho giao diện chat; tắt tự đăng ký tài khoản.
    • Nguyên tắc quyền tối thiểu: người dùng, ứng dụng, tài khoản dịch vụ chỉ có quyền cần thiết.
    • RAG: quyền xem tài liệu áp ở câu truy vấn dữ liệu, không nằm trong prompt.
    • Quyền quản trị máy chủ GPU (sudo, nhóm docker) giới hạn cho số ít người, rà soát định kỳ.
  4. Bước 4: Quản lý khoá API và bí mật

    Bash
    # File bí mật chỉ chủ sở hữu đọc được, không đưa vào git
    chmod 600 .env
    printf ".env\n*.key\n" >> .gitignore
    # Quét bí mật lỡ commit (ví dụ công cụ gitleaks)
    gitleaks detect --source . --no-banner
    • Mỗi ứng dụng một khoá, có thể thu hồi riêng; xoay vòng định kỳ.
    • Token Hugging Face dùng quyền đọc (read) cho máy chủ; không dùng token có quyền ghi.
    • Doanh nghiệp đã có hệ quản lý bí mật (Vault…) thì dùng thay cho file .env.
  5. Bước 5: Nhật ký truy cập và kiểm toán

    • Ghi: ai truy cập, lúc nào, dùng mô hình/tính năng nào, tài liệu nào được truy xuất.
    • Quyết định rõ có lưu nội dung prompt/câu trả lời không; nếu có, lưu có mã hoá, giới hạn người xem, có thời hạn xoá.
    • Gửi nhật ký về hệ thống tập trung (SIEM) để không bị sửa trên máy chủ AI.
    • Đồng bộ thời gian (NTP/chrony) để nhật ký các máy khớp nhau.
  6. Bước 6: Xử lý dữ liệu trước khi fine-tune hoặc nạp RAG

    • Loại bỏ hoặc che thông tin cá nhân không cần thiết (họ tên, số điện thoại, số giấy tờ, địa chỉ) trước khi huấn luyện.
    • Không huấn luyện bằng mật khẩu, khoá, thông tin tài khoản ngân hàng.
    • Lưu nguồn gốc dữ liệu: lấy từ đâu, ai cho phép dùng, dùng cho mục đích gì.
    • Kiểm thử mô hình sau fine-tune với câu hỏi dò thông tin nhạy cảm để phát hiện rò rỉ.
  7. Bước 7: Kiểm tra giấy phép mô hình khi dùng thương mại

    • Đọc mục License trên model card và file LICENSE trong repo mô hình — không suy từ tên họ mô hình, vì các kích thước khác nhau có thể dùng giấy phép khác nhau.
    • Phân biệt giấy phép mã nguồn mở phổ biến (Apache-2.0, MIT) với giấy phép riêng của hãng: có thể có điều kiện về quy mô người dùng, bắt buộc ghi nguồn, danh sách mục đích bị cấm, hoặc cấm dùng đầu ra để huấn luyện mô hình khác.
    • Giấy phép phi thương mại (ví dụ các biến thể CC BY-NC) không dùng cho sản phẩm, dịch vụ thu tiền.
    • Kiểm tra cả giấy phép của bộ dữ liệu dùng để fine-tune và của mô hình embedding/rerank.
    • Lưu lại bản giấy phép tại thời điểm tải mô hình vào hồ sơ dự án.
  8. Bước 8: Tuân thủ pháp luật về dữ liệu cá nhân (mức tổng quát)

    Cảnh báo: Phần này chỉ nêu định hướng chung, không phải tư vấn pháp lý. Quy định có thể thay đổi và áp dụng khác nhau theo ngành, loại dữ liệu. Hãy tham vấn luật sư hoặc bộ phận pháp chế trước khi xử lý dữ liệu cá nhân bằng AI.

    • Việt Nam đã có khung pháp lý về bảo vệ dữ liệu cá nhân (nghị định và luật chuyên ngành). Doanh nghiệp cần xác định văn bản đang có hiệu lực áp dụng cho mình.
    • Các nội dung thường phải rà soát: căn cứ/sự đồng ý khi xử lý dữ liệu, mục đích sử dụng, dữ liệu cá nhân nhạy cảm, quyền của chủ thể dữ liệu, chuyển dữ liệu ra nước ngoài, thông báo khi có sự cố.
    • Dùng dịch vụ AI đặt máy chủ ở nước ngoài có thể phát sinh nghĩa vụ liên quan chuyển dữ liệu ra nước ngoài — cần đánh giá trước.
    • Ngành tài chính, y tế, viễn thông… có thể có quy định riêng bổ sung.
    • Lập hồ sơ: sơ đồ luồng dữ liệu của hệ thống AI, biện pháp bảo vệ, người chịu trách nhiệm — hữu ích cho cả kiểm toán nội bộ lẫn làm việc với cơ quan quản lý.

Kiểm tra thành công

  • Có bảng phân loại dữ liệu và quy định mức nào được dùng với AI ở đâu.
  • Người dùng không có quyền không truy xuất được tài liệu mật qua chatbot (đã kiểm thử).
  • Không có bí mật trong git; khoá API có chủ sở hữu và lịch xoay vòng.
  • Nhật ký truy cập được gửi về hệ thống tập trung và có thời hạn lưu.
  • Hồ sơ giấy phép của mọi mô hình và bộ dữ liệu đang dùng.
  • Bộ phận pháp chế/luật sư đã xem sơ đồ luồng dữ liệu cá nhân của hệ thống.

Lỗi thường gặp & cách sửa

Nhân viên vẫn dùng dịch vụ AI công cộng với dữ liệu công ty

Nguyên nhân thường gặp: Chưa có công cụ nội bộ đủ tiện hoặc chưa có chính sách rõ ràng.

Ban hành chính sách ngắn gọn, đào tạo, cung cấp chatbot nội bộ (xem triển khai suy luận), giám sát ở gateway theo quy định nội bộ.

Chatbot tiết lộ nội dung tài liệu người hỏi không được xem

Nguyên nhân thường gặp: Lọc quyền đặt trong prompt hoặc quyền không đồng bộ với nguồn tài liệu.

Chuyển lọc quyền xuống câu truy vấn vector DB theo danh tính người dùng, đồng bộ quyền cùng tài liệu, bổ sung ca kiểm thử vượt quyền vào bộ đánh giá.

Không rõ mô hình đang dùng có được dùng thương mại

Nguyên nhân thường gặp: Chọn mô hình theo điểm benchmark, bỏ qua giấy phép.

Tạm dừng đưa vào sản phẩm, đọc giấy phép gốc, hỏi pháp chế; nếu không phù hợp, đổi sang mô hình giấy phép rõ ràng (xem danh sách mô hình).

Bước tiếp theo

Nguồn chính chủ

Lệnh, tên gói và tham số thay đổi theo phiên bản. Trước khi chạy trên máy thật, hãy kiểm tra phiên bản mới nhất tại trang chính chủ:

Giới hạn của bài

  • Bài không trích điều khoản pháp luật cụ thể và không thay thế tư vấn pháp lý.
  • Bài không đánh giá giấy phép của từng mô hình cụ thể — giấy phép có thể thay đổi theo phiên bản phát hành.
  • Bài không bao quát kiểm thử xâm nhập (red teaming) chuyên sâu cho ứng dụng LLM.
Cần người dựng hệ thống cùng?

Kỹ sư HQG khảo sát, lên cấu hình, lắp đặt và bàn giao hạ tầng AI chạy được thật.