Xây dựng cụm GPU nội bộ chạy mô hình mã nguồn mở (Llama, Qwen, Gemma) kèm RAG trên kho tài liệu doanh nghiệp, giao diện chat nội bộ có phân quyền và ghi log đầy đủ. Dữ liệu không rời khỏi hệ thống.
Phần lớn doanh nghiệp tìm tới giải pháp này sau khi đã gặp đúng tình huống bên trái.
Doanh nghiệp muốn dùng AI nhưng không thể gửi hợp đồng, hồ sơ khách hàng hay dữ liệu tài chính lên dịch vụ công cộng. Chi phí API cũng tăng không kiểm soát khi số người dùng tăng.
Xây dựng cụm GPU nội bộ chạy mô hình mã nguồn mở (Llama, Qwen, Gemma) kèm RAG trên kho tài liệu doanh nghiệp, giao diện chat nội bộ có phân quyền và ghi log đầy đủ. Dữ liệu không rời khỏi hệ thống.
Các con số dưới đây lấy từ dự án thực tế của HQG, đo trước và sau khi đưa hệ thống vào vận hành ổn định.
Luồng đi từ người dùng xuống các lớp hạ tầng. Mọi lớp đều được đưa vào hệ giám sát tập trung của HQG (đường nét đứt bên phải).
| Lớp | Thành phần | Vai trò trong hệ thống |
|---|---|---|
| 1 | Server 4–8x GPULớp tính toán | Nơi mô hình thực sự chạy. Mỗi node mang 4–8 GPU với tổng VRAM 192–640GB, đủ phục vụ mô hình 70B lượng tử FP8 cho khoảng 100 phiên đồng thời. |
| 2 | InfiniBand/25GbELớp kết nối | Nối các node huấn luyện với băng thông thấp độ trễ. InfiniBand dùng khi huấn luyện đa node; 25GbE là mức đủ nếu chỉ chạy suy luận. |
| 3 | vLLM + Open WebUILớp phục vụ mô hình | vLLM quản lý bộ nhớ KV cache và gộp yêu cầu theo lô liên tục; Open WebUI là giao diện chat nội bộ có lịch sử hội thoại và phân quyền theo phòng ban. |
| 4 | Qdrant / pgvectorLớp dữ liệu | Cơ sở dữ liệu vector lưu embedding của tài liệu nội bộ, phục vụ tìm kiếm ngữ nghĩa trong pipeline RAG trước khi đưa ngữ cảnh vào mô hình. |
| 5 | Keycloak SSOLớp định danh | Đăng nhập một lần bằng tài khoản công ty, gắn mỗi câu hỏi với một người dùng cụ thể trong log — điều kiện bắt buộc khi kiểm toán truy vết dữ liệu nhạy cảm. |
Ngân sách là mức khởi điểm cho quy mô nhỏ nhất, đã gồm thiết bị và công triển khai, chưa gồm VAT 8%. Lộ trình bên dưới áp dụng cho quy mô tiêu chuẩn.
Làm việc với các phòng ban để chọn 2–3 tình huống sử dụng đo được, ước lượng số người dùng đồng thời và kích thước kho tài liệu cần đưa vào RAG.
Chốt cấu hình GPU, tính tải điện và làm mát cho tủ rack, đặt hàng thiết bị và chuẩn bị mặt bằng phòng máy.
Lắp rack, đi dây, cài driver GPU, dựng cụm vLLM và cơ sở dữ liệu vector, tích hợp đăng nhập một lần.
Đưa kho tài liệu vào pipeline, tinh chỉnh cách cắt đoạn và xếp hạng kết quả, kiểm tra chất lượng trả lời với người dùng thật.
Đo tốc độ sinh token, độ trễ token đầu tiên và mức sử dụng GPU; bàn giao tài liệu vận hành và đào tạo hai buổi cho đội kỹ thuật.
Trợ lý AI nội bộ trả lời hợp đồng & quy trình, tiết kiệm ~4.100 giờ/năm
Xem thêm dự án của HQGKỹ sư giải pháp sẽ khảo sát hiện trạng và gửi lại hai đến ba phương án kèm bảng so sánh chi phí 5 năm trong vòng 5 ngày làm việc.
Điền thông tin bên dưới, kỹ sư giải pháp phụ trách AI & LLM nội bộ (Private AI) sẽ phản hồi trong 2 giờ làm việc.