Bỏ qua điều hướng
CÔNG TY CỔ PHẦN GIẢI PHÁP CÔNG NGHỆ HQG

Trung tâm AI cho doanh nghiệp

Chọn đúng mô hình, phần mềm và cấp hạ tầng cho mục đích AI cụ thể của bạn — rồi chạy trên máy chủ của chính doanh nghiệp, dữ liệu không phải gửi ra ngoài.

Nội dung trung lập về mô hình: gợi ý họ mô hình mở phổ biến, không cam kết điểm số.

Bạn muốn làm gì với AI?

Chọn nhu cầu và quy mô để xem lộ trình gợi ý: loại mô hình, phần mềm, cấp hạ tầng và những điểm cần lưu ý trước khi đầu tư.

Chọn một nhu cầu

Chatbot, trợ lý nội bộ trên tài liệu

Nhân viên hỏi quy trình, chính sách, tài liệu kỹ thuật bằng tiếng Việt; AI trả lời kèm trích dẫn đoạn tài liệu gốc.

Quy mô

50–500 người dùng, hàng chục nghìn tài liệu

Hạ tầng gợi ý
  1. Máy chủ CPU
  2. Workstation 1 GPU
  3. Máy chủ 2–4 GPU
  4. Cụm 8 GPU trở lên

Máy chủ 2–4 GPU

Máy rack trong phòng máy, nguồn và quạt dự phòng, quản trị từ xa. Tách GPU cho LLM và cho embedding/reranker; còn dư chỗ để nâng lên mô hình lớn hơn.

Loại mô hình phù hợp

  • LLM đa ngôn ngữ cỡ nhỏ–vừa. Các họ mô hình mở như Qwen, Gemma, Llama, Mistral — chấm thử trên câu hỏi thật của công ty.
  • Mô hình embedding đa ngôn ngữ. Ví dụ BGE-M3, multilingual-E5 — quyết định việc tìm đúng đoạn tài liệu.
  • Reranker. Chấm lại độ liên quan trước khi đưa cho LLM, giảm trả lời lạc đề.

Phần mềm, stack tham khảo

vLLM
Phục vụ mô hình cho nhiều người dùng, API tương thích OpenAI
Open WebUI hoặc Dify
Giao diện chat, quản lý kho tri thức, người dùng
PostgreSQL + pgvector hoặc Qdrant
Lưu vector và siêu dữ liệu phân quyền
Docling, PaddleOCR / VietOCR
Đọc PDF, Word và bản scan tiếng Việt

Rủi ro và lưu ý

  • Phân quyền: người dùng chỉ được truy vấn tài liệu mình có quyền xem — phải lọc ngay ở bước tìm kiếm, không chỉ ở giao diện.
  • Bản scan mờ, bảng biểu phức tạp làm câu trả lời sai; cần kiểm tra chất lượng dữ liệu đầu vào.
  • Luôn hiển thị trích dẫn và cho phép AI trả lời “không tìm thấy thông tin” để hạn chế bịa.
  • Log hỏi đáp chứa thông tin nhạy cảm: mã hoá và giới hạn người được xem.

Bước tiếp theo

Thiết bị AI đang có tại HQG

Máy chủ và workstation có GPU lấy trực tiếp từ kho hàng. Chưa chắc cấu hình đủ cho mô hình của bạn? Dùng công cụ tính trước.

Kiến thức AI nên biết

Tất cả hướng dẫn

Đọc theo thứ tự của một dự án thật, từ chọn máy tới vận hành.

  1. 01Chọn phần cứng cho AIGPU, VRAM, CPU, RAM, lưu trữ và mạng cho từng loại tải AI.
  2. 02Cài Ubuntu, driver NVIDIA và CUDADựng hệ điều hành và driver ổn định cho máy chủ GPU.
  3. 03Chạy AI trong Docker có GPUNVIDIA Container Toolkit, đóng gói và cô lập môi trường.
  4. 04Môi trường Python và PyTorchQuản lý phiên bản thư viện, tránh xung đột CUDA.
  5. 05Triển khai suy luận (inference)Phục vụ mô hình cho nhiều người dùng với API ổn định.
  6. 06RAG trên tài liệu nội bộTrợ lý hỏi đáp có trích dẫn nguồn, phân quyền theo tài liệu.
  7. 07Fine-tune LLM bằng LoRA, QLoRAChuẩn bị dữ liệu, huấn luyện và đánh giá bản tinh chỉnh.
  8. 08Huấn luyện trên nhiều GPUSong song hoá, kết nối GPU và lập lịch công việc.
  9. 09Giám sát và vận hành GPUTheo dõi nhiệt, công suất, lỗi phần cứng và chất lượng dịch vụ.
  10. 10Bảo mật dữ liệu khi dùng AIPhân quyền, log, prompt injection và dữ liệu cá nhân.

Bài viết AI & GPU

Tin tức

On-premise hay Cloud API?

Không có đáp án chung. Dữ liệu càng nhạy cảm và mức sử dụng càng đều, hạ tầng riêng càng có lý. Nhiều doanh nghiệp chọn kết hợp: thử nghiệm bằng API, đưa việc xử lý dữ liệu mật về máy chủ nội bộ.

So sánh định tính giữa chạy AI trên hạ tầng riêng và dùng Cloud API
Bảo mật dữ liệuOn-premiseDữ liệu nằm trong mạng công ty; tự kiểm soát log, phân quyền, nơi lưu trữ.Cloud APIDữ liệu gửi tới nhà cung cấp; phụ thuộc điều khoản, vị trí máy chủ và cấu hình lưu log của họ.
Chi phí khi dùng ít, không đềuOn-premiseBất lợi: phần cứng khấu hao cả khi không chạy.Cloud APICó lợi: trả theo lượng dùng, không đầu tư ban đầu.
Chi phí khi dùng nhiều, đều đặnOn-premiseThường có lợi khi GPU được khai thác cao trong nhiều năm.Cloud APIChi phí tăng tuyến tính theo token hoặc giờ GPU.
Tốc độ bắt đầuOn-premiseCần thời gian mua sắm, lắp đặt, cài đặt.Cloud APIDùng được ngay sau khi có tài khoản.
Độ trễOn-premiseThấp và ổn định trong mạng nội bộ; không phụ thuộc đường truyền quốc tế.Cloud APIPhụ thuộc Internet và tải của nhà cung cấp; có thể bị giới hạn tốc độ gọi.
Tuỳ biếnOn-premiseChọn mô hình mở bất kỳ, fine-tune, cố định phiên bản lâu dài.Cloud APIGiới hạn trong mô hình và tuỳ chọn nhà cung cấp mở; phiên bản có thể bị ngừng.
Mô hình mạnh nhấtOn-premiseChỉ dùng được mô hình mở trọng số.Cloud APITiếp cận các mô hình thương mại đóng mới nhất.
Vận hànhOn-premiseCần người quản trị phần cứng, driver, cập nhật, giám sát (hoặc thuê ngoài).Cloud APINhà cung cấp lo hạ tầng; doanh nghiệp lo tích hợp và chi phí.

Câu hỏi hay gặp

Xem 34 câu hỏi

Cần người cùng tính trước khi mua?

Gửi mục đích, số người dùng và loại dữ liệu. Kỹ sư HQG đề xuất cấu hình, phần mềm và phương án triển khai phù hợp.