Bỏ qua điều hướng
CÔNG TY CỔ PHẦN GIẢI PHÁP CÔNG NGHỆ HQG

Hỏi đáp AI cho doanh nghiệp

34 câu hỏi đội kỹ sư HQG thường nhận khi doanh nghiệp bắt đầu dùng AI trên hạ tầng riêng. Mỗi câu trả lời đi kèm một bước làm tiếp: công cụ tính, bài hướng dẫn hoặc kỹ sư tư vấn.

34 câu hỏi

Bắt đầu

Doanh nghiệp có cần tự chạy AI không, hay dùng ChatGPT là đủ?

Nếu dữ liệu không nhạy cảm và lượng dùng thấp, dịch vụ AI dạng thuê bao hoặc API thường là cách bắt đầu nhanh và rẻ nhất. Tự chạy trên hạ tầng riêng hợp lý khi dữ liệu không được phép ra ngoài (hợp đồng, hồ sơ khách hàng, bệnh án), khi lượng sử dụng đủ lớn để chi phí API vượt chi phí sở hữu phần cứng, hoặc khi cần tuỳ biến sâu. Nhiều doanh nghiệp kết hợp: thử nghiệm bằng API, đưa phần dữ liệu nhạy cảm về hạ tầng riêng.

So sánh mua, thuê và cloud
Nên bắt đầu dự án AI từ đâu?

Chọn một việc cụ thể và đo được, ví dụ rút ngắn thời gian tra cứu quy trình nội bộ. Chuẩn bị bộ câu hỏi hoặc dữ liệu mẫu kèm kết quả mong muốn, chạy thử nghiệm nhỏ trên mô hình mở hoặc API, chấm kết quả bằng chính dữ liệu của mình rồi mới quyết định quy mô phần cứng. Tránh mua phần cứng trước khi biết sẽ chạy mô hình nào cho bao nhiêu người dùng.

Chọn mục đích AI của bạn
Chạy thử nghiệm (PoC) cần chuẩn bị những gì?

Tối thiểu gồm: một bài toán rõ ràng; bộ tình huống mẫu lấy từ công việc thật kèm đáp án mong muốn; người phụ trách nghiệp vụ chấm kết quả; tiêu chí đạt hay không đạt thống nhất từ đầu; và một máy có GPU hoặc tài khoản API để chạy thử. Thiếu tiêu chí chấm là lý do phổ biến khiến thử nghiệm kéo dài mà không đi đến quyết định.

Nhờ kỹ sư HQG tư vấn PoC
Cần đội ngũ thế nào để vận hành AI nội bộ?

Mức cơ bản (một mô hình suy luận và giao diện chat) cần một kỹ sư hệ thống quen Linux, Docker và driver GPU. Khi có RAG, fine-tune hoặc nhiều mô hình, cần thêm người hiểu dữ liệu và biết đánh giá mô hình. Doanh nghiệp có thể thuê ngoài phần dựng hạ tầng và giữ phần dữ liệu nghiệp vụ trong nội bộ.

Dịch vụ triển khai hạ tầng AI

Chọn mô hình

Mô hình mở (open-weight) là gì, khác gì ChatGPT?

Mô hình mở công bố trọng số để tải về và chạy trên máy của bạn, ví dụ các họ Llama, Qwen, Gemma, Mistral, DeepSeek. Dữ liệu không phải rời hạ tầng, đổi lại bạn tự lo phần cứng, cập nhật và đánh giá chất lượng. Mở trọng số không đồng nghĩa dùng tự do: mỗi mô hình có giấy phép riêng. ChatGPT là dịch vụ dùng mô hình đóng, chỉ truy cập qua giao diện hoặc API của nhà cung cấp.

Xem thư viện mô hình
Mô hình nào dùng tốt cho tiếng Việt?

Nhiều mô hình đa ngôn ngữ đời mới xử lý tiếng Việt khá, ngoài ra có các bản do nhóm Việt Nam tinh chỉnh. Chất lượng thay đổi theo phiên bản và loại việc, nên đừng dựa hoàn toàn vào bảng xếp hạng chung. Cách chắc chắn nhất là chấm thử hai đến ba ứng viên trên chính bộ câu hỏi của doanh nghiệp.

So sánh mô hình
Mô hình càng nhiều tham số càng tốt?

Mô hình lớn thường suy luận tốt hơn nhưng cần nhiều VRAM hơn và chạy chậm hơn trên cùng phần cứng. Với việc hẹp như phân loại, trích xuất, trả lời theo tài liệu có RAG, mô hình nhỏ hoặc vừa thường đã đủ và rẻ hơn nhiều khi vận hành. Nên bắt đầu từ mô hình nhỏ nhất đạt yêu cầu chất lượng.

Tính cấu hình theo mô hình
Lượng tử hoá (INT8, INT4) có làm mô hình kém đi không?

Lượng tử hoá giảm số bit lưu trọng số, nhờ đó giảm VRAM và thường tăng tốc. INT8 hoặc FP8 thường giữ chất lượng gần bản gốc; INT4 tiết kiệm nhiều hơn nhưng có thể giảm chất lượng rõ hơn ở việc khó như suy luận nhiều bước, toán, lập trình. Mức ảnh hưởng phụ thuộc mô hình và phương pháp (GPTQ, AWQ, GGUF…), nên kiểm tra trên dữ liệu thật.

Tính VRAM ở INT4
Có nên dùng mô hình suy luận (reasoning)?

Mô hình suy luận sinh một chuỗi suy nghĩ dài trước khi trả lời, hữu ích cho bài toán nhiều bước như phân tích, toán, lập trình. Đổi lại chúng tạo ra nhiều token hơn, nên cần thông lượng GPU cao hơn và người dùng chờ lâu hơn. Với tra cứu tài liệu hay chăm sóc khách hàng, mô hình thông thường thường nhanh và đủ dùng.

Ước tính tải suy luận
Embedding và reranker trong RAG là gì?

Embedding biến mỗi đoạn văn thành một vector để tìm các đoạn gần nghĩa với câu hỏi; reranker chấm lại độ liên quan của các đoạn tìm được trước khi đưa cho LLM. Chọn mô hình embedding hỗ trợ tốt tiếng Việt ảnh hưởng lớn tới chất lượng câu trả lời, nhiều khi rõ hơn cả việc đổi sang LLM lớn hơn.

Hướng dẫn RAG tài liệu nội bộ

Phần cứng & chi phí

Tính VRAM cần cho một mô hình như thế nào?

Ước tính nhanh phần trọng số: số tỷ tham số nhân số byte mỗi tham số (FP16/BF16 là 2, INT8/FP8 là 1, INT4 khoảng 0,5) ra số GB. Ví dụ mô hình 8 tỷ tham số ở BF16 cần khoảng 16 GB chỉ cho trọng số. Cộng thêm KV cache, tăng theo độ dài ngữ cảnh và số phiên đồng thời, cùng phần dự phòng cho framework.

Mở công cụ tính cấu hình
Dùng GPU GeForce (RTX dòng chơi game) cho doanh nghiệp được không?

Cho thử nghiệm hoặc máy trạm cá nhân thì được. Khi đặt trong phòng máy chạy liên tục cần cân nhắc: kiểu tản nhiệt không hợp khung máy chủ đặt dày, đa số không có bộ nhớ ECC, hỗ trợ chia sẻ GPU cho nhiều người dùng hạn chế, và điều khoản giấy phép driver GeForce hạn chế triển khai trong trung tâm dữ liệu. GPU dòng chuyên nghiệp hoặc trung tâm dữ liệu phù hợp hơn cho vận hành lâu dài.

Tư vấn chọn GPU
Nên dùng một GPU lớn hay nhiều GPU nhỏ?

Nếu mô hình vừa trong một GPU, dùng một card thường đơn giản và nhanh hơn vì không tốn băng thông trao đổi giữa các card. Khi mô hình không vừa, phải chia qua nhiều GPU và tốc độ kết nối giữa chúng (NVLink hay PCIe) ảnh hưởng đáng kể. Nhiều GPU nhỏ có lợi khi cần phục vụ nhiều mô hình hoặc nhiều nhóm tách biệt.

Hướng dẫn chọn phần cứng AI
Khi nào cần máy chủ thay vì workstation?

Workstation hợp cho một đến vài người phát triển, thử nghiệm, đặt tại văn phòng. Máy chủ rack cần khi phục vụ nhiều người dùng liên tục, cần từ 2 GPU trở lên với nguồn và quạt dự phòng, cần quản trị từ xa qua cổng quản lý (iDRAC, iLO, BMC) và đặt trong phòng máy.

Xem workstation có GPU
Máy chủ GPU cần chuẩn bị điện và làm mát gì?

Máy chủ nhiều GPU tiêu thụ điện và toả nhiệt lớn hơn nhiều so với máy chủ thông thường. Trước khi đặt hàng, hãy kiểm tra công suất nguồn danh định của cấu hình, chuẩn ổ cắm và cầu dao, công suất UPS, tải cho phép của tủ rack và khả năng làm mát của phòng máy.

Công cụ thiết kế tủ rack
Mua, thuê thiết bị hay thuê GPU cloud — cách nào rẻ hơn?

Phụ thuộc mức sử dụng. GPU chạy gần như liên tục trong nhiều năm thường có lợi khi sở hữu; nhu cầu ngắn hạn, theo đợt hoặc chưa rõ quy mô hợp với thuê thiết bị hoặc cloud. Nhập thông số thật như số GPU, số giờ chạy, tiền điện, thời gian khấu hao vào công cụ TCO để so sánh.

Tính TCO
Có gắn thêm GPU vào máy chủ đang có được không?

Được nếu máy chủ có khe PCIe phù hợp về độ dài và độ dày, nguồn đủ công suất với đúng đầu cấp điện phụ, luồng gió đủ làm mát GPU và cấu hình nằm trong danh sách tương thích của hãng. Nhiều máy chủ 1U hoặc đời cũ không đáp ứng. Gửi model máy chủ để kỹ sư kiểm tra trước khi mua card.

Gửi yêu cầu kiểm tra

Huấn luyện, fine-tune

Nên dùng RAG hay fine-tune?

Dùng RAG khi cần trả lời theo tài liệu thay đổi thường xuyên và cần trích dẫn nguồn — cập nhật chỉ bằng việc thêm tài liệu. Dùng fine-tune khi cần mô hình theo đúng văn phong, định dạng đầu ra hoặc một tác vụ chuyên biệt ổn định. Hai cách kết hợp được; phần lớn trợ lý tài liệu nội bộ nên bắt đầu bằng RAG.

Hướng dẫn RAG
LoRA, QLoRA khác full fine-tune thế nào?

Full fine-tune cập nhật toàn bộ trọng số, cần VRAM cho trọng số, gradient và trạng thái bộ tối ưu — lớn gấp nhiều lần so với chạy suy luận. LoRA chỉ huấn luyện các ma trận nhỏ gắn thêm vào mô hình; QLoRA làm như vậy trên mô hình nền đã lượng tử hoá 4-bit nên giảm VRAM mạnh. Nhóm tác giả QLoRA (2023) công bố đã tinh chỉnh mô hình 65 tỷ tham số trên một GPU 48 GB.

Tính VRAM cho QLoRA
Cần bao nhiêu dữ liệu để fine-tune?

Không có con số chung. Tinh chỉnh văn phong hoặc định dạng đầu ra có thể thấy khác biệt với vài trăm mẫu chất lượng cao; tác vụ phức tạp cần nhiều hơn. Dạy kiến thức mới qua fine-tune thường kém hiệu quả hơn RAG. Độ chính xác và nhất quán của từng mẫu quan trọng hơn số lượng.

Hướng dẫn fine-tune LoRA, QLoRA
Doanh nghiệp có nên tự huấn luyện mô hình ngôn ngữ từ đầu?

Hầu như không cần. Huấn luyện từ đầu (pretrain) một mô hình ngôn ngữ đòi hỏi lượng dữ liệu hàng trăm tỷ token trở lên, cụm GPU lớn chạy dài ngày và đội nghiên cứu chuyên sâu. Tinh chỉnh một mô hình mở có sẵn đáp ứng mục tiêu của phần lớn doanh nghiệp với chi phí thấp hơn nhiều.

Ước tính quy mô pretrain
Huấn luyện trên nhiều GPU cần những gì?

Cần framework phân tán (PyTorch DDP/FSDP, DeepSpeed), kết nối tốc độ cao giữa các GPU trong máy (NVLink) và giữa các máy (InfiniBand hoặc Ethernet hỗ trợ RDMA), lưu trữ đọc ghi nhanh cho dữ liệu và checkpoint, cùng bộ lập lịch công việc như Slurm hoặc Kubernetes khi nhiều nhóm dùng chung.

Hướng dẫn huấn luyện nhiều GPU

Triển khai & vận hành

Nên dùng Ollama hay vLLM để chạy mô hình?

Ollama (dựa trên llama.cpp) cài nhanh, hợp thử nghiệm, máy trạm và ít người dùng. vLLM, SGLang hay TensorRT-LLM tối ưu cho nhiều người dùng đồng thời trên GPU máy chủ nhờ gom lô liên tục và quản lý KV cache hiệu quả, đồng thời cung cấp API tương thích OpenAI để tích hợp ứng dụng.

Hướng dẫn triển khai suy luận
Có giao diện chat nội bộ nào dùng được ngay?

Các dự án như Open WebUI, LibreChat, Dify, AnythingLLM cung cấp giao diện chat, quản lý người dùng và kết nối tài liệu, chạy được trên máy chủ nội bộ. Trước khi mở cho toàn công ty, hãy đọc giấy phép của từng dự án, cấu hình đăng nhập tập trung (SSO, LDAP) và phân quyền.

Hướng dẫn chạy AI bằng Docker
Máy chủ AI nên cài hệ điều hành và phần mềm nền gì?

Phổ biến nhất là Ubuntu Server bản LTS kèm driver NVIDIA, CUDA và NVIDIA Container Toolkit để chạy mô hình trong Docker. Nên cố định phiên bản driver và CUDA đã kiểm thử, cập nhật có kế hoạch và thử trên máy phụ trước để tránh xung đột thư viện.

Hướng dẫn cài Ubuntu, driver, CUDA
Vận hành AI cần giám sát những chỉ số nào?

Phần cứng: nhiệt độ, công suất, mức dùng GPU và VRAM, lỗi phần cứng (có thể thu thập bằng NVIDIA DCGM với Prometheus, Grafana). Dịch vụ: thời gian tới token đầu tiên, số token mỗi giây, số yêu cầu đang chờ, tỉ lệ lỗi. Nghiệp vụ: phản hồi của người dùng và các câu trả lời sai để cải thiện.

Hướng dẫn giám sát GPU
Bao lâu nên đổi sang mô hình mới một lần?

Không cần chạy theo mọi phiên bản mới. Giữ một bộ câu hỏi đánh giá cố định; khi có mô hình đáng chú ý, chạy lại bộ đánh giá và chỉ thay khi kết quả tốt hơn rõ trên dữ liệu của mình. Nên chạy song song một thời gian trước khi chuyển hẳn.

Theo dõi thư viện mô hình

Dữ liệu & bảo mật

Chạy AI nội bộ có đảm bảo dữ liệu không bị lộ?

Dữ liệu không đi tới nhà cung cấp bên ngoài, nhưng rủi ro trong nội bộ vẫn còn: người dùng hỏi ra tài liệu họ không có quyền xem, log truy vấn chứa thông tin nhạy cảm, API mô hình để mở không xác thực. Cần phân quyền theo tài liệu trong RAG, mã hoá và giới hạn truy cập log, đặt mọi dịch vụ sau lớp xác thực.

Hướng dẫn bảo mật dữ liệu AI
Prompt injection là gì, phòng thế nào?

Là khi nội dung đưa vào mô hình (câu hỏi, tài liệu, email, trang web) chứa chỉ dẫn khiến mô hình làm trái ý hệ thống, như tiết lộ dữ liệu hoặc gọi công cụ ngoài ý muốn. Hiện chưa có cách chặn tuyệt đối. Giảm rủi ro bằng cách giới hạn quyền của công cụ AI được gọi, tách nội dung không tin cậy, yêu cầu người duyệt với thao tác quan trọng và ghi log đầy đủ.

Đọc hướng dẫn bảo mật
Làm sao giảm việc AI trả lời sai, “ảo giác”?

Dùng RAG để mô hình trả lời dựa trên tài liệu và yêu cầu trích dẫn nguồn; cho phép mô hình nói không tìm thấy thông tin; đánh giá định kỳ bằng bộ câu hỏi có đáp án; và giữ người kiểm duyệt ở những quyết định có hệ quả pháp lý hoặc tài chính.

Hướng dẫn RAG có trích dẫn

Pháp lý, giấy phép

Dùng mô hình mở cho mục đích thương mại có được không?

Tuỳ giấy phép từng mô hình. Một số phát hành theo giấy phép mở như Apache 2.0 hoặc MIT; một số dùng giấy phép riêng của hãng kèm điều kiện như giới hạn quy mô người dùng, chính sách sử dụng chấp nhận được, yêu cầu ghi nhận; một số chỉ cho phép phi thương mại. Hãy đọc giấy phép của đúng phiên bản bạn tải về và lưu lại bản sao.

Tra giấy phép trong thư viện mô hình
Thư viện nhận diện hình ảnh có ràng buộc giấy phép gì?

Ví dụ Ultralytics YOLO phát hành theo AGPL-3.0: nếu tích hợp vào sản phẩm hoặc dịch vụ cung cấp cho bên ngoài mà không muốn công khai mã nguồn theo điều khoản AGPL, cần mua giấy phép doanh nghiệp của hãng. Có các lựa chọn theo giấy phép thoáng hơn. Cần kiểm tra cả giấy phép của mã nguồn lẫn trọng số mô hình.

Lộ trình camera AI
Dùng dữ liệu khách hàng để chạy AI cần lưu ý pháp lý gì?

Tại Việt Nam, xử lý dữ liệu cá nhân chịu điều chỉnh của Luật Bảo vệ dữ liệu cá nhân và các văn bản hướng dẫn (trước đó là Nghị định 13/2023/NĐ-CP). Các điểm cần chú ý: có căn cứ hợp pháp hoặc sự đồng ý phù hợp mục đích, đánh giá tác động xử lý dữ liệu, bảo vệ dữ liệu nhạy cảm, và thủ tục khi chuyển dữ liệu ra nước ngoài — gồm cả việc gửi dữ liệu tới dịch vụ AI đặt máy chủ ở nước ngoài. Nội dung này chỉ để tham khảo, không thay thế tư vấn pháp lý.

Hướng dẫn bảo mật dữ liệu AI
Ảnh, video do AI tạo có dùng làm quảng cáo được không?

Cần kiểm tra ba điểm: giấy phép của mô hình có cho dùng thương mại không; nội dung tạo ra có vô tình giống nhân vật, thương hiệu hoặc người thật đã được bảo hộ không; và quy định quảng cáo về thông tin gây hiểu nhầm. Việc nội dung do AI tạo có được bảo hộ bản quyền hay không hiện chưa thống nhất giữa các quốc gia.

Lộ trình tạo ảnh, video

Nội dung mang tính tham khảo kỹ thuật, không thay thế tư vấn pháp lý. Giấy phép mô hình và phần mềm thay đổi theo từng phiên bản — hãy đọc điều khoản của đúng bản bạn sử dụng.