So sánh mô hình AI mở
Đặt tối đa 4 mô hình cạnh nhau để chọn bằng tiêu chí dùng được: giấy phép có cho thương mại không, ngữ cảnh bao nhiêu, cần bao nhiêu VRAM và phần cứng tối thiểu là gì. Không có điểm benchmark ở đây — chất lượng phải tự thử trên câu hỏi thật của công ty bạn.
Bấm để thêm vào bảng so sánh.
| Tiêu chí | Qwen3 8B Alibaba Qwen | Gemma 3 27B IT | Llama 3.3 70B Instruct Meta |
|---|---|---|---|
| Tham số | 8,2B | 27,4B | 70,6B |
| Ngữ cảnh gốc | 40.960 token | 131.072 token | 131.072 token |
| Giấy phép thương mại | Dùng thương mại đượcApache 2.0 | Thương mại có điều kiệnGemma Terms of UseCho phép thương mại nhưng phải tuân thủ chính sách sử dụng bị cấm của Google. | Thương mại có điều kiệnLlama 3.3 Community LicenseGiới hạn 700 triệu người dùng hoạt động tháng và yêu cầu ghi nguồn. |
| Tiếng Việt | tốt | chưa rõHãng không công bố — phải tự thử trên câu hỏi thật của công ty. | chưa rõHãng không công bố — phải tự thử trên câu hỏi thật của công ty. |
| VRAM · Suy luận 4-bit | 7,8 GB1 × L4 24GB | 22,9 GB1 × L40S 48GB | 47,9 GB1 × A100 80GB PCIe |
| VRAM · Suy luận 8-bit | 11,9 GB1 × L4 24GB | 36,5 GB1 × L40S 48GB | 82,9 GB1 × H100 NVL 94GB PCIe |
| VRAM · Suy luận BF16 | 20,9 GB1 × L4 24GB | 66,6 GB1 × A100 80GB PCIe | 160,5 GB2 × H100 NVL 94GB PCIe |
| VRAM · Fine-tune QLoRA | 9 GB1 × L40S 48GB | 24,1 GB1 × L40S 48GB | 57,6 GB1 × A100 80GB PCIe |
| Phần cứng tối thiểu (suy luận 4-bit) | 1 × L4 24GB (24 GB)Xem thiết bị | 1 × L40S 48GB (48 GB)Xem thiết bị | 1 × A100 80GB PCIe (80 GB)Xem thiết bị |
| Phần cứng để fine-tune QLoRA | 1 × L40S 48GB (48 GB) | 1 × L40S 48GB (48 GB) | 1 × A100 80GB PCIe (80 GB) |
| Gợi ý ứng dụng |
|
|
|
| Ghi chú | Hãng công bố hỗ trợ 119 ngôn ngữ, có tiếng Việt. Ngữ cảnh gốc ~32K, mở rộng bằng YaRN. | Phần lớn lớp dùng sliding window 1.024 token nên KV cache thực tế nhỏ hơn nhiều so với công thức chuẩn (công thức cho cận trên). | — |
| Trang chính chủ · công cụ | Bản gốc Tính cấu hình riêng | Bản gốc Tính cấu hình riêng | Bản gốc Tính cấu hình riêng |
Đang hiện bộ mô hình gợi ý. Chọn mô hình ở trên để đổi bảng — liên kết trên thanh địa chỉ sẽ mang theo lựa chọn của bạn (dạng ?m=slug1,slug2).
Các cột VRAM được tính thế nào?
- Suy luận 4-bit
- Suy luận, trọng số 4-bit (GPTQ/AWQ/GGUF/NF4), 1 người dùng, ngữ cảnh theo mặc định của mô hình (tối đa 8.192 token).
- Suy luận 8-bit
- Suy luận, trọng số 8-bit (FP8 hoặc INT8 cùng 1 byte/tham số), 1 người dùng, ngữ cảnh như trên.
- Suy luận BF16
- Suy luận ở độ chính xác gốc khi hãng phát hành, 1 người dùng, ngữ cảnh như trên.
- Fine-tune QLoRA
- QLoRA: trọng số gốc 4-bit + adapter, batch 1, độ dài chuỗi 2.048 token. Adapter giả định ~1% tham số (rank 64 trên mọi lớp tuyến tính).
Công thức đầy đủ và chỗ để thay số của bạn (số người dùng đồng thời, ngữ cảnh dài hơn, batch lớn hơn) nằm ở công cụ tính cấu hình.
Đọc bảng này cho đúng
“Tiếng Việt: chưa rõ” không có nghĩa là kém. Đó là trường hợp hãng không công bố danh sách ngôn ngữ. Cách duy nhất để biết là tự thử trên câu hỏi thật của bạn.
Giấy phép thay đổi theo từng phiên bản. Luôn mở trang chính chủ ở cột cuối và đọc bản gốc trước khi dùng thương mại.
VRAM là ước lượng theo công thức, không phải đo thực tế. Phần mềm phục vụ mô hình, cách lượng tử hoá và độ dài câu hỏi thật đều làm con số đổi.
Không có cột “mô hình nào giỏi hơn”. Mọi bảng xếp hạng chất lượng đều phụ thuộc bộ câu hỏi dùng để chấm; HQG không đăng điểm benchmark của bên khác như số liệu của mình.
Thông tin tham khảo, kiểm tra giấy phép trước khi dùng thương mại. Số tham số và kiến trúc lấy từ trang chính chủ; mức VRAM là ước tính theo công thức, không phải đo thực tế. Dữ liệu mô hình đối chiếu với trang chính chủ tại thời điểm 2026-09.