Llama 4 Scout 17B-16E Instruct: cần bao nhiêu VRAM, GPU nào để chạy
Meta phát hành Llama 4 Scout 17B-16E Instruct với 108,6 tỷ tham số (MoE, kích hoạt 17 tỷ/token). Bảng dưới ước tính bộ nhớ GPU cho từng cách dùng để bạn chọn đúng máy chủ trước khi đầu tư. MoE 16 chuyên gia. Dùng attention theo khối ở phần lớn lớp nên KV cache thực tế nhỏ hơn công thức chuẩn; kiến trúc để trống để công cụ ước lượng.
Thông số
- Hãng phát triển
- Meta
- Họ mô hình
- Llama 4
- Nhóm
- Đa phương thức
- Số tham số
- 108,6 tỷ tham số (MoE, kích hoạt 17 tỷ/token)
- Ngữ cảnh gốc
- 10.485.760 token
- Giấy phép
- Llama 4 Community License — thương mại có điều kiệnGiới hạn 700 triệu người dùng hoạt động tháng; điều khoản riêng cho phần đa phương thức — đọc kỹ bản gốc.
- Tiếng Việt
- Có trong danh sách ngôn ngữ hãng công bố
- Ứng dụng gợi ý
- Hỏi đáp ảnh + văn bản · Tài liệu rất dài · Trợ lý đa ngôn ngữ
VRAM ước tính theo độ chính xác
Suy luận: 1 người dùng, ngữ cảnh 8.192 token. Huấn luyện: batch 1, 2.048 token/chuỗi, bật gradient checkpointing. Đã gồm dự phòng CUDA/framework.
| Tác vụ | FP32 | BF16 | FP8 / INT8 | INT4 |
|---|---|---|---|---|
| Suy luận (1 người dùng) | 483 GB | 242,4 GB | 122,9 GB | 69,2 GB |
| Fine-tune LoRA | — | 245,4 GB | 126 GB | — |
| Fine-tune QLoRA | — | — | — | 71,5 GB |
| Fine-tune toàn phần | 2 TB | 2 TB | — | — |
"—" là tổ hợp không dùng trong thực tế. GB = 10⁹ byte; VRAM hãng ghi theo GiB nên card thực tế dư thêm khoảng 7%.
Phương án GPU gợi ý
Số card ít nhất đủ VRAM, ưu tiên cân bằng giữa số lượng, độ dư bộ nhớ và giá card.
- Suy luận 4-bitcần ~69,2 GB
1 × NVIDIA A100 80GB PCIe · 80 GB · ~390 W · card ~285.000.000 ₫
Một card là đủ — đơn giản nhất để triển khai.
Tính với nhiều người dùng / context dài hơn - Suy luận BF16 (chất lượng gốc)cần ~242,4 GB
4 × NVIDIA A100 80GB PCIe · 320 GB · ~1,6 kW · card ~1.140.000.000 ₫
Chia mô hình qua 4 GPU (tensor parallel) với NVLink.
Tính với nhiều người dùng / context dài hơn - Fine-tune QLoRAcần ~71,5 GB
1 × NVIDIA A100 80GB PCIe · 80 GB · ~390 W · card ~285.000.000 ₫
Một card là đủ — đơn giản nhất để triển khai.
Tính với nhiều người dùng / context dài hơn
Giá là giá tham khảo riêng card GPU, chưa gồm máy chủ và VAT.
Máy chủ HQG chạy được Llama 4 Scout 17B-16E Instruct
Máy hỗ trợ từ 4 GPU trở lên — đủ khe cho phương án suy luận BF16 ở trên. Cấu hình GPU cụ thể do kỹ sư HQG tư vấn.
Dell PowerEdge C4130 E5-2609 V3 Six Core 1.9Ghz 16GB 2x 800GB SSD 4 X K80
Dell PowerEdge C4130 E5-2609 V3 Six Core 1.9Ghz 128GB 2x 800GB SSD 4 X K40
Cần triển khai Llama 4 Scout 17B-16E Instruct cho doanh nghiệp?
HQG tư vấn cấu hình, lắp đặt máy chủ GPU và cài sẵn môi trường chạy mô hình tại hạ tầng của bạn.
Thông tin tham khảo, kiểm tra giấy phép trước khi dùng thương mại. Số tham số và kiến trúc lấy từ trang chính chủ; mức VRAM là ước tính theo công thức, không phải đo thực tế. Dữ liệu cập nhật 09/2026. Nguồn: huggingface.co/meta-llama/Llama-4-Scout-17B-16E-Instruct.



