Bỏ qua điều hướng
CÔNG TY CỔ PHẦN GIẢI PHÁP CÔNG NGHỆ HQG
Suy luận & lập trìnhDùng thương mại được

gpt-oss-120b: cần bao nhiêu VRAM, GPU nào để chạy

OpenAI phát hành gpt-oss-120b với 116,8 tỷ tham số (MoE, kích hoạt 5,1 tỷ/token). Bảng dưới ước tính bộ nhớ GPU cho từng cách dùng để bạn chọn đúng máy chủ trước khi đầu tư. Trọng số MoE phát hành sẵn dạng MXFP4 (~4-bit) — hãng thiết kế để chạy trên một GPU 80GB. Chọn INT4 để sát cách triển khai gốc.

Thông số

Hãng phát triển
OpenAI
Họ mô hình
gpt-oss
Nhóm
Suy luận & lập trình
Số tham số
116,8 tỷ tham số (MoE, kích hoạt 5,1 tỷ/token)
Ngữ cảnh gốc
131.072 token
Giấy phép
Apache 2.0dùng thương mại đượcKèm chính sách sử dụng gpt-oss của OpenAI.
Tiếng Việt
Hãng chưa công bố cụ thể
Kiến trúc
36 lớp · hidden 2880 · 8 KV head × 64
Ứng dụng gợi ý
Suy luận nhiều bước · Agent · Lập trình

VRAM ước tính theo độ chính xác

Suy luận: 1 người dùng, ngữ cảnh 8.192 token. Huấn luyện: batch 1, 2.048 token/chuỗi, bật gradient checkpointing. Đã gồm dự phòng CUDA/framework.

Tác vụFP32BF16FP8 / INT8INT4
Suy luận (1 người dùng)516,6 GB258,9 GB130,5 GB72,6 GB
Fine-tune LoRA260,5 GB132 GB
Fine-tune QLoRA74 GB
Fine-tune toàn phần2,15 TB2,15 TB

"—" là tổ hợp không dùng trong thực tế. GB = 10⁹ byte; VRAM hãng ghi theo GiB nên card thực tế dư thêm khoảng 7%.

Phương án GPU gợi ý

Số card ít nhất đủ VRAM, ưu tiên cân bằng giữa số lượng, độ dư bộ nhớ và giá card.

  • Suy luận 4-bitcần ~72,6 GB

    1 × NVIDIA A100 80GB PCIe · 80 GB · ~390 W · card ~285.000.000 ₫

    Một card là đủ — đơn giản nhất để triển khai. Dư VRAM dưới 10%, dễ thiếu khi tăng context hoặc người dùng.

    Tính với nhiều người dùng / context dài hơn
  • Suy luận BF16 (chất lượng gốc)cần ~258,9 GB

    4 × NVIDIA A100 80GB PCIe · 320 GB · ~1,6 kW · card ~1.140.000.000 ₫

    Chia mô hình qua 4 GPU (tensor parallel) với NVLink.

    Tính với nhiều người dùng / context dài hơn
  • Fine-tune QLoRAcần ~74 GB

    1 × NVIDIA A100 80GB PCIe · 80 GB · ~390 W · card ~285.000.000 ₫

    Một card là đủ — đơn giản nhất để triển khai. Dư VRAM dưới 10%, dễ thiếu khi tăng context hoặc người dùng.

    Tính với nhiều người dùng / context dài hơn

Giá là giá tham khảo riêng card GPU, chưa gồm máy chủ và VAT.

Máy chủ HQG chạy được gpt-oss-120b

Máy hỗ trợ từ 4 GPU trở lên — đủ khe cho phương án suy luận BF16 ở trên. Cấu hình GPU cụ thể do kỹ sư HQG tư vấn.

Xem tất cả

Cần triển khai gpt-oss-120b cho doanh nghiệp?

HQG tư vấn cấu hình, lắp đặt máy chủ GPU và cài sẵn môi trường chạy mô hình tại hạ tầng của bạn.

Thông tin tham khảo, kiểm tra giấy phép trước khi dùng thương mại. Số tham số và kiến trúc lấy từ trang chính chủ; mức VRAM là ước tính theo công thức, không phải đo thực tế. Dữ liệu cập nhật 09/2026. Nguồn: huggingface.co/openai/gpt-oss-120b.