Bỏ qua điều hướng
CÔNG TY CỔ PHẦN GIẢI PHÁP CÔNG NGHỆ HQG
AI & GPU

Cụm máy chủ AI đẳng cấp thế giới: bên trong một tủ rack 135 kW và cách làm nhỏ lại cho doanh nghiệp Việt

GB300 NVL72 là cấu hình AI đắt nhất và dày đặc nhất đang bán trên thị trường: 72 GPU trong một tủ 48U, 135 kW mỗi tủ, nước làm mát vào tới 45 độ C. Bài viết bóc tách kiến trúc, mạng kết nối, điện, làm mát, chi phí điện tính bằng tiền Việt, và chỉ rõ cắt được gì khi ngân sách chỉ bằng một phần trăm.

N
Nguyễn Phúc Thịnh
Giám đốc Công nghệ
06/10/202616 phút đọc

Cấu hình đẳng cấp nhất thế giới hiện trông như thế nào

Khi khách hàng hỏi cấu hình máy chủ AI mạnh nhất thế giới đang bán là gì, câu trả lời của năm 2026 không còn là một con số GPU mà là một tủ rack hoàn chỉnh. Hệ GB300 NVL72 được NVIDIA công bố ở dạng tủ 48U chứa 72 GPU Blackwell Ultra và 36 CPU Grace, tổ chức thành 18 khay tính toán cao 1U cộng 9 khay switch NVLink. Toàn bộ 72 GPU nằm trong một miền NVLink duy nhất, nghĩa là với phần mềm chúng hành xử gần như một bộ tăng tốc khổng lồ chứ không phải 72 thiết bị rời phải tự nói chuyện với nhau qua mạng.

Bảng thông số NVIDIA công bố cho toàn tủ: 2.592 nhân Arm Neoverse V2 trên phần CPU, 20 TB bộ nhớ GPU với băng thông tới 576 TB/s, 17 TB bộ nhớ CPU dạng LPDDR5X với băng thông 14 TB/s, tổng bộ nhớ nhanh 37 TB, và băng thông NVLink toàn tủ 130 TB/s. Về năng lực tính toán, trang sản phẩm ghi 720 PFLOPS ở FP8 và FP6, 360 PFLOPS ở FP16 và BF16, 180 PFLOPS ở TF32, 6 PFLOPS FP32 và 100 TFLOPS FP64. Hãng ghi chú rằng các con số Tensor Core đã tính sparsity nếu không nói khác.

Trên tài liệu kỹ thuật của Lenovo cho cùng hệ này, thông số từng GPU được ghi rõ hơn: 288 GB HBM3e, băng thông 7,7 TB/s, công suất 1.100W mỗi GPU, hỗ trợ cắt tối đa 7 instance MIG, 18.000 TFLOPS FP4 và 9.000 TFLOPS FP8 có tính sparsity, và chỉ 1,25 TFLOPS FP64. Con số FP64 cuối cùng rất đáng chú ý và hay bị bỏ qua: đây là cỗ máy sinh ra cho AI độ chính xác thấp, không phải cho mô phỏng khoa học độ chính xác kép. Nếu bài toán của bạn là CFD hay động lực học phân tử, đây là cấu hình sai bất kể nó đắt tới đâu.

  • Tủ 48U, 72 GPU Blackwell Ultra và 36 CPU Grace, 18 khay tính toán 1U và 9 khay switch NVLink.
  • Bộ nhớ GPU toàn tủ 20 TB, bộ nhớ CPU 17 TB LPDDR5X, tổng bộ nhớ nhanh 37 TB.
  • Băng thông NVLink toàn tủ 130 TB/s; mỗi GPU 1,8 TB/s theo kiểu full mesh.
  • Mỗi GPU: 288 GB HBM3e, 7,7 TB/s, công suất 1.100W, tối đa 7 instance MIG.
  • FP8 toàn tủ 720 PFLOPS nhưng FP64 mỗi GPU chỉ 1,25 TFLOPS — không dành cho mô phỏng khoa học.

Bên trong một khay tính toán

Mỗi khay 1U chứa hai bo mạch chủ, mỗi bo gắn một CPU Grace và hai GPU B300, tức bốn GPU và hai CPU trên mỗi khay. CPU Grace có 72 nhân Arm Neoverse V2, xung cơ bản tới 3,1 GHz, công suất 300W. Bộ nhớ hệ thống là 960 GB LPDDR5X cho mỗi khay, chia 480 GB cho mỗi CPU, chạy ở 4.266 MT/s. Đây là LPDDR5X hàn chết trên bo, không có khe DIMM, nghĩa là dung lượng bộ nhớ hệ thống là thứ bạn chọn một lần khi mua và không nâng cấp về sau được.

Điểm kiến trúc quan trọng nhất của khay là cách CPU và GPU nối với nhau. Mỗi GPU có 450 GB/s NVLink đi tới CPU, và hai CPU trong cùng khay nối nhau bằng NVLink-C2C 300 GB/s hai chiều. So với một server x86 truyền thống nơi GPU treo trên PCIe Gen5 x16 cho khoảng 64 GB/s mỗi chiều, con đường CPU–GPU ở đây rộng hơn khoảng bảy lần. Hệ quả thực dụng là kỹ thuật offload trạng thái optimizer sang bộ nhớ CPU trở nên khả thi, trong khi trên nền tảng PCIe nó thường chậm tới mức vô dụng.

Phần lưu trữ cục bộ của mỗi khay là tối đa 8 ổ E1.S NVMe loại 3,84 TB hoặc 7,68 TB, tức tối đa 61,4 TB mỗi khay nếu cắm đủ tám ổ 7,68 TB; thiết kế tham chiếu của Lenovo chỉ cắm bốn ổ. Khay có thêm một ổ M.2 NVMe 1,92 TB dùng để khởi động. Cần lưu ý: hệ chỉ hỗ trợ RAID mềm. Nếu quy trình vận hành của bạn trông đợi RAID cứng với pin bảo vệ cache như trên PowerEdge hay ProLiant đời thường, hãy chuẩn bị lại kịch bản xử lý ổ lỗi trước khi nhận máy.

  • Mỗi khay 1U: 2 CPU Grace (72 nhân Neoverse V2, 300W) và 4 GPU B300.
  • 960 GB LPDDR5X mỗi khay, 480 GB mỗi CPU, 4.266 MT/s, hàn trên bo, không nâng cấp được.
  • NVLink CPU–GPU 450 GB/s mỗi GPU; NVLink-C2C giữa hai CPU 300 GB/s hai chiều.
  • Tối đa 8 ổ E1.S mỗi khay, dung lượng tối đa 61,4 TB; ổ khởi động M.2 1,92 TB.
  • Chỉ có RAID mềm — cần sửa lại quy trình thay ổ so với server doanh nghiệp thường.

Mạng kết nối: hai tầng hoàn toàn khác nhau

Người mới tiếp cận hạ tầng AI thường gộp mọi thứ vào một chữ mạng, rồi lên cấu hình sai. Thực tế có hai tầng độc lập. Tầng trong tủ là NVLink: 1,8 TB/s mỗi GPU, full mesh qua 9 khay switch, dùng để 72 GPU chia sẻ bộ nhớ và đồng bộ trọng số trong lúc huấn luyện. Tầng ra ngoài tủ là mạng gói: mỗi khay có bốn cổng OSFP trên ConnectX-8, mỗi cổng tới 800 Gb/s, chạy InfiniBand Quantum-X800 hoặc Ethernet Spectrum-X tuỳ lựa chọn.

Khoảng cách giữa hai tầng này là một bậc độ lớn, và đó là lý do miền NVLink có giới hạn cứng. Tài liệu Lenovo ghi rõ 9 khay switch NVLink là không mở rộng được, nghĩa là không có NVLink giữa các tủ. Hai tủ NVL72 đứng cạnh nhau vẫn phải nói chuyện với nhau qua InfiniBand hoặc Ethernet 800G. Khi lập kế hoạch song song hoá mô hình, ranh giới 72 GPU này là thứ bạn phải thiết kế xung quanh: tensor parallel và expert parallel nên nằm trong tủ, pipeline parallel và data parallel thì đi qua mạng gói được.

Ngoài hai tầng đó còn tầng thứ ba hay bị quên trong dự toán: mạng quản trị. Mỗi khay có thêm một card BlueField-3 B3240 với hai cổng 400G, Supermicro ghi mạng in-band tới 200 Gb/s qua BlueField-3 và mạng out-of-band 1G/10G Ethernet. Cấu hình tham chiếu của Lenovo kèm hai switch MSN2201-CSMRC cho 1GbE và 100GbE, cộng một switch SN2201 48 cổng cho quản trị. Cộng lại, một tủ duy nhất đã cần ba hệ thống cáp riêng biệt, và chi phí quang học cùng nhân công đi cáp là phần thường bị báo thiếu nhất trong các bản chào giá tôi được xem.

  • Tầng scale-up trong tủ: NVLink 1,8 TB/s mỗi GPU, full mesh, không vượt ra ngoài tủ.
  • Tầng scale-out ra ngoài: 4 cổng OSFP 800 Gb/s mỗi khay qua ConnectX-8, InfiniBand Quantum-X800 hoặc Spectrum-X Ethernet.
  • Miền NVLink dừng ở 72 GPU — hai tủ phải nối nhau bằng mạng gói.
  • Tầng quản trị riêng: BlueField-3 2x400G, in-band tới 200 Gb/s, out-of-band 1G/10G.
  • Một tủ cần ba hệ cáp riêng; chi phí quang và nhân công đi cáp thường bị báo thiếu.

Điện: 135 kW một tủ và vì sao con số đó đổi mọi thứ

Lenovo công bố công suất thiết kế toàn tủ là 135 kW, với đỉnh tới 155 kW tuỳ khối lượng công việc. Supermicro mô tả hệ của mình bằng tám khay nguồn 1U loại 33 kW, mỗi khay sáu bộ nguồn 5,5 kW, cho tổng 132 kW. Lenovo cho chọn sáu hoặc tám khay nguồn 33 kW, tức dung lượng cấp nguồn lắp đặt là 198 kW hoặc 264 kW để dự phòng. Phân phối điện trong tủ không còn bằng ổ cắm mà bằng busbar một chiều 50V chịu 1.400A; đầu vào mỗi khay nguồn là 200 đến 277 VAC.

Hãy đặt 135 kW cạnh thực tế phòng máy Việt Nam. Mật độ phổ biến ở các doanh nghiệp chúng tôi khảo sát vẫn là 4 đến 8 kW cho cả một tủ 42U, và những phòng máy được thiết kế tốt hơn thì 10 đến 15 kW. Một tủ NVL72 vì vậy tương đương toàn bộ tải điện của một phòng máy cỡ vừa gồm mười tới hai mươi tủ. Đây không phải chuyện kéo thêm aptomat. Nó là chuyện tiết diện cáp, công suất máy biến áp, dung lượng máy phát, dung lượng UPS, và trong nhiều trường hợp là chuyện xin nâng công suất hợp đồng mua điện.

Dung lượng UPS cũng cần nhìn lại cho đúng. Một tủ 135 kW cần khoảng 150 kVA UPS chỉ cho riêng nó ở hệ số công suất thực tế, chưa tính dự phòng N+1. Với chuỗi ắc quy, thời gian lưu điện mười lăm phút ở mức tải đó đòi hỏi một dàn ắc quy có khối lượng và diện tích sàn đáng kể, và sàn phòng máy nhiều toà nhà ở Việt Nam không được tính cho tải tập trung như vậy. Đây là lý do tôi luôn khuyên khảo sát kết cấu sàn cùng lúc với khảo sát điện, chứ đừng khảo sát điện trước rồi mới phát hiện vấn đề sàn.

  • Công suất tủ: 135 kW thiết kế, tới 155 kW đỉnh (Lenovo); 132 kW cấp nguồn (Supermicro).
  • Khay nguồn 33 kW mỗi khay, 6 bộ nguồn 5,5 kW mỗi khay, đầu vào 200–277 VAC.
  • Phân phối trong tủ bằng busbar 50V DC chịu 1.400A, không còn dùng ổ cắm.
  • Một tủ NVL72 bằng tổng tải điện của một phòng máy cỡ vừa 10–20 tủ thông thường.
  • Cần khoảng 150 kVA UPS cho một tủ, chưa tính N+1; phải khảo sát kết cấu sàn cho dàn ắc quy.

Làm mát: nước vào tới 45 độ C và 90 phần trăm nhiệt đi theo chất lỏng

Hệ này không có phương án làm mát bằng khí. Tài liệu Lenovo ghi tỷ lệ tản nhiệt khoảng 90 phần trăm theo chất lỏng và 10 phần trăm theo khí, với tấm lạnh áp trực tiếp lên CPU, GPU, HBM, card ConnectX-8 và cả linh kiện trong khay switch. Chất tải lạnh được khuyến nghị là nước khử ion, hoặc dung dịch PG25. Supermicro cho ba lựa chọn CDU: loại đặt trong tủ tới 250 kW, loại đặt cuối dãy tới 1,8 MW phục vụ được tối đa tám tủ, và loại sidecar L2A tới 200 kW không cần nước toà nhà.

Con số làm nhiều người ngạc nhiên nhất là nhiệt độ nước cấp cho phép lên tới 45 độ C. Nghe ngược trực giác, nhưng đó chính là điểm hay của làm mát chất lỏng áp chip: chênh lệch nhiệt độ giữa nước và chip vẫn đủ lớn nên không cần nước lạnh. Hệ quả là ở nhiều vùng khí hậu, hệ thống có thể thải nhiệt bằng tháp giải nhiệt hoặc dry cooler mà không cần chạy chiller, tiết kiệm phần lớn điện của hệ thống lạnh. Khí hậu nóng ẩm của Việt Nam làm bài toán này khó hơn châu Âu nhưng không loại trừ nó.

Cái giá phải trả nằm ở lưu lượng và áp suất, và đây là chỗ tài liệu Lenovo rất đáng đọc kỹ. Ở nước cấp 25 độ C, tủ cần 59 lít mỗi phút với tổn thất áp 2,3 psi. Ở 35 độ C, cần 89 lít mỗi phút và 4,9 psi. Ở 45 độ C, con số nhảy lên 177 lít mỗi phút và 18,4 psi. Nói cách khác, nước càng ấm thì càng cần bơm nhiều và bơm mạnh, tức tiết kiệm được điện chiller nhưng tốn thêm điện bơm và cần đường ống lớn hơn. Đó là một bài toán tối ưu thật sự, không phải một lựa chọn hiển nhiên. Ngoài ra khay tính toán vẫn cần khí cấp trong khoảng ASHRAE A2 từ 10 đến 35 độ C, còn nước cho khay switch chấp nhận 2 đến 50 độ C tức lớp W45.

  • Khoảng 90 phần trăm nhiệt tản qua chất lỏng, 10 phần trăm qua khí; không có bản làm mát khí.
  • Tấm lạnh phủ cả CPU, GPU, HBM, card mạng ConnectX-8 và linh kiện khay switch.
  • Nước cấp cho phép tới 45 độ C — mở ra khả năng thải nhiệt không cần chiller.
  • Lưu lượng theo nhiệt độ nước: 59 LPM ở 25 độ C, 89 LPM ở 35 độ C, 177 LPM ở 45 độ C.
  • Tổn thất áp tương ứng 2,3 psi, 4,9 psi và 18,4 psi — nước ấm hơn thì tốn điện bơm hơn.
  • CDU: trong tủ tới 250 kW, cuối dãy tới 1,8 MW cho 8 tủ, sidecar L2A 200 kW không cần nước toà nhà.

Chi phí vận hành tính bằng số

Hãy lấy giả định thực tế: một tủ chạy liên tục ở 80 phần trăm công suất thiết kế 135 kW, tức 108 kW trung bình. Trong một năm 8.760 giờ, đó là 946.080 kWh. Biểu giá bán lẻ điện cho kinh doanh áp dụng từ 10 tháng 5 năm 2025 theo Quyết định 1279/QĐ-BCT, cấp điện áp từ 22 kV trở lên, giờ bình thường là 2.887 đồng mỗi kWh chưa thuế giá trị gia tăng. Nhân ra, riêng tiền điện phần máy là khoảng 2,73 tỷ đồng mỗi năm. Nếu chạy lệch vào giờ cao điểm với đơn giá 5.025 đồng, con số có thể gần gấp đôi; nếu dồn được vào giờ thấp điểm 1.609 đồng thì giảm còn khoảng 1,52 tỷ đồng.

Phần làm mát tính thêm qua hệ số PUE. Một phòng máy làm mát chất lỏng được thiết kế tốt có thể đạt PUE quanh 1,2, tức thêm 20 phần trăm điện cho bơm, CDU, tháp giải nhiệt và tổn thất UPS, tương đương khoảng 0,55 tỷ đồng mỗi năm. Tổng chi phí điện cho một tủ duy nhất rơi vào khoảng 3,28 tỷ đồng mỗi năm. Qua ba năm là gần 10 tỷ đồng, và đó là con số bạn phải đặt cạnh giá mua phần cứng trong bảng tính tổng chi phí sở hữu, không phải bỏ sang một bên như chi phí vận hành nhỏ.

Nhân viên lập dự toán nên lưu ý ba điều. Thứ nhất, biểu giá điện được phép điều chỉnh theo chu kỳ ba tháng theo Nghị định 72/2025/NĐ-CP, nên con số trên là tham chiếu tại thời điểm viết chứ không phải cam kết. Thứ hai, khung giờ cao thấp điểm đã được điều chỉnh bằng Quyết định 963/QĐ-BCT áp dụng từ 22 tháng 4 năm 2026, nên lịch chạy job huấn luyện nên được xếp lại theo khung giờ mới. Thứ ba, nếu bài toán cho phép chạy ban đêm, việc đẩy phần lớn khối lượng vào giờ thấp điểm là đòn tiết kiệm lớn nhất và rẻ nhất mà bạn có trong tay.

  • Giả định 80 phần trăm tải trên 135 kW: 946.080 kWh mỗi năm cho một tủ.
  • Giờ bình thường 2.887 đồng/kWh (từ 22 kV trở lên, chưa VAT): khoảng 2,73 tỷ đồng/năm.
  • Giờ thấp điểm 1.609 đồng/kWh: khoảng 1,52 tỷ đồng/năm; giờ cao điểm 5.025 đồng thì gần gấp đôi.
  • Thêm 20 phần trăm cho làm mát ở PUE 1,2: khoảng 0,55 tỷ đồng/năm.
  • Tổng khoảng 3,28 tỷ đồng điện mỗi năm cho một tủ, gần 10 tỷ đồng trong ba năm.
  • Biểu giá điều chỉnh theo chu kỳ ba tháng; khung giờ mới áp dụng từ 22/4/2026 — phải xếp lại lịch job.
Công cụ liên quan
Dùng công cụ tư vấn GPU AI
Xem ngay

Doanh nghiệp Việt muốn làm nhỏ hơn thì cắt gì

Câu hỏi thực tế hầu như không bao giờ là mua hay không mua một tủ NVL72, mà là trong cấu hình đó, phần nào thực sự tạo ra giá trị cho bài toán của tôi. Thứ đầu tiên nên cắt là miền NVLink 72 GPU. Nó chỉ có ý nghĩa khi bạn huấn luyện hoặc phục vụ một mô hình đủ lớn để không vừa trong tám GPU. Nếu mô hình lớn nhất của bạn dưới 200 tỷ tham số ở định dạng đã lượng tử hoá, một node tám GPU nối NVLink nội bộ là đủ, và bạn tiết kiệm được toàn bộ 9 khay switch NVLink cùng hạ tầng busbar đi kèm.

Node tám GPU đó là phân khúc có sẵn và lắp được vào phòng máy thật. HPE công bố Compute XD690 là chassis 10U làm mát bằng khí, hai CPU Intel Xeon 6, tám GPU Blackwell Ultra B300 dạng HGX, mười hai bộ nguồn Titanium 3.200W cấu hình N+N, công suất tiêu thụ tiêu chuẩn 14,3 kW liên tục và 16,4 kW đỉnh. Dell có PowerEdge XE9780 ở dạng 10U làm mát khí với tám GPU HGX B300 NVL8, và bản XE9780L làm mát chất lỏng. Mức 14 đến 16 kW một máy vẫn cao so với phòng máy Việt Nam nhưng nằm trong tầm cải tạo được, khác hẳn 135 kW.

Thứ hai nên cắt là mạng 800G. Nếu bạn chỉ có một hoặc hai node và không huấn luyện phân tán qua nhiều máy, 800G InfiniBand không mang lại gì ngoài hoá đơn. Mạng 100GbE hoặc 200GbE đủ để nuôi dữ liệu cho tám GPU trong hầu hết kịch bản inference và fine-tune LoRA. Thứ ba nên cắt là lưu trữ 144 khay E1.S; một vài ổ NVMe Gen4 hoặc Gen5 làm tầng nóng cộng một NAS hiệu năng vừa làm tầng dữ liệu là cấu hình thực dụng hơn nhiều. Thứ tư, làm mát chất lỏng áp chip có thể hoãn: ở mức 14 kW một máy, làm mát bằng khí với ngăn cách luồng nóng lạnh chuẩn và nhiệt độ cấp gió dưới 24 độ C vẫn chạy được.

Thứ duy nhất tôi khuyên không cắt là bộ nhớ GPU. Đây là biến số quyết định bạn nạp được mô hình nào và phục vụ được bao nhiêu phiên đồng thời, và nó không thể bù bằng phần mềm. Nếu buộc phải chọn giữa bốn GPU dung lượng lớn và tám GPU dung lượng nhỏ cùng ngân sách, trong phần lớn bài toán phục vụ mô hình ngôn ngữ, bốn GPU dung lượng lớn là lựa chọn ít hối tiếc hơn.

  • Cắt đầu tiên: miền NVLink 72 GPU — chỉ cần khi mô hình không vừa trong 8 GPU.
  • Node 8 GPU thay thế: HPE XD690 10U khí, 14,3 kW liên tục, 16,4 kW đỉnh; Dell XE9780 10U khí.
  • Cắt mạng 800G nếu chỉ có một hai node và không huấn luyện phân tán; 100–200GbE là đủ.
  • Cắt 144 khay E1.S: vài ổ NVMe làm tầng nóng cộng NAS hiệu năng vừa là thực dụng hơn.
  • Hoãn làm mát chất lỏng được ở mức 14 kW mỗi máy nếu có ngăn cách luồng gió chuẩn.
  • Không cắt bộ nhớ GPU — đó là biến số phần mềm không bù được.

Ai nên mua và ai không nên

Nên nhìn tới cấu hình tủ đầy đủ nếu bạn thuộc một trong ba nhóm. Nhóm một là đơn vị thực sự huấn luyện mô hình nền từ đầu hoặc huấn luyện tiếp ở quy mô hàng trăm tỷ tham số, nơi miền NVLink 72 GPU là điều kiện kỹ thuật chứ không phải tiện nghi. Nhóm hai là nhà cung cấp dịch vụ cho thuê năng lực tính toán, nơi doanh thu tỷ lệ với mật độ và tỷ lệ tận dụng gần như luôn trên 80 phần trăm. Nhóm ba là đơn vị phục vụ mô hình suy luận dài, nhiều bước, cho hàng nghìn người dùng đồng thời, nơi tổng bộ nhớ nhanh 37 TB trong một miền tạo ra khác biệt về số phiên.

Không nên mua nếu bạn ở một trong các tình huống sau. Tỷ lệ tận dụng dự kiến dưới 60 phần trăm trong mười hai tháng tới: một tủ 135 kW chạy nửa tải là cách đốt tiền hiệu quả nhất tôi biết. Phòng máy hiện hữu không có nước làm mát và không có kế hoạch ngân sách cho hệ thống nước: phần hạ tầng có thể ngang hoặc hơn giá máy. Bài toán chính là mô phỏng khoa học FP64: 1,25 TFLOPS FP64 mỗi GPU khiến đây là lựa chọn tệ cho nhóm việc đó. Hoặc đội vận hành chưa từng chạy một cụm GPU đa node nào: hãy đi qua một hệ tám GPU trước, kinh nghiệm vận hành không mua được bằng tiền.

Có một con đường trung gian mà tôi thấy ít đơn vị Việt Nam tận dụng đủ: thuê năng lực tính toán theo giờ cho các đợt huấn luyện lớn không thường xuyên, và đặt tại chỗ một hệ nhỏ hơn cho dữ liệu nhạy cảm cùng khối lượng inference hàng ngày. Mô hình hỗn hợp này giữ dữ liệu cần kiểm soát ở trong nhà, đồng thời không bắt bạn trả tiền cho công suất đỉnh suốt ba trăm sáu mươi lăm ngày.

  • Nên cân nhắc: huấn luyện mô hình nền quy mô hàng trăm tỷ tham số.
  • Nên cân nhắc: nhà cung cấp cho thuê tính toán với tỷ lệ tận dụng trên 80 phần trăm.
  • Nên cân nhắc: phục vụ suy luận nhiều bước cho hàng nghìn người dùng đồng thời.
  • Không nên: tận dụng dự kiến dưới 60 phần trăm trong 12 tháng tới.
  • Không nên: phòng máy chưa có hệ thống nước và chưa có ngân sách cho nó.
  • Không nên: bài toán chính là mô phỏng FP64, hoặc đội chưa từng vận hành cụm GPU đa node.

Kết luận thẳng thắn

GB300 NVL72 là một thành tựu kỹ thuật thật, và cũng là một cấu hình mà đa số doanh nghiệp Việt Nam không nên mua trong vòng ba năm tới. Lý do không phải vì giá máy mà vì ba thứ đi kèm: 135 kW một tủ, hệ thống nước làm mát, và yêu cầu tỷ lệ tận dụng cao để phép tính có nghĩa. Thiếu bất kỳ thứ nào trong ba thứ đó, tiền bỏ ra sẽ không chuyển thành năng lực tính toán hữu dụng.

Điều đáng làm với cấu hình này là học từ nó. Ba bài học chuyển trực tiếp xuống quy mô nhỏ: bộ nhớ GPU và băng thông bộ nhớ quan trọng hơn số GPU; đường truyền CPU–GPU rộng mở ra những kỹ thuật tiết kiệm bộ nhớ mà PCIe không cho phép; và hạ tầng điện cùng làm mát phải được thiết kế trước phần cứng chứ không phải sau. Một hệ tám GPU được lắp trong một phòng máy có luồng gió đúng và điện đủ dự phòng sẽ cho ra nhiều giá trị hơn một hệ mười sáu GPU bị throttle vì quá nhiệt.

Khuyến nghị hành động cụ thể: trước khi bàn tới cấu hình, hãy đo ba con số của hiện trạng. Công suất điện khả dụng thực tế cho mỗi tủ trong phòng máy của bạn, tính cả dự phòng. Năng lực tản nhiệt thực tế của hệ thống lạnh hiện có, đo bằng nhiệt độ cấp gió và chênh lệch nhiệt độ trước sau tủ khi đầy tải. Và tỷ lệ tận dụng GPU trung bình ba tháng gần nhất nếu bạn đã có GPU. Ba con số đó quyết định cấu hình đúng chính xác hơn bất kỳ bảng so sánh thông số nào. HQG khảo sát tải điện, luồng gió và kết cấu sàn tại chỗ ở TP.HCM, Đà Nẵng và Hà Nội, và cho thuê máy chủ GPU theo tháng để chạy thử nghiệm trước khi bạn cam kết ngân sách. Hotline 1900 636 106.

Nguồn đã tra

Mọi thông số trong bài được đối chiếu với các trang sau tại thời điểm biên soạn tháng 10 năm 2026. Các con số về giá điện có thể thay đổi theo chu kỳ điều chỉnh, nên hãy kiểm tra lại trước khi dùng cho dự toán chính thức.

  • Trang sản phẩm GB300 NVL72 của NVIDIA: https://www.nvidia.com/en-us/data-center/gb300-nvl72/
  • Tài liệu kỹ thuật Lenovo NVIDIA GB300 NVL72 Rack Scale AI: https://lenovopress.lenovo.com/lp2357-lenovo-nvidia-gb300-nvl72-rack-scale-ai
  • Trang hệ thống Supermicro SRS-GB300-NVL72: https://www.supermicro.com/en/products/system/gpu/48u/srs-gb300-nvl72
  • Trang sản phẩm Dell PowerEdge XE9780: https://www.dell.com/en-us/shop/ipovw/poweredge-xe9780
  • Trang sản phẩm HPE Compute XD690: https://buy.hpe.com/us/en/compute/rack-servers/proliant-compute-xd600-servers/hpe-compute-xd690/p/1014909740
  • Biểu giá bán lẻ điện theo Quyết định 1279/QĐ-BCT (áp dụng từ 10/5/2025), tra qua Thư viện Pháp luật: https://thuvienphapluat.vn/phap-luat-doanh-nghiep/bai-viet/gia-dien-kinh-doanh-2026-cap-nhat-moi-nhat-20133.html
Dùng công cụ tư vấn GPU AI

Nhập mô hình và số người dùng để nhận cấu hình GPU phù hợp.

Dùng ngay
#GB300 NVL72#Blackwell Ultra#NVLink#làm mát chất lỏng#hạ tầng AI#điện trung tâm dữ liệu
N
Nguyễn Phúc Thịnh
Giám đốc Công nghệ

Định hướng kiến trúc kỹ thuật và bộ tiêu chuẩn triển khai hạ tầng của HQG, với nhiều năm dẫn dắt các dự án trung tâm dữ liệu quy mô lớn.

Chia sẻ