Hai loại máy, hai bài toán khác nhau
Workstation AI được thiết kế để một người dùng ngồi cạnh máy, làm việc tương tác, có màn hình cắm trực tiếp và chạy trong môi trường văn phòng. Server AI được thiết kế để nhiều người dùng truy cập từ xa, chạy liên tục hai mươi bốn trên bảy, đặt trong phòng máy có điều hoà chính xác và không ai ngồi bên cạnh. Sự khác biệt này quyết định mọi lựa chọn kỹ thuật phía sau: từ tốc độ quạt, thiết kế nguồn, tới cách quản trị và cách cấp phát tài nguyên.
Nhầm lẫn phổ biến nhất là mua workstation rồi đặt vào rack, hoặc mua server rồi đặt cạnh bàn làm việc. Trường hợp thứ nhất gây quá nhiệt vì workstation dựa vào luồng gió tự nhiên trong phòng thoáng, không phù hợp với khoang rack kín. Trường hợp thứ hai gây khổ sở cho cả phòng vì server 2U có thể phát ra 75 tới 85 dBA khi quạt tăng tốc, tương đương tiếng máy hút bụi công nghiệp chạy liên tục.
Cách đơn giản để phân biệt: nếu số người cần dùng GPU nhiều hơn một và họ không ngồi cùng phòng, bạn cần server. Nếu chỉ một kỹ sư nghiên cứu làm việc tương tác, cần hiển thị đồ hoạ trực tiếp và khối lượng công việc chưa liên tục, workstation là lựa chọn hợp lý và rẻ hơn đáng kể. Ranh giới này rõ hơn nhiều so với việc so sánh thông số GPU.
- Workstation phục vụ một người dùng tương tác, có xuất hình trực tiếp.
- Server phục vụ nhiều người dùng từ xa, chạy liên tục trong phòng máy.
- Server 2U phát ra 75 tới 85 dBA khi quạt tăng tốc, không đặt được trong văn phòng.
- Workstation trong rack kín sẽ quá nhiệt vì thiếu luồng gió cưỡng bức.
- Trên một người dùng và không ngồi cùng phòng: chọn server.
Nguồn điện, tản nhiệt và số khe PCIe
Một workstation cao cấp như Dell Precision 7960 hay HP Z8 Fury thường trang bị nguồn đơn 1.400 tới 1.500W, đủ cho hai tới ba GPU 300W cộng CPU. Không có nguồn dự phòng, nghĩa là hỏng nguồn là dừng máy. Server GPU như Dell PowerEdge R760xa dùng hai tới bốn bộ nguồn 2.400W hoặc 2.800W ở chế độ dự phòng nóng, cho phép thay nguồn hỏng mà không tắt máy. Với hệ thống phục vụ cả phòng ban, khác biệt này quan trọng hơn mọi thông số GPU.
Về tản nhiệt, workstation dùng quạt lớn quay chậm để giữ độ ồn dưới 45 dBA ở tải cao, chấp nhận nhiệt độ GPU quanh 80 độ C. Server dùng dãy quạt nhỏ quay tới 20.000 vòng mỗi phút tạo áp suất tĩnh cao đẩy gió xuyên qua tản nhiệt passive của card, giữ GPU dưới 70 độ C nhưng đánh đổi bằng tiếng ồn và điện năng cho quạt. Card data center như A100 hay L40S bắt buộc kiểu làm mát này, không có quạt riêng nên không thể lắp vào workstation thông thường.
Số khe PCIe cũng chênh lệch rõ. Workstation cao cấp cho tối đa ba GPU dual-slot vì hạn chế không gian và nguồn. Server 2U như R760xa nhận bốn GPU dual-slot, server 4U như Supermicro SYS-421GE nhận tám tới mười card. Quan trọng hơn số lượng là cách phân bổ làn PCIe: server dùng nền tảng có 128 làn trở lên đảm bảo mọi GPU chạy đủ x16, trong khi workstation thường chia sẻ làn với các khe khác và có thể tự động hạ xuống x8.
RTX 6000 Ada so với cụm GPU trong server
RTX 6000 Ada là card workstation đầu bảng hiện nay: nhân AD102 với 18.176 nhân CUDA, 48 GB GDDR6 có ECC, băng thông khoảng 960 GB/s, TDP 300W và quạt blower tích hợp. Về năng lực tính toán, card này ngang ngửa L40S, hỗ trợ đầy đủ FP8 qua Transformer Engine và có bốn cổng DisplayPort để xuất hình. Một workstation với hai card RTX 6000 Ada cho 96 GB VRAM tổng, đủ chạy fine-tune LoRA cho mô hình 70B lượng tử hoá hoặc phục vụ inference cho một nhóm nhỏ.
Giá tham chiếu của RTX 6000 Ada vào khoảng 7.000 tới 8.500 USD mỗi card. Một workstation hai card hoàn chỉnh với CPU Xeon W hoặc Threadripper Pro, 256 GB RAM và ổ NVMe rơi vào khoảng 25.000 tới 30.000 USD, tương đương 640 tới 770 triệu đồng. Một server 2U bốn card L40S với cấu hình tương đương về CPU và RAM có giá khoảng 45.000 tới 55.000 USD nhưng cho gấp đôi VRAM và có nguồn dự phòng, quản trị từ xa, khả năng chia sẻ cho nhiều người.
Điểm cần cân nhắc là RTX 6000 Ada không hỗ trợ MIG và giấy phép vGPU cho dòng RTX cũng khác dòng data center. Nếu mục tiêu là chia GPU cho nhiều người dùng theo cách được NVIDIA hỗ trợ chính thức, bạn cần card data center. Nếu chỉ cần một người dùng khai thác trọn vẹn một card, RTX 6000 Ada cho hiệu năng trên giá tốt hơn và có thêm đầu ra hiển thị mà card data center không có.
- RTX 6000 Ada: 48 GB GDDR6 ECC, khoảng 960 GB/s, TDP 300W, có quạt blower.
- Hỗ trợ FP8 và bốn cổng DisplayPort, chạy được cả AI lẫn đồ hoạ.
- Giá tham chiếu khoảng 7.000 tới 8.500 USD mỗi card.
- Không hỗ trợ MIG, hạn chế khả năng chia sẻ chính thức cho nhiều người dùng.
- Workstation hai card cho 96 GB VRAM tổng, đủ cho LoRA mô hình 70B lượng tử hoá.
Chia sẻ tài nguyên cho nhiều người dùng
Đây là lý do mạnh nhất để chọn server. Một workstation dù mạnh vẫn là tài nguyên của một người: khi kỹ sư A chạy job huấn luyện bốn tiếng, kỹ sư B ngồi chờ. Trong một đội năm người, tỷ lệ tận dụng thực tế của mô hình phân tán workstation cho từng người hiếm khi vượt 25 phần trăm, trong khi tổng chi phí lại cao hơn một server dùng chung. Phép tính này gần như luôn nghiêng về server khi đội có từ ba người trở lên.
Trên server, việc chia sẻ được thực hiện bằng bộ lập lịch. Với đội nhỏ, Slurm là lựa chọn đơn giản và ổn định: người dùng gửi job qua sbatch, hệ thống xếp hàng và cấp GPU theo hạn ngạch. Với môi trường phức tạp hơn, Kubernetes kèm NVIDIA GPU Operator cho phép đóng gói workload thành container và tự động phân bổ. Run:ai hoặc các nền tảng tương đương bổ sung thêm tính năng cấp phát linh hoạt và chia nhỏ GPU theo phần.
Cấp độ chia sẻ mịn nhất là MIG trên A100 hoặc H100, cắt một card thành tối đa bảy instance cách ly hoàn toàn về lỗi và hiệu năng. Với vGPU trên L40S hoặc A40, bạn chia được theo dung lượng bộ nhớ phục vụ máy trạm ảo. Cả hai cơ chế này đều không khả dụng trên workstation. Nếu chiến lược của công ty là dân chủ hoá quyền truy cập GPU cho nhiều phòng ban, workstation là ngõ cụt về mặt kiến trúc.
Bảo mật dữ liệu và quản trị từ xa
Một workstation đặt dưới gầm bàn là một rủi ro bảo mật vật lý. Ổ đĩa có thể bị tháo, cổng USB có thể bị cắm thiết bị lạ, và máy thường không nằm trong vùng mạng được kiểm soát chặt. Với dữ liệu khách hàng, hồ sơ y tế hoặc thông tin tài chính, đây là điểm yếu khó biện minh khi đi kiểm toán. Server đặt trong phòng máy có kiểm soát ra vào, mã hoá ổ đĩa ở mức bộ điều khiển RAID và nằm trong VLAN riêng giải quyết phần lớn các vấn đề này.
Về quản trị, server đi kèm bộ điều khiển ngoài băng: iDRAC9 trên Dell PowerEdge, iLO6 trên HPE ProLiant, XCC trên Lenovo ThinkSystem. Các bộ điều khiển này có địa chỉ IP riêng, hoạt động ngay cả khi máy tắt, cho phép bật tắt nguồn từ xa, xem màn hình ảo, gắn ảnh ISO để cài lại hệ điều hành và đọc toàn bộ nhật ký phần cứng. Khi một GPU báo lỗi ECC lúc hai giờ sáng, quản trị viên xử lý từ nhà thay vì lái xe tới văn phòng.
Server cũng hỗ trợ giám sát chủ động: cảm biến nhiệt độ trên từng thành phần, dự báo hỏng ổ đĩa, cảnh báo qua SNMP hoặc Redfish tích hợp vào hệ thống giám sát chung. Workstation gần như không có gì tương đương, và khi hỏng thì bạn biết vào lúc người dùng gọi điện phàn nàn. Với hệ thống mà cả phòng ban phụ thuộc vào, chênh lệch về khả năng vận hành này quan trọng không kém chênh lệch về hiệu năng.
- iDRAC9, iLO6 và XCC hoạt động ngay cả khi máy chủ đang tắt nguồn.
- Cho phép bật tắt từ xa, xem màn hình ảo và gắn ISO cài lại hệ điều hành.
- Cảnh báo qua SNMP hoặc Redfish tích hợp vào hệ thống giám sát chung.
- Server đặt trong phòng máy có kiểm soát ra vào và mã hoá ổ đĩa mức RAID.
- Workstation dưới gầm bàn là điểm yếu vật lý khó biện minh khi kiểm toán.
Lộ trình từ một workstation lên cụm server
Lộ trình chúng tôi thường tư vấn gồm ba giai đoạn. Giai đoạn một kéo dài ba tới sáu tháng: một workstation với một hoặc hai card RTX 6000 Ada, dành cho một tới hai kỹ sư khám phá bài toán, thử mô hình và xác định xem AI có tạo ra giá trị thật cho nghiệp vụ hay không. Chi phí giai đoạn này khoảng 400 tới 700 triệu đồng, đủ nhỏ để phê duyệt nhanh mà không cần hồ sơ đầu tư dài dòng.
Giai đoạn hai bắt đầu khi có ít nhất một trường hợp sử dụng chứng minh được hiệu quả và số người cần GPU vượt quá ba. Lúc này đầu tư một server 2U bốn GPU đặt trong phòng máy, dựng bộ lập lịch Slurm hoặc Kubernetes, và chuyển workstation thành máy phát triển cho kỹ sư. Chi phí khoảng 1,2 tới 1,6 tỷ đồng nhưng phục vụ được cả phòng ban với tỷ lệ tận dụng cao hơn nhiều.
Giai đoạn ba là khi AI đã thành hạ tầng thiết yếu, có SLA nội bộ và nhiều nhóm phụ thuộc. Lúc này cần từ hai server trở lên để có dự phòng, mạng liên kết 100GbE hoặc InfiniBand nếu huấn luyện phân tán, và hệ thống lưu trữ dùng chung dạng NAS hiệu năng cao hoặc SAN. Điểm mấu chốt là đừng nhảy cóc từ giai đoạn một lên giai đoạn ba. Chúng tôi đã thấy nhiều doanh nghiệp mua hệ tám GPU ngay từ đầu rồi để nhàn rỗi hơn một năm vì chưa có bài toán đủ chín.
Chi phí thực và khuyến nghị
Khi so sánh, đừng chỉ nhìn giá mua. Workstation không tốn chi phí phòng máy, không cần UPS công suất lớn, không cần điều hoà chính xác. Server cần rack, cần UPS đủ tải với thời gian dự phòng phù hợp, cần điều hoà và cần người vận hành. Với một server 2U bốn GPU tiêu thụ khoảng 2,5 kW, một bộ UPS APC dòng Smart-UPS SRT 5 kVA cho khoảng mười lăm phút dự phòng có giá vài chục triệu đồng, cộng chi phí điện và làm mát hàng năm.
Ngược lại, workstation có chi phí ẩn về thời gian chờ. Nếu năm kỹ sư dùng chung ba workstation và mỗi người mất trung bình một giờ mỗi ngày để chờ máy rảnh, đó là 1.200 giờ công mỗi năm. Quy ra chi phí nhân sự, con số này thường vượt phần chênh lệch giữa hai phương án phần cứng chỉ sau mười tám tháng. Hãy đưa thời gian chờ vào bảng tính, đây là biến số bị bỏ quên nhiều nhất.
Khuyến nghị cụ thể của tôi: nếu đội dưới ba người và bạn còn đang khám phá, mua một workstation hai card RTX 6000 Ada và bắt đầu ngay trong tháng này. Nếu đội từ ba người trở lên, có ít nhất một ứng dụng đã chạy thật với người dùng nội bộ, hãy chuyển thẳng sang server 2U bốn GPU với bộ lập lịch. Nếu bạn chưa chắc mình đang ở đâu, thuê một server GPU theo tháng trong sáu mươi ngày và đo tỷ lệ tận dụng thực tế trước khi quyết định. HQG hỗ trợ cả hai hướng, từ cấu hình workstation tại chỗ tới thiết kế phòng máy và cho thuê server GPU tại TP.HCM, Đà Nẵng và Hà Nội. Hotline 1900 636 106.
- Server 2U bốn GPU tiêu thụ khoảng 2,5 kW, cần UPS 5 kVA trở lên.
- Đưa thời gian chờ máy của kỹ sư vào bảng tính chi phí, thường bị bỏ quên.
- Đội dưới ba người và đang khám phá: một workstation hai card RTX 6000 Ada.
- Đội từ ba người và đã có ứng dụng chạy thật: server 2U bốn GPU kèm bộ lập lịch.
- Chưa rõ nhu cầu: thuê server GPU sáu mươi ngày và đo tỷ lệ tận dụng trước.
Nhập mô hình và số người dùng để nhận cấu hình GPU phù hợp.
Chuyển yêu cầu nghiệp vụ thành thiết kế hạ tầng khả thi, chuyên phân tích TCO và quy hoạch năng lực dài hạn.


