Mục lục bài
Cần theo dõi những gì
Các bước thực hiện
Tiến độ chỉ lưu trên trình duyệt này.
Bước 1: Kiểm tra nhanh bằng nvidia-smi
Bash Bước 2: Theo dõi lỗi Xid trong nhật ký kernel
Bash Xid là mã lỗi driver NVIDIA ghi vào nhật ký kernel. Mỗi mã có ý nghĩa và hướng xử lý khác nhau (lỗi ứng dụng, lỗi bộ nhớ, GPU rớt khỏi bus…) — tra trong tài liệu Xid của NVIDIA trước khi kết luận phần cứng hỏng.
Bước 3: Chạy dcgm-exporter
Bash Bộ chỉ số mặc định được khai trong file CSV của dcgm-exporter. Muốn thêm trường (ví dụ lỗi ECC chi tiết), tạo file CSV riêng và gắn vào container theo README của dự án.
Bash Bước 4: Cấu hình Prometheus và luật cảnh báo
prometheus.yml gpu-alerts.yml Bash Lưu ý: Chỉ số vLLM chỉ truy cập được nếu cổng 8000 nghe trên IP mà Prometheus tới được. Nếu vLLM bind 127.0.0.1, chạy Prometheus agent tại chỗ hoặc mở
/metricsqua reverse proxy giới hạn IP.Bước 5: Dựng dashboard Grafana
Bash - Thêm Prometheus làm data source.
- Nhập dashboard DCGM Exporter do NVIDIA/cộng đồng công bố trên thư viện dashboard của Grafana, rồi chỉnh theo nhãn máy của bạn.
- Tối thiểu có các panel: nhiệt độ, công suất, utilization, bộ nhớ, Xid theo từng GPU; dung lượng ổ; độ trễ vLLM.
- Nối Alertmanager/Grafana Alerting tới kênh nhóm vận hành thật sự đọc (email, Telegram, Zalo OA qua webhook…).
Bước 6: Theo dõi thí nghiệm: MLflow hoặc Weights & Biases
MLflow tự host Trong
SFTConfig/TrainingArguments, đặtreport_to="mlflow"để ghi loss, tham số và thời gian chạy.Cảnh báo: Weights & Biases bản cloud gửi số liệu, cấu hình (và artifact nếu bật) lên máy chủ của nhà cung cấp. Dự án có dữ liệu nhạy cảm: dùng MLflow tự host, W&B bản tự host, hoặc
WANDB_MODE=offline— và kiểm tra không log mẫu dữ liệu.Bước 7: Sao lưu checkpoint và mô hình
Bash - Áp dụng nguyên tắc 3-2-1: ba bản, hai loại phương tiện, một bản ngoài site.
- Sao lưu cả dữ liệu huấn luyện đã làm sạch, script, file khoá phiên bản — không chỉ trọng số.
- Thử khôi phục định kỳ; bản sao lưu chưa từng khôi phục thử thì chưa chắc dùng được.
Bước 8: Lập lịch bảo trì
Muốn giao phần vận hành cho đội chuyên trách, xem dịch vụ hạ tầng AI của HQG.
Kiểm tra thành công
- Prometheus trang Targets: các job
dcgm,node(vàvllmnếu có) ở trạng thái UP. - Grafana hiển thị số liệu từng GPU; tắt thử container dcgm-exporter → cảnh báo mất số liệu được gửi tới kênh vận hành.
- Một lần huấn luyện có đầy đủ tham số và đường loss trong MLflow.
- Khôi phục thử một checkpoint từ bản sao lưu và nạp được bằng script đánh giá.
Lỗi thường gặp & cách sửa
dcgm-exporter khởi động rồi thoát ngay
Nguyên nhân thường gặp: Thiếu quyền, container không thấy GPU, hoặc tag không tương thích driver.
Xid xuất hiện lặp lại trên cùng một GPU
Nguyên nhân thường gặp: Tuỳ mã Xid: lỗi phần mềm/ứng dụng, lỗi bộ nhớ, quá nhiệt, lỗi nguồn hoặc kết nối PCIe.
Tra mã trong tài liệu Xid, đối chiếu nhiệt độ và công suất lúc lỗi, chạy dcgmi diag -r 3 ngoài giờ, xem nhật ký BMC. Nếu tài liệu hướng về phần cứng, liên hệ bảo hành với log đầy đủ.
Ổ đĩa đầy, job huấn luyện chết giữa chừng
Nguyên nhân thường gặp: Checkpoint, cache mô hình, log tích luỹ không có chính sách dọn.
Bước tiếp theo
Nguồn chính chủ
Lệnh, tên gói và tham số thay đổi theo phiên bản. Trước khi chạy trên máy thật, hãy kiểm tra phiên bản mới nhất tại trang chính chủ:
- NVIDIA DCGM Exporter — GitHub
- NVIDIA Xid Errors
- nvidia-smi — tài liệu
- Prometheus — Documentation
- Grafana — Documentation
- MLflow — Documentation
- Weights & Biases — Documentation
- restic — Documentation
Giới hạn của bài
- Ngưỡng cảnh báo trong bài là ví dụ để cú pháp chạy được, không phải ngưỡng khuyến nghị cho GPU cụ thể.
- Bài không đề cập giám sát trong Kubernetes (GPU Operator) và lập lịch job (Slurm).
Kỹ sư HQG khảo sát, lên cấu hình, lắp đặt và bàn giao hạ tầng AI chạy được thật.