Lập kế hoạch huấn luyện mô hình AI
Trước khi mua GPU hay gọi nhà thầu, hãy biết: dữ liệu của bạn là bao nhiêu token, một lần huấn luyện mất mấy giờ, cần bao nhiêu ổ cho checkpoint, tốn bao nhiêu điện và dự án chạy mấy tuần. Mọi con số đi kèm phép tính để kỹ sư của bạn kiểm lại.
Fine-tune theo giọng công ty
Dạy mô hình trả lời đúng văn phong, thuật ngữ và quy tắc của công ty — từ tập hội thoại mẫu đã được người thật duyệt.
Cách làm: QLoRA hoặc LoRA trên vài nghìn đến vài chục nghìn mẫu hội thoại. Giữ nguyên trọng số gốc, chỉ học lớp adapter.
Fine-tune dạy CÁCH NÓI, không dạy được KIẾN THỨC cập nhật. Thông tin hay thay đổi (giá, tồn kho, chính sách) phải lấy qua RAG, không nhồi vào trọng số.
RAG trên tài liệu riêng
Trợ lý trả lời theo tài liệu nội bộ và trích dẫn được đoạn gốc. Không huấn luyện mô hình sinh, chỉ xây kho vector từ tài liệu.
Cách làm: Chạy mô hình nhúng (embedding) xuôi một lượt qua toàn bộ tài liệu, lưu vector vào kho; mô hình sinh dùng bản có sẵn.
Đây là lựa chọn nên thử TRƯỚC khi fine-tune: rẻ hơn, sửa dữ liệu là đổi được câu trả lời ngay, và luôn có trích dẫn để người dùng kiểm.
Huấn luyện tiếp trên miền dữ liệu riêng
Mô hình chưa quen ngôn ngữ, thuật ngữ của ngành (hồ sơ kỹ thuật, văn bản chuyên ngành) — học tiếp trên kho văn bản thô của công ty.
Cách làm: Continued pre-training: thường 1 epoch trên kho văn bản lớn, LoRA cho nhẹ hoặc toàn phần khi có nhiều GPU.
Tốn nhất trong ba hướng và dễ làm mô hình quên năng lực cũ (catastrophic forgetting). Chỉ làm khi đã thử RAG và LoRA mà vẫn chưa đạt.
8,2B tham số · giấy phép Apache 2.0
Độ chính xác dùng để tính: INT4 (4-bit).
Quy đổi ra 3 triệu token theo công thức hiện ở bảng bên.
Giả định nâng cao (sửa được)
Kết quả ước lượng
Cần cân nhắc trước khi chạy
- Fine-tune dạy cách nói và cách định dạng, không dạy được kiến thức hay thay đổi. Trước khi huấn luyện, hãy thử RAG — rẻ hơn và sửa được ngay.
Phần cứng đủ cho 23,9 GB VRAM
- 1 × L40S 48GB48 GB · dư 50%
Một card là đủ — đơn giản nhất để triển khai.
- 1 × RTX 6000 Ada 48GB48 GB · dư 50%
Một card là đủ — đơn giản nhất để triển khai.
- 1 × A100 80GB PCIe80 GB · dư 70%
Một card là đủ — đơn giản nhất để triển khai.
Lịch trình 16 tuần
Tính từ lượng dữ liệu, số người làm dữ liệu và số giờ máy khả dụng mỗi tuần. Sửa ba thông số đó là lịch đổi theo.
- Tuần 1
Chốt mục tiêu và bộ câu hỏi kiểm tra
- Viết ra 1 câu mô tả việc mô hình phải làm được, kèm tiêu chí đạt/không đạt.
- Lập bộ 50–200 câu hỏi thật kèm đáp án mong muốn do người trong công ty duyệt (bộ đánh giá).
- Đo thử mô hình gốc chưa huấn luyện trên bộ này để có mốc so sánh.
Kết quả phải có: Bộ đánh giá đã chốt + điểm của mô hình gốc
- Tuần 2–11
Thu thập và làm sạch dữ liệu
- Xuất hội thoại/biểu mẫu, bỏ trùng, chuẩn hoá về mẫu JSONL theo chat template của mô hình.
- Ẩn danh thông tin cá nhân trước khi đưa vào tập huấn luyện.
- Tách train/validation theo thời gian hoặc theo nguồn, không trộn ngẫu nhiên nếu dữ liệu lặp nội dung.
- Năng suất giả định: 500 mẫu/người/tuần × 1 người.
Kết quả phải có: Tập dữ liệu đã làm sạch + ảnh chụp tình trạng dữ liệu
- Tuần 12
Chạy thử nhỏ để bắt lỗi quy trình
- Huấn luyện trên 1–2% dữ liệu để bắt lỗi định dạng, lỗi hết VRAM, lỗi nạp dữ liệu.
- Kiểm tra lưu và nạp lại checkpoint thành công trước khi chạy thật.
Kết quả phải có: Một lần chạy hoàn tất không lỗi + log
- Tuần 13
Huấn luyện và dò tham số (12 lần thử)
- Mỗi lần chạy ~17 phút trên 1 × NVIDIA L40S 48GB.
- Mỗi lần chỉ đổi một nhóm tham số (learning rate, rank, số epoch) và ghi lại kết quả.
- Dừng sớm khi điểm validation xấu đi — không chạy hết epoch cho vui.
Kết quả phải có: Bảng so sánh các lần chạy + bản tốt nhất
- Tuần 14
Đánh giá và soát an toàn
- Chấm trên bộ đánh giá đã chốt từ tuần 1; so với mô hình gốc.
- Người thật đọc mù 50 câu trả lời của bản mới và bản gốc để chọn.
- Thử các câu hỏi hiểm: dữ liệu nhạy cảm, câu ngoài phạm vi, prompt injection.
Kết quả phải có: Báo cáo đánh giá + quyết định có đưa vào dùng
- Tuần 15–16
Chạy thử trong một nhóm nhỏ
- Mở cho một phòng ban dùng thật, có nút báo lỗi câu trả lời.
- Theo dõi độ trễ, tỷ lệ phải chuyển cho người thật, các câu trả lời bị báo sai.
- Gom câu trả lời sai thành dữ liệu cho vòng sau.
Kết quả phải có: Bản chạy thử + danh sách lỗi để làm vòng tiếp theo
Vì sao ra những con số trên
Mỗi dòng là phép tính đã thay số thật — bạn hoặc kỹ sư của bạn tính lại bằng máy tính tay được.
| Phần | Phép tính | Kết quả |
|---|---|---|
| Token dữ liệu | 5.000 mẫu × 600 token/mẫu = 3 triệu token | 3 triệu token |
| Tổng token xử lý | 3 triệu token × 3 epoch | 9 triệu token |
| Thời gian 1 epoch | 4 × 8,19 tỷ tham số × 3 triệu token ÷ (733 TFLOPS × 1 GPU × MFU 0,4) | ~6 phút |
| Thời gian cả lần chạy | ~6 phút × 3 epoch | ~17 phút |
| Giờ máy mỗi tuần | 8 giờ/ngày × 5 ngày/tuần | 40 giờ/tuần |
| Dung lượng 1 checkpoint | 0,082 tỷ tham số được học × 14 byte/tham số | 1,1 GB |
| Ổ cần cho checkpoint | 1,1 GB × 3 bản giữ lại | 3,5 GB |
| Điện năng 1 lần chạy | 455 W × 0,3 giờ × PUE 1,6 ÷ 1.000 | 0,2 kWh |
| Công suất cả máy | 350 W/GPU × 1 GPU × 1,3 (CPU, RAM, quạt, tổn hao nguồn) | 455 W |
| Số lần thử chạy được trong 1 tuần | 40 giờ/tuần ÷ 0,3 giờ/lần | 143,2 lần/tuần |
| Số lần thử nên tính | Khuyến nghị của HQG: lấy số lần chạy được trong 2 tuần (143,2 × 2), tối thiểu 3 lần (1 chạy thử + 2 lần dò tham số), tối đa 12 lần | 12 lần |
| Số tuần cho phần máy chạy | 0,3 giờ/lần × 12 lần ÷ 40 giờ/tuần (làm tròn lên) | 1 tuần |
Giả định đã dùng — đọc trước khi đưa cho lãnh đạo
- Tất cả con số trên là ƯỚC LƯỢNG từ công thức số học hiển thị ngay bên cạnh, không phải kết quả đo trên máy thật. Thời gian thực tế phụ thuộc framework, tốc độ nạp dữ liệu, mạng giữa các GPU và thời gian dừng để đánh giá.
- FLOPs/GPU lấy theo bảng thông số GPU của HQG (733 TFLOPS cho NVIDIA L40S 48GB). MFU 40% là GIẢ ĐỊNH — hãy đo MFU thật của bạn rồi nhập lại.
- Quy đổi ký tự → token (3 ký tự/token) là GIẢ ĐỊNH cho tiếng Việt có dấu. Cách đo đúng: nạp tokenizer của chính mô hình bạn dùng và đếm trên dữ liệu thật của bạn.
- Giá điện 3.250 đ/kWh và PUE 1,6 là số tham chiếu trong cấu hình site, không phải hoá đơn của bạn.
- Lịch trình theo tuần dựa trên năng suất làm dữ liệu giả định và 40 giờ máy/tuần; sửa hai thông số này là lịch đổi theo.
Cách đo số token thật và chuẩn bị dữ liệu: xem Chuẩn bị dữ liệu huấn luyện và hướng dẫn fine-tune LoRA/QLoRA.

CÔNG TY CỔ PHẦN GIẢI PHÁP CÔNG NGHỆ HQG
Hotline 1900 636 106 · info@hqg.vn · hqg.asia
Kế hoạch huấn luyện AI
Fine-tune theo giọng công ty
Ngày lập: —
Phạm vi
| Mục tiêu | Fine-tune theo giọng công ty — QLoRA hoặc LoRA trên vài nghìn đến vài chục nghìn mẫu hội thoại. Giữ nguyên trọng số gốc, chỉ học lớp adapter. |
|---|---|
| Mô hình | Qwen3 8B (8,2B tham số, giấy phép Apache 2.0) |
| Cách huấn luyện | Fine-tune QLoRA · INT4 (4-bit) |
| Dữ liệu | 5.000 số mẫu hội thoại ≈ 3 triệu token × 3 epoch = 9 triệu token |
| Phần cứng dự kiến | 1 × NVIDIA L40S 48GB (48 GB VRAM, 455 W cả máy) |
Kết quả ước lượng
| VRAM cần | 23,9 GB — vừa phần cứng nêu trên |
|---|---|
| Thời gian 1 epoch | ~6 phút |
| Thời gian 1 lần chạy | ~17 phút |
| Số lần thử nên tính | 12 lần (chạy được 143,2 lần/tuần) |
| Ổ cho checkpoint | 1,1 GB/bản · giữ 3 bản = 3,5 GB |
| Điện năng | 0,2 kWh/lần chạy · cả quá trình 2 kWh ≈ 7.931 ₫ |
| Tổng thời gian dự án | 16 tuần |
Lịch trình theo tuần
| Tuần 1 | Chốt mục tiêu và bộ câu hỏi kiểm tra. Viết ra 1 câu mô tả việc mô hình phải làm được, kèm tiêu chí đạt/không đạt. Lập bộ 50–200 câu hỏi thật kèm đáp án mong muốn do người trong công ty duyệt (bộ đánh giá). Đo thử mô hình gốc chưa huấn luyện trên bộ này để có mốc so sánh. Kết quả phải có: Bộ đánh giá đã chốt + điểm của mô hình gốc. |
|---|---|
| Tuần 2–11 | Thu thập và làm sạch dữ liệu. Xuất hội thoại/biểu mẫu, bỏ trùng, chuẩn hoá về mẫu JSONL theo chat template của mô hình. Ẩn danh thông tin cá nhân trước khi đưa vào tập huấn luyện. Tách train/validation theo thời gian hoặc theo nguồn, không trộn ngẫu nhiên nếu dữ liệu lặp nội dung. Năng suất giả định: 500 mẫu/người/tuần × 1 người. Kết quả phải có: Tập dữ liệu đã làm sạch + ảnh chụp tình trạng dữ liệu. |
| Tuần 12 | Chạy thử nhỏ để bắt lỗi quy trình. Huấn luyện trên 1–2% dữ liệu để bắt lỗi định dạng, lỗi hết VRAM, lỗi nạp dữ liệu. Kiểm tra lưu và nạp lại checkpoint thành công trước khi chạy thật. Kết quả phải có: Một lần chạy hoàn tất không lỗi + log. |
| Tuần 13 | Huấn luyện và dò tham số (12 lần thử). Mỗi lần chạy ~17 phút trên 1 × NVIDIA L40S 48GB. Mỗi lần chỉ đổi một nhóm tham số (learning rate, rank, số epoch) và ghi lại kết quả. Dừng sớm khi điểm validation xấu đi — không chạy hết epoch cho vui. Kết quả phải có: Bảng so sánh các lần chạy + bản tốt nhất. |
| Tuần 14 | Đánh giá và soát an toàn. Chấm trên bộ đánh giá đã chốt từ tuần 1; so với mô hình gốc. Người thật đọc mù 50 câu trả lời của bản mới và bản gốc để chọn. Thử các câu hỏi hiểm: dữ liệu nhạy cảm, câu ngoài phạm vi, prompt injection. Kết quả phải có: Báo cáo đánh giá + quyết định có đưa vào dùng. |
| Tuần 15–16 | Chạy thử trong một nhóm nhỏ. Mở cho một phòng ban dùng thật, có nút báo lỗi câu trả lời. Theo dõi độ trễ, tỷ lệ phải chuyển cho người thật, các câu trả lời bị báo sai. Gom câu trả lời sai thành dữ liệu cho vòng sau. Kết quả phải có: Bản chạy thử + danh sách lỗi để làm vòng tiếp theo. |
Công thức và giả định
| Token dữ liệu | 5.000 mẫu × 600 token/mẫu = 3 triệu token = 3 triệu token |
|---|---|
| Tổng token xử lý | 3 triệu token × 3 epoch = 9 triệu token |
| Thời gian 1 epoch | 4 × 8,19 tỷ tham số × 3 triệu token ÷ (733 TFLOPS × 1 GPU × MFU 0,4) = ~6 phút |
| Thời gian cả lần chạy | ~6 phút × 3 epoch = ~17 phút |
| Giờ máy mỗi tuần | 8 giờ/ngày × 5 ngày/tuần = 40 giờ/tuần |
| Dung lượng 1 checkpoint | 0,082 tỷ tham số được học × 14 byte/tham số = 1,1 GB |
| Ổ cần cho checkpoint | 1,1 GB × 3 bản giữ lại = 3,5 GB |
| Điện năng 1 lần chạy | 455 W × 0,3 giờ × PUE 1,6 ÷ 1.000 = 0,2 kWh |
| Công suất cả máy | 350 W/GPU × 1 GPU × 1,3 (CPU, RAM, quạt, tổn hao nguồn) = 455 W |
| Số lần thử chạy được trong 1 tuần | 40 giờ/tuần ÷ 0,3 giờ/lần = 143,2 lần/tuần |
| Số lần thử nên tính | Khuyến nghị của HQG: lấy số lần chạy được trong 2 tuần (143,2 × 2), tối thiểu 3 lần (1 chạy thử + 2 lần dò tham số), tối đa 12 lần = 12 lần |
| Số tuần cho phần máy chạy | 0,3 giờ/lần × 12 lần ÷ 40 giờ/tuần (làm tròn lên) = 1 tuần |
Cảnh báo
- Fine-tune dạy cách nói và cách định dạng, không dạy được kiến thức hay thay đổi. Trước khi huấn luyện, hãy thử RAG — rẻ hơn và sửa được ngay.
Công cụ tính như thế nào?
Thời gian huấn luyện ước lượng theo bậc độ lớn: k × số tham số × số token ÷ (FLOPs mỗi GPU × số GPU × MFU), với k = 6 cho huấn luyện đầy đủ, 4 cho LoRA/QLoRA và 2 khi chỉ chạy xuôi để nhúng tài liệu. MFU (mức khai thác thực của GPU) là giả định bạn sửa được, mặc định 40%.
VRAM dùng chung công thức với công cụ tính cấu hình: trọng số, KV cache, activations, gradient và trạng thái optimizer, cộng phần dự phòng.
Điện năng = công suất (W) × giờ × PUE ÷ 1.000. Công suất lấy TDP của GPU × số card × 1,3 cho CPU, RAM, quạt và tổn hao nguồn. Giá điện và PUE là số tham chiếu trong cấu hình web, không phải hoá đơn của bạn.
Lịch trình theo tuần tính từ lượng dữ liệu, số người làm dữ liệu và số giờ máy khả dụng mỗi tuần — ba thông số bạn tự nhập.
Những gì công cụ này KHÔNG làm
Không hứa chất lượng mô hình. Không có con số nào ở đây nói bản fine-tune của bạn sẽ trả lời tốt hơn bao nhiêu phần trăm. Điều đó chỉ đo được bằng bộ câu hỏi thật do người trong công ty duyệt.
Không phải báo giá. Trang này không tính tiền thiết bị. Tiền điện là ước lượng theo giá tham chiếu.
Không thay đo thực tế. Thời gian thật phụ thuộc framework, tốc độ nạp dữ liệu, mạng giữa các GPU. Hãy chạy thử trên 1–2% dữ liệu rồi nhân lên — con số đó đáng tin hơn mọi công thức.
Bước tiếp theo: chuẩn bị dữ liệu và so sánh mô hình trước khi chốt phần cứng.