Phần 3: Thực Chiến Fine-Tuning QLoRA: Axolotl & Unsloth

Phần 3: Thực Chiến Fine-Tuning QLoRA: Axolotl & Unsloth

← Chương trước: Phần 2: Kỹ Nghệ Dữ Liệu Cho SFT: NEFTune & SemDeDup | Mục lục Series | Chương tiếp theo: Phần 4: Knowledge Distillation: Chắt Lọc Tri Thức DeepSeek-R1 → Answer-first: QLoRA lượng tử hóa trọng số gốc xuống định dạng 4-bit NormalFloat (NF4) kết hợp Double Quantization và Paged Optimizers. Kỹ thuật này giảm hơn 65% VRAM, cho phép fine-tune mô hình 8B-14B trên một GPU 24GB duy nhất (A10G/L4) mà vẫn bảo toàn 99% độ chính xác. ...

20 tháng 5, 2026 · 11 phút · Lê Tuấn Anh
Phần 8: Tối Ưu Hóa Inference & Triển Khai vLLM Trên Production

Phần 8: Tối Ưu Hóa Inference & Triển Khai vLLM Trên Production

← Chương trước: Phần 7: Agentic Memory - Giải Quyết Lời Nguyền ‘Cá Vàng’ | Mục lục Series | Chương tiếp theo: Phần 9: Giám Sát & Gỡ Lỗi Luồng Suy Nghĩ Của AI → Answer-first: Tối ưu hóa phục vụ mô hình LLM trong sản xuất sử dụng vLLM với cơ chế PagedAttention quản lý KV-cache hiệu quả, Chunked Prefill giảm nghẽn tài nguyên và lượng tử hóa FP8/AWQ giúp tăng thông lượng xử lý lên gấp 4 lần trên cùng phần cứng GPU. ...

17 tháng 5, 2026 · 7 phút · Lê Tuấn Anh