Answer-first: Sổ Tay SLM Playbook cung cấp hướng dẫn thực chiến giúp doanh nghiệp làm chủ mô hình ngôn ngữ nhỏ (SLMs): kiến trúc Hybrid AI, kỹ nghệ dữ liệu SFT, fine-tuning QLoRA với Axolotl/Unsloth, chắt lọc tri thức DeepSeek-R1, căn chỉnh hành vi (DPO/GRPO) và tối ưu phục vụ mô hình trên vLLM.

Chào mừng bạn đến với Phase 2.5 của lộ trình làm chủ kiến trúc AI-Native.

Khi các mô hình ngôn ngữ nhỏ (Small Language Models - SLMs) như Llama 3.1 8B, Phi-4 14B hay Qwen 2.5 Coder 7B đạt tới ngưỡng năng lực tiệm cận các mô hình thương mại lớn (Frontier LLMs) trong các tác vụ chuyên biệt, việc tự huấn luyện và vận hành SLMs trở thành yếu tố cốt lõi để doanh nghiệp tối ưu hóa chi phí (TCO), bảo mật dữ liệu tuyệt đối và làm chủ hoàn toàn công nghệ.

Series này được thiết kế như một Playbook Kỹ Thuật Thực Chiến, đi thẳng từ lý thuyết lượng tử hóa, cơ chế toán học của alignment, cho đến cấu hình code mẫu cụ thể trên Axolotl/vLLM để bạn sẵn sàng áp dụng ngay lập tức vào hạ tầng Enterprise.


📚 Cấu Trúc Sổ Tay SLM Playbook (Chapter Roadmap)

Bộ tài liệu này được chia thành các phần thực hành chuyên sâu theo trình tự phát triển dự án thực tế:


❓ Câu Hỏi Thường Gặp (FAQ)

Khi nào doanh nghiệp nên tự host SLM thay vì dùng API của OpenAI/Anthropic?

Doanh nghiệp nên tự host SLM khi: (1) Khối lượng truy vấn lớn (> 5-10 triệu tokens/ngày) khiến chi phí API vượt quá chi phí thuê GPU, (2) Yêu cầu tuân thủ dữ liệu nghiêm ngặt (Data Privacy, GDPR, PCI-DSS) không được phép gửi dữ liệu ra ngoài, hoặc (3) Cần độ trễ cực thấp (Time-to-First-Token < 50ms) trong mạng nội bộ.

QLoRA khác biệt gì so với LoRA thông thường và có làm giảm chất lượng mô hình không?

LoRA đóng băng trọng số gốc ở định dạng FP16 và huấn luyện các ma trận adapter hạng thấp (low-rank). QLoRA lượng tử hóa các trọng số gốc xuống 4-bit NormalFloat (NF4) kết hợp Double Quantization, giúp giảm hơn 65% dung lượng VRAM (huấn luyện model 7B chỉ cần GPU 12-16GB VRAM) trong khi vẫn duy trì 99% hiệu năng học so với LoRA 16-bit đầy đủ.

Thuật toán GRPO (Group Relative Policy Optimization) mang lại bước đột phá gì trong căn chỉnh mô hình?

GRPO (thuật toán được sử dụng trong DeepSeek-Math và DeepSeek-R1) loại bỏ hoàn toàn sự cần thiết của Critic Model (Reward Model riêng biệt) vốn chiếm tới 50% tài nguyên GPU trong PPO truyền thống. Bằng cách lấy mẫu một nhóm (group) câu trả lời cho cùng một prompt và tính toán phần thưởng tương đối trong nhóm, GRPO cắt giảm một nửa dung lượng bộ nhớ training.

🔗 Series Liên Quan & Masterclass Đề Xuất