Phần 4: Knowledge Distillation: Chắt Lọc Tri Thức DeepSeek-R1

Phần 4: Knowledge Distillation: Chắt Lọc Tri Thức DeepSeek-R1

← Chương trước: Phần 3: Thực Chiến Fine-Tuning QLoRA: Axolotl & Unsloth | Mục lục Series | Chương tiếp theo: Phần 5: Căn Chỉnh Hành Vi (Preference Alignment): DPO & GRPO → Answer-first: Chắt lọc tri thức (Knowledge Distillation) chuyển giao năng lực suy luận sâu từ Teacher lớn (DeepSeek-R1) sang Student SLM nhỏ (Qwen-2.5-Coder 7B). Bằng cách huấn luyện trên chuỗi suy luận Chain-of-Thought và hàm mất mát kết hợp Cross-Entropy/KL Divergence, SLM đạt độ chính xác tương đương mô hình gốc. ...

20 tháng 5, 2026 · 9 phút · Lê Tuấn Anh