
Phần 5: Căn Chỉnh Hành Vi (Preference Alignment): DPO & GRPO
← Chương trước: Phần 4: Knowledge Distillation: Chắt Lọc Tri Thức DeepSeek-R1 | Mục lục Series | Chương tiếp theo: Phần 6: Enterprise Serving & Quantization Với vLLM → Answer-first: Căn chỉnh hành vi mô hình bằng DPO loại bỏ hoàn toàn bước huấn luyện Reward Model, trong khi thuật toán GRPO (sử dụng trong DeepSeek-R1) tối ưu phần thưởng nhóm tương đối giúp giảm 50% bộ nhớ training so với PPO truyền thống. ...