<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>RLHF on Engineering Playbook</title><link>https://learn.tanhdev.com/tags/rlhf/</link><description>Recent content in RLHF on Engineering Playbook</description><image><title>Engineering Playbook</title><url>https://learn.tanhdev.com/vesviet.png</url><link>https://learn.tanhdev.com/vesviet.png</link></image><generator>Hugo</generator><language>vi</language><lastBuildDate>Sun, 16 Aug 2026 12:00:00 +0700</lastBuildDate><atom:link href="https://learn.tanhdev.com/tags/rlhf/index.xml" rel="self" type="application/rss+xml"/><item><title>Phần 5: Căn Chỉnh Hành Vi (Preference Alignment): DPO &amp; GRPO</title><link>https://learn.tanhdev.com/series/slm-playbook/part-5-preference-alignment/</link><pubDate>Wed, 20 May 2026 21:05:00 +0700</pubDate><guid>https://learn.tanhdev.com/series/slm-playbook/part-5-preference-alignment/</guid><description>So sánh Direct Preference Optimization (DPO) với Group Relative Policy Optimization (GRPO) loại bỏ hoàn toàn Critic Model.</description></item></channel></rss>