Executive Summary — Sổ Tay Tối Ưu Hóa SLM

← Series hub Next → Trong hai năm qua, làn sóng áp dụng AI trong doanh nghiệp gần như bị chi phối bởi một kiến trúc duy nhất: Tích hợp API với các mô hình đóng khổng lồ (Frontier LLMs). Mặc dù mô hình API-Centric này giúp việc thử nghiệm ý tưởng (PoC) diễn ra nhanh chóng, nó lại nhanh chóng trở thành một gánh nặng khi mở rộng hệ thống ở quy mô Production và phải xử lý dữ liệu nhạy cảm. ...

20 tháng 5, 2026 · 4 phút · Tuan Anh

Beyond Chatbots: Generative UI là gì?

Trong hai năm qua, ngành công nghiệp phần mềm bị cuốn vào cơn lốc của mô hình “Chat-in-a-box”. Hàng loạt các công ty nhúng một cửa sổ chat (thường nằm ở góc phải màn hình) vào mọi ứng dụng—từ hệ thống lõi ngân hàng, ERP, cho đến phần mềm quản lý nhân sự—với hy vọng AI sẽ tự động hóa mọi thao tác của người dùng. Nhưng thực tế lại chứng minh điều ngược lại. ...

16 tháng 5, 2026 · 5 phút · Tuan Anh

Executive Summary — Chuyển dịch sang kiến trúc Agentic

Mặc dù việc sử dụng AI để viết mã nguồn hoặc trả lời ticket hỗ trợ khách hàng đang trở nên phổ biến, sự chuyển đổi thực sự trong phần mềm doanh nghiệp lại nằm ở các Hệ thống Agentic (Agentic Systems). Chúng ta đang bước ra khỏi kiến trúc monolithic chỉ sử dụng một prompt duy nhất, tiến tới mạng lưới phân tán gồm nhiều AI Agent có khả năng lên kế hoạch, điều phối và thực thi các quy trình làm việc phức tạp một cách tự chủ. ...

14 tháng 5, 2026 · 4 phút · Tuan Anh

Xây Dựng AI-Native Engineering Organization

Nếu như Series đầu tiên đã giúp bạn thay đổi tư duy từ “Thợ gõ code” sang “Kiến trúc sư”, thì cuốn sổ tay này (Playbook) sẽ trả lời câu hỏi cốt lõi tiếp theo ở tầm vóc doanh nghiệp: “Làm thế nào để scale năng suất 10x của một cá nhân thành năng suất của toàn bộ tổ chức?” Sự thật phũ phàng là: Việc mua license Cursor hay Copilot cho toàn bộ team không biến công ty của bạn thành một “AI-Native Company”. Nó chỉ biến team của bạn thành một nhóm người dùng chung một công cụ đắt đỏ. ...

13 tháng 5, 2026 · 4 phút · Tuan Anh

Tóm tắt — Lập trình viên Kỷ nguyên AI: Ai ở lại, Ai rời đi?

Ngành công nghiệp phần mềm đang chứng kiến một cuộc chuyển giao quyền lực lịch sử. Quyền lực đang dần rời khỏi tay những người “chỉ biết gõ code” để chuyển sang những người “biết cách giải quyết vấn đề bằng hệ thống và AI”. Bối Cảnh: Khi “Viết Code” Không Còn Là Kỹ Năng Độc Tôn Trong hơn hai thập kỷ qua, giá trị của một lập trình viên phần lớn được đo lường bằng việc họ am hiểu cú pháp (syntax) ngôn ngữ nào, thành thạo framework nào (React, Angular, Spring Boot, v.v.), và khả năng ghi nhớ các API. ...

10 tháng 5, 2026 · 4 phút · Tuan Anh

Phần 0: Tại sao có thể tránh bẫy Magento $200K/Năm

Bất kỳ đội ngũ kỹ thuật nào xây dựng hệ thống nghiêm túc trên Magento cuối cùng cũng sẽ đụng phải ba bức tường giống nhau: bức tường bản quyền, bức tường khả năng chịu tải (scaling), và bức tường tốc độ phát triển (developer velocity). Câu hỏi chỉ là bạn sẽ đụng phải chúng trước hay sau khi chúng bào mòn tiền bạc và khách hàng thực sự của bạn. ...

1 tháng 4, 2026 · 10 phút · Lê Tuấn Anh

Kiến Trúc Hybrid AI & Tự Host vLLM | SLM Playbook

Trong giai đoạn đầu của làn sóng AI (2023-2024), kiến trúc mặc định của hầu hết các startup và doanh nghiệp là API-Centric: Gửi mọi request đến OpenAI GPT-4 hoặc Anthropic Claude. Mô hình này rất tiện lợi cho giai đoạn thử nghiệm (PoC) nhưng lại nhanh chóng đổ vỡ khi hệ thống quy mô lớn (Production) phải đối mặt với hai bức tường: Bảo mật dữ liệu và Chi phí vận hành khổng lồ. ...

21 tháng 5, 2026 · 13 phút · Tuan Anh

Generative UI State Management: Astro vs Next.js RSC

Trong phần trước, chúng ta đã thống nhất việc loại bỏ Chatbot để tiến tới Generative UI. Nhưng để AI có thể “đẻ” ra được các UI Component ngay trên màn hình người dùng, Frontend và Backend không thể chỉ giao tiếp qua các API stateless thông thường. Chúng cần chia sẻ một trạng thái (State) chung. Vấn đề là: Bộ não của AI và Trình duyệt của người dùng nói hai ngôn ngữ hoàn toàn khác nhau. ...

16 tháng 5, 2026 · 5 phút · Tuan Anh

Phần 1 — Agent Topology & Orchestration

Prerequisite: Để hiểu rõ bối cảnh và lý do tại sao chúng ta cần các hệ thống Multi-Agent thay vì Microservices truyền thống, vui lòng tham khảo Kiến Trúc Hệ Thống AI-Native Toàn Diện. Khi mới tiếp cận với GenAI, đa phần lập trình viên đều bắt đầu bằng việc nhồi nhét một khối lượng prompt khổng lồ cho một LLM duy nhất, hy vọng nó sẽ hoàn thành toàn bộ tác vụ. Tuy nhiên, khi hệ thống scale, cách tiếp cận “Single Monolithic Agent” này bộc lộ những điểm yếu chí mạng về hiệu năng, chi phí và khả năng kiểm soát rủi ro. ...

15 tháng 5, 2026 · 6 phút · Tuan Anh

Kỹ Nghệ Ngữ Cảnh Theo Chuẩn Domain-Driven Design

Một trong những sai lầm thảm họa nhất của các kỹ sư khi mới chuyển sang dùng AI (như Cursor hay Copilot) là tư duy: “Cứ ném toàn bộ source code vào, AI tự khắc hiểu”. Trong các dự án đồ án sinh viên (Monolith nhỏ), điều này có thể đúng. Nhưng ở môi trường Enterprise, nơi hệ thống được chia thành hàng chục Microservices với hàng triệu dòng code, việc “nhồi nhét” bừa bãi ngữ cảnh (Context) sẽ dẫn đến 3 hậu quả chết người: ...

13 tháng 5, 2026 · 8 phút · Tuan Anh

Phần 1 — Sự sụp đổ của "Thợ Gõ Code"

Trong nhiều năm, hình ảnh một lập trình viên tài năng thường gắn liền với tốc độ gõ phím thoăn thoắt, khả năng ghi nhớ hàng tá thư viện API, và việc viết ra những đoạn mã không một lỗi cú pháp. Chúng ta gọi họ là những “Coder” thuần túy. Nhưng khi AI bước vào sân chơi, một sự thật phũ phàng đã hiện ra: Viết code chỉ là phần dễ nhất trong việc xây dựng phần mềm. ...

10 tháng 5, 2026 · 7 phút · Tuan Anh

Phần 1: Phân rã Magento thành 21 Go Microservices bằng DDD

Bất kỳ team Magento nào khi quyết định chuyển dịch sang microservices cũng đều phải đối mặt với cùng một câu hỏi đầu tiên: cần bao nhiêu service? Ngành công nghiệp thường bảo là 4–6. “Service danh mục (Catalog), service đơn hàng (Order), service khách hàng (Customer), service tồn kho (Inventory), service thanh toán (Payment), và có thể thêm CMS nữa.” Mọi bài blog, mọi bài diễn thuyết ở hội thảo đều tựu trung ở danh sách này. Đó là một điểm khởi đầu hợp lý — nhưng nó hoàn toàn sai lầm khi áp dụng cho e-commerce nghiêm túc ở quy mô lớn. ...

8 tháng 4, 2026 · 16 phút · Lê Tuấn Anh

Data Engineering SFT: NEFTune & SemDeDup | SLM Playbook

Trong kỷ nguyên của LLMs/SLMs, câu slogan kinh điển của ngành dữ liệu: “Garbage In, Garbage Out” chưa bao giờ đúng hơn thế. Khi thực hiện huấn luyện tinh chỉnh có giám sát (Supervised Fine-Tuning - SFT) cho các mô hình ngôn ngữ nhỏ (SLMs), chất lượng và cấu trúc dữ liệu đóng vai trò quyết định 90% hiệu năng thực chiến của mô hình sau khi train. Việc nhồi nhét hàng triệu dòng dữ liệu hội thoại thu thập thô (raw web scrape hoặc synthetic data cấp thấp) chỉ khiến mô hình bị ngộ độc, quá khớp (overfitting) với các câu trả lời rập khuôn và tiêu tốn hàng nghìn giờ GPU vô ích. ...

22 tháng 5, 2026 · 10 phút · Tuan Anh

Phần 2 — State, Memory & Context Management

Prerequisite: Để nắm vững các khái niệm nền tảng về Memory Architecture trong hệ thống AI, vui lòng xem lại Kiến Trúc Hệ Thống AI-Native Toàn Diện. Sau khi đã giải quyết bài toán giao tiếp giữa các Agent ở Phần 1, chúng ta phải đối mặt với “kẻ thù” lớn nhất của LLM: Giới hạn Context Window. Một Orchestrator giỏi đến mấy cũng vô dụng nếu các Worker Agent quên mất yêu cầu ban đầu của User chỉ sau vài lượt (turns) chạy tool. ...

17 tháng 5, 2026 · 5 phút · Tuan Anh

Component Registry & MCP to Frontend

Trong phần trước, chúng ta đã hiểu rằng Frontend Framework-Agnostic (như Astro) không nhận mã HTML từ AI, mà nhận dữ liệu JSON. Nhưng làm sao để Frontend biết cần phải render khối JSON đó thành một thẻ <Card>, một cái <Chart>, hay một <Form>? Câu trả lời nằm ở Component Registry — bộ não phân giải giao diện của kiến trúc Generative UI. 3.1. Sự hội tụ của MCP (Model Context Protocol) và Frontend Để hiểu Component Registry, ta cần đi ngược dòng lên Backend. Ở Backend, các hệ thống Agentic hiện đại đang chuẩn hóa việc giao tiếp với các hệ thống ngoại vi (như Database, API) thông qua chuẩn MCP (Model Context Protocol) (Xem thêm chi tiết tại Series: MCP Engineering In Production). ...

16 tháng 5, 2026 · 4 phút · Tuan Anh

Xây Dựng Hệ Sinh Thái Private AI Và Tự Do Kiến Trúc

Ở Bài 1, chúng ta đã giải quyết được bài toán chất lượng code bằng Context Engineering. Nhưng khi bắt đầu triển khai AI cho toàn bộ tổ chức (Scale-up), các Giám đốc Công nghệ (CTO) sẽ ngay lập tức đâm sầm vào một bức tường khác: Chi phí và Bảo mật. 1. Cạm Bẫy “Pay-per-seat” và “Mù Lòa” Dữ Liệu Hãy lấy một sự liên tưởng thực tế: Việc mua license GitHub Copilot hay ChatGPT Enterprise cho 100 kỹ sư cũng giống như việc bạn mua các phần mềm SaaS dạng “Pay-per-seat” (trả tiền theo user). Khi đội ngũ phình to, chi phí sẽ nhân lên theo cấp số nhân. Tệ hơn nữa, nếu OpenAI ngày mai quyết định tăng giá gấp đôi, bạn hoàn toàn không có đường lui (Vendor Lock-in). ...

14 tháng 5, 2026 · 6 phút · Tuan Anh

Phần 2 — Phân định ranh giới: Việc của Người và Việc của Máy

Khi nhận ra tốc độ gõ code đã bị AI đánh bại (như thảo luận ở Phần 1), một nỗi sợ vô hình bao trùm lên giới lập trình: “Vậy tôi sẽ làm gì nếu AI làm hết?” Câu trả lời nằm ở việc phân định rõ ranh giới: AI không làm “hết”. AI chỉ làm những việc cơ bắp kỹ thuật, còn con người giữ lại phần đầu não và trách nhiệm. Để tối ưu hóa quá trình phát triển phần mềm mà không đánh mất quyền kiểm soát, chúng ta cần kẻ một đường chỉ đỏ giữa “Lãnh địa của Máy” và “Lãnh địa của Người”. ...

10 tháng 5, 2026 · 8 phút · Tuan Anh

Phần 2: Rush Monorepo - Quản trị 21 Go & 2 Next.js Apps

Khi bạn sở hữu 21 Go microservices và 2 ứng dụng frontend, câu hỏi hạ tầng đầu tiên không phải là Kubernetes hay CI/CD — mà là làm thế nào để bạn quản lý chính bản thân phần source code? Hai lựa chọn sau sẽ thất bại ngay lập tức: polyrepo (hơn 21 repo Git rời rạc, bất khả thi để duy trì phiên bản đồng nhất) và một monorepo ngây ngô (vứt tất tần tật mọi thứ vào chung một thư mục, dependency ma ám ngập tràn). Bạn cần một công cụ quản lý monorepo thực thụ. ...

15 tháng 4, 2026 · 12 phút · Lê Tuấn Anh

Thực Chiến QLoRA Fine-tuning: Axolotl & Unsloth

Huấn luyện tinh chỉnh toàn phần (Full Parameter Fine-Tuning) một mô hình ngôn ngữ lớn là một đặc quyền xa xỉ. Đối với một mô hình nhỏ như Llama 3 8B, việc cập nhật toàn bộ tham số ở định dạng 16-bit vẫn đòi hỏi cụm phần cứng khổng lồ vượt xa khả năng của các nhà phát triển hoặc startup vừa và nhỏ. Để giải quyết bài toán tài nguyên, các kỹ thuật PEFT (Parameter-Efficient Fine-Tuning) ra đời, nổi bật nhất là LoRA và QLoRA. Chúng cho phép huấn luyện các mô hình hàng tỷ tham số trên duy nhất một chiếc GPU phổ thông (như RTX 3090, 4090 hoặc A10G) mà không làm suy giảm chất lượng đầu ra. ...

23 tháng 5, 2026 · 9 phút · Tuan Anh

Phần 3 — Secure Tool Calling & Guardrails

Prerequisite: Bảo mật AI đòi hỏi tư duy khác biệt so với bảo mật Web truyền thống. Vui lòng tham khảo Kiến Trúc Hệ Thống AI-Native Toàn Diện để nắm được bối cảnh hệ thống trước khi đi sâu vào Tool Calling. Ở Phần 2, Agent của chúng ta đã có một bộ nhớ hoàn hảo. Nhưng trí nhớ tốt thôi là chưa đủ; sức mạnh thực sự của Agentic System nằm ở khả năng Hành động (Take Action) thông qua việc gọi Công cụ (Tools). ...

20 tháng 5, 2026 · 5 phút · Tuan Anh

Generative UI Security: Chống XSS, Prompt Injection & WCAG

Nếu Frontend truyền thống có quy tắc bất di bất dịch là “Không bao giờ tin tưởng dữ liệu từ người dùng”, thì với AI-Native Frontend, quy tắc đó là: “Không bao giờ tin tưởng dữ liệu từ LLM”. 4.1. Cơn ác mộng XSS và Prompt Injection Hãy tưởng tượng bạn cho phép LLM tự do sinh ra mã HTML hoặc Markdown, sau đó bạn dùng thuộc tính innerHTML (hoặc {@html} trong Svelte, dangerouslySetInnerHTML trong React) để render ra màn hình. ...

16 tháng 5, 2026 · 4 phút · Tuan Anh

Enterprise RAG Architecture: Kiến Trúc 'Bộ Não' Nội Bộ

90% các bài hướng dẫn làm RAG (Retrieval-Augmented Generation) trên mạng đều là các “toy examples” (ví dụ đồ chơi): Viết 10 dòng Python, đọc một file PDF, băm nhỏ (chunking) rồi nhét vào Vector Database, sau đó hỏi đáp. Nhưng khi đem hệ thống đó áp dụng vào thực tế doanh nghiệp, nó sẽ sụp đổ ngay lập tức. Trong môi trường Enterprise, RAG không phải là một bài toán AI (AI Problem), mà bản chất của nó là một Bài toán Kiến trúc Dữ liệu (Data Architecture Problem). ...

15 tháng 5, 2026 · 8 phút · Tuan Anh

Phần 3 — Giải mã Năng suất 10x: Nhanh ở đâu, chậm ở đâu?

Mạng xã hội và các chiến dịch marketing của các hãng công nghệ liên tục tiêm nhiễm vào đầu chúng ta một khái niệm: “10x Developer nhờ AI”. Hình ảnh một lập trình viên nhâm nhi ly cà phê, gõ vài dòng prompt và hoàn thành khối lượng công việc của cả một tuần trong một buổi sáng thật sự rất hấp dẫn. Nhưng sự thật dưới chiến hào (trenches) của các dự án thực tế lại phũ phàng hơn nhiều. AI mang lại một nguồn sức mạnh khổng lồ, nhưng nó tuân theo định luật bảo toàn năng lượng: Thời gian bạn tiết kiệm được khi “gõ code” sẽ bị đòi lại một phần (thậm chí là toàn bộ) ở khâu đọc và bảo trì, nếu bạn không biết cách. ...

10 tháng 5, 2026 · 8 phút · Tuan Anh

Phần 3: Golang + Kratos v2 — Đi sâu vào Framework Microservice

Đối với các kỹ sư chuyển từ Magento PHP sang, việc chuyển dịch sang Go microservices không chỉ đơn thuần là đổi ngôn ngữ lập trình — mà nó là một cách thức tổ chức code khác biệt về mặt bản chất. Magento có controller, model, block, helper, và plugin. Còn Go với Kratos v2 sở hữu chính xác 5 lớp (layer), mỗi lớp mang một trách nhiệm được định nghĩa rạch ròi. ...

22 tháng 4, 2026 · 15 phút · Lê Tuấn Anh

Knowledge Distillation: Chắt Lọc Tri Thức DeepSeek-R1

Sự xuất hiện của DeepSeek-R1 vào đầu năm 2025 đã làm đảo lộn nhiều quan điểm cũ về phát triển trí tuệ nhân tạo. Thay vì chạy đua nâng cấp số lượng tham số phần cứng thô, DeepSeek đã chứng minh một bước đi mang tính đột phá: Chắt lọc tri thức (Knowledge Distillation) từ các mô hình suy luận siêu lớn (Reasoning Models) có thể truyền lại khả năng lập luận đa bước (Chain of Thought - CoT) cho các mô hình nhỏ (SLMs) như Qwen hoặc Llama. ...

24 tháng 5, 2026 · 8 phút · Tuan Anh

Phần 4 — AgentOps & Production Observability

Prerequisite: Trước khi bàn về việc giám sát (Monitoring), bạn cần hiểu rõ kiến trúc vận hành của AI trong Enterprise. Vui lòng đọc lại Kiến Trúc Hệ Thống AI-Native Toàn Diện. Chúng ta đã trải qua một chặng đường dài: Thiết kế Topology (Phần 1), xây dựng Memory (Phần 2), và dựng khiên bảo vệ Guardrails (Phần 3). Bây giờ, Agent của bạn đã sẵn sàng lên Production. Nhưng đây mới là lúc cơn ác mộng thực sự bắt đầu: Làm sao bạn debug một hệ thống mà kết quả trả về mỗi lần một khác (Non-deterministic)? ...

22 tháng 5, 2026 · 5 phút · Tuan Anh

Generative UI Human-In-The-Loop: Optimistic UI & Fallback

Khác với các phần mềm truyền thống (nơi phản hồi diễn ra trong vòng vài chục mili-giây), hệ thống AI luôn đi kèm với một bóng ma ám ảnh: Độ trễ (Latency). Bên cạnh đó, vì AI có tính xác suất (non-deterministic), nó luôn có nguy cơ thực hiện sai ý đồ của người dùng. Nếu bạn để AI tự động thực thi một lệnh nguy hiểm (như Xóa Database hay Chuyển tiền) mà không có sự kiểm duyệt của con người, đó là một thảm họa. ...

16 tháng 5, 2026 · 4 phút · Tuan Anh

Phần 3B — AI Automation for Internal Operations

Hệ thống RAG siêu việt mà chúng ta xây dựng ở Bài 3A sẽ chỉ là một món “đồ chơi công nghệ” đắt tiền nếu nó chỉ dùng để trả lời câu hỏi: “Hàm này trong dự án làm gì?”. Ban giám đốc (BOD) và các CFO không quan tâm việc Dev tiết kiệm được 15 phút gõ code. Thứ họ quan tâm là ROI (Return on Investment). Để duy trì ngân sách cho AI Platform, Tech Lead phải chứng minh được hệ thống này có thể cắt giảm chi phí vận hành (Operational Costs) ở các phòng ban khác như Finance, Logistics, và HR. ...

16 tháng 5, 2026 · 6 phút · Tuan Anh

Phần 4 — Sự xóa nhòa ranh giới SDLC & Cuộc cách mạng QC

Quy trình phát triển phần mềm truyền thống (SDLC) thường được mô tả như một dây chuyền lắp ráp nhà máy. Business Analyst (BA) viết requirement $\rightarrow$ Designer vẽ UI $\rightarrow$ Lập trình viên (Dev) gõ code $\rightarrow$ Quality Assurance (QA) tìm bug $\rightarrow$ DevOps đẩy lên server. Mỗi người ngồi trong một “lô cốt” (silo) riêng và giao tiếp qua những tấm vé Jira. Nhưng AI đã vung chiếc búa tạ đập nát những bức tường này. Khi một BA có thể nhờ AI sinh ra một đoạn code chạy thử (Proof of Concept), và một Lập trình viên có thể nhờ AI viết kịch bản test tự động, ranh giới giữa các vai trò trở nên vô cùng mờ nhạt. ...

10 tháng 5, 2026 · 7 phút · Tuan Anh

Phần 4: gRPC Internal + REST Gateway — Vòng đời của Hợp đồng API

Mọi API hướng ra công chúng (public-facing) trong Nền tảng Composable Commerce đều bắt đầu từ một file .proto. Phần code — bao gồm các hàm handler gRPC viết bằng Go, TypeScript SDK, các route HTTP, kiểm tra tính hợp lệ của request (request validation), các mã lỗi — tất cả đều được tự động generate ra từ bản hợp đồng (contract) đó. Bài viết này sẽ ghi chép lại những quy ước đằng sau để hệ thống đó vận hành mượt mà. ...

29 tháng 4, 2026 · 15 phút · Lê Tuấn Anh