Tối Ưu Hóa Inference & Triển Khai vLLM Trên Production

1. Nút Cổ Chai Của LLM: Tại Sao GPU Vẫn Thất Nghiệp? Sau khi thiết kế xong toàn bộ kiến trúc Agent ở 7 phần trước, đến lúc bạn đưa hệ thống lên Production (chạy thực tế). Mọi start-up đều sớm nhận ra một sự thật cay đắng: Kẻ thù của LLM không phải là Sức mạnh tính toán (Compute), mà là Băng thông bộ nhớ (Memory Bandwidth). Để chạy mô hình Llama-3 70B (chuẩn FP16), bạn cần khoảng 140GB VRAM chỉ để chứa mô hình. Nhưng khi có 100 User cùng gửi prompt, hệ thống phải sinh ra một vùng nhớ tạm gọi là KV Cache để giữ lại bối cảnh của 100 cuộc hội thoại đó. Ngay lập tức, KV Cache phình to ra và ăn cạn bộ nhớ VRAM còn lại. Hệ thống báo lỗi Out-Of-Memory (OOM) và sụp đổ, mặc dù sức mạnh xử lý của GPU lúc đó chỉ mới xài hết 30%. Làm sao để “nhồi” nhiều User hơn vào GPU mà không bị tràn RAM? ...

17 tháng 5, 2026 · 5 phút · Tuan Anh

Tech Radar 10/07: Kiến trúc Cloud-Native AI — Envoy Gateway, K8s Inference Extension & Dapr Agents

🇬🇧 Read the English version of this article on tanhdev.com Answer-first: Trong năm 2026, Kỹ thuật Nền tảng (Platform Engineering) cho AI không còn nằm ở việc chọn đúng LLM framework. Những câu hỏi thực sự là: Ai kiểm soát chi phí token? Ai định tuyến lưu lượng truy cập thông minh đến đúng GPU pod? Trạng thái của tác nhân (agent state) đi về đâu sau một sự cố crash? Ba dự án CNCF — Envoy AI Gateway, K8s Gateway API Inference Extension, và Dapr Agents — đang hội tụ để trả lời những câu hỏi đó ở tầng cơ sở hạ tầng, giúp mã nguồn ứng dụng (application code) không phải gánh vác. ...

10 tháng 7, 2026 · 13 phút · Lê Tuấn Anh

Tech Radar 01/05/2026: Sạp AI-Native Cloud Của DigitalOcean - Rẽ Luồng Inference, Quản Trị Retrieval, kẹp Bãi Chồng Đồ Nghề Agents Tích Hợp

🇬🇧 Read the English version of this article on tanhdev.com Màn bóc tem AI-Native Cloud của tay DigitalOcean hồi 28/04/2026 đéo phải là quả announcement AI infrastructure khổng lồ nhất trong tuần, cơ mà nó dư sức quất danh hiệu rành rọt chóp bu nhất. Thay vì vọc AI y xì đúc như một bãi feature rẻ rách đắp chắp vá vô cái legacy cloud (cloud đồ cổ), tay DigitalOcean xắn tay reorganizing (tái cơ cấu) banh chành nguyên cái platform đặng ôm trọn cái hình hài thực thụ của mớ production AI systems hiện tại: multi-model inference (nhai suy luận đa model), retrieval (móc data), routing (rẽ luồng), state (neo trạng thái), kẹp đống long-running agent workflows (mớ luồng agent cày bừa dai nhách). ...

1 tháng 5, 2026 · 16 phút · Tuan Anh