Tech Radar 10/07: Kiến trúc Cloud-Native AI — Envoy Gateway, K8s

🇬🇧 Read the English version of this article on tanhdev.com Answer-first: Trong năm 2026, Kỹ thuật Nền tảng (Platform Engineering) cho AI không còn nằm ở việc chọn đúng LLM framework. Những câu hỏi thực sự là: Ai kiểm soát chi phí token? Ai định tuyến lưu lượng truy cập thông minh đến đúng GPU pod? Trạng thái của tác nhân (agent state) đi về đâu sau một sự cố crash? Ba dự án CNCF — Envoy AI Gateway, K8s Gateway API Inference Extension, và Dapr Agents — đang hội tụ để trả lời những câu hỏi đó ở tầng cơ sở hạ tầng, giúp mã nguồn ứng dụng (application code) không phải gánh vác. ...

10 tháng 7, 2026 · 13 phút · Lê Tuấn Anh

Bảo Mật API & Rate Limiting Trong Go — Token Bucket, Leaky Bucket & Redis Lua

Điều kiện tiên quyết: Đây là Phần 11 của Khóa Học System Design. Các bài học trước đã hướng dẫn xây dựng các thành phần cốt lõi của hệ thống — bài học này sẽ trang bị các giải pháp bảo vệ API và kiểm soát lưu lượng truy cập (Rate Limiting) để đảm bảo tính ổn định khi hệ thống gặp đột biến lưu lượng (traffic spikes). Answer-first: Đối mặt với các đợt lưu lượng khổng lồ do Bot và Agentic AI tạo ra năm 2026, cơ chế API Rate Limiting bảo vệ các dịch vụ backend bằng cách kiểm soát lượng request được phép xử lý trong một khoảng thời gian. Hệ thống bảo mật hiện đại bắt buộc phải triển khai mô hình bảo vệ đa lớp (Layered Defense): WAF ở rìa ngoài để dập tắt các đợt tấn công quá tải dung lượng (Volumetric Spikes/DDoS), API Gateway ở tầng L7 để xác thực vé truy cập (Credentials/Tokens) và kiểm soát hạn ngạch (Quotas), và Application Middleware ở tầng trong cùng để áp đặt các quy tắc nghiệp vụ chi tiết. Việc định danh client để rate limit cần xác định IP chính xác và an toàn (sử dụng PROXY protocol hoặc trích xuất đúng địa chỉ IP thực từ header X-Forwarded-For). ...

18 tháng 6, 2026 · 12 phút · Lê Tuấn Anh