Phần 3: Nghệ Thuật Chunking & Semantic Caching: Late Chunking và Tối Ưu Chi Phí

Phần 3: Nghệ Thuật Chunking & Semantic Caching: Late Chunking và Tối Ưu Chi Phí

← Chương trước: Phần 2: Agentic Ingestion & Multimodal Knowledge Graphs | Mục lục Series | Chương tiếp theo: Phần 4: Streaming CDC & Federated RAG → Answer-first: Late Chunking tạo embedding cho toàn bộ tài liệu trước khi phân đoạn, giữ trọn ngữ cảnh toàn cục cho từng chunk nhỏ. Kết hợp Semantic Caching trên Redis giúp tái sử dụng câu trả lời cho các truy vấn tương đồng, giảm tới 70% chi phí gọi API và hạ độ trễ xuống mili-giây. ...

17 tháng 5, 2026 · 6 phút · Lê Tuấn Anh