Tech Radar: Kiến Trúc Multi-Head Latent Attention (MLA) DeepSeek-V3

Tech Radar: Kiến Trúc Multi-Head Latent Attention (MLA) Của DeepSeek-V3 & Tối Ưu Nén KV Cache

Tech Radar: Kiến Trúc Multi-Head Latent Attention (MLA) Của DeepSeek-V3 & Tối Ưu Nén KV Cache Answer-First: Cơ chế Multi-Head Latent Attention (MLA) trên DeepSeek-V3 giải quyết trực tiếp bài toán thắt cổ chai về băng thông bộ nhớ và dung lượng VRAM trong quá trình suy luận mô hình ngôn ngữ lớn. Bằng cách chiếu các vector Key và Value vào không gian tiềm ẩn nén (latent space $d_{latent} = 512$) trước khi đưa vào bộ đệm KV cache, MLA giúp giảm 75% dung lượng VRAM tiêu thụ tại runtime so với Multi-Head Attention (MHA) truyền thống và Grouped-Query Attention (GQA), đồng thời vẫn bảo toàn năng lực biểu diễn thông qua kỹ thuật Decoupled Rotary Position Embedding (RoPE). ...