🇬🇧 Read the English version of this article on tanhdev.com

Mistral chính thức ra mắt mô hình Mistral Small 4 — mô hình 119 tỷ tham số (119B parameters) được thiết kế để hợp nhất các năng lực vốn trước đây yêu cầu ba mô hình riêng biệt. Phát hành dưới giấy phép mã nguồn mở Apache 2.0 và được tối ưu cho cả độ trễ (latency) lẫn băng thông xử lý (throughput), Small 4 đánh dấu bước chuyển chiến lược trong hệ sinh thái mô hình mã nguồn mở.

Cải tiến quan trọng của bản phát hành nằm ở kiến trúc hợp nhất (unified architecture): Mistral đã tích hợp năng lực suy luận chuyên sâu của Magistral, khả năng xử lý đa mô thức (multimodal) của Pixtral và năng lực lập trình của Devstral vào một mô hình duy nhất với cơ chế điều chỉnh hành vi linh hoạt. Lập trình viên không còn phải chuyển đổi giữa các mô hình chuyên biệt mà có thể tùy chỉnh một mô hình duy nhất cho các phản hồi nhanh, suy luận chuyên sâu hoặc phân tích hình ảnh tùy theo yêu cầu tác vụ.

Ba chủ đề chính định hình bản phát hành này bao gồm: Kiến trúc mô hình hợp nhất (Unified Architecture), cơ chế suy luận tùy biến linh hoạt (Configurable Reasoning), và vị thế chiến lược với giấy phép mã nguồn mở Apache 2.0.

1. Kiến Trúc Hợp Nhất: Một Mô Hình Cho Nhiều Chế Độ Xử Lý

Mistral Small 4 là mô hình đầu tiên trong dòng sản phẩm của Mistral hợp nhất thành công các năng lực vốn bị chia rẽ trước đây:

flowchart TD
    subgraph "Dòng Sản Phẩm Cũ Của Mistral"
        MAG[Magistral] --> REASON[Suy Luận Chuyên Sâu]
        PIX[Pixtral] --> MULTI[Xử Lý Thị Giác Đa Mô Thức]
        DEV[Devstral] --> CODE[Lập Trình Cho AI Agent]
    end
    
    subgraph "Kiến Trúc Hợp Nhất Mistral Small 4"
        SMALL4[Mistral Small 4] --> MODE1[reasoning_effort=none<br/>Fast Instruct]
        SMALL4 --> MODE2[reasoning_effort=medium<br/>Chế Độ Cân Bằng]
        SMALL4 --> MODE3[reasoning_effort=high<br/>Suy Luận Chuyên Sâu]
        SMALL4 --> MULTI2[Đa Mô Thức Nguyên Bản]
        SMALL4 --> CODE2[Tối Ưu Lập Trình Agent]
    end

Thông số kiến trúc cốt lõi:

  • Kiến trúc Mixture of Experts (MoE): 128 chuyên gia (experts), 4 chuyên gia kích hoạt cho mỗi token.
  • Tổng 119 tỷ tham số (119B parameters), 6 tỷ tham số kích hoạt mỗi token (6B active parameters, 8B bao gồm embeddings).
  • Cửa sổ bối cảnh 256k token (256k context window).
  • Khả năng xử lý đa mô thức nguyên bản: Tiếp nhận cả dữ liệu văn bản và hình ảnh.

Kiến trúc hợp nhất này đơn giản hóa đáng kể độ phức tạp vận hành. Đội ngũ phát triển trước đây phải duy trì và điều phối ba mô hình triển khai riêng biệt (với yêu cầu hạ tầng, giá token và rủi ro khác nhau) giờ đây có thể vận hành trên một endpoint duy nhất và điều khiển hành vi bằng tham số.

2. Cơ Chế Suy Luận Tùy Biến (Configurable Reasoning)

Tính năng nổi bật của Small 4 là tham số reasoning_effort, cho phép điều chỉnh linh hoạt độ sâu suy luận của mô hình trực tiếp trong các câu lệnh mà không cần đổi mô hình:

Mức Độ (reasoning_effort)Hành Vi Xử LýỨng Dụng Phù Hợp
nonePhản hồi cực nhanh, nhẹ nhàngTrò chuyện hằng ngày, tra cứu đơn giản
lowSuy luận nhanhTác vụ tiêu chuẩn
mediumSuy luận cân bằngLập trình chung
highSuy luận chuyên sâu từng bướcBài toán phức tạp, nghiên cứu chuyên sâu
flowchart LR
    INPUT[Dữ Liệu Đầu Vào] --> CLASSIFY{Đánh Giá Độ Phức Tạp Tác Vụ}
    CLASSIFY -->|Đơn Giản| NONE[reasoning_effort=none<br/>Độ trễ ~100ms]
    CLASSIFY -->|Trung Bình| MEDIUM[reasoning_effort=medium<br/>Độ trễ ~500ms]
    CLASSIFY -->|Phức Tạp| HIGH[reasoning_effort=high<br/>Độ trễ ~2s]
    
    NONE --> OUTPUT[Kết Quả Phản Hồi]
    MEDIUM --> OUTPUT
    HIGH --> OUTPUT

Mô hình này khác biệt với việc chia tách thành các phiên bản mô hình riêng (như Pro/Flash hoặc Opus/Sonnet/Haiku). Thay vì điều hướng request qua lại giữa các dịch vụ khác nhau, Mistral Small 4 tự điều chỉnh độ sâu suy luận nội tại — đánh đổi độ trễ để lấy độ chính xác ngay trên một kiến trúc duy nhất.

Cải tiến hiệu năng được ghi nhận:

  • Giảm 40% thời gian xử lý tổng thể (end-to-end completion time).
  • Tăng gấp 3 lần số lượng request xử lý mỗi giây so với Mistral Small 3.
  • Đạt điểm số tương đương với các mô hình 120B khác trong khi tạo ra kết quả ngắn gọn hơn từ 20-60%.

3. Giấy Phép Mã Nguồn Mở Apache 2.0 Và Vị Thế Chiến Lược

Mistral Small 4 được phát hành theo giấy phép Apache 2.0 — một trong những giấy phép mã nguồn mở tự do nhất trong phân khúc mô hình tiên tiến hiện nay.

Trong bối cảnh DeepSeek-V4 dùng giấy phép MIT, Llama sử dụng giấy phép thương mại tùy biến có điều kiện, và các mô hình độc quyền (proprietary) chỉ cung cấp qua API, Mistral khẳng định lựa chọn mở hoàn toàn cho doanh nghiệp:

flowchart TD
    subgraph "Bản Đồ Giấy Phép Tháng 04/2026"
        PROP[Mô Hình Độc Quyền API<br/>OpenAI, Anthropic] --> PAY[Trả Phí Theo Token]
        LLAMA[Meta Llama 4<br/>Custom License] --> RESTRICT[Giới Hạn Điều Khoản Thương Mại]
        DEEP[DeepSeek-V4<br/>MIT License] --> OPEN1[Mã Nguồn Mở Nguồn Gốc Trung Quốc]
        MISTRAL[Mistral Small 4<br/>Apache 2.0] --> OPEN2[Mã Nguồn Mở Tự Do Khai Thác<br/>Không Ràng Buộc Thương Mại]
    end

Ưu điểm của giấy phép Apache 2.0:

  • Cho phép khai thác thương mại đầy đủ mà không bắt buộc ghi nhận bản quyền phức tạp.
  • Tích hợp sẵn điều khoản cấp phép bằng sáng chế (patent grant).
  • Không giới hạn việc tùy biến, sửa đổi hoặc phân phối lại.
  • Dễ dàng nhúng trực tiếp vào các sản phẩm và dịch vụ thương mại của doanh nghiệp.

Mistral cũng tham gia NVIDIA Nemotron Coalition với tư cách thành viên sáng lập, thúc đẩy hợp tác tối ưu hóa cho doanh nghiệp. Mô hình đã khả dụng sẵn trên các công cụ vLLM, llama.cpp, SGLang và Transformers.

4. Yêu Cầu Hạ Tầng Vận Hành

Hiệu năng tối ưu của Small 4 đòi hỏi cấu hình phần cứng phù hợp:

Cấu hình hạ tầng tối thiểu:

  • 4x NVIDIA HGX H100, hoặc
  • 2x NVIDIA HGX H200, hoặc
  • 1x NVIDIA DGX B200

Cấu hình khuyến nghị:

  • 4x NVIDIA HGX H100, hoặc
  • 4x NVIDIA HGX H200, hoặc
  • 2x NVIDIA DGX B200

Cấu hình này phù hợp cho việc triển khai tại các doanh nghiệp tầm trung hoặc trên môi trường Cloud. Với 6B tham số kích hoạt cho mỗi token, mô hình đạt sự cân bằng tối ưu giữa năng lực xử lý và chi phí hạ tầng.

Năng lực đa mô thức (hỗ trợ cả văn bản và hình ảnh) cho phép Small 4 ứng dụng hiệu quả vào phân tích tài liệu, giải đáp trực quan và các agent đọc hiểu giao diện phần mềm.

5. Định Hướng Cho Các Đội Ngũ Kỹ Thuật

Ba khuyến nghị dành cho các kỹ sư và quản lý công nghệ:

  1. Xu hướng hợp nhất mô hình là tiêu chuẩn mới: Sự đơn giản trong vận hành một mô hình hợp nhất có thể tùy chỉnh hành vi vượt trội hơn việc duy trì hệ thống điều hướng phức tạp giữa nhiều mô hình chuyên biệt. Đội ngũ nên đánh giá lại chi phí kỹ thuật của việc duy trì nhiều endpoint riêng lẻ.
  2. Giấy phép Apache 2.0 giảm thiểu rủi ro pháp lý: Khi xây dựng sản phẩm cốt lõi trên các mô hình LLM, giấy phép Apache 2.0 giúp loại bỏ hoàn toàn các rủi ro pháp lý và ràng buộc thương mại từ nhà cung cấp.
  3. Hiệu năng xử lý là thước đo cạnh tranh: Sự tối ưu về độ dài kết quả đầu ra của Mistral giúp giảm trực tiếp chi phí suy luận và cải thiện trải nghiệm người dùng. Đội ngũ nên đánh giá mô hình dựa trên các chỉ số “chất lượng trên độ trễ” thay vì chỉ dựa vào điểm số benchmark thuần túy.

Tóm Tắt Các Tính Năng Trọng Tâm

Tính NăngCơ Chế Kỹ ThuậtGiá Trị Thực Tế
Kiến Trúc Hợp NhấtHợp nhất Magistral + Pixtral + Devstral vào một mô hìnhĐơn giản hóa hạ tầng triển khai, giảm độ phức tạp vận hành
Suy Luận Tùy BiếnTham số reasoning_effort điều chỉnh độ sâu suy luậnMột mô hình xử lý đa dạng loại tác vụ với độ trễ tối ưu
Giấy Phép Apache 2.0Giấy phép mã nguồn mở tự do đầy đủTriển khai thương mại an toàn, không bị ràng buộc pháp lý
119B Params / 6B ActiveKiến trúc MoE 128 experts, 4 active per tokenSuy luận hiệu quả với chi phí phần cứng hợp lý
Bối Cảnh 256k TokenHỗ trợ cửa sổ bối cảnh lớnXử lý tốt các bộ mã nguồn và tài liệu kỹ thuật dài
Đa Mô Thức Nguyên BảnĐọc hiểu văn bản và hình ảnh đồng thờiỨng dụng cho trích xuất tài liệu, phân tích giao diện UI
Tối Ưu Độ Trễ 40%Tăng tốc độ phản hồi tổng thểGiảm chi phí tính toán suy luận và cải thiện UX

Tổng Kết Radar Takeaway

Mistral Small 4 thể hiện xu hướng hợp nhất trong thiết kế mô hình: Thay vì bắt lập trình viên phải điều phối nhiều mô hình chuyên biệt, một kiến trúc duy nhất có thể tùy chỉnh độ sâu suy luận linh hoạt sẽ giải quyết hiệu quả các bài toán thực tế.

Giấy phép mã nguồn mở Apache 2.0 cùng khả năng tối ưu hóa độ trễ giúp Mistral Small 4 trở thành lựa chọn hấp dẫn cho các doanh nghiệp muốn tự chủ hạ tầng AI mà không bị ràng buộc bởi các điều khoản pháp lý hay chi phí API độc quyền.


🔗 Đọc thêm các chuyên đề liên quan: