Liên hệ
Mua hàng 098.236.8008 Mua hàng 0862.535.536
Kỹ Thuật, Bảo Hành 086.552.8008 Tin tức
DANH MỤC SẢN PHẨM

Mục lục

Qwen3.8-Flash-Next Hé Lộ Kiến Trúc Hướng Tới Qwen4

Thời gian 27-08-2026 | Chia sẻ: Facebook Zalo Twitter

Qwen3.8-Flash-Next Hé Lộ Kiến Trúc Hướng Tới Qwen4

Qwen Team công bố Qwen3.8-Flash-Next ngày 26/8/2026 và mở model weights cho cộng đồng. Đây được mô tả là bản xem trước sớm của nhiều thay đổi kiến trúc sẽ được sử dụng cho Qwen4.

Model Dùng Kiến Trúc Mixture Of Experts

Qwen3.8-Flash-Next thuộc nhóm multimodal MoE. Theo NVIDIA, model sử dụng context gốc 262.144 token và có thể mở rộng tới khoảng 1 triệu token bằng YaRN. MoE giúp chỉ kích hoạt một phần mạng ở mỗi token thay vì toàn bộ parameter.

Gated DeltaNet Xử Lý Phần Lớn Layer

Kiến trúc kết hợp Gated DeltaNet với Qwen Sparse Attention. NVIDIA mô tả ba trên bốn layer dùng GDN để nén lịch sử thành trạng thái lặp có kích thước cố định, trong khi layer còn lại dùng Sparse Attention để truy xuất thông tin từ context rộng. Mục tiêu là giảm chi phí của full attention khi context trở nên rất dài.

Qwen3.8-Flash-Next Previews The Qwen4 Architecture With 125B Parameters •  Ask Yuga!

Context Một Triệu Token Đặt Áp Lực Lớn Lên Hạ Tầng

Context dài hữu ích với repository lớn, bộ tài liệu hoặc agent kéo dài nhiều bước, nhưng chi phí prefill và cache có thể tăng mạnh.

Qwen Team đưa các thay đổi về attention, residual, embedding và optimization nhằm cải thiện hiệu quả tính toán. Không phải ứng dụng nào cũng cần 1M token. Developer vẫn nên chia dữ liệu hợp lý và dùng retrieval khi phù hợp.

NVIDIA Công Bố Hiệu Năng Trên GB300 NVL72

NVIDIA thử model trên GB300 NVL72 và báo cáo throughput vượt 16.000 token mỗi giây trên mỗi GPU cùng hơn 200 token mỗi giây trên mỗi người dùng trong cấu hình công bố. Các con số này phụ thuộc hardware, batching và cấu hình inference, vì vậy không nên áp trực tiếp cho workstation cá nhân.

Hệ Sinh Thái Inference Được Hỗ Trợ

NVIDIA cung cấp hỗ trợ qua TensorRT-LLM, vLLM, SGLang và các công cụ NeMo cho fine-tuning hoặc reinforcement learning. Điều này giúp developer có nhiều lựa chọn khi thử model từ workstation tới hệ thống rack-scale.

Model Có Ý Nghĩa Gì Với Agentic Coding?

Code agent thường cần đọc nhiều file, giữ lịch sử tool call và hiểu thay đổi kéo dài qua nhiều bước. Context rộng có thể giúp giảm việc mất thông tin giữa các giai đoạn. Tuy nhiên, agent vẫn cần memory management, tool permission và validation. Một model có context lớn không tự động tạo agent đáng tin cậy.

Qwen3.8-Flash-Next - a Hugging Face Space by victor

PC Chạy Qwen3.8 Có Khả Thi Không?

Model quy mô lớn không phù hợp với một GPU gaming phổ thông nếu muốn chạy nguyên bản ở precision cao. NVIDIA cho biết model có thể mở rộng từ hệ thống local NVIDIA tới GB300 NVL72, nhưng phần cứng local phù hợp vẫn thuộc nhóm workstation mạnh hoặc nhiều GPU.

Người dùng cá nhân thường cần quantization, model nhỏ hơn hoặc API cloud. RAM 64 GB trở lên và GPU nhiều VRAM có thể hữu ích cho thử nghiệm model lớn, nhưng cấu hình cần tính theo checkpoint cụ thể. Hoàng Long Computer cung cấp workstation AI, GPU, RAM và SSD chính hãng, hỗ trợ xây hệ thống theo model local, inference và phát triển AI.

SSD Cũng Là Thành Phần Dễ Bị Bỏ Qua

Model weights có thể chiếm hàng chục tới hàng trăm GB. SSD NVMe 2 TB hoặc cao hơn phù hợp hơn nếu workstation giữ nhiều checkpoint và dataset. Dung lượng cache của framework cũng cần được tính ngoài file weights chính.

Qwen3.8 Flash Next là bản phát hành đáng chú ý vì không chỉ mở một model mới mà còn hé lộ hướng kiến trúc Qwen4. Gated DeltaNet kết hợp Sparse Attention nhắm tới bài toán context dài và hiệu quả inference. Với developer, giá trị thực tế nằm ở việc thử model trên coding agent, multimodal workflow và dữ liệu dài, thay vì chỉ so parameter hoặc context trên bảng thông số.

Lê Minh Tuấn

Lê Minh Tuấn là một “Biên tập viên - Reviewer công nghệ” tại Tây Hồ, Hà Nội. Với hơn 10 năm hoạt động chuyên sâu trong lĩnh vực công nghệ, anh là một reviewer kỳ cựu, có tiếng trong cộng đồng đam mê phần cứng máy tính tại Hà Nội. Anh bắt đầu sự nghiệp từ năm 2014 với vai trò là kỹ thuật viên phần cứng, sau đó chuyển hướng sang review công nghệ nhờ đam mê chia sẻ kiến thức và trải nghiệm thực tế đến cộng đồng.

Hotline: 0982368008
ĐĂNG KÝ TƯ VẤN
X