01 KHÁCH HÀNG CÁ NHÂN
02 KHÁCH HÀNG DOANH NGHIỆP
03 KHÁCH HÀNG GAME NET
04 HỖ TRỢ KĨ THUẬT, BẢO HÀNH - TRẢ GÓP
05 PHỤ TRÁCH KÊNH BÁN BUÔN, PHÂN PHỐI
GỬI Ý KIẾN, PHẢN HỒI
HOTLINE: 1900 5392
(thời gian làm việc từ 8h30 - 18h00 hàng ngày)
Mục lục
Qwen Team công bố Qwen3.8-Flash-Next ngày 26/8/2026 và mở model weights cho cộng đồng. Đây được mô tả là bản xem trước sớm của nhiều thay đổi kiến trúc sẽ được sử dụng cho Qwen4.
Qwen3.8-Flash-Next thuộc nhóm multimodal MoE. Theo NVIDIA, model sử dụng context gốc 262.144 token và có thể mở rộng tới khoảng 1 triệu token bằng YaRN. MoE giúp chỉ kích hoạt một phần mạng ở mỗi token thay vì toàn bộ parameter.
Kiến trúc kết hợp Gated DeltaNet với Qwen Sparse Attention. NVIDIA mô tả ba trên bốn layer dùng GDN để nén lịch sử thành trạng thái lặp có kích thước cố định, trong khi layer còn lại dùng Sparse Attention để truy xuất thông tin từ context rộng. Mục tiêu là giảm chi phí của full attention khi context trở nên rất dài.

Context dài hữu ích với repository lớn, bộ tài liệu hoặc agent kéo dài nhiều bước, nhưng chi phí prefill và cache có thể tăng mạnh.
Qwen Team đưa các thay đổi về attention, residual, embedding và optimization nhằm cải thiện hiệu quả tính toán. Không phải ứng dụng nào cũng cần 1M token. Developer vẫn nên chia dữ liệu hợp lý và dùng retrieval khi phù hợp.
NVIDIA thử model trên GB300 NVL72 và báo cáo throughput vượt 16.000 token mỗi giây trên mỗi GPU cùng hơn 200 token mỗi giây trên mỗi người dùng trong cấu hình công bố. Các con số này phụ thuộc hardware, batching và cấu hình inference, vì vậy không nên áp trực tiếp cho workstation cá nhân.
NVIDIA cung cấp hỗ trợ qua TensorRT-LLM, vLLM, SGLang và các công cụ NeMo cho fine-tuning hoặc reinforcement learning. Điều này giúp developer có nhiều lựa chọn khi thử model từ workstation tới hệ thống rack-scale.
Code agent thường cần đọc nhiều file, giữ lịch sử tool call và hiểu thay đổi kéo dài qua nhiều bước. Context rộng có thể giúp giảm việc mất thông tin giữa các giai đoạn. Tuy nhiên, agent vẫn cần memory management, tool permission và validation. Một model có context lớn không tự động tạo agent đáng tin cậy.
![]()
Model quy mô lớn không phù hợp với một GPU gaming phổ thông nếu muốn chạy nguyên bản ở precision cao. NVIDIA cho biết model có thể mở rộng từ hệ thống local NVIDIA tới GB300 NVL72, nhưng phần cứng local phù hợp vẫn thuộc nhóm workstation mạnh hoặc nhiều GPU.
Người dùng cá nhân thường cần quantization, model nhỏ hơn hoặc API cloud. RAM 64 GB trở lên và GPU nhiều VRAM có thể hữu ích cho thử nghiệm model lớn, nhưng cấu hình cần tính theo checkpoint cụ thể. Hoàng Long Computer cung cấp workstation AI, GPU, RAM và SSD chính hãng, hỗ trợ xây hệ thống theo model local, inference và phát triển AI.
Model weights có thể chiếm hàng chục tới hàng trăm GB. SSD NVMe 2 TB hoặc cao hơn phù hợp hơn nếu workstation giữ nhiều checkpoint và dataset. Dung lượng cache của framework cũng cần được tính ngoài file weights chính.
Qwen3.8 Flash Next là bản phát hành đáng chú ý vì không chỉ mở một model mới mà còn hé lộ hướng kiến trúc Qwen4. Gated DeltaNet kết hợp Sparse Attention nhắm tới bài toán context dài và hiệu quả inference. Với developer, giá trị thực tế nằm ở việc thử model trên coding agent, multimodal workflow và dữ liệu dài, thay vì chỉ so parameter hoặc context trên bảng thông số.
Công Ty CPTM Dịch Vụ và Công Nghệ Hoàng Long
Hệ thống cửa hàng
LỰA CHỌN CỬA HÀNG GẦN NƠI BẠN NHẤT