01 KHÁCH HÀNG CÁ NHÂN
02 KHÁCH HÀNG DOANH NGHIỆP
03 KHÁCH HÀNG GAME NET
04 HỖ TRỢ KĨ THUẬT, BẢO HÀNH - TRẢ GÓP
05 PHỤ TRÁCH KÊNH BÁN BUÔN, PHÂN PHỐI
GỬI Ý KIẾN, PHẢN HỒI
HOTLINE: 1900 5392
(thời gian làm việc từ 8h30 - 18h00 hàng ngày)
Mục lục
NVIDIA ngày 11/8/2026 công bố loạt cập nhật xoay quanh local AI, mô hình mở và agent chạy trực tiếp trên thiết bị. Tâm điểm là Nemotron 3.5 Lightning, một mô hình MoE 30B có open weights, được thiết kế cho các tác vụ agent cần phản hồi nhanh và có khả năng tùy chỉnh. Cùng đợt này, NVIDIA cũng nói về Meta Muse Glimmer, LTX-2.5, các cập nhật cho DGX Spark và hệ sinh thái công cụ chạy mô hình tại chỗ. Xu hướng này đáng chú ý với người dùng PC vì AI không còn chỉ nằm trên cloud. Một số mô hình hiện có thể chạy trên RTX PC, workstation hoặc hệ thống để bàn chuyên dụng, mở thêm lựa chọn cho lập trình, xử lý dữ liệu riêng, tạo nội dung và tự động hóa quy trình.
NVIDIA giới thiệu Nemotron 3.5 Lightning là mô hình 30B dạng mixture-of-experts dành cho các tác vụ agent. Theo số liệu nội bộ của hãng, mô hình có thể tạo token nhanh hơn tới 4 lần và giảm thời gian hoàn thành tác vụ khoảng 30% so với nhóm mô hình mở cùng phân khúc mà NVIDIA dùng để đối chiếu. Đây là số liệu do nhà sản xuất công bố, vì vậy người dùng vẫn cần chờ thêm benchmark độc lập trong nhiều workload.
Open weights cho phép nhà phát triển tiếp tục tinh chỉnh bằng dữ liệu riêng. NVIDIA nêu các ví dụ như huấn luyện mô hình theo phong cách viết của doanh nghiệp, thuật ngữ trong nhiếp ảnh hoặc 3D, hay quy ước code của một nhóm lập trình.
Điều này khác với việc chỉ dùng một chatbot tổng quát. Khi mô hình được điều chỉnh theo workflow, agent có thể hiểu cách đặt tên file, cấu trúc báo cáo hoặc quy tắc code của nhóm tốt hơn. Tuy nhiên, doanh nghiệp vẫn cần kiểm thử đầu ra và giới hạn quyền truy cập của agent trước khi cho phép xử lý dữ liệu quan trọng.

Cùng ngày, NVIDIA cho biết Meta Muse Glimmer là mô hình 30B có open weights, context trên 120K và được tối ưu cho coding cùng local agentic AI. NVIDIA công bố mô hình đạt hơn 200 token mỗi giây trên RTX 5090 trong bài thử của hãng.
Muse Glimmer có thể làm việc với file cục bộ, ứng dụng và chuỗi tác vụ nhiều bước. NVIDIA nêu các trường hợp như đọc tài liệu, xử lý email, hỗ trợ coding và làm việc với dữ liệu riêng ngay trên hệ thống.
Lợi ích của local AI không chỉ nằm ở tốc độ. Khi dữ liệu không cần gửi lên một dịch vụ bên ngoài cho từng bước xử lý, doanh nghiệp có thêm lựa chọn kiểm soát luồng dữ liệu. Dù vậy, chạy local không tự động biến hệ thống thành an toàn. Quyền thư mục, tài khoản, nhật ký và cách agent được phép gọi công cụ vẫn phải được cấu hình theo chính sách nội bộ.

NVIDIA cho biết Nemotron 3.5 Lightning có thể chạy trên RTX PC, DGX Spark, Jetson và mở rộng lên RTX PRO workstation, DGX Station hoặc môi trường data center. Hãng cũng phối hợp với vLLM, Ollama, llama.cpp và LM Studio để hỗ trợ nhiều định dạng và cách triển khai.
Tuy nhiên, khả năng chạy mô hình và khả năng vận hành thoải mái là hai việc khác nhau. Mô hình lớn có thể cần lượng VRAM cao, RAM hệ thống rộng và SSD có tốc độ tốt để nạp checkpoint. Người dùng nên xem dung lượng model, kiểu lượng tử hóa và context thực tế trước khi chọn GPU.
Local AI trong đợt cập nhật này không chỉ tập trung vào ngôn ngữ. NVIDIA cho biết LTX-2.5 hỗ trợ tạo video nhiều cảnh, tăng tính liên tục giữa các đoạn và có workflow ComfyUI cho RTX GPU, DGX Spark cùng DGX Station. Trên RTX 6000 PRO, NVIDIA công bố mức tăng hiệu năng tới 20% và giảm bộ nhớ khoảng 40% trong một số thử nghiệm của hãng.

Với mô hình ngôn ngữ hoặc tạo nội dung tại máy, GPU và VRAM thường là hai yếu tố được chú ý trước. Tuy nhiên, RAM hệ thống và SSD cũng có vai trò rõ vì checkpoint có thể rất lớn và nhiều workflow cần tải thêm encoder, VAE hoặc model phụ.
Người mới thử local AI không cần bắt đầu bằng hệ thống quá cao. Một PC có GPU phù hợp với model nhỏ, RAM 32 GB và SSD NVMe có thể dùng để học cách chạy inference, thử lượng tử hóa và xây workflow. Khi dự án tăng quy mô, người dùng mới cân nhắc GPU nhiều VRAM hoặc workstation mạnh hơn.
Hoàng Long Computer cung cấp PC đồ họa, workstation, PC gaming, GPU, RAM và SSD chính hãng, hỗ trợ lựa chọn cấu hình dựa trên mô hình, phần mềm và nhu cầu nâng cấp.
NVIDIA Nemotron 3.5 Lightning cho thấy local AI đang được mở rộng theo hướng agent chạy liên tục, tùy chỉnh theo dữ liệu và triển khai trên nhiều nhóm phần cứng. Muse Glimmer, LTX-2.5 và các công cụ liên quan cũng cho thấy PC có thể đảm nhiệm ngày càng nhiều tác vụ AI trước đây thường gắn với cloud. Người dùng vẫn nên đọc benchmark theo đúng cấu hình, kiểm tra VRAM và xem yêu cầu của model trước khi nâng máy. Local AI tạo thêm quyền chủ động, nhưng hiệu quả thực tế phụ thuộc phần cứng, phần mềm và cách workflow được thiết kế.
Công Ty CPTM Dịch Vụ và Công Nghệ Hoàng Long
Hệ thống cửa hàng
LỰA CHỌN CỬA HÀNG GẦN NƠI BẠN NHẤT