Liên hệ
Mua hàng 098.236.8008 Mua hàng 0862.535.536
Kỹ Thuật, Bảo Hành 086.552.8008 Tin tức
DANH MỤC SẢN PHẨM

Mục lục

NVIDIA AVO Đạt 100 Điểm Trên ARC-AGI-3 Public Set

Thời gian 24-08-2026 | Chia sẻ: Facebook Zalo Twitter

NVIDIA AVO Đạt 100 Điểm Trên ARC-AGI-3 Public Set

NVIDIA công bố kết quả nghiên cứu AVO vào ngày 22/8/2026 với điểm 100.00 RHAE trên bộ public set của ARC-AGI-3. Hệ thống hoàn thành toàn bộ 183 level thuộc 25 môi trường, đồng thời dùng ít hơn khoảng 12% environment action so với VISTA theo dữ liệu NVIDIA công bố. Điều đáng chú ý không chỉ nằm ở điểm benchmark. NVIDIA dùng kết quả để lập luận rằng hiệu quả của AI agent phụ thuộc mạnh vào architecture bao quanh model: memory, tool use, feedback, recovery và khả năng duy trì công việc qua nhiều vòng.

AVO Là Gì?

AVO là viết tắt của Agentic Variation Operators, một hệ thống agent tổng quát do NVIDIA phát triển. Agent có thể đọc và sửa code, chạy command, tra tài liệu rồi xác minh kết quả thông qua thực thi. Điểm NVIDIA tập trung là khả năng hoạt động tự chủ trên các task kéo dài.

Trong nghiên cứu tối ưu GPU kernel, AVO thay phần variation được lập trình trước bằng agent tự quyết định nên kiểm tra gì, thay đổi gì, chạy test nào và candidate nào cần giữ lại.

NVIDIA AVO — an agent system scores 100% on ARC-AGI-3's public set — NVIDIA  | AI/TLDR

Agent Không Chỉ Là Một Model Ngôn Ngữ

NVIDIA mô tả model frontier chỉ là một thành phần. Harness xung quanh quyết định cách model nhận context, gọi tool, lưu state, xử lý feedback và phục hồi sau lỗi. Điều này khá quan trọng với xu hướng agent hiện nay. Hai hệ thống dùng cùng model có thể tạo kết quả khác đáng kể nếu một bên quản lý memory, tool và validation tốt hơn.

ARC-AGI-3 Kiểm Tra Khả Năng Suy Luận Qua Tương Tác

ARC-AGI-3 đưa agent vào các môi trường game-like chưa biết trước. Agent không nhận hướng dẫn rõ về luật hoặc mục tiêu, mà phải tương tác, quan sát hệ quả và tự suy luận cách tiến tới level tiếp theo. AVO hoàn thành toàn bộ 183 level thuộc 25 environment trong public set và đạt 100.00 RHAE. NVIDIA lưu ý đây là kết quả trên public set, không phải semi-private hoặc private competition set. Phân biệt này rất quan trọng. Điểm public không nên được diễn đạt thành việc toàn bộ ARC-AGI-3 đã được giải quyết.

Kiến Trúc Từ GPU Kernel Có Thể Chuyển Sang Game-Like Environment

NVIDIA ban đầu xây AVO cho software engineering và tối ưu GPU kernel. Các task đó yêu cầu agent đọc implementation, đặt giả thuyết, thay code, chạy benchmark rồi điều chỉnh dựa trên kết quả. Khi chuyển sang ARC-AGI-3, domain thay đổi hoàn toàn nhưng vòng lặp logic vẫn tương tự: xây giả thuyết từ thông tin thiếu, hành động, quan sát, giữ state, sửa giả thuyết và tiếp tục. NVIDIA xem khả năng chuyển kiến trúc giữa hai domain như bằng chứng rằng AVO không chỉ được tối ưu cho một bài coding riêng.

AVO Được Thử Với Nhiều Model Frontier

Kết quả public set đầy đủ được NVIDIA chạy với Claude Opus 5. Đội nghiên cứu còn ghép AVO với GPT-5.6 Sol trên một tập game khó để quan sát profile hoạt động. NVIDIA cho biết Sol hoàn thành một số level tương ứng nhanh hơn về thời gian thực, trong khi Opus sử dụng ít environment action hơn trong các so sánh cùng level. Đây mới là thử nghiệm giới hạn, chưa phải benchmark tổng quát giữa hai model. Chi tiết này càng củng cố ý tưởng rằng architecture và model cần được xem cùng nhau. Một model có profile tốc độ khác, model kia tiết kiệm action hơn, còn harness quyết định cách các khả năng được chuyển thành tiến trình.

NVIDIA's AVO Hits 100% On ARC-AGI-3 — With Caveats

Ý Nghĩa Với AI Agent Doanh Nghiệp

Trong môi trường thực tế, agent hiếm khi chỉ trả lời một câu hỏi. Nó có thể phải mở dữ liệu, gọi API, sửa file, chờ kết quả, xử lý lỗi rồi tiếp tục sau nhiều bước. AVO cho thấy năm thành phần cần được quan tâm: state bền vững, tool rõ quyền, feedback có thể kiểm tra, cơ chế recovery và context management dài hạn. Điều này cũng đồng nghĩa việc mua model mạnh hơn chưa chắc giải quyết toàn bộ vấn đề nếu workflow xung quanh thiếu validation.

PC Phát Triển AI Agent Cần Gì?

Developer dùng API cloud có thể tập trung vào CPU, RAM và SSD thay vì GPU cực mạnh. RAM 32 GB khá hữu ích khi chạy IDE, Docker, database và nhiều service local. SSD NVMe giúp container image, cache và repository phản hồi nhanh. Nếu chạy model local, GPU và VRAM trở nên quan trọng. Cấu hình cần được chọn theo model, quantization, context và framework cụ thể.

Hoàng Long Computer cung cấp workstation, PC lập trình, GPU, RAM và SSD chính hãng, hỗ trợ cấu hình theo AI local, Docker và workflow phát triển phần mềm.

NVIDIA AVO đạt 100.00 RHAE trên public set ARC-AGI-3 và hoàn thành toàn bộ 183 level trong 25 environment. Điểm kỹ thuật đáng quan tâm hơn con số benchmark là việc cùng một agent architecture chuyển từ tối ưu GPU kernel sang môi trường reasoning tương tác. Kết quả cho thấy cuộc đua AI agent đang dần chuyển từ câu hỏi “model nào mạnh hơn” sang “toàn bộ hệ thống khai thác model ra sao”.

Lê Minh Tuấn

Lê Minh Tuấn là một “Biên tập viên - Reviewer công nghệ” tại Tây Hồ, Hà Nội. Với hơn 10 năm hoạt động chuyên sâu trong lĩnh vực công nghệ, anh là một reviewer kỳ cựu, có tiếng trong cộng đồng đam mê phần cứng máy tính tại Hà Nội. Anh bắt đầu sự nghiệp từ năm 2014 với vai trò là kỹ thuật viên phần cứng, sau đó chuyển hướng sang review công nghệ nhờ đam mê chia sẻ kiến thức và trải nghiệm thực tế đến cộng đồng.

Hotline: 0982368008
ĐĂNG KÝ TƯ VẤN
X
banner hssv left
banner hssv right