Nvidia vừa chứng minh rằng hệ thống hỗ trợ, không phải mô hình AI, mới là nhân vật chính

Đạt 100% điểm trên một trong những bài kiểm tra khắt khe nhất của AI — và mô hình hầu như không xứng đáng nhận công. Nghiên cứu mới nhất của Nvidia được công bố lặng lẽ vào thứ Sáu, nhưng ý nghĩa của nó rất to lớn: cấu trúc hỗ trợ bạn xây dựng xung quanh một mô hình AI quan…

Share
Editorial illustration: A complex system of interconnected cables, harnesses, and connectors bundled together, photographed  — MonstarX

Nvidia vừa chứng minh rằng hệ thống hỗ trợ, không phải mô hình AI, mới là nhân vật chính

Đạt 100% điểm trên một trong những bài kiểm tra khắt khe nhất của AI — và mô hình hầu như không xứng đáng nhận công. Nghiên cứu mới nhất của Nvidia được công bố lặng lẽ vào thứ Sáu, nhưng ý nghĩa của nó rất to lớn: cấu trúc hỗ trợ bạn xây dựng xung quanh một mô hình AI quan trọng hơn bản thân mô hình, đặc biệt khi nhiệm vụ phức tạp và chạy dài hạn. Nếu bạn là nhà phát triển hoặc nhà sáng lập ở châu Á vẫn còn lo lắng về việc chọn mô hình nền tảng nào, nghiên cứu này là một thách thức trực tiếp đối với cách suy nghĩ đó.

Điều Gì Đã Xảy Ra

Nvidia công bố nghiên cứu mới cho thấy Claude Opus 5, khi được bao bọc trong một hệ thống hỗ trợ tùy chỉnh, đạt được 100% điểm trên ARC-AGI-3 — một bài kiểm tra lý luận tương tác đã trở thành thước đo có ý nghĩa về khả năng AI đa năng. Mà không có hệ thống hỗ trợ, Opus 5 chỉ đạt 30%, vẫn là kết quả cao nhất trong tất cả các mô hình được kiểm tra. Khoảng cách giữa 30% và 100% không được thu hẹp bằng cách thay thế một mô hình tốt hơn. Nó được thu hẹp bằng cách xây dựng cơ sở hạ tầng tốt hơn xung quanh cùng một mô hình.

Hệ thống hỗ trợ mà Nvidia xây dựng — gọi là AVO — bao gồm hai thành phần quan trọng: một hệ thống quản lý bộ nhớ được thiết kế để xử lý ngữ cảnh chạy dài hạn mà không suy giảm, và một thành phần "giám sát" hoạt động như một người quản lý, giữ cho agent tập trung vào nhiệm vụ và ngăn nó đi vào những vòng lặp lý luận không liên quan. Theo báo cáo của TechCrunch, Adel El Hallak, Phó Chủ tịch Sản phẩm của Nvidia cho đơn vị AI, đã nói rõ ràng: "Đó là mô hình. Đó là cấu trúc xung quanh mô hình, mà chúng tôi gọi là hệ thống hỗ trợ, tức là tập hợp các công cụ mà nó sử dụng. Đó là thời gian chạy và các kỹ năng và thư viện liên quan mà chúng tôi cung cấp cho nó quyền truy cập."

Nghiên cứu tập trung cụ thể vào các nhiệm vụ dài hạn — công việc yêu cầu kết nối nhiều quyết định lại với nhau, đôi khi trong nhiều ngày, để tạo ra kết quả hoàn thành. Điều này hoàn toàn khác với một lần trao đổi prompt-response duy nhất. Để AI thực hiện đáng tin cậy các nhiệm vụ dài hạn mà không trôi dạt là một trong những vấn đề mở khó nhất trong nghiên cứu AI agent. Phát hiện của Nvidia cho thấy câu trả lời không phải là một mô hình thông minh hơn — đó là một hệ thống hỗ trợ thông minh hơn.

Đây là một sự thay đổi có ý nghĩa trong cách ngành công nghiệp nên suy nghĩ về thiết kế hệ thống AI. Mô hình là bộ não. Hệ thống hỗ trợ là hệ thần kinh, kỷ luật và bộ nhớ. Bạn cần cả ba.

Tại Sao Điều Này Quan Trọng Đối Với Châu Á

Hệ sinh thái nhà phát triển và khởi nghiệp của châu Á có mối quan hệ cụ thể với các mô hình nền tảng làm cho nghiên cứu này đặc biệt phù hợp. Trên khắp Đông Nam Á, Ấn Độ, Nhật Bản, Hàn Quốc và Trung Quốc, hầu hết các đội không xây dựng các mô hình nền tảng — họ xây dựng trên đầu chúng. Câu hỏi chiến lược luôn là: chúng ta sử dụng mô hình nào? Nghiên cứu của Nvidia đặt lại câu hỏi đó thành thứ yếu.

Lợi thế cạnh tranh thực sự trong cuộc đua AI của châu Á sẽ không đến từ quyền truy cập độc quyền vào GPT-5 hoặc Claude Opus 6. Nó sẽ đến từ các đội xây dựng các hệ thống hỗ trợ tốt hơn — kiến trúc bộ nhớ tốt hơn, điều phối công cụ tốt hơn, logic giám sát tốt hơn — trên đầu bất kỳ mô hình nào có sẵn cho họ. Đó là một trò chơi mà các nhà phát triển châu Á có thể chiến thắng, vì đó là một vấn đề kỹ thuật và sản phẩm, không phải một vấn đề ngân sách tính toán.

Hãy xem xét thực tế thực tế cho một nhà sáng lập ở Jakarta, Bangalore hoặc Thành phố Hồ Chí Minh xây dựng một sản phẩm quy trình công việc được hỗ trợ bởi AI. Bạn không phải đào tạo mô hình biên giới của riêng mình. Bạn đang gọi một API. Câu hỏi trở thành: bạn xây dựng cái gì xung quanh lệnh gọi API đó? Bạn xử lý ngữ cảnh như thế nào trên một nhiệm vụ kéo dài nhiều ngày? Bạn ngăn chặn agent đi lạc khi nó gặp phải một trạng thái không mong muốn như thế nào? Đây là những vấn đề về hệ thống hỗ trợ, và chúng có thể giải quyết được bằng kỹ thuật mạnh mẽ.

Cũng có một khía cạnh chi phí quan trọng ở châu Á. Các mô hình nhỏ hơn với các hệ thống hỗ trợ xuất sắc có thể vượt trội hơn các mô hình lớn hơn, đắt tiền hơn chạy mà không có một. Đối với các công ty khởi nghiệp hoạt động với ngân sách đám mây hạn chế — đó là hầu hết các công ty khởi nghiệp trong khu vực — đó không chỉ là một cái nhìn sâu sắc về kiến trúc, nó là một chiến lược tài chính. Xây dựng một hệ thống hỗ trợ tuyệt vời, và bạn có thể sử dụng một mô hình gọn gàng hơn. Kết quả điểm chuẩn hỗ trợ điều này một cách thực nghiệm.

Công nghệ châu Á luôn cạnh tranh bằng cách xây dựng các hệ thống thông minh hơn trên các thành phần có sẵn. Nghiên cứu này xác nhận cách tiếp cận đó ở cấp độ kiến trúc của AI.

Điều Này Có Nghĩa Gì Đối Với Các Nhà Phát Triển

Nếu bạn đang xây dựng các hệ thống agent ngày hôm nay, nghiên cứu của Nvidia cung cấp cho bạn một khuôn khổ cụ thể để suy nghĩ về nơi đầu tư nỗ lực kỹ thuật của bạn. Ngừng coi mô hình như một hộp đen hoạt động hoặc không hoạt động. Bắt đầu coi hệ thống hỗ trợ là bề mặt kỹ thuật chính.

Dưới đây là những gì một hệ thống hỗ trợ cấp sản xuất cần xử lý, dựa trên các phát hiện của Nvidia:

  • Quản lý bộ nhớ: Các nhiệm vụ dài hạn tích lũy ngữ cảnh nhanh chóng. Nếu không có kiến trúc bộ nhớ rõ ràng — quyết định những gì cần giữ, những gì cần nén, những gì cần loại bỏ — ngữ cảnh hiệu quả của mô hình suy giảm theo thời gian, và hiệu suất sụp đổ. Đây không phải là vấn đề về mô hình. Đó là một vấn đề về hệ thống.
  • Logic giám sát: Hệ thống hỗ trợ của Nvidia bao gồm một thành phần giám sát theo dõi tiến trình của agent và can thiệp khi nó trôi dạt. Hãy coi đây là một meta-agent nhẹ có công việc duy nhất là giữ cho agent chính trung thực. Triển khai điều này không yêu cầu một mô hình biên giới thứ hai — một mô hình nhỏ hơn, rẻ hơn có thể đóng vai trò giám sát một cách hiệu quả.
  • Điều phối công cụ: Những công cụ nào agent có thể gọi, theo thứ tự nào, với logic xử lý lỗi nào — đây là lãnh địa của hệ thống hỗ trợ. Điều phối công cụ được thiết kế kém là một trong những chế độ lỗi phổ biến nhất trong các triển khai agent sản xuất.
  • Vòng lặp phản hồi: Hệ thống hỗ trợ cần phản hồi kết quả cho mô hình theo một cách có cấu trúc, không chỉ đổ kết quả thô. Cách bạn định dạng phản hồi đó ảnh hưởng đáng kể đến quyết định tiếp theo của mô hình.

Thực tế, điều này có nghĩa là bài kiểm tra kiến trúc của bạn không nên bắt đầu bằng "mô hình nào?" Nó nên bắt đầu bằng "hệ thống hỗ trợ của chúng ta xử lý bộ nhớ, giám sát, lệnh gọi công cụ và phản hồi như thế nào?" Trả lời tốt bốn câu hỏi đó, và lựa chọn mô hình của bạn trở thành một tối ưu hóa thứ yếu.

Đối với các đội xây dựng trên MonstarX, điều này ánh xạ trực tiếp đến cách nền tảng được thiết kế — mô hình cơ bản là một lớp, nhưng các trình kết nối, logic điều phối và môi trường thời gian chạy xung quanh nó là nơi sự khác biệt thực sự tồn tại. Nghiên cứu của Nvidia về cơ bản là một xác nhận của triết lý nền tảng trên mô hình mà phát triển AI-native nghiêm túc đã chuyển hướng trong 18 tháng qua.

Một điểm khởi đầu thực tế: kiểm toán các triển khai agent hiện tại của bạn và xác định nơi ngữ cảnh bị mất trên các bước. Đó hầu như luôn là chế độ lỗi đầu tiên trong các nhiệm vụ dài hạn, và nó hoàn toàn là một vấn đề về hệ thống hỗ trợ. Sửa lớp bộ nhớ trước khi bạn xem xét nâng cấp mô hình.

Những Điểm Chính

Nghiên cứu AVO của Nvidia là một lập luận rõ ràng, dựa trên thực nghiệm cho một cái gì đó mà các kỹ sư AI có kinh nghiệm đã nghi ngờ trong một thời gian: hệ thống hỗ trợ là sản phẩm. Mô hình là cơ sở hạ tầng. Dưới đây là những gì cần mang theo:

  • Lựa chọn mô hình là một điểm khởi đầu, không phải một chiến lược. Claude Opus 5 đi từ 30% đến 100% trên ARC-AGI-3 với cùng các trọng số và một hệ thống hỗ trợ tốt hơn. Sự khác biệt giữa các mô hình là thực tế, nhưng sự khác biệt giữa các hệ thống hỗ trợ lớn hơn cho công việc dài hạn.
  • Kiến trúc bộ nhớ là bắt buộc đối với các hệ thống agent. Nếu agent của bạn đang chạy các nhiệm vụ kéo dài hơn vài phút hoặc hơn một số lệnh gọi công cụ, bạn cần một lớp quản lý bộ nhớ rõ ràng. Đây không phải là tùy chọn.