Nvidia baru tunjukkan bahawa rangka kerja, bukan model AI, adalah hero sebenarnya
Skor 100% pada salah satu penanda aras AI yang paling menghukum — dan model itu hampir tidak layak mendapat kredit. Penyelidikan terbaru Nvidia menunjukkan bahawa perancah yang anda bina di sekitar model AI lebih penting daripada model itu sendiri, terutamanya untuk tugas yang…
Nvidia baru tunjukkan bahawa rangka kerja, bukan model AI, adalah hero sebenarnya
Skor 100% pada salah satu penanda aras AI yang paling menghukum — dan model itu hampir tidak layak mendapat kredit. Penyelidikan terbaru Nvidia diluncurkan dengan senyap pada hari Jumaat, tetapi implikasinya jelas: perancah yang anda bina di sekitar model AI lebih penting daripada model itu sendiri, terutamanya apabila tugasnya kompleks dan berjangka panjang. Jika anda seorang pembangun atau pengasas di Asia yang masih terobsesi dengan model asas mana yang perlu dipilih, penyelidikan ini adalah cabaran langsung terhadap naluri itu.
Apa Yang Berlaku
Nvidia menerbitkan penyelidikan baru menunjukkan bahawa Claude Opus 5, apabila dibungkus dalam rangka kerja tersuai, mencapai skor 100% pada ARC-AGI-3 — penanda aras penaakulan interaktif yang telah menjadi ukuran bermakna bagi keupayaan AI tujuan umum. Tanpa rangka kerja, Opus 5 mendapat skor 30%, yang masih merupakan hasil tertinggi di antara semua model yang diuji. Jurang antara 30% dan 100% tidak ditutup dengan menukar model yang lebih baik. Ia ditutup dengan membina infrastruktur yang lebih baik di sekitar model yang sama.
Rangka kerja yang dibina Nvidia — dipanggil AVO — termasuk dua komponen kritikal: sistem pengurusan memori yang dirancang untuk mengendalikan konteks jangka panjang tanpa kemerosotan, dan komponen "penyelia" yang bertindak seperti bos, memastikan ejen tetap fokus pada tugas dan mencegahnya daripada tersesat ke dalam gelung penaakulan yang tidak relevan. Menurut laporan TechCrunch, Adel El Hallak, Naib Presiden Nvidia untuk produk unit AInya, menyatakannya dengan jelas: "Ia adalah model. Ia adalah perancah di sekitar model, yang kami panggil rangka kerja, iaitu set alat yang digunakannya. Ia adalah runtime dan kemahiran serta perpustakaan yang berkaitan yang kami berikan akses kepadanya."
Penyelidikan ini memberi tumpuan khusus kepada tugas jangka panjang — kerja yang memerlukan menggabungkan banyak keputusan bersama-sama, kadangkala selama berhari-hari, untuk menghasilkan output yang lengkap. Ini pada asasnya berbeza daripada pertukaran prompt-respons tunggal. Mendapatkan AI untuk melaksanakan tugas jangka panjang dengan andal tanpa hanyut adalah salah satu masalah terbuka paling sukar dalam penyelidikan AI agentic. Penemuan Nvidia mencadangkan jawapannya bukan model yang lebih pintar — ia adalah rangka kerja yang lebih pintar.
Ini adalah perubahan bermakna dalam cara industri harus berfikir tentang reka bentuk sistem AI. Model adalah otak. Rangka kerja adalah sistem saraf, disiplin, dan memori. Anda memerlukan ketiga-tiganya.
Mengapa Ia Penting untuk Asia
Ekosistem pembangun dan permulaan Asia mempunyai hubungan khusus dengan model asas yang menjadikan penyelidikan ini sangat relevan. Di seluruh Asia Tenggara, India, Jepun, Korea Selatan, dan China, kebanyakan pasukan tidak membina model asas — mereka membina di atasnya. Soalan strategik sentiasa: model mana yang kami gunakan? Penyelidikan Nvidia mengubah soalan itu menjadi sekunder.
Kelebihan kompetitif sebenar dalam perlumbaan AI Asia tidak akan datang daripada akses eksklusif kepada GPT-5 atau Claude Opus 6. Ia akan datang daripada pasukan yang membina rangka kerja yang lebih baik — seni bina memori yang lebih baik, orkestrasi alat yang lebih baik, logik penyelia yang lebih baik — di atas model apa pun yang tersedia untuk mereka. Itu adalah permainan yang boleh dimenangkan oleh pembangun Asia, kerana ia adalah masalah kejuruteraan dan produk, bukan masalah belanjawan pengiraan.
Pertimbangkan realiti praktikal bagi pengasas di Jakarta, Bangalore, atau Ho Chi Minh City yang membina produk aliran kerja berkuasa AI. Anda tidak melatih model sempadan anda sendiri. Anda memanggil API. Soalannya menjadi: apa yang anda bina di sekitar panggilan API itu? Bagaimana anda mengendalikan konteks merentas tugas berbilang hari? Bagaimana anda mencegah ejen daripada terkeluar dari jejak apabila ia menghadapi keadaan yang tidak dijangka? Ini adalah masalah rangka kerja, dan ia boleh diselesaikan dengan kejuruteraan yang kuat.
Ada juga dimensi kos yang penting di Asia. Model yang lebih kecil dengan rangka kerja yang cemerlang boleh mengatasi model yang lebih besar dan lebih mahal yang berjalan tanpanya. Bagi syarikat permulaan yang beroperasi dengan belanjawan awan yang terhad — yang merupakan kebanyakan syarikat permulaan di rantau ini — itu bukan hanya pandangan seni bina, ia adalah strategi kewangan. Bina rangka kerja yang hebat, dan anda boleh mampu menggunakan model yang lebih ramping. Hasil penanda aras menyokong ini secara empirikal.
Teknologi Asia sentiasa bersaing dengan membina sistem yang lebih pintar pada komponen yang tersedia. Penyelidikan ini mengesahkan pendekatan itu pada tahap seni bina AI.
Apa Maksudnya untuk Pembangun
Jika anda membina sistem agentic hari ini, penyelidikan Nvidia memberi anda rangka kerja konkrit untuk berfikir tentang tempat untuk melabur usaha kejuruteraan anda. Berhenti menganggap model sebagai kotak hitam yang sama ada berfungsi atau tidak. Mulai menganggap rangka kerja sebagai permukaan kejuruteraan utama.
Inilah yang perlu ditangani oleh rangka kerja gred pengeluaran, berdasarkan penemuan Nvidia:
- Pengurusan memori: Tugas jangka panjang mengumpul konteks dengan cepat. Tanpa seni bina memori yang jelas — memutuskan apa yang perlu disimpan, apa yang perlu dimampatkan, apa yang perlu dibuang — konteks berkesan model merosot dari semasa ke semasa, dan prestasi runtuh. Ini bukan masalah model. Ia adalah masalah sistem.
- Logik penyelia: Rangka kerja Nvidia termasuk komponen penyelia yang memantau kemajuan ejen dan campur tangan apabila ia hanyut. Fikirkan ini sebagai meta-ejen ringan yang satu-satunya tugasnya adalah memastikan ejen utama jujur. Melaksanakan ini tidak memerlukan model sempadan kedua — model yang lebih kecil dan lebih murah boleh memainkan peranan penyelia dengan berkesan.
- Orkestrasi alat: Alat mana yang boleh dipanggil oleh ejen, dalam urutan apa, dengan logik pengendalian ralat apa — ini adalah wilayah rangka kerja. Orkestrasi alat yang dirancang dengan buruk adalah salah satu mod kegagalan paling biasa dalam penempatan ejen pengeluaran.
- Gelung maklum balas: Rangka kerja perlu memberi maklum balas hasil kepada model dengan cara yang berstruktur, bukan hanya membuang output mentah. Cara anda memformat maklum balas itu membentuk keputusan seterusnya model dengan ketara.
Secara praktikal, ini bermakna semakan seni bina anda tidak boleh bermula dengan "model mana?" Ia harus bermula dengan "bagaimana rangka kerja kami mengendalikan memori, pengawasan, panggilan alat, dan maklum balas?" Jawab empat soalan itu dengan baik, dan pilihan model anda menjadi pengoptimuman sekunder.
Bagi pasukan yang membina di atas MonstarX, ini dipetakan terus ke cara platform dirancang — model asas adalah satu lapisan, tetapi penyambung, logik orkestrasi, dan persekitaran runtime di sekelilingnya adalah tempat pembezaan sebenar berada. Penyelidikan Nvidia pada asasnya adalah pengesahan falsafah platform-atas-model yang telah bergerak ke arah pembangunan AI-asli yang serius selama 18 bulan yang lalu.
Satu titik permulaan praktikal: audit pelaksanaan ejen semasa anda dan kenal pasti tempat konteks hilang merentas langkah. Itu hampir selalu mod kegagalan pertama dalam tugas jangka panjang, dan ia sepenuhnya masalah rangka kerja. Baiki lapisan memori sebelum anda mempertimbangkan untuk menaik taraf model.
Pengambilan Utama
Penyelidikan AVO Nvidia adalah hujah yang bersih dan berasaskan empirikal untuk sesuatu yang telah disyaki oleh jurutera AI berpengalaman untuk seketika: rangka kerja adalah produk. Model adalah infrastruktur. Inilah yang perlu dibawa ke hadapan:
- Pilihan model adalah titik permulaan, bukan strategi. Claude Opus 5 pergi dari 30% kepada 100% pada ARC-AGI-3 dengan berat yang sama dan rangka kerja yang lebih baik. Delta antara model adalah nyata, tetapi delta antara rangka kerja lebih besar untuk kerja jangka panjang.
- Seni bina memori adalah wajib untuk sistem agentic. Jika ejen anda menjalankan tugas yang menjangkau lebih daripada beberapa minit atau lebih daripada segelintir panggilan alat, anda memerlukan lapisan pengurusan memori yang jelas. Ini adalah