Ipinakita ng Nvidia na ang harness, hindi ang AI model, ang tunay na bayani

Isang 100% na marka sa isa sa pinakamahigpit na benchmark ng AI — at ang modelo ay halos hindi karapat-dapat sa parangal. Ang pinakabagong pananaliksik ng Nvidia ay nagpapakita na ang scaffolding sa paligid ng AI model ay mas mahalaga kaysa sa modelo mismo, lalo na para sa mga…

Share
Editorial illustration: A complex system of interconnected cables, harnesses, and connectors bundled together, photographed  — MonstarX

Ipinakita ng Nvidia na ang harness, hindi ang AI model, ang tunay na bayani

Isang 100% na marka sa isa sa pinakamahigpit na benchmark ng AI — at ang model ay halos hindi karapat-dapat sa parangal. Ang pinakabagong pananaliksik ng Nvidia ay naglabas nang tahimik sa isang Biyernes, ngunit ang mga implikasyon nito ay malakas: ang scaffolding na itinayo mo sa paligid ng isang AI model ay mas mahalaga kaysa sa modelo mismo, lalo na kapag ang gawain ay kumplikado at pangmatagalan. Kung ikaw ay isang developer o founder sa Asya na patuloy na nag-aalala kung aling foundation model ang pipiliin, ang pananaliksikong ito ay direktang hamon sa ganitong pag-iisip.

Ano ang Nangyari

Naglabas ang Nvidia ng bagong pananaliksik na nagpapakita na ang Claude Opus 5, kapag nabalot sa isang custom-built na harness, nakamit ang 100% na marka sa ARC-AGI-3 — isang interactive reasoning benchmark na naging makabuluhang sukatan ng general-purpose AI capability. Nang walang harness, ang Opus 5 ay nakakuha ng 30%, na pa rin ang pinakamataas na resulta sa lahat ng mga modelo na sinubukan. Ang agwat sa pagitan ng 30% at 100% ay hindi na-close sa pamamagitan ng pagpalit sa mas magandang modelo. Ito ay na-close sa pamamagitan ng pagbuo ng mas magandang infrastructure sa paligid ng parehong modelo.

Ang harness na itinayo ng Nvidia — tinatawag na AVO — ay may kasamang dalawang kritikal na bahagi: isang memory management system na dinisenyo upang harapin ang long-running context nang walang pagkasira, at isang "supervisor" component na gumaganap na parang boss, pinapanatili ang agent sa gawain at pinipigilan ito mula sa paglalakbay sa mga hindi kaugnay na reasoning loops. Ayon sa ulat ng TechCrunch, si Adel El Hallak, VP ng Nvidia para sa produkto ng AI unit nito, ay malinaw na nagsabi: "Ito ay ang modelo. Ito ay ang scaffolding sa paligid ng modelo, na tinatawag namin na harness, ibig sabihin ang hanay ng mga tool na ginagamit nito. Ito ay ang runtime at ang mga kaugnay na skills at libraries na binibigyan namin ito ng access."

Ang pananaliksik ay nakatuon partikular sa long-horizon tasks — trabaho na nangangailangan ng pagkukulay ng maraming desisyon, minsan sa loob ng ilang araw, upang makabuo ng isang tapos na output. Ito ay fundamentally iba sa isang solong prompt-response exchange. Ang pagpapakita sa AI na maaasahang magsagawa ng long-horizon tasks nang hindi umaalis ay isa sa pinakamahirap na bukas na problema sa agentic AI research. Ang paghahanap ng Nvidia ay nagmumungkahi na ang sagot ay hindi isang mas matalinong modelo — ito ay isang mas matalinong harness.

Ito ay isang makabuluhang pagbabago sa kung paano dapat mag-isip ang industriya tungkol sa AI system design. Ang modelo ay ang utak. Ang harness ay ang nervous system, ang disiplina, at ang memorya. Kailangan mo ng lahat ng tatlo.

Bakit Ito Mahalaga para sa Asya

Ang ecosystem ng developer at startup ng Asya ay may partikular na relasyon sa foundation models na ginagawang partikular na relevant ang pananaliksikong ito. Sa buong Southeast Asia, India, Japan, South Korea, at China, karamihan ng mga team ay hindi nagbubuo ng foundation models — sila ay nagbubuo sa tuktok ng mga ito. Ang estratehikong tanong ay palaging: aling modelo ang gagamitin namin? Ang pananaliksik ng Nvidia ay muling binubuo ang tanong na ito bilang pangalawa.

Ang tunay na competitive advantage sa AI race ng Asya ay hindi magmumula sa eksklusibong access sa GPT-5 o Claude Opus 6. Ito ay magmumula sa mga team na nagbubuo ng mas magandang harnesses — mas magandang memory architectures, mas magandang tool orchestration, mas magandang supervisor logic — sa tuktok ng anumang modelo na available sa kanila. Ito ay isang laro na maaaring manalo ang mga Asian developers, dahil ito ay isang engineering at product problem, hindi isang compute-budget problem.

Isaalang-alang ang praktikal na realidad para sa isang founder sa Jakarta, Bangalore, o Ho Chi Minh City na nagbubuo ng isang AI-powered workflow product. Hindi ka nagsasanay ng iyong sariling frontier model. Ikaw ay tumatawag ng isang API. Ang tanong ay nagiging: ano ang itinayo mo sa paligid ng API call na ito? Paano mo hinahawakan ang context sa isang multi-day task? Paano mo pinipigilan ang agent mula sa pag-off-track kapag tumama ito sa isang hindi inaasahang estado? Ang mga ito ay harness problems, at sila ay nalulutas gamit ang malakas na engineering.

May kasamang cost dimension din na mahalaga sa Asya. Ang mas maliit na mga modelo na may mahusay na harnesses ay maaaring lampasan ang mas malalaking, mas mahal na mga modelo na tumatakbo nang walang isa. Para sa mga startup na gumagana sa limitadong cloud budgets — na karamihan ng mga startup sa rehiyon — ito ay hindi lamang isang architectural insight, ito ay isang financial strategy. Bumuo ng isang mahusay na harness, at maaari mong gamitin ang isang mas lean na modelo. Ang benchmark result ay sumusuporta sa ito nang empirical.

Ang tech ng Asya ay palaging nakipagkompetensya sa pamamagitan ng pagbuo ng mas matalinong mga sistema sa available na mga bahagi. Ang pananaliksikong ito ay nagpapatunay ng diskarte na ito sa architectural level ng AI.

Ano Ang Kahulugan Nito para sa mga Developer

Kung ikaw ay nagbubuo ng agentic systems ngayon, ang pananaliksik ng Nvidia ay nagbibigay sa iyo ng konkretong framework upang mag-isip tungkol sa kung saan mag-invest ng iyong engineering effort. Tumigil sa pagtrato sa modelo bilang isang black box na alinman ay gumagana o hindi. Simulan ang pagtrato sa harness bilang pangunahing engineering surface.

Narito kung ano ang kailangan ng isang production-grade harness na hawakan, batay sa mga paghahanap ng Nvidia:

  • Memory management: Ang long-horizon tasks ay mabilis na naiipon ang context. Nang walang explicit memory architecture — pagpapasya kung ano ang panatilihin, kung ano ang i-compress, kung ano ang itapon — ang epektibong context ng modelo ay bumababa sa paglipas ng panahon, at ang performance ay nagsasagawa. Ito ay hindi isang modelo problem. Ito ay isang systems problem.
  • Supervisor logic: Ang harness ng Nvidia ay may kasamang supervisor component na sumusubaybay sa pag-unlad ng agent at nakikipag-ugnayan kapag ito ay umaalis. Isipin ito bilang isang lightweight meta-agent na ang tanging trabaho ay panatilihing tapat ang pangunahing agent. Ang pagpapatupad nito ay hindi nangangailangan ng isang pangalawang frontier model — isang mas maliit, mas murang modelo ay maaaring epektibong maglaro ng supervisor role.
  • Tool orchestration: Aling mga tool ang maaaring tawagin ng agent, sa anong pagkakasunod-sunod, na may anong error-handling logic — ito ay harness territory. Ang masamang dinisenyo na tool orchestration ay isa sa mga pinaka-common na failure modes sa production agent deployments.
  • Feedback loops: Ang harness ay kailangang ibalik ang mga resulta sa modelo sa isang structured na paraan, hindi lamang itapon ang raw output. Kung paano mo binubuo ang feedback na ito ay malaking impluwensya sa susunod na desisyon ng modelo.

Praktikal, nangangahulugang ang iyong architecture review ay hindi dapat magsimula sa "aling modelo?" Dapat itong magsimula sa "paano hinahawakan ng aming harness ang memory, supervision, tool calls, at feedback?" Sagutin nang mabuti ang apat na tanong na ito, at ang iyong modelo choice ay nagiging isang pangalawang optimization.

Para sa mga team na nagbubuo sa MonstarX, ito ay direktang tumutugma sa kung paano dinisenyo ang platform — ang underlying model ay isang layer, ngunit ang mga connector, orchestration logic, at runtime environment sa paligid nito ay kung saan ang tunay na differentiation ay nabubuhay. Ang pananaliksik ng Nvidia ay mahalagang isang validation ng platform-over-model philosophy na ang seryosong AI-native development ay lumipat sa nakaraang 18 buwan.

Isang praktikal na starting point: suriin ang iyong kasalukuyang agent implementations at tukuyin kung saan ang context ay nawawala sa mga hakbang. Ito ay halos palaging ang unang failure mode sa long-horizon tasks, at ito ay ganap na isang harness problem. Ayusin ang memory layer bago mo isaalang-alang ang pag-upgrade sa modelo.

Mga Pangunahing Takeaway

Ang AVO research ng Nvidia ay isang malinaw, empirically grounded argument para sa isang bagay na ang mga karanasang AI engineers ay nagsuspetsa sa loob ng ilang panahon: ang harness ay ang produkto. Ang modelo ay infrastructure. Narito kung ano ang dadalhin:

  • Ang modelo choice ay isang starting point, hindi isang estratehiya. Ang Claude Opus 5 ay lumipat mula 30% hanggang 100% sa ARC-AGI-3 na may parehong weights at isang mas magandang harness. Ang delta sa pagitan ng mga modelo ay tunay, ngunit ang delta sa pagitan ng mga harnesses ay mas malaki para sa long-horizon work.
  • Ang memory architecture ay non-negotiable para sa agentic systems. Kung ang iyong agent ay tumatakbo sa mga gawain na sumasaklaw ng higit sa ilang minuto o higit sa ilang tool calls, kailangan mo ng isang explicit memory management layer. Ito ay hindi isang nice-to-have — ito ay isang core architectural requirement.