英伟达证明了:AI模型的外壳,而非模型本身,才是真正的英雄

英伟达的最新研究表明,围绕AI模型构建的框架比模型本身更重要。通过自定义外壳,Claude Opus 5在ARC-AGI-3基准上的成绩从30%跃升至100%,证明了对于长期复杂任务,系统架构的力量超越了模型本身。

Share
Editorial illustration: A complex system of interconnected cables, harnesses, and connectors bundled together, photographed  — MonstarX

英伟达证明了:AI模型的外壳,而非模型本身,才是真正的英雄

在AI最严苛的基准测试之一上获得100%的成绩——但模型本身几乎不值得这份荣誉。英伟达最新的研究在周五悄然发布,但其影响力巨大:你围绕AI模型构建的框架比模型本身更重要,尤其是当任务复杂且长期运行时。如果你是亚洲的开发者或创始人,仍在纠结选择哪个基础模型,这项研究直接挑战了这种思维方式。

发生了什么

英伟达发表了新研究,表明Claude Opus 5在自定义外壳的包装下,在ARC-AGI-3上获得了100%的成绩——这是一个交互式推理基准,已成为衡量通用AI能力的重要指标。没有外壳的情况下,Opus 5的得分是30%,在所有测试的模型中仍然是最高的。从30%到100%的差距不是通过更换更好的模型来弥补的,而是通过在同一模型周围构建更好的基础设施来实现的。

英伟达构建的外壳——称为AVO——包含两个关键组件:一个内存管理系统,设计用于处理长期运行的上下文而不会性能下降;以及一个"监督者"组件,就像一个老板一样,让智能体保持在正轨上,防止它陷入无关的推理循环。根据TechCrunch的报道,英伟达AI部门产品副总裁Adel El Hallak直言不讳地说:"这是模型。这是模型周围的框架,我们称之为外壳,即它使用的工具集。这是运行时以及我们给予它访问权限的相关技能和库。"

该研究特别关注长期任务——需要将许多决策串联在一起的工作,有时跨越数天才能产生完整输出。这与单个提示-响应交换从根本上不同。让AI能够可靠地执行长期任务而不偏离是智能体AI研究中最困难的开放问题之一。英伟达的发现表明,答案不是更聪明的模型——而是更聪明的外壳。

这是业界应该如何思考AI系统设计的一个有意义的转变。模型是大脑。外壳是神经系统、纪律和记忆。你需要这三者。

为什么这对亚洲很重要

亚洲的开发者和初创生态系统与基础模型有着特殊的关系,这使得这项研究特别相关。在东南亚、印度、日本、韩国和中国,大多数团队都不是在构建基础模型——他们是在其基础上构建。战略问题始终是:我们使用哪个模型?英伟达的研究将这个问题重新定义为次要的。

亚洲AI竞赛中真正的竞争优势不会来自对GPT-5或Claude Opus 6的独占访问权。它将来自那些在任何可用模型之上构建更好外壳的团队——更好的内存架构、更好的工具编排、更好的监督逻辑。这是亚洲开发者可以赢的游戏,因为这是一个工程和产品问题,而不是计算预算问题。

考虑一下在雅加达、班加罗尔或胡志明市构建AI驱动工作流产品的创始人的实际情况。你不是在训练自己的前沿模型。你在调用API。问题变成了:你在那个API调用周围构建什么?你如何处理跨越多天任务的上下文?当智能体遇到意外状态时,你如何防止它偏离轨道?这些是外壳问题,可以通过强大的工程来解决。

还有一个成本维度在亚洲尤其重要。具有出色外壳的较小模型可以超越没有外壳的较大、更昂贵的模型。对于在受限云预算上运营的初创公司——这是该地区大多数初创公司——这不仅是一个架构洞察,而是一个财务策略。构建一个伟大的外壳,你就能负担得起使用更精简的模型。基准测试结果从经验上支持了这一点。

亚洲科技一直通过在现有组件上构建更聪明的系统来竞争。这项研究在AI的架构层面验证了这种方法。

这对开发者意味着什么

如果你今天正在构建智能体系统,英伟达的研究为你提供了一个具体的框架来思考在哪里投入工程努力。停止将模型视为一个要么有效要么无效的黑盒。开始将外壳视为主要的工程表面。

根据英伟达的发现,生产级外壳需要处理以下内容:

  • 内存管理:长期任务会快速积累上下文。没有显式的内存架构——决定保留什么、压缩什么、丢弃什么——模型的有效上下文会随时间退化,性能会崩溃。这不是模型问题。这是系统问题。
  • 监督逻辑:英伟达的外壳包含一个监督组件,用于监控智能体的进度,并在其偏离时进行干预。将其视为一个轻量级元智能体,其唯一工作是保持主要智能体的诚实。实现这一点不需要第二个前沿模型——一个更小、更便宜的模型可以有效地扮演监督角色。
  • 工具编排:智能体可以调用哪些工具、按什么顺序、使用什么错误处理逻辑——这是外壳领域。设计不良的工具编排是生产智能体部署中最常见的失败模式之一。
  • 反馈循环:外壳需要以结构化方式将结果反馈给模型,而不仅仅是转储原始输出。你如何格式化该反馈会显著影响模型的下一个决策。

实际上,这意味着你的架构审查不应该从"选择哪个模型?"开始。它应该从"我们的外壳如何处理内存、监督、工具调用和反馈?"开始。很好地回答这四个问题,你的模型选择就成了次要的优化。

对于在MonstarX上构建的团队,这直接映射到平台的设计方式——底层模型是一个层,但围绕它的连接器、编排逻辑和运行时环境是真正的差异所在。英伟达的研究本质上是对过去18个月来严肃的AI原生开发一直在向前推进的平台优于模型哲学的验证。

一个实际的起点:审计你当前的智能体实现,并确定在各个步骤中上下文在哪里丢失。这几乎总是长期任务中的第一个失败模式,完全是一个外壳问题。在考虑升级模型之前,先修复内存层。

关键要点

英伟达的AVO研究是一个清晰的、有经验基础的论证,说明了一些经验丰富的AI工程师已经怀疑的事情:外壳就是产品。模型是基础设施。以下是要点:

  • 模型选择是起点,不是策略。Claude Opus 5在ARC-AGI-3上从30%跃升到100%,使用相同的权重和更好的外壳。模型之间的差异是真实的,但对于长期工作,外壳之间的差异更大。
  • 内存架构对于智能体系统是不可协商的。如果你的智能体正在运行跨越超过几分钟或超过少数工具调用的任务,你需要一个显式的内存管理层。这是