Nvidiaが証明した:AIモデルではなく、ハーネスが本当のヒーローである
AI最高難度ベンチマークの1つで100%スコアを達成 — しかしモデルはほぼ評価に値しない。Nvidiaの最新研究は金曜日に静かに発表されたが、その含意は大きい:AIモデルの周りに構築するスキャフォルディングは、モデル自体よりも重要であり、特にタスクが複雑で長時間実行される場合はそうだ。
Nvidiaが証明した:AIモデルではなく、ハーネスが本当のヒーローである
AI最高難度ベンチマークの1つで100%スコアを達成 — しかしモデルはほぼ評価に値しない。Nvidiaの最新研究は金曜日に静かに発表されたが、その含意は大きい:AIモデルの周りに構築するスキャフォルディングは、モデル自体よりも重要であり、特にタスクが複雑で長時間実行される場合はそうだ。アジアの開発者やファウンダーでまだどのファウンデーションモデルを選ぶかに執着している人は、この研究はその直感への直接的な挑戦となる。
何が起きたのか
Nvidiaが発表した新しい研究によると、カスタムビルドのハーネスでラップされたClaude Opus 5は、ARC-AGI-3で100%スコアを達成した — 汎用AI能力の意味のある測定基準となったインタラクティブ推論ベンチマークだ。ハーネスなしでは、Opus 5は30%のスコアを獲得したが、これはテストされたすべてのモデルの中で最高の結果だった。30%から100%へのギャップは、より優れたモデルに交換することで埋められたのではない。同じモデルの周りにより優れたインフラストラクチャを構築することで埋められたのだ。
Nvidiaが構築したハーネス — AVOと呼ばれる — には2つの重要なコンポーネントが含まれている:長時間実行されるコンテキストを処理するように設計されたメモリ管理システムと、ボスのように機能し、エージェントをタスクに集中させ、無関係な推論ループに迷い込むのを防ぐ「スーパーバイザー」コンポーネントだ。TechCrunchの報道によると、NvidiaのAIユニット製品担当VP、Adel El Hallakは率直に述べている:「それはモデルだ。モデルの周りのスキャフォルディング、つまりハーネスと呼ぶもの、すなわちそれが利用するツールのセットだ。ランタイムと、それがアクセスできるようにする関連スキルとライブラリだ。」
この研究は特に長期タスクに焦点を当てている — 完成した出力を生成するために、時には数日にわたって多くの決定を連鎖させる必要がある作業だ。これは単一のプロンプト応答交換とは根本的に異なる。AIが漂流することなく長期タスクを確実に実行させることは、エージェンティックAI研究における最も難しいオープン問題の1つだ。Nvidiaの発見は、答えがより賢いモデルではなく、より賢いハーネスであることを示唆している。
これはAIシステム設計について業界がどのように考えるべきかについての意味のあるシフトだ。モデルは脳だ。ハーネスは神経系、規律、そしてメモリだ。3つすべてが必要だ。
アジアにとって重要な理由
アジアの開発者とスタートアップエコシステムは、ファウンデーションモデルとの特定の関係を持っており、この研究を特に関連性のあるものにしている。東南アジア、インド、日本、韓国、中国全体で、ほとんどのチームはファウンデーションモデルを構築していない — それらの上に構築している。戦略的な質問は常に:どのモデルを使うのか?だった。Nvidiaの研究はその質問を二次的なものとして再構成する。
アジアのAIレースにおける本当の競争優位性は、GPT-5やClaude Opus 6への独占的アクセスから来るのではない。より優れたハーネス — より優れたメモリアーキテクチャ、より優れたツールオーケストレーション、より優れたスーパーバイザーロジック — を、利用可能なモデルの上に構築するチームから来るのだ。それはアジアの開発者が勝つことができるゲームだ。なぜなら、それはコンピュート予算の問題ではなく、エンジニアリングと製品の問題だからだ。
ジャカルタ、バンガロール、またはホーチミンシティでAI駆動ワークフロー製品を構築しているファウンダーの実際的な現実を考えてみよう。あなたは独自のフロンティアモデルを訓練していない。APIを呼び出している。質問は次のようになる:そのAPI呼び出しの周りに何を構築するのか?複数日のタスク全体でコンテキストをどのように処理するのか?予期しない状態に遭遇したときにエージェントがオフトラックになるのをどのように防ぐのか?これらはハーネスの問題であり、強力なエンジニアリングで解決可能だ。
アジアで特に重要なコスト面もある。優れたハーネスを備えた小さいモデルは、ハーネスなしで実行されている大きく、より高価なモデルを上回ることができる。制約されたクラウド予算で運営されているスタートアップ — これは地域のほとんどのスタートアップだ — にとって、それは単なるアーキテクチャの洞察ではなく、財務戦略だ。優れたハーネスを構築すれば、より軽いモデルを使う余裕ができる。ベンチマーク結果はこれを経験的に裏付けている。
アジアテックは常に利用可能なコンポーネント上でより賢いシステムを構築することで競争してきた。この研究はAIのアーキテクチャレベルでそのアプローチを検証する。
開発者にとって何を意味するのか
今日エージェンティックシステムを構築している場合、Nvidiaの研究はエンジニアリング努力をどこに投資するかについて考えるための具体的なフレームワークを提供する。モデルをブラックボックスとして扱うのをやめよう。ハーネスを主要なエンジニアリング表面として扱い始めよう。
Nvidiaの発見に基づいて、本番グレードのハーネスが処理する必要があるものは次の通りだ:
- メモリ管理:長期タスクはコンテキストを急速に蓄積する。明示的なメモリアーキテクチャ — 何を保持し、何を圧縮し、何を破棄するかを決定する — がなければ、モデルの有効コンテキストは時間とともに低下し、パフォーマンスは崩壊する。これはモデルの問題ではない。システムの問題だ。
- スーパーバイザーロジック:Nvidiaのハーネスには、エージェントの進捗を監視し、漂流時に介入するスーパーバイザーコンポーネントが含まれている。これを、プライマリエージェントを正直に保つことだけが仕事の軽量なメタエージェントと考えよう。これを実装するには、2番目のフロンティアモデルは必要ない — より小さく、より安いモデルがスーパーバイザーの役割を効果的に果たすことができる。
- ツールオーケストレーション:エージェントが呼び出すことができるツール、その順序、どのようなエラーハンドリングロジック — これはハーネスの領域だ。不十分に設計されたツールオーケストレーションは、本番エージェントデプロイメントにおける最も一般的な障害モードの1つだ。
- フィードバックループ:ハーネスは結果をモデルに構造化された方法でフィードバックする必要があり、単に生の出力をダンプするだけではない。そのフィードバックをフォーマットする方法は、モデルの次の決定に大きく影響する。
実際には、これはアーキテクチャレビューが「どのモデル?」で始まるべきではなく、「ハーネスはメモリ、スーパーバイザー、ツール呼び出し、フィードバックをどのように処理するのか?」で始まるべきであることを意味する。これら4つの質問にうまく答えれば、モデルの選択は二次的な最適化になる。
MonstarX上に構築しているチームにとって、これはプラットフォームの設計方法に直接マップされる — 基盤となるモデルは1つのレイヤーだが、その周りのコネクタ、オーケストレーションロジック、ランタイム環境が本当の差別化が存在する場所だ。Nvidiaの研究は本質的に、過去18ヶ月間、真摯なAIネイティブ開発が向かっているプラットフォーム・オーバー・モデルの哲学の検証だ。
実際の出発点の1つ:現在のエージェント実装を監査し、ステップ全体でコンテキストが失われている場所を特定する。それはほぼ常に長期タスクにおける最初の障害モードであり、それは完全にハーネスの問題だ。モデルのアップグレードを検討する前にメモリレイヤーを修正しよう。
主要なポイント
Nvidiaの AVO研究は、経験豊富なAIエンジニアが一時的に疑っていたことについての明確で経験的に根拠のある議論だ:ハーネスが製品だ。モデルはインフラストラクチャだ。前に進めるべきことは次の通りだ:
- モデルの選択は戦略ではなく出発点だ。Claude Opus 5は、同じ重みとより優れたハーネスでARC-AGI-3で30%から100%に上昇した。モデル間のデルタは実数だが、長期作業のためのハーネス間のデルタはより大きい。
- メモリアーキテクチャはエージェンティックシステムにおいて交渉の余地がない。エージェントが数分以上またはツール呼び出しの数個以上にわたるタスクを実行している場合、明示的なメモリ管理レイヤーが必要だ。