엔비디아가 증명한 것: AI 모델이 아닌 하네스가 진정한 주인공

AI의 가장 까다로운 벤치마크 중 하나에서 100% 점수를 기록했지만, 모델이 그 공로를 받을 자격은 거의 없다. 엔비디아의 최신 연구는 금요일 조용히 공개되었지만, 그 의미는 크다: AI 모델 주위에 구축하는 기반 구조가 모델 자체보다 더 중요하다.

Share
Editorial illustration: A complex system of interconnected cables, harnesses, and connectors bundled together, photographed  — MonstarX

엔비디아가 증명한 것: AI 모델이 아닌 하네스가 진정한 주인공

AI의 가장 까다로운 벤치마크 중 하나에서 100% 점수를 기록했지만, 모델이 그 공로를 받을 자격은 거의 없다. 엔비디아의 최신 연구는 금요일 조용히 공개되었지만, 그 의미는 크다: AI 모델 주위에 구축하는 기반 구조가 모델 자체보다 더 중요하다. 특히 복잡하고 장시간 실행되는 작업의 경우 더욱 그렇다. 아시아의 개발자나 창업자로서 어떤 기초 모델을 선택할지 고민하고 있다면, 이 연구는 그러한 직관에 대한 직접적인 도전이다.

무엇이 일어났는가

엔비디아는 Claude Opus 5가 맞춤형 하네스로 감싸졌을 때 ARC-AGI-3에서 100% 점수를 달성했다는 새로운 연구를 발표했다. ARC-AGI-3는 범용 AI 능력의 의미 있는 척도가 된 대화형 추론 벤치마크다. 하네스 없이 Opus 5는 30%를 기록했으며, 이는 테스트된 모든 모델 중 여전히 가장 높은 결과였다. 30%에서 100%로의 격차는 더 나은 모델로 교체하여 좁혀지지 않았다. 같은 모델 주위에 더 나은 인프라를 구축하여 좁혀졌다.

엔비디아가 구축한 하네스(AVO라고 불림)는 두 가지 핵심 구성 요소를 포함한다: 성능 저하 없이 장시간 실행되는 컨텍스트를 처리하도록 설계된 메모리 관리 시스템, 그리고 보스처럼 작동하여 에이전트를 작업에 집중시키고 무관한 추론 루프로 빠져나가는 것을 방지하는 "감독자" 구성 요소다. TechCrunch의 보도에 따르면, 엔비디아 AI 부문 제품 담당 VP인 Adel El Hallak은 이렇게 명확히 말했다: "모델이 있고, 모델 주위의 기반 구조(우리가 하네스라고 부르는 것), 즉 모델이 활용하는 도구 세트가 있다. 그리고 런타임과 우리가 접근 권한을 제공하는 관련 기술과 라이브러리가 있다."

이 연구는 특히 장기 지평 작업에 초점을 맞춘다. 이는 완성된 결과물을 생성하기 위해 때로는 며칠에 걸쳐 많은 의사결정을 연결해야 하는 작업이다. 이는 단일 프롬프트-응답 교환과 근본적으로 다르다. AI가 표류하지 않고 장기 지평 작업을 안정적으로 실행하도록 하는 것은 에이전트 AI 연구에서 가장 어려운 미해결 문제 중 하나다. 엔비디아의 발견은 답이 더 똑똑한 모델이 아니라 더 똑똑한 하네스라는 것을 시사한다.

이는 업계가 AI 시스템 설계에 대해 생각하는 방식의 의미 있는 변화다. 모델은 뇌다. 하네스는 신경계, 규율, 그리고 메모리다. 셋 다 필요하다.

아시아에 중요한 이유

아시아의 개발자 및 스타트업 생태계는 기초 모델과의 특정한 관계를 가지고 있으며, 이는 이 연구를 특히 관련성 있게 만든다. 동남아시아, 인도, 일본, 한국, 중국 전역에서 대부분의 팀은 기초 모델을 구축하지 않고 그 위에 구축하고 있다. 전략적 질문은 항상 이것이었다: 어떤 모델을 사용할 것인가? 엔비디아의 연구는 그 질문을 2차적인 것으로 재구성한다.

아시아의 AI 경쟁에서 진정한 경쟁 우위는 GPT-5나 Claude Opus 6에 대한 독점적 접근에서 나오지 않을 것이다. 더 나은 하네스를 구축하는 팀에서 나올 것이다. 더 나은 메모리 아키텍처, 더 나은 도구 오케스트레이션, 더 나은 감독자 로직을 사용하여 사용 가능한 모든 모델 위에 구축하는 팀에서 말이다. 이는 아시아 개발자가 이길 수 있는 게임이다. 왜냐하면 이는 컴퓨팅 예산 문제가 아니라 엔지니어링 및 제품 문제이기 때문이다.

자카르타, 방갈로르, 또는 호찌민시에서 AI 기반 워크플로우 제품을 구축하는 창업자의 실제 상황을 생각해보자. 당신은 자신의 프론티어 모델을 훈련하지 않고 있다. API를 호출하고 있다. 질문은 다음과 같이 된다: 그 API 호출 주위에 무엇을 구축할 것인가? 다중 일 작업 전체에서 컨텍스트를 어떻게 처리할 것인가? 예상치 못한 상태에 도달했을 때 에이전트가 궤도를 벗어나는 것을 어떻게 방지할 것인가? 이것들은 하네스 문제이며, 강력한 엔지니어링으로 해결 가능하다.

아시아에서 특히 중요한 비용 차원도 있다. 우수한 하네스를 갖춘 더 작은 모델은 하네스 없이 실행되는 더 크고 비싼 모델을 능가할 수 있다. 제한된 클라우드 예산으로 운영하는 스타트업의 경우(지역의 대부분의 스타트업) 이는 단순한 아키텍처 통찰이 아니라 재무 전략이다. 훌륭한 하네스를 구축하고 더 가벼운 모델을 사용할 여유를 가져라. 벤치마크 결과가 이를 경험적으로 뒷받침한다.

아시아 기술은 항상 사용 가능한 구성 요소로 더 똑똑한 시스템을 구축하여 경쟁해왔다. 이 연구는 AI의 아키텍처 수준에서 그 접근 방식을 검증한다.

개발자에게 의미하는 것

오늘날 에이전트 시스템을 구축하고 있다면, 엔비디아의 연구는 엔지니어링 노력을 어디에 투자할지 생각하는 구체적인 프레임워크를 제공한다. 모델을 작동하거나 작동하지 않는 블랙박스로 취급하는 것을 멈춰라. 하네스를 주요 엔지니어링 표면으로 취급하기 시작하자.

엔비디아의 발견에 따르면, 프로덕션 등급 하네스가 처리해야 할 사항은 다음과 같다:

  • 메모리 관리: 장기 지평 작업은 컨텍스트를 빠르게 축적한다. 명시적 메모리 아키텍처(무엇을 유지할지, 무엇을 압축할지, 무엇을 버릴지 결정)가 없으면 모델의 효과적인 컨텍스트는 시간이 지남에 따라 저하되고 성능이 붕괴된다. 이는 모델 문제가 아니다. 시스템 문제다.
  • 감독자 로직: 엔비디아의 하네스는 에이전트의 진행 상황을 모니터링하고 표류할 때 개입하는 감독자 구성 요소를 포함한다. 이를 유일한 역할이 주요 에이전트를 정직하게 유지하는 것인 경량 메타 에이전트로 생각하자. 이를 구현하려면 두 번째 프론티어 모델이 필요하지 않다. 더 작고 저렴한 모델이 감독자 역할을 효과적으로 수행할 수 있다.
  • 도구 오케스트레이션: 에이전트가 호출할 수 있는 도구, 호출 순서, 오류 처리 로직 - 이것은 하네스 영역이다. 설계가 잘못된 도구 오케스트레이션은 프로덕션 에이전트 배포에서 가장 흔한 실패 모드 중 하나다.
  • 피드백 루프: 하네스는 결과를 모델에 구조화된 방식으로 피드백해야 하며, 단순히 원본 출력을 덤프하지 않아야 한다. 그 피드백을 포맷하는 방식은 모델의 다음 의사결정에 크게 영향을 미친다.

실제로, 이는 아키텍처 검토가 "어떤 모델?"로 시작하지 않아야 함을 의미한다. "우리의 하네스는 메모리, 감독, 도구 호출, 피드백을 어떻게 처리하는가?"로 시작해야 한다. 이 네 가지 질문에 잘 답하면, 모델 선택은 2차 최적화가 된다.

MonstarX에서 구축하는 팀의 경우, 이는 플랫폼이 설계된 방식에 직접 매핑된다. 기본 모델은 한 계층이지만, 그 주위의 커넥터, 오케스트레이션 로직, 런타임 환경이 진정한 차별화가 이루어지는 곳이다. 엔비디아의 연구는 본질적으로 지난 18개월 동안 진지한 AI 네이티브 개발이 향해온 플랫폼 우선 철학의 검증이다.

한 가지 실용적인 시작점: 현재 에이전트 구현을 감사하고 단계 전체에서 컨텍스트가 손실되는 위치를 파악하자. 이는 거의 항상 장기 지평 작업의 첫 번째 실패 모드이며, 완전히 하네스 문제다. 모델 업그레이드를 고려하기 전에 메모리 계층을 수정하자.

핵심 요점

엔비디아의 AVO 연구는 경험 많은 AI 엔지니어들이 한동안 의심해온 것에 대한 명확하고 경험적으로 근거한 주장이다: 하네스가 제품이다. 모델은 인프라다. 다음은 기억해야 할 사항이다:

  • 모델 선택은 전략이 아니라 시작점이다. Claude Opus 5는 같은 가중치와 더 나은 하네스로 ARC-AGI-3에서 30%에서 100%로 올라갔다. 모델 간의 차이는 실제이지만, 장기 지평 작업의 경우 하네스 간의 차이가 더 크다.
  • 메모리 아키텍처는 에이전트 시스템에 필수 불가결하다. 에이전트가 몇 분 이상 또는 몇 개 이상의 도구 호출을 실행하는 작업을 실행하는 경우, 명시적 메모리 관리 계층이 필요하다.