Vercel CEO 기예르모 라우흐가 말하는 모델과 에이전트 분리의 중요성

하루에 600만 건의 배포. 그 중 절반은 코딩 에이전트가 트리거합니다. Vercel CEO 기예르모 라우흐는 모델과 에이전트를 분리해야 한다고 주장합니다. 아시아 개발자들에게 이것이 의미하는 바를 살펴봅시다.

Share
Editorial illustration: A chess board mid-game with two distinct pieces separated to opposite sides—one piece isolated on an — MonstarX

Vercel CEO 기예르모 라우흐가 말하는 모델과 에이전트 분리의 중요성

하루에 600만 건의 배포. 그 중 절반은 코딩 에이전트가 트리거합니다. 매 24시간마다 Vercel 인프라를 통해 흐르는 1조 개의 토큰. 기예르모 라우흐가 프로덕션 AI에 대해 이야기할 때, 그는 이론을 펼치는 것이 아니라 실시간 텔레메트리를 읽고 있습니다. Vercel의 ShipNYC 컨퍼런스 이후 최근 TechCrunch 인터뷰에서 라우흐는 AI 인프라가 나아갈 방향의 핵심을 꿰뚫는 명확한 주장을 제시했습니다. 모델과 에이전트는 분리되어야 하며, 이를 먼저 파악하는 개발자들이 실제로 프로덕션에서 생존할 수 있는 시스템을 구축할 것이라는 것입니다.

이 대화는 Vercel의 로드맵을 훨씬 넘어선 의미를 갖습니다. 빠르게 배포하고, 비용을 면밀히 관리하며, 실리콘밸리와는 다른 속도로 움직이는 시장을 위해 AI 네이티브 제품을 만들고 있는 아시아 전역의 개발자들에게, 라우흐의 관점은 지금 당장 에이전트 아키텍처를 생각하는 데 실질적인 렌즈를 제공합니다.

무엇이 일어났는가

Vercel CEO 기예르모 라우흐가 말하는 모델과 에이전트 분리는 단순한 헤드라인이 아닙니다. 이는 Vercel이 프로토타이핑 단계를 넘어 자신의 조직 내에서 에이전트를 규모 있게 운영하기 시작했을 때 명백해진 실제 아키텍처 긴장을 설명합니다.

TechCrunch 인터뷰에 따르면, 지난해는 프로토타이핑의 시대였습니다 — "에이전트를 풀어놓고, 모두가 만들 수 있다"는 식이었습니다. Vercel은 회사 전체에 수백 개의 에이전트를 유기적으로 배포했고 빠르게 배웠습니다. 어려운 교훈은 이 에이전트들이 프로덕션에 진입했을 때 나왔습니다. 라우흐의 핵심 통찰: 프로덕션을 최적화하면 즉시 가격 대비 성능을 살펴보기 시작합니다. 이는 대부분의 팀이 프로토타입 단계에서 건너뛰는 질문을 던집니다 — 모델과 에이전트 로직이 정말 함께 묶여 있어야 할까요?

이들을 분리하는 주장은 간단합니다. 에이전트는 루프입니다: 컨텍스트를 인식하고, 행동을 결정하고, 실행하고, 반복합니다. 모델은 단지 그 루프 내의 추론 구성 요소일 뿐입니다. 이들이 긴밀하게 결합되어 있을 때 — 에이전트가 본질적으로 특정 모델의 API 래퍼일 때 — 환경이 변할 때 모델을 교체하거나, 작업 유형별로 비용을 최적화하거나, 에이전트 로직을 다시 작성하지 않고도 더 저렴하고 빠른 모델로 더 간단한 하위 작업을 라우팅할 수 있는 능력을 잃게 됩니다.

현재 매일 1조 개 이상의 토큰을 처리하는 Vercel의 AI 게이트웨이는 이 문제에 대한 부분적인 답변입니다. 이는 에이전트와 모델 사이에 위치하여 모델 계층을 추상화하므로 에이전트 로직은 이식 가능하게 유지됩니다. 라우흐의 입장은 Vercel 같은 플랫폼 회사들이 이제 주요 AI 랩들과 직접적인 긴장 관계에 있다는 것입니다. 정확히 그 이유는 랩들이 모델과 에이전트를 함께 묶어두려는 구조적 인센티브를 가지고 있기 때문입니다 — 종속성은 토큰 수익에 좋습니다. 플랫폼 회사들은 반대의 인센티브를 가집니다: 이식성과 조합성은 다음 벤치마크 사이클에서 어느 모델이 우승하든 개발자들을 플랫폼에 유지합니다.

이것은 진정으로 중요한 구조적 싸움이며, 개발자들이 지금 당장 내리고 있는 인프라 결정에서 펼쳐지고 있습니다.

아시아에 중요한 이유

아시아의 AI 개발자 생태계는 이 모델 대 에이전트 긴장과의 관계가 서방의 논평에서 종종 놓치는 특정한 특성을 가지고 있습니다. 동남아시아, 한국, 일본, 인도의 개발자들은 OpenAI나 Anthropic에만 배타적으로 구축하지 않습니다. 여기서의 모델 환경은 진정으로 다원적입니다 — Alibaba의 Qwen 시리즈, DeepSeek, Baidu의 ERNIE, 그리고 지역 언어를 위해 미세 조정된 증가하는 오픈 웨이트 모델 스택이 모두 프로덕션 워크로드를 놓고 경쟁합니다. 이것은 약점이 아닙니다. 실제로 에이전트 아키텍처가 처음부터 모델 이식성을 위해 구축되었다면 구조적 이점입니다.

비용 민감성은 또 다른 요소입니다. 자카르타나 호찌민시에서 AI 네이티브 제품을 구축하는 스타트업은 샌프란시스코의 Series B 회사와 같은 마진 가정으로 작업하지 않습니다. 라우흐가 프로덕션에서 "가격/성능"을 지배적인 관심사로 이야기할 때, 이것은 아시아에서 다르게 울려 퍼집니다 — 이것은 좋은 최적화가 아니라, 종종 실행 가능한 비즈니스와 추론 비용으로 소진되기 전에 제품-시장 적합을 찾는 비즈니스 사이의 차이입니다.

또한 지연 시간 차원도 있습니다. 에이전트 호출을 미국 기반 모델 엔드포인트를 통해 라우팅하면 아시아의 최종 사용자에게 실제 지연을 도입합니다. 에이전트 오케스트레이션을 모델 선택에서 깔끔하게 분리하는 아키텍처는 지역적으로 배포된 모델로 라우팅하기 훨씬 쉽게 만듭니다 — Alibaba Cloud의 Qwen 배포, 로컬 제공자의 DeepSeek 엔드포인트, 또는 자신의 인프라에서 실행되는 오픈 웨이트 모델이든 상관없이 말입니다. 라우흐의 프레임워크는 아시아 맥락에 적용되면, 단지 비용에 관한 것이 아닙니다 — 이것은 당신이 제공하는 사용자들을 위해 실제로 잘 작동하는 시스템을 구축하는 것에 관한 것입니다.

MonstarX에서 구축하는 창업자들을 위해, 아시아의 AI 네이티브 개발 플랫폼인 이 아키텍처 원칙은 오늘 에이전트 스택을 어떻게 생각해야 하는지에 직접 매핑됩니다. 에이전트 로직에 모델 종속성을 하드코딩하는 팀들은 더 좋고, 더 저렴하거나, 더 빠른 모델이 사용 가능해질 때 풀기 고통스러울 기술 부채를 축적하고 있습니다 — 아시아의 모델 환경에서는 대부분의 사람들이 예상하는 것보다 더 짧은 사이클로 이런 일이 발생합니다.

개발자에게 의미하는 바

라우흐의 주장의 실질적 함의는 에이전트 아키텍처가 다른 분산 시스템과 동일한 설계 규율을 받을 자격이 있다는 것입니다. 구체적으로 이를 생각하는 방법은 다음과 같습니다.

모델을 정체성이 아닌 인프라로 취급하세요. 에이전트의 가치는 오케스트레이션 로직, 메모리 관리, 도구 사용, 그리고 작업을 분해하는 능력에 있습니다. 이 중 어느 것도 어느 모델을 호출하는지와 얽혀 있어서는 안 됩니다. 에이전트 루프와 모델 호출 사이에 깔끔한 인터페이스를 정의하세요 — 오늘 하나의 모델만 사용하고 있더라도 말입니다.

이것의 최소 버전은 모델 호출을 단일 함수 뒤에 추상화하는 것처럼 보입니다:

async function callModel(prompt, options = {}) {
  const { model = process.env.DEFAULT_MODEL, temperature = 0.2 } = options;
  return await modelGateway.complete({ prompt, model, temperature });
}

그 단일 추상화 계층은 GPT-4o에서 Qwen-Max로, DeepSeek-V3로 전환하는 것이 리팩터가 아닌 설정 변경이라는 의미입니다. 명백해 보이지만, 지금 작성되고 있는 대부분의 에이전트 코드베이스는 이를 하지 않습니다 — 그들은 OpenAI SDK를 직접 호출하고, 어디서나, 모델 이름이 하드코딩되어 있습니다.

처음부터 다중 모델 라우팅을 위해 설계하세요. 에이전트의 모든 하위 작업이 같은 모델을 필요로 하지는 않습니다. 문서 요약 단계는 더 작고 빠른 모델에서 저렴하게 실행될 수 있습니다. 복잡한 추론 단계는 최첨단 모델이 필요할 수 있습니다. 에이전트 로직이 모델 계층에서 분리되어 있으면, 아무것도 다시 작성하지 않고도 작업 유형별로 라우팅할 수 있습니다. 이것이 Vercel의 AI 게이트웨이 플레이가 의미 있는 이유입니다 — 이것은 정확히 이런 종류의 규모 있는 라우팅을 위한 인프라입니다.

세션별이 아닌 에이전트 단계별 토큰 비용을 모니터링하세요. 모델을 에이전트에서 분리하면, 이전에 없던 관찰성을 얻습니다. 에이전트 루프의 어느 단계가 가장 많은 토큰을 소비하는지, 어느 모델 호출이 비용 대비 낮은 품질의 출력을 반환하는지, 그리고 최종 결과를 저하시키지 않고 더 저렴한 모델로 대체할 수 있는 곳을 볼 수 있습니다. 이것이 라우흐가 설명하는 "가격/성능" 최적화입니다 — 이것은 아키텍처 분리가 존재할 때만 가능해집니다.

실패 모드를 다르게 생각하세요. 긴밀하게 결합된 모델-에이전트 시스템은 모델 API가 다운되거나 속도 제한을 받을 때 완전히 실패합니다. 분리된 시스템은 대체 모델로 폴백하거나, 우아하게 저하되거나, 작업을 큐에 넣을 수 있습니다. 아시아에서 실제 사용자를 제공하는 프로덕션 시스템의 경우