Vercel के CEO Guillermo Rauch: मॉडल्स को एजेंट्स से अलग करने की लड़ाई
छह मिलियन डिप्लॉयमेंट्स प्रतिदिन। आधे कोडिंग एजेंट्स द्वारा ट्रिगर किए जाते हैं। Vercel के इंफ्रास्ट्रक्चर के माध्यम से हर 24 घंटे में 1 ट्रिलियन टोकन्स प्रवाहित होते हैं। Guillermo Rauch का तर्क: मॉडल्स और एजेंट्स को अलग किया जाना चाहिए।
Vercel के CEO Guillermo Rauch: मॉडल्स को एजेंट्स से अलग करने की लड़ाई
प्रतिदिन 60 लाख डिप्लॉयमेंट्स। इनमें से आधे कोडिंग एजेंट्स द्वारा ट्रिगर किए जाते हैं। Vercel के इंफ्रास्ट्रक्चर के माध्यम से हर 24 घंटे में 1 ट्रिलियन टोकन्स प्रवाहित होते हैं। जब Guillermo Rauch प्रोडक्शन में AI के बारे में बात करते हैं, तो वे सिद्धांत नहीं दे रहे — वे लाइव टेलीमेट्री से पढ़ रहे हैं। Vercel के ShipNYC कॉन्फ्रेंस के बाद एक हाल के TechCrunch इंटरव्यू में, Rauch ने एक तीक्ष्ण तर्क प्रस्तुत किया जो AI इंफ्रास्ट्रक्चर के भविष्य के मूल को छूता है: मॉडल्स और एजेंट्स को अलग किया जाना चाहिए, और जो डेवलपर्स इसे पहले समझ लेंगे वे ऐसे सिस्टम्स बनाएंगे जो वास्तव में प्रोडक्शन में टिके रहेंगे।
यह बातचीत Vercel के अपने रोडमैप से कहीं आगे तक महत्वपूर्ण है। एशिया भर के डेवलपर्स के लिए — तेजी से शिप करना, लागतों पर नजर रखना, और तेजी से AI-नेटिव प्रोडक्ट्स बनाना जो Silicon Valley की तुलना में अलग गति से काम करने वाले बाजारों के लिए हैं — Rauch का दृष्टिकोण एजेंट आर्किटेक्चर के बारे में सोचने के लिए एक व्यावहारिक लेंस प्रदान करता है।
क्या हुआ
Vercel के CEO Guillermo Rauch द्वारा मॉडल्स को एजेंट्स से अलग करने की लड़ाई केवल एक आकर्षक शीर्षक नहीं है। यह एक वास्तविक आर्किटेक्चरल तनाव का वर्णन करता है जो Rauch कहते हैं कि तब स्पष्ट हो गया जब Vercel प्रोटोटाइपिंग चरण से आगे बढ़ा और अपने संगठन के अंदर एजेंट्स को बड़े पैमाने पर चलाने लगा।
TechCrunch इंटरव्यू के अनुसार, पिछले साल प्रोटोटाइपिंग के बारे में था — "एजेंट्स को मुक्त करो, सभी बना सकते हैं।" Vercel ने पूरी कंपनी में सैकड़ों एजेंट्स को जैविक रूप से तैनात किया और तेजी से सीखा। कठिन सबक तब आए जब वे एजेंट्स प्रोडक्शन में पहुंचे। Rauch की केंद्रीय अंतर्दृष्टि: जब आप प्रोडक्शन के लिए अनुकूल करते हैं, तो आप तुरंत कीमत-से-प्रदर्शन को देखने लगते हैं। यह एक सवाल उठाता है जो अधिकांश टीमें प्रोटोटाइप चरण के दौरान छोड़ देती हैं — क्या मॉडल और एजेंट लॉजिक को वास्तव में एक साथ बंडल किया जाना चाहिए?
उन्हें अलग करने का तर्क सीधा है। एक एजेंट एक लूप है: यह संदर्भ को समझता है, एक कार्रवाई पर निर्णय लेता है, इसे निष्पादित करता है, और दोहराता है। मॉडल केवल उस लूप के अंदर तर्क घटक है। जब वे कसकर जुड़े होते हैं — जब आपका एजेंट अनिवार्य रूप से एक विशिष्ट मॉडल के API के चारों ओर एक रैपर होता है — आप परिदृश्य बदलने के साथ मॉडल्स को स्वैप करने की क्षमता खो देते हैं, कार्य प्रकार के अनुसार लागतों को अनुकूलित करते हैं, या सरल उप-कार्यों के लिए सस्ते, तेजी से मॉडल्स तक पहुंचते हैं बिना अपने एजेंट लॉजिक को फिर से लिखे।
Vercel का AI गेटवे, जो अब प्रतिदिन 1 ट्रिलियन से अधिक टोकन्स को प्रोसेस करता है, आंशिक रूप से इस समस्या का उत्तर है। यह एजेंट्स और मॉडल्स के बीच बैठता है, मॉडल लेयर को एब्सट्रैक्ट करता है ताकि एजेंट लॉजिक पोर्टेबल रहे। Rauch की स्थिति यह है कि Vercel जैसी प्लेटफॉर्म कंपनियां अब प्रमुख लैब्स के साथ सीधे तनाव में हैं, बिल्कुल क्योंकि लैब्स के पास मॉडल्स और एजेंट्स को बंडल रखने के लिए एक संरचनात्मक प्रोत्साहन है — लॉक-इन टोकन राजस्व के लिए अच्छा है। प्लेटफॉर्म कंपनियों के पास विपरीत प्रोत्साहन है: पोर्टेबिलिटी और कम्पोजेबिलिटी डेवलपर्स को प्लेटफॉर्म पर रखती है चाहे कोई भी मॉडल अगले बेंचमार्क चक्र को जीते।
यह एक वास्तविक महत्वपूर्ण संरचनात्मक लड़ाई है, और यह इंफ्रास्ट्रक्चर निर्णयों में खेल रही है जो डेवलपर्स अभी बना रहे हैं।
एशिया के लिए यह क्यों महत्वपूर्ण है
एशिया के AI डेवलपर इकोसिस्टम का इस मॉडल-बनाम-एजेंट तनाव के साथ एक विशिष्ट संबंध है जो पश्चिमी टिप्पणी अक्सर मिस करती है। दक्षिण पूर्व एशिया, दक्षिण कोरिया, जापान, और भारत के डेवलपर्स विशेष रूप से OpenAI या Anthropic पर निर्माण नहीं कर रहे हैं। यहां मॉडल परिदृश्य वास्तव में बहुवादी है — Alibaba की Qwen श्रृंखला, DeepSeek, Baidu का ERNIE, और क्षेत्रीय भाषाओं के लिए ट्यून किए गए ओपन-वेट मॉडल्स की बढ़ती स्टैक सभी प्रोडक्शन वर्कलोड्स के लिए प्रतिस्पर्धा करते हैं। यह एक कमजोरी नहीं है। यह वास्तव में एक संरचनात्मक लाभ है यदि आपकी एजेंट आर्किटेक्चर दिन एक से मॉडल पोर्टेबिलिटी के लिए बनाई गई है।
लागत संवेदनशीलता एक अन्य कारक है। Jakarta या Ho Chi Minh City में एक स्टार्टअप जो एक AI-नेटिव प्रोडक्ट बना रहा है वह San Francisco में एक Series B कंपनी के समान मार्जिन मान्यताओं के साथ काम नहीं कर रहा है। जब Rauch "कीमत/प्रदर्शन" के बारे में बात करते हैं जैसा कि प्रोडक्शन में प्रमुख चिंता है, यह एशिया में अलग तरीके से गूंजता है — यह एक अच्छा-होना अनुकूलन नहीं है, यह अक्सर एक व्यवहार्य व्यवसाय और एक ऐसे व्यवसाय के बीच का अंतर है जो प्रोडक्ट-मार्केट फिट खोजने से पहले अनुमान लागतों पर जल जाता है।
लेटेंसी आयाम भी है। एजेंट कॉल्स को एक US-आधारित मॉडल एंडपॉइंट के माध्यम से रूट करना एशिया में अंतिम उपयोगकर्ताओं के लिए वास्तविक लेटेंसी पेश करता है। एक आर्किटेक्चर जो एजेंट ऑर्केस्ट्रेशन को मॉडल चयन से स्पष्ट रूप से अलग करता है, क्षेत्रीय रूप से तैनात मॉडल्स तक रूट करना बहुत आसान बनाता है — चाहे वह Alibaba Cloud पर एक Qwen डिप्लॉयमेंट हो, एक स्थानीय प्रदाता पर एक DeepSeek एंडपॉइंट, या आपके अपने इंफ्रास्ट्रक्चर पर चलने वाला एक ओपन-वेट मॉडल। Rauch का ढांचा, एशियाई संदर्भ में लागू किया गया, केवल लागत के बारे में नहीं है — यह ऐसे सिस्टम्स बनाने के बारे में है जो वास्तव में उन उपयोगकर्ताओं के लिए अच्छी तरह से काम करते हैं जिन्हें आप सेवा दे रहे हैं।
MonstarX पर निर्माण करने वाले संस्थापकों के लिए, एशिया का AI-नेटिव dev प्लेटफॉर्म, यह आर्किटेक्चरल सिद्धांत सीधे इस बात पर मैप करता है कि आप आज अपनी एजेंट स्टैक के बारे में कैसे सोचना चाहिए। जो टीमें अपने एजेंट लॉजिक में मॉडल निर्भरताओं को हार्ड-कोड करती हैं वे तकनीकी ऋण जमा कर रही हैं जो तब दर्दनाक होगा जब एक बेहतर, सस्ता, या तेजी से मॉडल उपलब्ध हो जाता है — और एशिया के मॉडल परिदृश्य में, यह अधिकांश लोगों की अपेक्षा से कम चक्र पर होता है।
डेवलपर्स के लिए इसका क्या मतलब है
Rauch के तर्क का व्यावहारिक निहितार्थ यह है कि एजेंट आर्किटेक्चर किसी भी अन्य वितरित सिस्टम के समान डिजाइन अनुशासन के योग्य है। यहां इसके बारे में ठोस तरीके से सोचना है।
मॉडल्स को इंफ्रास्ट्रक्चर के रूप में मानें, पहचान के रूप में नहीं। आपके एजेंट की कीमत इसके ऑर्केस्ट्रेशन लॉजिक, इसके मेमोरी प्रबंधन, इसके टूल उपयोग, और कार्यों को विघटित करने की इसकी क्षमता में है। इनमें से कोई भी यह से उलझा नहीं होना चाहिए कि आप कौन सा मॉडल कॉल कर रहे हैं। अपने एजेंट लूप और अपनी मॉडल कॉल्स के बीच एक स्वच्छ इंटरफेस परिभाषित करें — भले ही आप आज केवल एक मॉडल का उपयोग कर रहे हों।
इसका एक न्यूनतम संस्करण एक एकल फ़ंक्शन के पीछे अपनी मॉडल कॉल्स को एब्सट्रैक्ट करने जैसा दिखता है:
async function callModel(prompt, options = {}) {
const { model = process.env.DEFAULT_MODEL, temperature = 0.2 } = options;
return await modelGateway.complete({ prompt, model, temperature });
}वह एकल एब्सट्रेक्शन लेयर मतलब GPT-4o से Qwen-Max से DeepSeek-V3 में स्वैप करना एक कॉन्फिग परिवर्तन है, एक रीफैक्टर नहीं। यह स्पष्ट लगता है, लेकिन अधिकांश एजेंट कोडबेस जो अभी लिखे जा रहे हैं वह ऐसा नहीं करते — वे सीधे OpenAI SDK को कॉल करते हैं, हर जगह, मॉडल नाम हार्डकोड के साथ।
शुरुआत से ही मल्टी-मॉडल रूटिंग के लिए डिजाइन करें। आपके एजेंट में हर उप-कार्य को एक ही मॉडल की आवश्यकता नहीं है। एक दस्तावेज सारांश चरण एक छोटे, तेजी से मॉडल पर सस्ते में चल सकता है। एक जटिल तर्क चरण को एक सीमांत मॉडल की आवश्यकता हो सकती है। यदि आपका एजेंट लॉजिक मॉडल लेयर से अलग है, तो आप कार्य प्रकार द्वारा रूट कर सकते हैं बिना कुछ भी फिर से लिखे। यह वह जगह है जहां Vercel की AI गेटवे प्ले समझ में आता है — यह बिल्कुल इस तरह की रूटिंग के लिए इंफ्रास्ट्रक्चर है।
एजेंट चरण के अनुसार टोकन लागतों की निगरानी करें, केवल सत्र के अनुसार नहीं। जब आप मॉडल्स को एजेंट्स से अलग करते हैं, तो आप पहले से अवलोकनशीलता प्राप्त करते हैं जो आपके पास नहीं था। आप देख सकते हैं कि आपके एजेंट लूप में कौन से चरण सबसे अधिक टोकन्स का उपभोग कर रहे हैं, कौन सी मॉडल कॉल्स उनकी लागत के सापेक्ष कम गुणवत्ता के आउटपुट लौटा रहे हैं, और जहां आप अंतिम परिणाम को खराब किए बिना एक सस्ता मॉडल प्रतिस्थापित कर सकते हैं। यह "कीमत/प्रदर्शन" अनुकूलन है जो Rauch वर्णन कर रहे हैं — यह केवल तभी संभव हो जाता है जब आर्किटेक्चरल अलगाव मौजूद हो।
विफलता मोड्स के बारे में अलग तरीके से सोचें। एक कसकर जुड़ी मॉडल-एजेंट प्रणाली पूरी तरह विफल हो जाती है जब मॉडल API नीचे चला जाता है या आपको दर-सीमित करता है। एक अलग प्रणाली एक वैकल्पिक मॉडल में वापस जा सकती है, सुंदर तरीके से खराब हो सकती है, या कार्य को कतार में रख सकती है। प्रोडक्शन सिस्टम्स के लिए जो वास्तविक