ভার্সেল সিইও গিয়েরমো রাউচ: মডেল এবং এজেন্টকে আলাদা করার লড়াই

প্রতিদিন ছয় মিলিয়ন ডিপ্লয়মেন্ট। তার অর্ধেক কোডিং এজেন্ট দ্বারা ট্রিগার করা। প্রতি ২৪ ঘণ্টায় ভার্সেলের অবকাঠামোর মধ্য দিয়ে এক ট্রিলিয়ন টোকেন প্রবাহিত হচ্ছে। গিয়েরমো রাউচ ভার্সেলের সিইও হিসাবে প্রোডাকশনে এআই সম্পর্কে একটি তীক্ষ্ণ যুক্তি উপস্থাপন করেছেন: মডেল এবং…

Editorial illustration: A chess board mid-game with two distinct pieces separated to opposite sides—one piece isolated on an — MonstarX

ভার্সেল সিইও গিয়েরমো রাউচ: মডেল এবং এজেন্টকে আলাদা করার লড়াই

প্রতিদিন ছয় মিলিয়ন ডিপ্লয়মেন্ট। তার অর্ধেক কোডিং এজেন্ট দ্বারা ট্রিগার করা। প্রতি ২৪ ঘণ্টায় ভার্সেলের অবকাঠামোর মধ্য দিয়ে এক ট্রিলিয়ন টোকেন প্রবাহিত হচ্ছে। যখন গিয়েরমো রাউচ প্রোডাকশনে এআই সম্পর্কে কথা বলতে বসেন, তিনি তত্ত্ব দিচ্ছেন না — তিনি লাইভ টেলিমেট্রি থেকে পড়ছেন। ভার্সেলের ShipNYC কনফারেন্সের পরে সম্প্রতি TechCrunch সাক্ষাৎকারে, রাউচ একটি তীক্ষ্ণ যুক্তি উপস্থাপন করেছেন যা এআই অবকাঠামো কোথায় যাচ্ছে তার মূলে পৌঁছায়: মডেল এবং এজেন্টগুলিকে আলাদা করতে হবে, এবং যে ডেভেলপাররা এটি প্রথমে বুঝতে পারবে তারা এমন সিস্টেম তৈরি করবে যা প্রকৃতপক্ষে প্রোডাকশনে টিকে থাকবে।

এই কথোপকথন ভার্সেলের নিজস্ব রোডম্যাপের বাইরে অনেক বেশি গুরুত্বপূর্ণ। এশিয়া জুড়ে ডেভেলপারদের জন্য — দ্রুত শিপিং করা, খরচ ঘনিষ্ঠভাবে পর্যবেক্ষণ করা, এবং ক্রমবর্ধমানভাবে সিলিকন ভ্যালির চেয়ে ভিন্ন গতিতে চলে এমন বাজারের জন্য এআই-নেটিভ পণ্য তৈরি করা — রাউচের ফ্রেমওয়ার্ক এখনই এজেন্ট আর্কিটেকচার সম্পর্কে চিন্তা করার জন্য একটি ব্যবহারিক লেন্স অফার করে।

কী ঘটেছে

ভার্সেল সিইও গিয়েরমো রাউচ: মডেল এবং এজেন্টকে আলাদা করার লড়াই শুধুমাত্র একটি আকর্ষণীয় শিরোনাম নয়। এটি একটি বাস্তব স্থাপত্য উত্তেজনা বর্ণনা করে যা রাউচ বলেছেন যখন ভার্সেল প্রোটোটাইপিং পর্যায় অতিক্রম করে এবং তার নিজস্ব সংস্থার মধ্যে স্কেলে এজেন্ট চালাতে শুরু করেছিল তখন স্পষ্ট হয়ে উঠেছিল।

TechCrunch সাক্ষাৎকার অনুযায়ী, গত বছর প্রোটোটাইপিং সম্পর্কে ছিল — "এজেন্টগুলি মুক্ত করুন, সবাই তৈরি করতে পারে।" ভার্সেল জৈবিকভাবে সংস্থা জুড়ে শত শত এজেন্ট স্থাপন করেছিল এবং দ্রুত শিখেছিল। কঠিন পাঠগুলি এসেছিল যখন সেই এজেন্টগুলি প্রোডাকশনে পৌঁছেছিল। রাউচের কেন্দ্রীয় অন্তর্দৃষ্টি: যখন আপনি প্রোডাকশনের জন্য অপ্টিমাইজ করেন, আপনি অবিলম্বে মূল্য-থেকে-কর্মক্ষমতা দেখতে শুরু করেন। এটি একটি প্রশ্ন জোর করে যা বেশিরভাগ দল প্রোটোটাইপ পর্যায়ে এড়িয়ে যায় — মডেল এবং এজেন্ট লজিক সত্যিই একসাথে বান্ডেল করা উচিত?

তাদের বিভক্ত করার যুক্তি সরল। একটি এজেন্ট একটি লুপ: এটি প্রসঙ্গ উপলব্ধি করে, একটি পদক্ষেপ সিদ্ধান্ত নেয়, এটি সম্পাদন করে এবং পুনরাবৃত্তি করে। মডেল শুধুমাত্র সেই লুপের মধ্যে যুক্তি উপাদান। যখন তারা দৃঢ়ভাবে যুক্ত থাকে — যখন আপনার এজেন্ট মূলত একটি নির্দিষ্ট মডেলের এপিআইয়ের চারপাশে একটি মোড়ক — আপনি ল্যান্ডস্কেপ পরিবর্তনের সাথে সাথে মডেলগুলি স্যুইচ করার ক্ষমতা হারান, প্রতিটি কাজের ধরনের খরচ অপ্টিমাইজ করুন, বা সহজ সাব-টাস্কগুলির জন্য সস্তা, দ্রুত মডেলগুলিতে রুট করুন আপনার এজেন্ট লজিক পুনর্লিখন ছাড়াই।

ভার্সেলের এআই গেটওয়ে, যা এখন প্রতিদিন ১ ট্রিলিয়নেরও বেশি টোকেন প্রক্রিয়া করে, এই সমস্যার আংশিক উত্তর। এটি এজেন্ট এবং মডেলের মধ্যে বসে, মডেল লেয়ারকে বিমূর্ত করে যাতে এজেন্ট লজিক পোর্টেবল থাকে। রাউচের অবস্থান হল যে ভার্সেলের মতো প্ল্যাটফর্ম কোম্পানিগুলি এখন প্রধান ল্যাবগুলির সাথে সরাসরি উত্তেজনায় রয়েছে, ঠিক কারণ ল্যাবগুলির মডেল এবং এজেন্টগুলি বান্ডেল রাখার জন্য একটি কাঠামোগত প্রণোদনা রয়েছে — লক-ইন টোকেন রাজস্বের জন্য ভাল। প্ল্যাটফর্ম কোম্পানিগুলির বিপরীত প্রণোদনা রয়েছে: পোর্টেবিলিটি এবং সংমিশ্রণযোগ্যতা ডেভেলপারদের প্ল্যাটফর্মে রাখে তা নির্বিশেষে কোন মডেল পরবর্তী বেঞ্চমার্ক চক্র জিতবে।

এটি একটি প্রকৃতপক্ষে গুরুত্বপূর্ণ কাঠামোগত লড়াই, এবং এটি অবকাঠামো সিদ্ধান্তে খেলছে যা ডেভেলপাররা এখনই করছে।

এশিয়ার জন্য এটি কেন গুরুত্বপূর্ণ

এশিয়ার এআই ডেভেলপার ইকোসিস্টেমের এই মডেল-বনাম-এজেন্ট উত্তেজনার সাথে একটি নির্দিষ্ট সম্পর্ক রয়েছে যা পশ্চিমা মন্তব্য প্রায়শই মিস করে। দক্ষিণ-পূর্ব এশিয়া, দক্ষিণ কোরিয়া, জাপান এবং ভারতের ডেভেলপাররা একচেটিয়াভাবে OpenAI বা Anthropic-এ তৈরি করছেন না। এখানে মডেল ল্যান্ডস্কেপ সত্যিকারের বহুত্ববাদী — আলিবাবার Qwen সিরিজ, DeepSeek, বাইডুর ERNIE, এবং আঞ্চলিক ভাষার জন্য সূক্ষ্ম-সুর করা ওপেন-ওয়েট মডেলের ক্রমবর্ধমান স্ট্যাক সবই প্রোডাকশন ওয়ার্কলোডের জন্য প্রতিযোগিতা করে। এটি একটি দুর্বলতা নয়। এটি আসলে একটি কাঠামোগত সুবিধা যদি আপনার এজেন্ট আর্কিটেকচার দিন এক থেকে মডেল পোর্টেবিলিটির জন্য তৈরি হয়।

খরচ সংবেদনশীলতা আরেকটি কারণ। জাকার্তা বা হো চি মিন শহরে একটি এআই-নেটিভ পণ্য তৈরি করা একটি স্টার্টআপ সান ফ্রান্সিসকোতে একটি সিরিজ বি কোম্পানির মতো একই মার্জিন অনুমান নিয়ে কাজ করছে না। যখন রাউচ প্রোডাকশনে প্রভাবশালী উদ্বেগ হিসাবে "মূল্য/কর্মক্ষমতা" সম্পর্কে কথা বলেন, এটি এশিয়ায় ভিন্নভাবে অনুরণিত হয় — এটি একটি সুন্দর-থাকা অপ্টিমাইজেশন নয়, এটি প্রায়শই একটি কার্যকর ব্যবসা এবং একটির মধ্যে পার্থক্য যা অনুমান খরচে জ্বলে যায় পণ্য-বাজার ফিট খুঁজে পাওয়ার আগে।

লেটেন্সি মাত্রাও রয়েছে। এজেন্ট কলগুলি একটি ইউএস-ভিত্তিক মডেল এন্ডপয়েন্টের মাধ্যমে রুট করা এশিয়ার শেষ ব্যবহারকারীদের জন্য প্রকৃত লেটেন্সি প্রবর্তন করে। একটি আর্কিটেকচার যা এজেন্ট অর্কেস্ট্রেশনকে মডেল নির্বাচন থেকে পরিষ্কারভাবে আলাদা করে আঞ্চলিকভাবে স্থাপিত মডেলগুলিতে রুট করা অনেক সহজ করে তোলে — তা আলিবাবা ক্লাউডে একটি Qwen স্থাপনা হোক, স্থানীয় প্রদানকারীতে একটি DeepSeek এন্ডপয়েন্ট হোক, বা আপনার নিজের অবকাঠামোতে চলমান একটি ওপেন-ওয়েট মডেল হোক। রাউচের ফ্রেমওয়ার্ক, এশিয়ান প্রসঙ্গে প্রয়োগ করা, শুধুমাত্র খরচ সম্পর্কে নয় — এটি এমন সিস্টেম তৈরি করার বিষয়ে যা আপনি যে ব্যবহারকারীদের সেবা করছেন তাদের জন্য প্রকৃতপক্ষে ভাল কর্মক্ষমতা করে।

MonstarX-এ তৈরি করা প্রতিষ্ঠাতাদের জন্য, এশিয়ার এআই-নেটিভ ডেভ প্ল্যাটফর্ম, এই স্থাপত্য নীতি সরাসরি আপনার এজেন্ট স্ট্যাক সম্পর্কে আজ কীভাবে চিন্তা করা উচিত তার উপর ম্যাপ করে। যে দলগুলি তাদের এজেন্ট লজিকে মডেল নির্ভরতা হার্ড-কোড করছে তারা প্রযুক্তিগত ঋণ জমা করছে যা একটি ভাল, সস্তা বা দ্রুত মডেল উপলব্ধ হয়ে গেলে আনবিন্ড করা ব্যথাদায়ক হবে — এবং এশিয়ার মডেল ল্যান্ডস্কেপে, এটি বেশিরভাগ মানুষ আশা করে তার চেয়ে একটি ছোট চক্রে ঘটে।

ডেভেলপারদের জন্য এর অর্থ কী

রাউচের যুক্তির ব্যবহারিক প্রভাব হল যে এজেন্ট আর্কিটেকচার অন্য কোনো বিতরণ করা সিস্টেমের মতোই ডিজাইন শৃঙ্খলা প্রাপ্য। এখানে এটি কংক্রিটভাবে কীভাবে চিন্তা করতে হয়।

মডেলগুলিকে অবকাঠামো হিসাবে বিবেচনা করুন, পরিচয় নয়। আপনার এজেন্টের মূল্য তার অর্কেস্ট্রেশন লজিক, তার মেমরি ম্যানেজমেন্ট, তার টুল ব্যবহার এবং কাজগুলি বিয়োজন করার ক্ষমতায় রয়েছে। এর কোনটিই কোন মডেল আপনি কল করছেন তার সাথে জড়িত হওয়া উচিত নয়। আপনার এজেন্ট লুপ এবং আপনার মডেল কলের মধ্যে একটি পরিষ্কার ইন্টারফেস সংজ্ঞায়িত করুন — এমনকি যদি আপনি আজ শুধুমাত্র একটি মডেল ব্যবহার করছেন।

এর একটি ন্যূনতম সংস্করণ একটি একক ফাংশনের পিছনে আপনার মডেল কলগুলি বিমূর্ত করার মতো দেখায়:

async function callModel(prompt, options = {}) {
  const { model = process.env.DEFAULT_MODEL, temperature = 0.2 } = options;
  return await modelGateway.complete({ prompt, model, temperature });
}

সেই একক বিমূর্তকরণ স্তর মানে GPT-4o থেকে Qwen-Max থেকে DeepSeek-V3-এ স্যুইচ করা একটি কনফিগ পরিবর্তন, একটি রিফ্যাক্টর নয়। এটি স্পষ্ট মনে হয়, কিন্তু এখনই লেখা এজেন্ট কোডবেসের সংখ্যাগরিষ্ঠ এটি করে না — তারা সরাসরি OpenAI SDK কল করে, সর্বত্র, মডেল নাম হার্ড-কোড করা।

শুরু থেকে মাল্টি-মডেল রুটিংয়ের জন্য ডিজাইন করুন। আপনার এজেন্টের প্রতিটি সাব-টাস্কের একই মডেল প্রয়োজন নেই। একটি ডকুমেন্ট সারসংক্ষেপ পদক্ষেপ একটি ছোট, দ্রুত মডেলে সস্তায় চলতে পারে। একটি জটিল যুক্তি পদক্ষেপ একটি সীমান্ত মডেলের প্রয়োজন হতে পারে। যদি আপনার এজেন্ট লজিক মডেল লেয়ার থেকে আলাদা করা হয়, আপনি কাজের ধরন দ্বারা কিছু পুনর্লিখন ছাড়াই রুট করতে পারেন। এখানে ভার্সেলের এআই গেটওয়ে খেলা অর্থপূর্ণ — এটি স্কেলে ঠিক এই ধরনের রুটিংয়ের জন্য অবকাঠামো।

প্রতিটি এজেন্ট পদক্ষেপে টোকেন খরচ পর্যবেক্ষণ করুন, শুধুমাত্র প্রতিটি সেশন নয়। যখন আপনি মডেলগুলি এজেন্টগুলি থেকে বিভক্ত করেন, আপনি আগে যা ছিল না তার দৃশ্যমানতা অর্জন করেন। আপনি দেখতে পারেন আপনার এজেন্ট লুপের কোন পদক্ষেপগুলি সবচেয়ে বেশি টোকেন ব্যবহার করছে, কোন মডেল কলগুলি তাদের খরচের তুলনায় কম-মানের আউটপুট ফেরত দিচ্ছে, এবং আপনি চূড়ান্ত ফলাফল হ্রাস না করে একটি সস্তা মডেল প্রতিস্থাপন করতে পারেন। এটি "মূল্য/কর্মক্ষমতা" অপ্টিমাইজেশন যা রাউচ বর্ণনা করছেন — এটি শুধুমাত্র সম্ভব হয় একবার স্থাপত্য বিচ্ছেদ বিদ্যমান।

ব্যর্থতার মোড সম্পর্কে ভিন্নভাবে চিন্তা করুন। একটি দৃঢ়ভাবে যুক্ত মডেল-এজেন্ট সিস্টেম সম্পূর্ণভাবে ব্যর্থ হয় যখন মডেল এপিআই নিচে যায় বা আপনাকে হার-সীমা করে। একটি আলাদা করা সিস্টেম একটি বিকল্প মডেলে ফিরে যেতে পারে, সুন্দরভাবে হ্রাস করতে পারে বা কাজটি সারিবদ্ধ করতে পারে। প্রকৃত