Nvidia প্রমাণ করেছে যে AI মডেল নয়, হার্নেসই এখন আসল নায়ক
AI এর সবচেয়ে কঠিন বেঞ্চমার্কগুলির একটিতে ১০০% স্কোর — এবং মডেলটি সেই সাফল্যের খুব কম কৃতিত্ব পাওয়ার যোগ্য। Nvidia এর সর্বশেষ গবেষণা শুক্রবার নীরবে প্রকাশিত হয়েছিল, কিন্তু এর প্রভাব অত্যন্ত গুরুত্বপূর্ণ: একটি AI মডেলের চারপাশে যে কাঠামো তৈরি করেন তা মডেলটির চেয়ে অনেক বেশি…
Nvidia প্রমাণ করেছে যে AI মডেল নয়, হার্নেসই এখন আসল নায়ক
AI এর সবচেয়ে কঠিন বেঞ্চমার্কগুলির একটিতে ১০০% স্কোর — এবং মডেলটি সেই সাফল্যের খুব কম কৃতিত্ব পাওয়ার যোগ্য। Nvidia এর সর্বশেষ গবেষণা শুক্রবার নীরবে প্রকাশিত হয়েছিল, কিন্তু এর প্রভাব অত্যন্ত গুরুত্বপূর্ণ: একটি AI মডেলের চারপাশে যে কাঠামো তৈরি করেন তা মডেলটির চেয়ে অনেক বেশি গুরুত্বপূর্ণ, বিশেষ করে যখন কাজটি জটিল এবং দীর্ঘমেয়াদী। যদি আপনি এশিয়ার একজন ডেভেলপার বা প্রতিষ্ঠাতা যিনি এখনও কোন ফাউন্ডেশন মডেল বেছে নেবেন তা নিয়ে চিন্তা করছেন, এই গবেষণা সেই প্রবৃত্তির জন্য একটি সরাসরি চ্যালেঞ্জ।
কী ঘটেছে
Nvidia নতুন গবেষণা প্রকাশ করেছে যা দেখায় যে Claude Opus 5, যখন একটি কাস্টম-বিল্ট হার্নেসে মোড়ানো হয়, ARC-AGI-3 এ ১০০% স্কোর অর্জন করেছে — একটি ইন্টারঅ্যাক্টিভ রিজনিং বেঞ্চমার্ক যা সাধারণ-উদ্দেশ্যমূলক AI ক্ষমতার একটি অর্থপূর্ণ পরিমাপ হয়ে উঠেছে। হার্নেস ছাড়াই, Opus 5 ৩০% স্কোর করেছে, যা পরীক্ষা করা সমস্ত মডেলের মধ্যে এখনও সর্বোচ্চ ফলাফল ছিল। ৩০% থেকে ১০০% এর মধ্যে ব্যবধান একটি ভাল মডেলে স্যুইচ করে বন্ধ করা হয়নি। এটি একই মডেলের চারপাশে আরও ভাল অবকাঠামো তৈরি করে বন্ধ করা হয়েছিল।
Nvidia যে হার্নেসটি তৈরি করেছে — AVO নামে পরিচিত — এতে দুটি গুরুত্বপূর্ণ উপাদান রয়েছে: একটি মেমরি ম্যানেজমেন্ট সিস্টেম যা দীর্ঘমেয়াদী প্রসঙ্গ পরিচালনা করার জন্য ডিজাইন করা হয়েছে অবনতি ছাড়াই, এবং একটি "সুপারভাইজর" উপাদান যা একজন বসের মতো কাজ করে, এজেন্টকে কাজে রেখে এবং এটিকে অপ্রাসঙ্গিক রিজনিং লুপে বিচরণ করা থেকে প্রতিরোধ করে। TechCrunch এর রিপোর্টিং অনুযায়ী, Adel El Hallak, Nvidia এর AI ইউনিটের পণ্য VP, এটি স্পষ্টভাবে বলেছেন: "এটি মডেল। এটি মডেলের চারপাশের কাঠামো, যা আমরা হার্নেস বলি, অর্থাৎ এটি যে সরঞ্জামগুলি ব্যবহার করে। এটি রানটাইম এবং সংযুক্ত দক্ষতা এবং লাইব্রেরি যা আমরা এটিকে অ্যাক্সেস দিই।"
গবেষণাটি বিশেষভাবে দীর্ঘ-দিগন্ত কাজগুলিতে ফোকাস করে — এমন কাজ যা অনেক সিদ্ধান্তকে একসাথে স্ট্রিং করার প্রয়োজন, কখনও কখনও দিনের পর দিন, একটি সম্পূর্ণ আউটপুট তৈরি করতে। এটি একটি একক প্রম্পট-প্রতিক্রিয়া বিনিময় থেকে মৌলিকভাবে আলাদা। AI কে দীর্ঘ-দিগন্ত কাজগুলি নির্ভরযোগ্যভাবে সম্পাদন করতে পেতে বিচরণ ছাড়াই এজেন্টিক AI গবেষণায় সবচেয়ে কঠিন খোলা সমস্যাগুলির মধ্যে একটি। Nvidia এর অনুসন্ধান পরামর্শ দেয় যে উত্তরটি একটি স্মার্ট মডেল নয় — এটি একটি স্মার্ট হার্নেস।
এটি AI সিস্টেম ডিজাইন সম্পর্কে শিল্পকে কীভাবে চিন্তা করা উচিত তার একটি অর্থপূর্ণ পরিবর্তন। মডেলটি মস্তিষ্ক। হার্নেসটি স্নায়ুতন্ত্র, শৃঙ্খলা এবং স্মৃতি। আপনার তিনটিই প্রয়োজন।
এশিয়ার জন্য এটি কেন গুরুত্বপূর্ণ
এশিয়ার ডেভেলপার এবং স্টার্টআপ ইকোসিস্টেমের ফাউন্ডেশন মডেলগুলির সাথে একটি নির্দিষ্ট সম্পর্ক রয়েছে যা এই গবেষণাকে বিশেষভাবে প্রাসঙ্গিক করে তোলে। দক্ষিণ-পূর্ব এশিয়া, ভারত, জাপান, দক্ষিণ কোরিয়া এবং চীন জুড়ে, বেশিরভাগ দলগুলি ফাউন্ডেশন মডেল তৈরি করছে না — তারা তাদের উপরে তৈরি করছে। কৌশলগত প্রশ্নটি সর্বদা ছিল: আমরা কোন মডেল ব্যবহার করি? Nvidia এর গবেষণা সেই প্রশ্নটিকে গৌণ হিসাবে পুনর্নির্ধারণ করে।
এশিয়ার AI প্রতিযোগিতায় প্রকৃত প্রতিযোগিতামূলক সুবিধা GPT-5 বা Claude Opus 6 এর একচেটিয়া অ্যাক্সেস থেকে আসতে চলেছে না। এটি এমন দলগুলি থেকে আসতে চলেছে যারা আরও ভাল হার্নেস তৈরি করে — আরও ভাল মেমরি আর্কিটেকচার, আরও ভাল টুল অর্কেস্ট্রেশন, আরও ভাল সুপারভাইজর লজিক — তাদের কাছে উপলব্ধ যেকোনো মডেলের উপরে। এটি একটি গেম যা এশিয়ান ডেভেলপাররা জিততে পারে, কারণ এটি একটি প্রকৃত-বাজেট সমস্যা নয়, এটি একটি ইঞ্জিনিয়ারিং এবং পণ্য সমস্যা।
জাকার্তা, ব্যাঙ্গালোর বা হো চি মিন সিটিতে একটি AI-চালিত ওয়ার্কফ্লো পণ্য তৈরি করছেন এমন একজন প্রতিষ্ঠাতার ব্যবহারিক বাস্তবতা বিবেচনা করুন। আপনি আপনার নিজের সীমান্ত মডেল প্রশিক্ষণ করছেন না। আপনি একটি API কল করছেন। প্রশ্নটি হয়ে ওঠে: আপনি সেই API কলের চারপাশে কী তৈরি করেন? আপনি একটি বহু-দিনের কাজ জুড়ে প্রসঙ্গ কীভাবে পরিচালনা করেন? আপনি এজেন্টকে ট্র্যাক থেকে কীভাবে প্রতিরোধ করেন যখন এটি একটি অপ্রত্যাশিত অবস্থায় পৌঁছায়? এগুলি হার্নেস সমস্যা, এবং সেগুলি শক্তিশালী ইঞ্জিনিয়ারিং দিয়ে সমাধানযোগ্য।
একটি খরচ মাত্রাও রয়েছে যা এশিয়ায় তীব্রভাবে গুরুত্বপূর্ণ। চমৎকার হার্নেস সহ ছোট মডেলগুলি একটি ছাড়াই বৃহত্তর, আরও ব্যয়বহুল মডেলগুলিকে ছাড়িয়ে যেতে পারে। সীমাবদ্ধ ক্লাউড বাজেটে কাজ করা স্টার্টআপগুলির জন্য — যা অঞ্চলের বেশিরভাগ স্টার্টআপ — এটি শুধুমাত্র একটি স্থাপত্য অন্তর্দৃষ্টি নয়, এটি একটি আর্থিক কৌশল। একটি দুর্দান্ত হার্নেস তৈরি করুন, এবং আপনি একটি লীনার মডেল ব্যবহার করতে পারেন। বেঞ্চমার্ক ফলাফল এটি অভিজ্ঞতামূলকভাবে সমর্থন করে।
এশিয়া টেক সর্বদা উপলব্ধ উপাদানগুলিতে স্মার্ট সিস্টেম তৈরি করে প্রতিযোগিতা করেছে। এই গবেষণা AI এর স্থাপত্য স্তরে সেই পদ্ধতিটি যাচাই করে।
ডেভেলপারদের জন্য এর অর্থ কী
যদি আপনি আজ এজেন্টিক সিস্টেম তৈরি করছেন, Nvidia এর গবেষণা আপনাকে আপনার ইঞ্জিনিয়ারিং প্রচেষ্টা কোথায় বিনিয়োগ করতে হবে তা চিন্তা করার জন্য একটি কংক্রিট ফ্রেমওয়ার্ক দেয়। মডেলটিকে একটি ব্ল্যাক বক্স হিসাবে বিবেচনা করা বন্ধ করুন যা কাজ করে বা করে না। হার্নেসটিকে প্রাথমিক ইঞ্জিনিয়ারিং পৃষ্ঠ হিসাবে বিবেচনা করা শুরু করুন।
Nvidia এর অনুসন্ধানের উপর ভিত্তি করে একটি উৎপাদন-গ্রেড হার্নেসকে কী পরিচালনা করতে হবে তা এখানে:
- মেমরি ম্যানেজমেন্ট: দীর্ঘ-দিগন্ত কাজগুলি দ্রুত প্রসঙ্গ জমা করে। স্পষ্ট মেমরি আর্কিটেকচার ছাড়াই — কী রাখতে হবে, কী সংকুচিত করতে হবে, কী বাতিল করতে হবে তা সিদ্ধান্ত নেওয়া — মডেলের কার্যকর প্রসঙ্গ সময়ের সাথে সাথে হ্রাস পায় এবং কর্মক্ষমতা ভেঙে পড়ে। এটি একটি মডেল সমস্যা নয়। এটি একটি সিস্টেম সমস্যা।
- সুপারভাইজর লজিক: Nvidia এর হার্নেসে একটি সুপারভাইজর উপাদান রয়েছে যা এজেন্টের অগ্রগতি পর্যবেক্ষণ করে এবং যখন এটি বিচরণ করে তখন হস্তক্ষেপ করে। এটিকে একটি হালকা মেটা-এজেন্ট হিসাবে চিন্তা করুন যার একমাত্র কাজ হল প্রাথমিক এজেন্টকে সৎ রাখা। এটি বাস্তবায়ন করার জন্য একটি দ্বিতীয় সীমান্ত মডেল প্রয়োজন নেই — একটি ছোট, সস্তার মডেল কার্যকরভাবে সুপারভাইজর ভূমিকা পালন করতে পারে।
- টুল অর্কেস্ট্রেশন: এজেন্ট কোন সরঞ্জামগুলি কল করতে পারে, কী ক্রমে, কী ত্রুটি-পরিচালনা লজিক সহ — এটি হার্নেস অঞ্চল। দুর্বলভাবে ডিজাইন করা টুল অর্কেস্ট্রেশন উৎপাদন এজেন্ট স্থাপনায় সবচেয়ে সাধারণ ব্যর্থতার মোডগুলির মধ্যে একটি।
- প্রতিক্রিয়া লুপ: হার্নেসকে ফলাফলগুলি মডেলে একটি কাঠামোগত উপায়ে ফিড করতে হবে, শুধু কাঁচা আউটপুট ডাম্প করবে না। আপনি সেই প্রতিক্রিয়াটি কীভাবে ফর্ম্যাট করেন তা মডেলের পরবর্তী সিদ্ধান্তকে উল্লেখযোগ্যভাবে আকার দেয়।
ব্যবহারিকভাবে, এর অর্থ আপনার স্থাপত্য পর্যালোচনা "কোন মডেল?" দিয়ে শুরু করা উচিত নয়। এটি "আমাদের হার্নেস মেমরি, তদারকি, টুল কল এবং প্রতিক্রিয়া কীভাবে পরিচালনা করে?" দিয়ে শুরু করা উচিত। সেই চারটি প্রশ্নের উত্তর ভালভাবে দিন, এবং আপনার মডেল পছন্দ একটি গৌণ অপ্টিমাইজেশন হয়ে ওঠে।
MonstarX এ তৈরি করা দলগুলির জন্য, এটি সরাসরি প্ল্যাটফর্মটি কীভাবে ডিজাইন করা হয়েছে তার সাথে ম্যাপ করে — অন্তর্নিহিত মডেলটি একটি স্তর, কিন্তু এর চারপাশের সংযোগকারী, অর্কেস্ট্রেশন লজিক এবং রানটাইম পরিবেশ যেখানে প্রকৃত পার্থক্য বাস করে। Nvidia এর গবেষণা সারাংশে প্ল্যাটফর্ম-ওভার-মডেল দর্শনের একটি যাচাইকরণ যা গুরুতর AI-নেটিভ উন্নয়ন গত ১৮ মাসে দিকে চলেছে।
একটি ব্যবহারিক শুরু পয়েন্ট: আপনার বর্তমান এজেন্ট বাস্তবায়নগুলি অডিট করুন এবং চিহ্নিত করুন যেখানে প্রসঙ্গ পদক্ষেপ জুড়ে হারিয়ে যাচ্ছে। এটি দীর্ঘ-দিগন্ত কাজগুলিতে প্রায় সর্বদা প্রথম ব্যর্থতার মোড, এবং এটি সম্পূর্ণরূপে একটি হার্নেস সমস্যা। মডেল আপগ্রেড করার বিষয়টি বিবেচনা করার আগে মেমরি স্তরটি ঠিক করুন।
মূল টেকঅ্যাওয়ে
Nvidia এর AVO গবেষণা এমন কিছুর জন্য একটি পরিষ্কার, অভিজ্ঞতামূলকভাবে ভিত্তিক যুক্তি যা অভিজ্ঞ AI ইঞ্জিনিয়াররা একটি সময়ের জন্য সন্দেহ করেছেন: হার্নেসটি পণ্য। মডেলটি অবকাঠামো। এখানে এগিয়ে নিয়ে যাওয়ার জন্য কী রয়েছে:
- মডেল পছন্দ একটি শুরু পয়েন্ট, একটি কৌশল নয়। Claude Opus 5 একই ওজন এবং একটি ভাল হার্নেস সহ ARC-AGI-3 এ ৩০% থেকে ১০০% এ গেছে। মডেলগুলির মধ্যে ডেল্টা বাস্তব, কিন্তু দীর্ঘ-দিগন্ত কাজের জন্য হার্নেসগুলির মধ্যে ডেল্টা বৃহত্তর।
- মেমরি আর্কিটেকচার এজেন্টিক সিস্টেমের জন্য অ-আলোচনাযোগ্য। যদি আপনার এজেন্ট এমন কাজ চালাচ্ছে যা কয়েক মিনিটের বেশি বা কয়েকটি টুল কলের বেশি বিস্তৃত, আপনার একটি স্পষ্ট মেমরি ম্যানেজমেন্ট স্তর প্রয়োজন। এটি