AI سے بنائے گئے مینو میں یکسانیت کا مسئلہ اور اس کے نتائج

آپ مینو اٹھاتے ہیں، کھانے کی تصویروں پر نظر ڈالتے ہیں، اور کچھ غلط لگتا ہے — اتنا غلط نہیں کہ نام دے سکیں، لیکن اتنا غلط کہ آپ مینو رکھ دیں۔ AI سے بنائے گئے مینو میں یکسانیت کا مسئلہ اب اتنا حقیقی ہو گیا ہے کہ صارفین اسے براہ راست محسوس کر رہے ہیں۔

Editorial illustration: A restaurant kitchen counter lined with identical plated dishes, each precisely the same—same garnis — MonstarX

AI سے بنائے گئے مینو میں یکسانیت کا مسئلہ اور اس کے نتائج

آپ مینو اٹھاتے ہیں، کھانے کی تصویروں پر نظر ڈالتے ہیں، اور کچھ غلط لگتا ہے — اتنا غلط نہیں کہ نام دے سکیں، لیکن اتنا غلط کہ آپ مینو رکھ دیں۔ AI سے بنائے گئے مینو میں یکسانیت کا مسئلہ اب اتنا حقیقی ہو گیا ہے کہ صارفین اسے براہ راست محسوس کر رہے ہیں، چاہے وہ اسے سمجھا نہ سکیں۔ یہ محض ڈیزائن کی شکایت نہیں ہے۔ یہ اس بات کا اشارہ ہے کہ generative AI کس طرح ناکام ہوتا ہے جب اسے بغیر مہارت، سیاق و سباق، یا احتیاط کے استعمال کیا جائے — اور اس کے اثرات ریستوران کی صنعت سے بہت آگے تک پھیلے ہوئے ہیں۔

TechCrunch کے Amanda Silberling کے مطابق، AI سے بنائی گئی مینو کی تصویریں اب کافی حد تک کیفے اور ریستورانوں میں نظر آنے لگی ہیں۔ یہ تصویریں تکنیکی لحاظ سے درست ہیں — بالکل متوازن، عجیب طریقے سے ہموار، خوفناک طریقے سے بے عیب — لیکن وہ فوری طور پر یہ احساس دلاتی ہیں کہ کچھ غلط ہے۔ Reality Defender کے CTO Alex Lisle نے یہ کہا: "یہ ایسے ہے جیسے کوئی اجنبی بغیر پیزا کے بنیادی اصول سمجھے اسے بنانے کی کوشش کر رہا ہو۔" کچھ تصویریں واضح طور پر نقلی ہیں، جیسے ایک burrito جس میں پنیر اتنا بلبلاتا اور پگھلتا ہوا ہے کہ یہ جدید فن لگتا ہے۔ دوسری اتنی لطیف ہیں کہ آپ کو دوسری نظر میں ہی یکسانیت کا احساس ہوتا ہے۔ کسی بھی صورت میں، اثر ایک جیسا ہے: عدم اعتماد۔

کیا ہوا

ریستوران کے مالکین مینو ڈیزائن کے لیے generative AI کی طرف رجوع کرنے لگے۔ معاشیات کاغذ پر سمجھ میں آتی ہے — کھانے کی تصویروں کے لیے فوٹوگرافر کو کمیشن کرنا مہنگا ہے، اور ایک text-to-image ماڈل منٹوں میں ایک درجن مینو تصویریں بنا سکتا ہے تقریباً صفر اضافی لاگت پر۔ مسئلہ یہ ہے کہ یہ ماڈلز "خوبصورتی" کی ایک تنگ نظریے پر تربیت یافتہ ہیں — ویب سے کھرچے گئے لاکھوں تصویروں میں کھانے کی تصویری کی شماریاتی اوسط۔ نتیجہ یہ تصویریں ہیں جو سطحی اپیل کے لیے بہتری کرتی ہیں جبکہ ان نقائص کو نکال دیتی ہیں جو کھانے کو حقیقی بناتے ہیں: پیزا کی پرت پر تھوڑی سی غیر مساوی سیاہی، سالس کا غیر متوازن انداز میں جمع ہونا، ایک اصل سینڈوچ کی ایماندارانہ بے ترتیبی۔

سوشل میڈیا کے صارفین نے اس رجحان کو وائرل ہونے والی پوسٹس میں نشاندہی کرنا شروع کیا، ایسے مینو کی طرف اشارہ کرتے ہوئے جہاں کھانا ویڈیو گیم کی رینڈرنگ سے زیادہ لگتا تھا بجائے اس کے جو کوئی باورچی خانہ اصل میں بنا سکتا ہے۔ یہ تصویریں ناپسندیدہ نہیں تھیں — وہ صرف عجیب تھیں۔ اور یہ عجیب پن ہی نقطہ ہے۔ صارفین کو AI کی شناخت کے لیے کسی ٹول کی ضرورت نہیں تھی۔ وہ صرف جانتے تھے۔

یہ بنیادی ناکامی کا طریقہ ہے: generative AI، جب ڈومین کے علم یا انسانی ادارتی فیصلے کے بغیر لاگو کیا جائے، تو ایک اوسط میں متقارب ہوتا ہے۔ یہ ایسے نتائج پیدا کرتا ہے جو شماریاتی لحاظ سے ممکنہ ہوں بجائے واقعی اچھے ہونے کے۔ کھانے کی تصویری میں، یہ متقاربیت ایسی تصویریں پیدا کرتی ہے جو ہر دوسری AI کھانے کی تصویر کی طرح لگتی ہیں — ہموار، متوازن، اور بالآخر غیر لذیذ بالکل اس لیے کہ وہ بہت کامل ہیں۔ یکسانیت ہی مسئلہ ہے۔ AI خود نہیں۔

یہ قابلِ غور ہے کہ AI کی شناخت کی کمپنیاں جیسے Reality Defender اب خاص طور پر اسی متحرک کی وجہ سے موجود ہیں۔ مواد کی تصدیق کے ٹولز کی ایک مارکیٹ AI سے بنائے گئے مواد کے پھیلاؤ کے ساتھ متوازی طور پر ابھری ہے — ایک ثانوی صنعت جو اعتماد کی کمی پر بنی ہے جو بے احتیاط AI کی تعیناتی سے پیدا ہوتی ہے۔

ایشیا کے لیے اس کا کیوں اہم ہے

ایشیا کی کھانے اور مشروبات کی صنعت بہت بڑی، بکھری ہوئی، اور گہری بصری ہے۔ سنگاپور میں ہاکر سٹال کے آپریٹرز سے جو اپنے پہلے ڈیجیٹل مینو بنا رہے ہیں، جکارتہ یا ہو چی منہ سٹی میں درمیانے سائز کی ریستوران چین سے جو ڈیلیوری پلیٹ فارمز میں پھیل رہی ہیں، سستے میں اعلیٰ معیار کے بصری مواد پیدا کرنے کا دباؤ شدید ہے۔ AI تصویر جنریٹر کی طرف رجوع کرنے کی رغبت بالکل سمجھ میں آتی ہے۔

لیکن یکسانیت کا مسئلہ ایشیا کی کھانے کی ثقافت میں دوسری مارکیٹوں سے زیادہ سخت ہے۔ یہاں کھانا شناخت ہے۔ بک کت تے کا ایک پیالہ، چار کوے تیو کی ایک پلیٹ، صحیح tonkotsu ramen کا ایک پیالہ — یہ ڈشز علاقائی فخر، خاندانی تاریخ، اور مقامی خصوصیت رکھتے ہیں۔ ایک AI ماڈل جو بنیادی طور پر مغربی کھانے کی تصویری ڈیٹاسیٹ پر تربیت یافتہ ہے وہ یہ نہیں سمجھے گا کہ تلے ہوئے چاول کی پلیٹ پر صحیح مقدار میں wok hei سیاہی میں نظر آتا ہے، نہ کہ ہموار سنہری چمک میں۔ یہ کچھ ایسا پیدا کرے گا جو تلے ہوئے چاول کی طرح لگے جیسے اسٹاک فوٹو کسی حقیقی جگہ کی طرح لگتا ہے — تکنیکی لحاظ سے درست، جذباتی لحاظ سے خالی۔

ایشیائی بانیوں کے لیے جو کھانے کی ٹیک کی جگہ میں تعمیر کر رہے ہیں — ڈیلیوری پلیٹ فارمز، ریستوران مینجمنٹ SaaS، ڈیجیٹل مینو ٹولز — یہ محض ایک نمائندگی کا مسئلہ نہیں ہے، بلکہ ایک پروڈکٹ ڈیزائن کا مسئلہ ہے۔ اگر آپ کا پلیٹ فارم تاجروں کے لیے AI بصری مواد تیار کرتا ہے، اور وہ بصری مواد صارف کے اعتماد کو کمزور کرتا ہے، تو آپ کا پلیٹ فارم اس شہرت کی لاگت برداشت کرتا ہے۔ تاجر کھانے کو الزام دیتا ہے۔ صارف ریستوران کو الزام دیتا ہے۔ لیکن پلیٹ فارم نے اسے ممکن بنایا۔

یہاں ایک وسیع ایشیا ٹیک رجحان بھی کام میں ہے۔ جیسے جیسے AI ٹولنگ سستی اور زیادہ قابلِ رسائی ہو رہی ہے، پروڈکٹس کے درمیان فرق تیزی سے ذوق پر منحصر ہوگا — محض تکنیکی صلاحیت پر نہیں۔ کوئی بھی ڈیولپر ایک تصویر جنریشن API کو کال کر سکتا ہے۔ سوال یہ ہے کہ کیا آپ کا پروڈکٹ اتنا ڈومین علم، اتنا ثقافتی سیاق و سباق، اور اتنی انسانی نگرانی لاگو کرتا ہے کہ نتائج واقعی اچھے ہوں بجائے محض مناسب ہونے کے۔ یہ ایک پروڈکٹ فیصلہ ہے، اور یہ ان مارکیٹوں میں زیادہ اہم ہے جہاں بنایا جانے والا مواد ثقافتی وزن رکھتا ہے۔

ڈیولپرز کے لیے اس کا مطلب

مینو کا مسئلہ ایک مفید کیس سٹڈی ہے کسی بھی ڈیولپر کے لیے جو اپنے پروڈکٹ میں AI سے چلنے والا مواد جنریشن بنا رہے ہیں۔ ناکامی کا نمونہ مستقل ہے: ایک عام مقصد کا ماڈل لیں، اسے ڈومین کے مخصوص مسئلے پر لاگو کریں، fine-tuning اور انسانی جائزے کے مراحل کو چھوڑ دیں، اور شپ کریں۔ نتیجہ تکنیکی لحاظ سے فعال اور جمالیاتی لحاظ سے درمیانی ہوگا۔ صارفین کو نوٹس ہوگا، چاہے وہ اسے سمجھا نہ سکیں۔

کچھ ٹھوس سبق قابلِ غور ہیں:

  • عام مقصد کے ماڈلز شروعات کے نقاط ہیں، اختتام کے نقاط نہیں۔ ایک text-to-image ماڈل جو وسیع ویب ڈیٹا پر تربیت یافتہ ہے وہ وسیع اوسط نتائج پیدا کرے گا۔ اگر آپ کے استعمال کے معاملے میں ثقافتی خصوصیت کی ضرورت ہے — اور زیادہ تر ایشیائی مارکیٹ کے معاملات میں ہے — تو آپ کو یا تو ڈومین سے متعلقہ ڈیٹا پر fine-tuning کی ضرورت ہے، یا ایک انسانی ادارتی پرت جو نتائج کو فلٹر اور منتخب کرے صارفین تک پہنچنے سے پہلے۔
  • Uncanny valley کے اثرات صرف چہروں تک محدود نہیں ہیں۔ اصل uncanny valley کا تصور انسان نما روبوٹس پر لاگو ہوتا تھا جو تقریباً لیکن بالکل انسان نہیں لگتے تھے۔ یہی ادراکی میکانزم کھانے، لکھنے، UI کاپی، اور کسی بھی ڈومین پر لاگو ہوتا ہے جہاں انسانوں کو گہری بدیہی معلومات ہے کہ "صحیح" کیا لگتا ہے۔ اگر آپ ان کسی بھی ڈومین میں مواد بنا رہے ہیں، تو اسے حقیقی صارفین کے ساتھ ٹیسٹ کریں جو ہدف کی ثقافت سے ہوں — محض اندرونی جائزہ لینے والے نہیں۔
  • یکسانیت ایک نظامی خطرہ ہے، ایک بار کی خرابی نہیں۔ جب آپ کے پلیٹ فارم کو استعمال کرنے والا ہر ریستوران ایک جیسے بنیادی ماڈل سے ایک جیسی ڈیفالٹ سیٹنگز کے ساتھ مینو بناتا ہے، تو نتائج متقارب ہوں گے۔ صارفین جو متعدد ریستورانوں میں کھاتے ہیں انہیں نوٹس ہونے لگے گا۔ یکسانیت اس بات کا اشارہ بن جاتی ہے کہ کچھ خودکار ہے، اور خودکار کا مطلب ہے غیر قابلِ اعتماد۔ اپنی جنریشن پائپ لائن میں پہلے دن سے ہی تنوع اور حسب ضرورت بنائیں۔
  • اعتماد کو دوبارہ بنانا اسے کھونے سے زیادہ مشکل ہے۔ ریستورانیں جنہوں نے AI مینو تصویروں کو جلدی اپنایا وہ اب ایک شہرت کے اشارے سے نمٹ رہی ہیں جس کی انہوں نے توقع نہیں کی تھی۔ ڈیولپرز کے لیے جو پلیٹ فارمز بنا رہے ہیں، سبق یہ ہے کہ AI سے بنائے گئے مواد کے ساتھ تیزی سے شپ کرنا صرف کم خطرہ ہے اگر مواد کی معیت واقعی اعلیٰ ہو۔ ورنہ، آپ اپنے صارفین کے اعتماد کے خلاف قرض لے رہے ہیں۔

بنیادی ڈھانچے کی طرف سے، MonstarX پر تعمیر کرنے والے ڈیولپرز AI مواد جنریشن کے کام کے بہاؤ میں براہ راست انسانی جائزے کے چیک پوائنٹس شامل کر سکتے ہیں — AI نتیجے کو ایک ڈرافٹ کے طور پر سلوک کرتے ہوئے جو ایک تصدیق کے مرحلے سے گزرتا ہے۔