مشكلة التشابه في قوائم الطعام المولدة بالذكاء الاصطناعي غير الشهية

تلتقط قائمة الطعام وتلقي نظرة على صور الطعام، وتشعر بأن شيئاً ما غير صحيح. مشكلة التشابه في قوائم الطعام المولدة بالذكاء الاصطناعي غير الشهية أصبحت الآن حقيقية بما يكفي لكي يلاحظها العملاء، حتى عندما لا يستطيعون شرح ما يرونه.

Editorial illustration: A restaurant kitchen counter lined with identical plated dishes, each precisely the same—same garnis — MonstarX

مشكلة التشابه في قوائم الطعام المولدة بالذكاء الاصطناعي غير الشهية

تلتقط قائمة الطعام وتلقي نظرة على صور الطعام، وتشعر بأن شيئاً ما غير صحيح — ليس خاطئاً بما يكفي لتسميته، لكنه خاطئ بما يكفي لتضع القائمة جانباً. مشكلة التشابه في قوائم الطعام المولدة بالذكاء الاصطناعي غير الشهية أصبحت الآن حقيقية بما يكفي لكي يلاحظها العملاء بشكل حسي، حتى عندما لا يستطيعون شرح ما يرونه. هذا ليس شكوى تصميم هامشية. إنها إشارة إلى كيفية فشل الذكاء الاصطناعي التوليدي عند نشره بدون حرفية أو سياق أو اعتدال — وله آثار تتجاوز صناعة المطاعم بكثير.

وفقاً لأماندا سيلبرلينج من TechCrunch، بدأت الرسوم التوضيحية لقوائم الطعام المولدة بالذكاء الاصطناعي تظهر عبر المقاهي والمطاعم على نطاق واسع. الصور كفؤة من الناحية التقنية — متماثلة بدقة، ناعمة بشكل غريب، خالية من العيوب بشكل مريب — لكنها تثير شعوراً فورياً بأن شيئاً ما خاطئ. قال مدير التكنولوجيا في Reality Defender، أليكس ليسل، بصراحة: "يبدو الأمر وكأن كائناً فضائياً يحاول صنع بيتزا دون فهم مبادئها الأساسية." بعض الصور واضحة الزيف، مثل بوريتو بجبن فقاعي وذائب بحيث يبدو كفن طليعي. والبعض الآخر دقيق بما يكفي بحيث تلاحظ الخطأ فقط في النظرة الثانية. على أي حال، التأثير واحد: عدم الثقة.

ما حدث

بدأ أصحاب المطاعم باللجوء إلى الذكاء الاصطناعي التوليدي كطريقة مختصرة لتصميم القوائم. الاقتصاديات منطقية على الورق — فتكليف مصور طعام احترافي مكلف، وبإمكان نموذج نص إلى صورة أن ينتج عشرات الرسوم التوضيحية للقوائم في دقائق بتكلفة هامشية قريبة من الصفر. المشكلة أن هذه النماذج تم تدريبها على جمالية ضيقة من "الاستحسان" — متوسط إحصائي لما تبدو عليه صور الطعام عبر ملايين الصور المجمعة من الويب. والنتيجة صور تحسّن الجاذبية السطحية بينما تزيل النقائص التي تجعل الطعام يبدو حقيقياً: الفحم غير المتساوي قليلاً على قشرة البيتزا، الطريقة التي تتجمع بها الصلصة بشكل غير متماثل، الفوضى الصادقة للساندويتش الفعلي.

بدأ مستخدمو وسائل التواصل الاجتماعي بالإشارة إلى الظاهرة في منشورات انتشرت بسرعة، مشيرين إلى قوائم حيث يبدو الطعام أشبه برسم من لعبة فيديو بدلاً من شيء يمكن لمطبخ أن ينتجه فعلاً. الرسوم التوضيحية لم تكن مسيئة — كانت غريبة فقط. وهذه الغرابة هي النقطة. لم يكن العملاء بحاجة إلى أداة كشف الذكاء الاصطناعي للشعور بأن شيئاً ما خاطئ. كانوا يعرفون فقط.

هذا هو نمط الفشل الأساسي: الذكاء الاصطناعي التوليدي، عند تطبيقه بدون معرفة متخصصة أو حكم تحريري بشري، يتقارب نحو المتوسط. ينتج مخرجات محتملة إحصائياً بدلاً من كونها جيدة حقاً. في تصوير الطعام، هذا التقارب ينتج صوراً تبدو مثل كل صورة طعام ذكاء اصطناعي أخرى — ناعمة، متماثلة، وفي النهاية غير شهية بالضبط لأنها مثالية جداً. التشابه هو المشكلة. ليس الذكاء الاصطناعي نفسه.

من الجدير بالملاحظة أن شركات كشف الذكاء الاصطناعي مثل Reality Defender موجودة الآن بالتحديد بسبب هذا الديناميكي. ظهرت سوق لأدوات التحقق من المحتوى بالتوازي مع انتشار المحتوى المولد بالذكاء الاصطناعي — صناعة ثانوية مبنية على عجز الثقة الذي ينشئه نشر الذكاء الاصطناعي غير المدروس.

لماذا يهم هذا لآسيا

صناعة الغذاء والمشروبات في آسيا ضخمة وموزعة وبصرية بعمق. من مشغلي أكشاك الطعام في سنغافورة الذين يبنون قوائمهم الرقمية الأولى، إلى سلاسل المطاعم متوسطة الحجم في جاكرتا أو مدينة هو تشي منه التي تتوسع عبر منصات التوصيل، الضغط لإنتاج محتوى بصري عالي الجودة بتكلفة منخفضة مكثف. الإغراء بالوصول إلى مولد صور الذكاء الاصطناعي مفهوم تماماً.

لكن مشكلة التشابه تؤثر بشكل أقوى في ثقافة الطعام الآسيوية مقارنة بالأسواق الأخرى. الطعام هنا هو الهوية. وعاء من باك كوت تيه، طبق من تشار كواي تيو، وعاء مناسب من توتكوتسو رامن — هذه الأطباق تحمل الفخر الإقليمي والتاريخ العائلي والخصوصية المحلية. نموذج الذكاء الاصطناعي المدرب بشكل أساسي على مجموعات بيانات صور الطعام الغربية لن يفهم أن الكمية الصحيحة من وك هاي على طبق الأرز المقلي مرئية في الفحم، وليس في توهج ذهبي ناعم. سينتج شيئاً يبدو غامضاً مثل الأرز المقلي بالطريقة التي تبدو بها صورة الأوراق الاقتصادية غامضة مثل مكان حقيقي — دقيق من الناحية التقنية، فارغ عاطفياً.

بالنسبة للمؤسسين الآسيويين الذين يبنون في مجال تكنولوجيا الطعام — منصات التوصيل، برامج إدارة المطاعم، أدوات القوائم الرقمية — هذه مشكلة تصميم منتج، وليست مجرد مشكلة جمالية. إذا كانت منصتك تولد صوراً ذكاء اصطناعي للتجار، وتلك الصور تقوض ثقة العملاء، فإن منصتك تتحمل تلك التكلفة السمعة. التاجر يلوم الطعام. العميل يلوم المطعم. لكن المنصة مكنتها.

هناك أيضاً اتجاه تكنولوجيا آسيوي أوسع في اللعب هنا. مع أن أدوات الذكاء الاصطناعي أصبحت أرخص وأكثر إمكانية الوصول، ستأتي التمايز بين المنتجات بشكل متزايد إلى الذوق — ليس فقط القدرة التقنية. أي مطور يمكنه استدعاء واجهة برمجية لتوليد الصور. السؤال هو ما إذا كان منتجك يطبق معرفة مجال كافية، سياق ثقافي كافي، وإشراف بشري كافي لإنتاج مخرجات جيدة فعلاً بدلاً من مجرد كافية. هذا حكم تصميم منتج، وهو يهم أكثر في الأسواق حيث يحمل المحتوى المولد وزناً ثقافياً.

ما يعنيه هذا للمطورين

مشكلة القائمة هي دراسة حالة مفيدة لأي مطور يبني توليد محتوى مدعوم بالذكاء الاصطناعي في منتج. نمط الفشل متسق: خذ نموذجاً عام الغرض، طبقه على مشكلة متخصصة بالمجال، تخطَّ خطوات الضبط الدقيق والمراجعة البشرية، وأطلقه. المخرجات ستكون وظيفية من الناحية التقنية وعادية من الناحية الجمالية. سيلاحظ المستخدمون، حتى لو لم يستطيعوا التعبير عن السبب.

بعض الدروس الملموسة التي تستحق التمثل:

  • النماذج عامة الغرض هي نقاط انطلاق، وليست نقاط نهاية. نموذج نص إلى صورة مدرب على بيانات ويب واسعة سينتج مخرجات عادية على نطاق واسع. إذا كانت حالة الاستخدام الخاصة بك تتطلب خصوصية ثقافية — وتتطلبها معظم حالات الاستخدام في السوق الآسيوية — فأنت بحاجة إما إلى ضبط دقيق على بيانات ذات صلة بالمجال، أو طبقة تحريرية بشرية تصفي وتنسق المخرجات قبل وصولها للمستخدمين.
  • تأثيرات الوادي الغريب لا تقتصر على الوجوه. مفهوم الوادي الغريب الأصلي انطبق على الروبوتات الإنسانية التي بدت تقريباً لكن ليس تماماً إنسانية. نفس آلية الإدراك تنطبق على الطعام والكتابة ونسخ الواجهة الرسومية وأي مجال حيث للبشر معرفة حدسية عميقة بما يبدو "صحيح". إذا كنت تولد محتوى في أي من هذه المجالات، اختبره مع مستخدمين حقيقيين من الثقافة المستهدفة — وليس فقط المراجعين الداخليين.
  • التشابه هو خطر منهجي، وليس خلل لمرة واحدة. عندما يولد كل مطعم يستخدم منصتك قوائم من نفس النموذج الأساسي بنفس إعدادات الافتراضي، ستتقارب المخرجات. العملاء الذين يأكلون في عدة مطاعم سيبدآن بالملاحظة. التشابه يصبح إشارة بأن شيئاً ما آلي، والآلي يبدأ بمعنى غير جدير بالثقة. بنِ التنوع والتخصيص في خط أنابيب التوليد الخاص بك من اليوم الأول.
  • الثقة أصعب إعادة بناء من فقدانها. المطاعم التي اعتمدت صور قوائم الذكاء الاصطناعي مبكراً تتعامل الآن مع إشارة سمعة لم تتوقعها. بالنسبة للمطورين الذين يبنون منصات، الدرس هو أن الشحن السريع مع محتوى الذكاء الاصطناعي منخفض المخاطر فقط إذا كانت جودة المحتوى عالية حقاً. وإلا، فأنت تقترض ضد ثقة مستخدميك.

على جانب البنية الأساسية، يمكن للمطورين الذين يبنون على MonstarX أن يطبقوا نقاط فحص المراجعة البشرية مباشرة في سير عمل توليد محتوى الذكاء الاصطناعي — معاملة مخرجات الذكاء الاصطناعي كمسودة تمر عبر خطوة التحقق.