Vấn đề tính đồng nhất trong những menu AI được tạo ra không hấp dẫn
Bạn nhặt lên một thực đơn, liếc nhìn vào hình ảnh thực phẩm, và cảm giác có gì đó không ổn. Vấn đề tính đồng nhất trong những menu AI được tạo ra không hấp dẫn giờ đã thực tế đến mức khách hàng nhận thấy nó một cách trực quan, ngay cả khi họ không thể giải thích những gì họ đang…
Vấn đề tính đồng nhất trong những menu AI được tạo ra không hấp dẫn
Bạn nhặt lên một thực đơn, liếc nhìn vào hình ảnh thực phẩm, và cảm giác có gì đó không ổn — không sai đủ để có thể nêu tên, chỉ sai đủ để khiến bạn đặt thực đơn xuống. Vấn đề tính đồng nhất trong những menu AI được tạo ra không hấp dẫn giờ đã thực tế đến mức khách hàng nhận thấy nó một cách trực quan, ngay cả khi họ không thể giải thích những gì họ đang nhìn thấy. Đây không phải là một phàn nàn thiết kế niche. Đó là một tín hiệu về cách generative AI thất bại khi được triển khai mà không có kỹ thuật, bối cảnh hoặc kiềm chế — và nó có những hàm ý vượt ra ngoài ngành công nghiệp nhà hàng.
Theo Amanda Silberling của TechCrunch, các minh họa menu được tạo bởi AI đã bắt đầu xuất hiện trên các quán cà phê và nhà hàng ở quy mô lớn. Các hình ảnh có năng lực kỹ thuật — hoàn toàn đối xứng, mịn màng kỳ lạ, hoàn hảo một cách rùng rợn — nhưng chúng kích hoạt cảm giác ngay lập tức rằng có gì đó không ổn. CTO của Reality Defender Alex Lisle nói thẳng: "Nó gần như một người ngoài hành tinh cố gắng làm một chiếc pizza mà không hiểu các nguyên tắc cốt lõi của nó." Một số hình ảnh rõ ràng là giả, như một chiếc burrito với phô mai bong bóng và chảy nát đến mức nó trông như một tác phẩm nghệ thuật tiền vệ. Những cái khác tinh tế đến mức bạn chỉ nhận thấy sự sai lệch ở lần nhìn thứ hai. Dù bằng cách nào, hiệu ứng cũng giống nhau: mất tin tưởng.
Điều Gì Đã Xảy Ra
Chủ nhà hàng bắt đầu chuyển sang generative AI như một cách tắt để thiết kế thực đơn. Kinh tế học có ý nghĩa trên giấy — thuê một nhiếp ảnh gia thực phẩm rất tốn kém, và một mô hình text-to-image có thể tạo ra một tá minh họa thực đơn trong vài phút với chi phí biên tế gần như bằng không. Vấn đề là các mô hình này được huấn luyện trên một thẩm mỹ hẹp về "tính dễ chịu" — một trung bình thống kê của hình ảnh nhiếp ảnh thực phẩm trên hàng triệu hình ảnh được cạo từ web. Kết quả là các hình ảnh tối ưu hóa cho sự hấp dẫn bề ngoài trong khi loại bỏ những khiếm khuyết làm cho thực phẩm trông thực tế: những vết cháy hơi không đều trên vỏ bánh pizza, cách nước sốt tập trung không đối xứng, sự lộn xộn trung thực của một chiếc bánh sandwich thực tế.
Người dùng mạng xã hội bắt đầu gắn cờ hiện tượng này trong các bài viết trở thành viral, chỉ ra những thực đơn nơi thực phẩm trông giống như một bản render từ một trò chơi video hơn là thứ gì đó một bếp có thể thực sự sản xuất. Các minh họa không phải là xúc phạm — chúng chỉ là kỳ lạ. Và sự kỳ lạ đó chính là vấn đề. Khách hàng không cần một công cụ phát hiện AI để cảm nhận rằng có gì đó không ổn. Họ chỉ biết thôi.
Đây là chế độ thất bại cốt lõi: generative AI, khi được áp dụng mà không có kiến thức miền hoặc phán xét biên tập của con người, hội tụ vào một trung bình. Nó tạo ra các đầu ra có khả năng thống kê cao hơn là thực sự tốt. Trong nhiếp ảnh thực phẩm, sự hội tụ đó tạo ra các hình ảnh trông giống như mọi hình ảnh thực phẩm AI khác — mịn màng, đối xứng, và cuối cùng không hấp dẫn chính vì chúng quá hoàn hảo. Tính đồng nhất là vấn đề. Không phải AI chính nó.
Cần lưu ý rằng các công ty khởi động phát hiện AI như Reality Defender giờ đây tồn tại chính vì động lực này. Một thị trường cho các công cụ xác minh nội dung đã nổi lên song song với sự phổ biến của nội dung được tạo bởi AI — một ngành công nghiệp thứ cấp được xây dựng trên thiếu hụt tin tưởng mà triển khai AI bất cẩn tạo ra.
Tại Sao Điều Này Quan Trọng Đối Với Châu Á
Ngành thực phẩm và đồ uống của Châu Á là khổng lồ, phân mảnh, và sâu sắc về mặt hình ảnh. Từ các nhà điều hành quầy hàng rong ở Singapore xây dựng thực đơn kỹ thuật số đầu tiên của họ, đến các chuỗi nhà hàng vừa ở Jakarta hoặc Thành phố Hồ Chí Minh mở rộng quy mô trên các nền tảng giao hàng, áp lực để tạo ra nội dung hình ảnh chất lượng cao rẻ tiền là rất lớn. Sự cám dỗ để sử dụng một trình tạo hình ảnh AI là hoàn toàn có thể hiểu được.
Nhưng vấn đề tính đồng nhất ảnh hưởng mạnh hơn đến nền văn hóa ẩm thực của Châu Á so với các thị trường khác. Thực phẩm ở đây là bản sắc. Một bát bak kut teh, một đĩa char kway teow, một bát tonkotsu ramen thích hợp — những món ăn này mang theo niềm tự hào khu vực, lịch sử gia đình, và tính cụ thể địa phương. Một mô hình AI được huấn luyện chủ yếu trên các bộ dữ liệu nhiếp ảnh thực phẩm phương Tây sẽ không hiểu rằng lượng wok hei phù hợp trên một đĩa cơm chiên có thể nhìn thấy trong vết cháy, không phải trong một ánh sáng vàng mịn màng. Nó sẽ tạo ra thứ gì đó trông mơ hồ giống như cơm chiên theo cách một ảnh chứng khoán trông mơ hồ giống như một nơi thực tế — chính xác về mặt kỹ thuật, rỗng tuếch về mặt cảm xúc.
Đối với các nhà sáng lập Châu Á xây dựng trong không gian công nghệ thực phẩm — các nền tảng giao hàng, SaaS quản lý nhà hàng, công cụ thực đơn kỹ thuật số — đây là một vấn đề thiết kế sản phẩm, không chỉ là một vấn đề thẩm mỹ. Nếu nền tảng của bạn tạo ra hình ảnh AI cho các thương nhân, và những hình ảnh đó làm suy yếu sự tin tưởng của khách hàng, nền tảng của bạn phải chịu chi phí danh tiếng đó. Thương nhân đổ lỗi cho thực phẩm. Khách hàng đổ lỗi cho nhà hàng. Nhưng nền tảng đã cho phép điều đó.
Cũng có một xu hướng công nghệ Châu Á rộng hơn đang diễn ra ở đây. Khi công cụ AI trở nên rẻ hơn và dễ tiếp cận hơn, sự khác biệt giữa các sản phẩm sẽ ngày càng phụ thuộc vào thị hiếu — không chỉ khả năng kỹ thuật. Bất kỳ nhà phát triển nào cũng có thể gọi một API tạo hình ảnh. Câu hỏi là liệu sản phẩm của bạn có áp dụng đủ kiến thức miền, đủ bối cảnh văn hóa, và đủ giám sát của con người để tạo ra các đầu ra thực sự tốt hơn là chỉ đủ hay không. Đó là một quyết định phán xét sản phẩm, và nó quan trọng hơn ở các thị trường nơi nội dung được tạo ra mang trọng lượng văn hóa.
Điều Này Có Nghĩa Gì Đối Với Các Nhà Phát Triển
Vấn đề thực đơn là một trường hợp nghiên cứu hữu ích cho bất kỳ nhà phát triển nào xây dựng tạo nội dung do AI hỗ trợ vào một sản phẩm. Mô hình thất bại là nhất quán: lấy một mô hình mục đích chung, áp dụng nó cho một vấn đề cụ thể miền, bỏ qua các bước tinh chỉnh và xem xét của con người, và triển khai. Đầu ra sẽ có chức năng kỹ thuật và thẩm mỹ trung bình. Người dùng sẽ nhận thấy, ngay cả khi họ không thể diễn đạt lý do tại sao.
Một vài bài học cụ thể đáng được nội tâm hóa:
- Các mô hình mục đích chung là điểm bắt đầu, không phải điểm kết thúc. Một mô hình text-to-image được huấn luyện trên dữ liệu web rộng sẽ tạo ra các đầu ra rộng trung bình. Nếu trường hợp sử dụng của bạn yêu cầu tính cụ thể văn hóa — và hầu hết các trường hợp sử dụng thị trường Châu Á đều yêu cầu — bạn cần tinh chỉnh trên dữ liệu liên quan đến miền, hoặc một lớp biên tập của con người lọc và quản lý các đầu ra trước khi chúng tiếp cận người dùng.
- Các hiệu ứng thung lũng kỳ lạ không giới hạn ở khuôn mặt. Khái niệm thung lũng kỳ lạ ban đầu áp dụng cho các robot hình người trông gần như nhưng không hoàn toàn giống con người. Cơ chế nhận thức tương tự áp dụng cho thực phẩm, viết lách, sao chép UI, và bất kỳ miền nào mà con người có kiến thức trực quan sâu sắc về những gì "đúng" trông như thế nào. Nếu bạn đang tạo nội dung trong bất kỳ miền nào trong số này, hãy kiểm tra nó với người dùng thực từ nền văn hóa mục tiêu — không chỉ những người xem xét nội bộ.
- Tính đồng nhất là một rủi ro hệ thống, không phải một lỗi một lần. Khi mọi nhà hàng sử dụng nền tảng của bạn tạo thực đơn từ cùng một mô hình cơ bản với cùng các cài đặt mặc định, các đầu ra sẽ hội tụ. Khách hàng ăn tại nhiều nhà hàng sẽ bắt đầu nhận thấy. Tính đồng nhất trở thành một tín hiệu rằng có gì đó được tự động hóa, và tự động hóa bắt đầu có nghĩa là không đáng tin cậy. Xây dựng biến thể và tùy chỉnh vào đường ống tạo của bạn từ ngày đầu tiên.
- Tin tưởng khó xây dựng lại hơn là mất đi. Các nhà hàng áp dụng hình ảnh thực đơn AI sớm giờ đây đang xử lý một tín hiệu danh tiếng mà họ không dự đoán. Đối với các nhà phát triển xây dựng nền tảng, bài học là gửi nhanh với nội dung được tạo bởi AI chỉ có rủi ro thấp nếu chất lượng nội dung thực sự cao. Nếu không, bạn đang vay lại sự tin tưởng của người dùng.
Ở phía cơ sở hạ tầng, các nhà phát triển xây dựng trên MonstarX có thể xếp các điểm kiểm tra xem xét của con người trực tiếp vào các quy trình tạo nội dung AI — coi đầu ra AI là một bản nháp đi qua một bước xác thực