Tái Định Nghĩa Độc Lập: Cách Các Mô Hình AI của Meta Giúp Đại Học Pittsburgh Chuyển Đổi Công Nghệ Robot Hỗ Trợ

Hơn 100.000 chấn thương liên quan đến xe lăn đưa người dân vào các phòng cấp cứu ở Mỹ mỗi năm. Đại Học Pittsburgh hiện đang giải quyết vấn đề này bằng cách triển khai các mô hình AI mã nguồn mở của Meta vào một nền tảng robot có thể định nghĩa lại độc lập thể chất cho hàng triệu…

Share
Editorial illustration: A robotic arm with articulated fingers hovering above a tabletop object—a coffee cup, a doorknob, a  — MonstarX

Tái Định Nghĩa Độc Lập: Cách Các Mô Hình AI của Meta Giúp Đại Học Pittsburgh Chuyển Đổi Công Nghệ Robot Hỗ Trợ

Hơn 100.000 chấn thương liên quan đến xe lăn đưa người dân vào các phòng cấp cứu ở Mỹ mỗi năm — không phải vì xe lăn vốn dĩ nguy hiểm, mà vì công nghệ chưa theo kịp độ phức tạp của các môi trường thực tế. Đó là vấn đề mà Phòng Thí Nghiệm Kỹ Thuật Nhân Tố (HERL) của Đại Học Pittsburgh hiện đang giải quyết trực tiếp, triển khai các mô hình AI mã nguồn mở của Meta bên trong một nền tảng robot có thể định nghĩa lại độc lập thể chất cho hàng triệu người. Tái Định Nghĩa Độc Lập: Cách Các Mô Hình AI của Meta Đang Thúc Đẩy Sự Thay Đổi Này là một câu chuyện có ý nghĩa vượt xa Pittsburgh — nó mang những hàm ý trực tiếp cho các nhà phát triển và người sáng lập xây dựng các sản phẩm được hỗ trợ bởi AI trên toàn Châu Á.

Điều Gì Đã Xảy Ra

HERL của Đại Học Pittsburgh, hợp tác cùng với công ty tiên phong công nghệ hỗ trợ ATDev, đang xây dựng Nền Tảng Robot Hỗ Trợ Khả Năng Vận Động và Thao Tác Cung Cấp Độc Lập Cho Người Khuyết Tật — được gọi là RAMMP. Sáng kiến này được hỗ trợ bởi tới 41,5 triệu đô la tài trợ từ Cơ Quan Dự Án Nghiên Cứu Nâng Cao về Sức Khỏe (ARPA-H), một cơ quan chính phủ Mỹ được thành lập để hỗ trợ những bước đột phá y sinh học có tính chuyển đổi.

Theo bài viết trên blog AI của Meta về dự án này, nền tảng RAMMP đang được xây dựng để giải quyết một thực tế khắc nghiệt: có khoảng 5,5 triệu người sử dụng xe lăn ở Hoa Kỳ, và công nghệ hỗ trợ có sẵn cho họ thường không phản ánh độ phức tạp của các môi trường thực tế — địa hình không bằng phẳng, không gian trong nhà chật chội, những chướng ngại vật động. Khi công nghệ không đáp ứng được, hậu quả không chỉ là bất tiện. Chúng có thể gây nguy hiểm về thể chất.

Để thu hẹp khoảng cách đó, nhóm HERL đang tích hợp các mô hình AI mã nguồn mở của Meta — cụ thể là SAM (Segment Anything Model)DINOv2 — vào ngăn xếp nhận thức của RAMMP. SAM xử lý phân đoạn cảnh thời gian thực, xác định các bề mặt, chướng ngại vật và đường dẫn có thể điều hướng từ dữ liệu cảm biến. DINOv2 cung cấp trích xuất đặc trưng hình ảnh mạnh mẽ, cho phép hệ thống khái quát hóa trên các môi trường nó chưa được đào tạo rõ ràng. Cùng nhau, chúng cung cấp cho nền tảng robot một nền tảng để hiểu thế giới vật lý với loại tinh tế mà khả năng vận động hỗ trợ đòi hỏi.

Việc lựa chọn các mô hình mã nguồn mở của Meta không phải là tình cờ. Nó phản ánh một quyết định kỹ thuật có chủ đích: các trọng số mở có nghĩa là nhóm nghiên cứu có thể tinh chỉnh, kiểm toán và điều chỉnh các mô hình theo các ràng buộc cụ thể của robot hỗ trợ — suy luận độ trễ thấp, triển khai cạnh, độ tin cậy quan trọng về an toàn — mà không bị khóa vào một API độc quyền có thể thay đổi hoặc biến mất. Lựa chọn kiến trúc đó đáng được lưu ý bởi bất kỳ nhà phát triển nào xây dựng trên các nền tảng AI ngày hôm nay.

Tại Sao Điều Này Quan Trọng Đối Với Châu Á

Châu Á có dân số người khuyết tật về khả năng vận động lớn nhất trên hành tinh. Theo Tổ Chức Y Tế Thế Giới, hơn 1 tỷ người trên toàn cầu sống với một số hình thức khuyết tật, và một phần không cân xứng là ở Châu Á — đặc biệt là ở các xã hội già hóa như Nhật Bản, Hàn Quốc, Đài Loan và ngày càng tăng ở Trung Quốc. Đông Nam Á thêm một lớp khác: các quốc gia như Việt Nam, Indonesia và Philippines có dân số lớn với quyền truy cập hạn chế vào công nghệ hỗ trợ chất lượng cao, cả do chi phí và khoảng cách cơ sở hạ tầng.

Dự án RAMMP báo hiệu một điều quan trọng cho hệ sinh thái công nghệ Châu Á: sự hội tụ của AI mã nguồn mở, robot và chăm sóc sức khỏe không còn là một sự tò mò nghiên cứu. Nó là một ngành kỹ thuật được tài trợ, hướng tới triển khai. Các mô hình cung cấp năng lượng cho RAMMP — SAM và DINOv2 — có sẵn công khai. Bất kỳ nhóm nào ở Singapore, Seoul hay Thâm Quyến đều có thể kéo chúng ngay hôm nay và bắt đầu xây dựng.

Điều ít phổ biến hơn ở Châu Á là cơ sở hạ tầng thể chế để biến khả năng đó thành một sản phẩm tập trung vào người dùng. Phương pháp của HERL — tập trung quá trình thiết kế xung quanh những người sử dụng xe lăn thực tế, chạy các thử nghiệm thực tế, lặp lại các yêu cầu an toàn — là một phương pháp sản phẩm cũng như một phương pháp nghiên cứu. Các nhà sáng lập công nghệ sức khỏe Châu Á xây dựng trong không gian hỗ trợ sẽ làm tốt khi nghiên cứu nó.

Cũng có một góc độ phần cứng. Châu Á thống trị sản xuất robot toàn cầu. Đài Loan, Nhật Bản và Hàn Quốc sản xuất một phần đáng kể của các bộ chuyển động robot, cảm biến và tính toán nhúng trên toàn thế giới. Khoảng cách không phải ở chuỗi cung ứng phần cứng — nó ở lớp phần mềm AI làm cho robot nhận thức bối cảnh và an toàn đủ để triển khai liền kề con người. Đó chính xác là nơi các mô hình mở như SAM và DINOv2 đang mở khóa những khả năng mới, và nơi các nhà phát triển AI Châu Á có một cửa sổ cạnh tranh thực sự ngay bây giờ.

Đối với những người sáng lập trong khu vực, đây là một tín hiệu: robot hỗ trợ không phải là một lĩnh vực ngách dành riêng cho các phòng thí nghiệm nghiên cứu Mỹ được tài trợ tốt. Nó là một lĩnh vực mở, và các mô hình AI nền tảng đã sẵn sàng để sử dụng miễn phí.

Điều Này Có Ý Nghĩa Gì Đối Với Các Nhà Phát Triển

Kiến trúc kỹ thuật đằng sau RAMMP cung cấp một bản thiết kế thực tế mà các nhà phát triển có thể học trực tiếp. Về cơ bản, hệ thống sử dụng các mô hình AI ngôn ngữ hình ảnh để nhận thức môi trường, kết hợp với logic điều khiển robot dịch các đầu ra nhận thức thành các quyết định chuyển động an toàn, thời gian thực. Hai mô hình Meta thực hiện công việc nặng — SAM và DINOv2 — đều có sẵn trên Hugging Face và các kho lưu trữ GitHub của Meta.

Đây là những gì một đường ống nhận thức tối thiểu sử dụng các mô hình này trông như thế nào về mặt khái niệm:

  • Đầu vào: Luồng camera RGB-D (độ sâu + màu) từ các cảm biến gắn trên nền tảng vận động
  • Phân đoạn: SAM xử lý từng khung hình để xác định các vùng riêng biệt — sàn, chướng ngại vật, đồ nội thất, dốc
  • Trích xuất đặc trưng: DINOv2 tạo ra các nhúng cho các vùng được xác định, cho phép hệ thống phân loại và lý luận về các loại bề mặt và khả năng vượt qua
  • Lớp quyết định: Một mô hình điều khiển hạ lưu sử dụng mặt nạ phân đoạn và nhúng để tính toán các đường dẫn điều hướng an toàn trong thời gian thực
  • Chuyển động: Các lệnh động cơ được phát hành cho hệ thống lái của xe lăn với các ràng buộc tránh va chạm được tích hợp sẵn

Những thách thức kỹ thuật ở đây là không tầm thường. Chạy SAM ở độ trễ chấp nhận được trên phần cứng cạnh — mà không cần một chuyến tròn đến đám mây — yêu cầu lượng tử hóa mô hình và tối ưu hóa suy luận cẩn thận. Các nhúng của DINOv2 rất mạnh nhưng tính toán dày đặc; triển khai chúng trên các hệ thống nhúng như NVIDIA Jetson hoặc Qualcomm RB5 yêu cầu lập hồ sơ và cắt tỉa. Đây là những vấn đề có thể giải quyết được, nhưng chúng yêu cầu nỗ lực kỹ thuật có chủ đích, không chỉ là các lệnh gọi API.

Đối với các nhà phát triển xây dựng trên MonstarX, bài học rộng hơn từ RAMMP là về kỷ luật kiến trúc: khi bạn xây dựng các hệ thống AI hoạt động trong các môi trường vật lý với những cược an toàn thực sự, lựa chọn giữa mô hình mã nguồn mở và độc quyền không chỉ là một quyết định chi phí — nó là một quyết định kiểm soát. Các trọng số mở cung cấp cho bạn khả năng tinh chỉnh trên dữ liệu cụ thể về miền (trong trường hợp của HERL, các môi trường vận động trong nhà), chạy ngoại tuyến mà không có hình phạt độ trễ và duy trì hệ thống khi các nhà cung cấp thượng nguồn thay đổi API của họ.

Điều này quan trọng đối với bất kỳ ứng dụng AI nào mà độ tin cậy và khả năng kiểm toán không thể thương lượng — chăm sóc sức khỏe, hậu cần, tự động hóa công nghiệp, chăm sóc người cao tuổi. Tất cả các lĩnh vực dọc này đang phát triển nhanh chóng trên toàn Châu Á, và tất cả chúng đều chia sẻ cùng một yêu cầu: AI mà bạn có thể kiểm tra, điều chỉnh và tin tưởng.

Dự án RAMMP