Tạo, chỉnh sửa và xuất hiện trong video với hai bản cập nhật Google Vids mới

Google vừa làm cho việc thuê một đội ngũ sản xuất video trở nên khó khăn hơn đáng kể đối với nội dung nội bộ. Hai tính năng mới trong Google Vids — Gemini Omni và avatar cá nhân — cho phép bạn tạo, tinh chỉnh và xuất hiện trong video mà không cần chạm vào camera hay thanh trượt…

Share
Editorial illustration: A film editor's desk in stark overhead view: a glowing monitor displaying a video timeline with mult — MonstarX

Tạo, chỉnh sửa và xuất hiện trong video với hai bản cập nhật Google Vids mới

Google vừa làm cho việc thuê một đội ngũ sản xuất video trở nên khó khăn hơn đáng kể đối với nội dung nội bộ. Hai tính năng mới trong Google Vids — Gemini Omni và avatar cá nhân — cho phép bạn tạo, tinh chỉnh và xuất hiện trong video mà không cần chạm vào camera hay thanh trượt timeline. Đối với các nhà phát triển và nhà sáng lập trên khắp châu Á xây dựng demo sản phẩm, quy trình onboarding và nội dung tiếp thị với ngân sách hạn chế, đây là điều đáng chú ý.

Khả năng tạo, chỉnh sửa và xuất hiện trong video với hai bản cập nhật Google Vids mới không chỉ là một câu chuyện về năng suất. Đó là một tín hiệu về hướng đi của việc tạo nội dung hỗ trợ bởi AI — và tốc độ khoảng cách giữa "video chuyên nghiệp" và "thứ bạn làm trong mười phút" đang thu hẹp nhanh như thế nào.

Điều Gì Đã Xảy Ra

Vào ngày 16 tháng 7 năm 2026, Google công bố hai bản cập nhật lớn cho Google Vids: sự xuất hiện của Gemini Omni trong nền tảng và giới thiệu avatar cá nhân. Cả hai tính năng đều được thiết kế để loại bỏ hai điểm ma sát lớn nhất trong sản xuất video — độ phức tạp kỹ thuật của chỉnh sửa và sự lúng túng khi xuất hiện trước camera.

Gemini Omni trong Google Vids cho phép bạn tạo các clip video chất lượng cao bằng cách sử dụng các lời nhắc văn bản bằng ngôn ngữ tự nhiên. Bạn cũng có thể cung cấp cho nó các tham chiếu hình ảnh — một bức ảnh, một bản phác thảo thô, một ảnh chụp màn hình — và Omni kết hợp những đầu vào đó thành một video phù hợp với tầm nhìn bạn mô tả. Quy trình chỉnh sửa là hội thoại: thay vì kéo các clip và điều chỉnh các đường cong màu, bạn mô tả những gì bạn muốn thay đổi. Thay đổi nền. Sửa ánh sáng. Làm cho người trình bày trông ít vội vàng hơn. Omni xử lý nó.

Điều này dựa trên việc triển khai trước đó của Google về Veo 3.1 cho tất cả người dùng Vids vào tháng 2 năm 2026, lần đầu tiên đưa tính năng tạo video AI vào nền tảng. Gemini Omni đưa nền tảng đó tiến xa hơn bằng cách làm cho vòng lặp chỉnh sửa lặp lại và được điều khiển bằng chat — bạn tinh chỉnh từng bước, không phải một lần.

Avatar cá nhân là bản cập nhật thứ hai, và có thể là bản cập nhật ấn tượng hơn. Tải lên một bức selfie và một bản ghi âm giọng nói ngắn, và Google Vids tạo ra một avatar kỹ thuật số trông và nghe giống như bạn. Avatar đó sau đó có thể thực hiện các bài thuyết trình, hướng dẫn hoặc thông báo thay mặt bạn — không cần thiết lập camera, không cần ghi lại khi kịch bản thay đổi. Mỗi clip được tạo bởi AI đều bao gồm một hình mờ kỹ thuật số để minh bạch.

Cả hai tính năng đang được triển khai ngay bây giờ, với tính đủ điều kiện phụ thuộc vào gói Google Workspace của bạn.

Tại Sao Điều Này Quan Trọng Đối Với Châu Á

Nội dung video ở châu Á không phải là tùy chọn — đó là lớp giao tiếp mặc định. Từ các buổi ra mắt sản phẩm trên Bilibili và YouTube đến các video đào tạo nội bộ được chia sẻ qua WeChat và Slack, video là cách các đội giao tiếp, cách các startup pitch và cách các sản phẩm được giải thích. Vấn đề luôn là chi phí và thời gian sản xuất.

Thuê một biên tập viên video ở Singapore, Jakarta hoặc Seoul rất đắt. Tự làm trong iMovie hoặc Premiere mất hàng giờ mà bạn không có. Kết quả: hầu hết các đội giai đoạn sớm hoặc gửi các bản ghi màn hình chất lượng thấp hoặc bỏ qua video hoàn toàn và tự hỏi tại sao tài liệu của họ không được đọc.

Gemini Omni thay đổi phương trình đó. Một nhà sáng lập ở Thành phố Hồ Chí Minh giờ đây có thể mô tả một hướng dẫn sản phẩm bằng tiếng Việt hoặc tiếng Anh bình thường, tham chiếu một vài ảnh chụp màn hình giao diện người dùng và nhận lại một clip được đánh bóng. Không timeline. Không keyframe. Không outsourcing cho một freelancer với thời gian quay vòng ba ngày.

Tính năng avatar cá nhân mang trọng lượng đặc biệt trong các nền văn hóa kinh doanh có bối cảnh cao của châu Á, nơi việc đặt một khuôn mặt vào một thông điệp là quan trọng. Ở các thị trường như Nhật Bản, Hàn Quốc và trên khắp Đông Nam Á, các tin nhắn video từ một người phát ngôn có thể nhận dạng được — thậm chí là một người kỹ thuật số — mang lại nhiều niềm tin hơn so với một bộ slide. Khả năng tạo avatar đó một lần và sử dụng lại nó trên hàng chục video, bằng nhiều ngôn ngữ nếu cần, là một bộ nhân thực sự cho các đội nhỏ.

Cũng có một góc độ bản địa hóa đáng được gắn cờ. Khi tạo video AI trưởng thành, ma sát của việc sản xuất nội dung đa ngôn ngữ giảm đáng kể. Một startup có người dùng ở Thái Lan, Indonesia và Philippines có thể thực tế duy trì các tài sản video riêng biệt cho mỗi thị trường mà không cần một đội nội dung chuyên dụng. Đó không phải là giả thuyết — đó là hệ quả trực tiếp của hướng đi của công nghệ này.

Hình mờ kỹ thuật số mà Google đã xây dựng cũng có liên quan đến môi trường quy định của châu Á. Một số thị trường trong khu vực — bao gồm Singapore và Hàn Quốc — đang tích cực phát triển các khung công bố nội dung AI. Gửi với hình mờ được tích hợp sẵn đặt Google phía trước đường cong đó và cung cấp cho các đội doanh nghiệp trong các ngành công nghiệp được quy định một dấu vết kiểm toán có thể bảo vệ được.

Điều Này Có Nghĩa Gì Đối Với Các Nhà Phát Triển

Nếu bạn đang xây dựng trên Google Workspace hoặc tích hợp các công cụ Workspace vào sản phẩm của mình, những bản cập nhật này có những hàm ý cụ thể cho những gì bạn có thể gửi cho người dùng.

Cơ hội trực tiếp nhất là trong các công cụ dành cho nhà phát triển cho quy trình công việc nội dung. Các đội sử dụng Google Vids bên trong các đường ống tự động hóa Workspace lớn hơn — hãy nghĩ về các ghi chú phát hành được tạo tự động, bản tổng kết sự cố hoặc các bản cập nhật thành công của khách hàng — giờ đây có thể kích hoạt tạo video theo chương trình thay vì dựa vào một người để ngồi xuống và ghi. Mô hình chỉnh sửa hội thoại có nghĩa là tinh chỉnh hạ lưu cũng có thể được viết kịch bản hoặc tạo mẫu.

Đối với các nhà phát triển xây dựng các công cụ nội bộ hoặc nền tảng hướng tới khách hàng trên MonstarX, khả năng avatar cá nhân mở ra một trường hợp sử dụng cụ thể: phân phối video được cá nhân hóa theo quy mô. Hãy tưởng tượng một quy trình onboarding nơi avatar của một nhà sáng lập hướng dẫn từng người dùng mới thông qua các bước thiết lập — được tạo một lần, phục vụ cho hàng nghìn, được cập nhật bằng cách thay đổi một kịch bản thay vì ghi lại. Loại trải nghiệm đó trước đây chỉ có thể truy cập được cho các đội có ngân sách sản xuất video chuyên dụng.

Mô hình chat-to-edit cũng đáng nghiên cứu từ góc độ kiến trúc UX. Google đang đặt cược rằng giao diện tự nhiên nhất để chỉnh sửa video không phải là timeline — đó là một cuộc trò chuyện. Đó là cùng một cược cơ bản cho hầu hết các công cụ phát triển AI-native hiện đại, bao gồm sự chuyển dịch hướng tới các giao diện ngôn ngữ tự nhiên để tạo mã và triển khai. Nếu người dùng của bạn không phải là kỹ thuật, thiết kế các quy trình chỉnh sửa hoặc cấu hình của sản phẩm của bạn xung quanh AI hội thoại thay vì các điều khiển giao diện người dùng truyền thống ngày càng là lựa chọn đúng.

Từ quan điểm thực tế, các nhà phát triển nên theo dõi một vài điều khi các tính năng này được triển khai:

  • Bề mặt API: Google chưa công bố một API công khai cho tạo video Gemini Omni trong Vids. Theo dõi tài liệu dành cho nhà phát triển Google Workspace để tìm các thay đổi — khả năng này gần như chắc chắn sẽ trở thành có thể lập trình.
  • Tiêu chuẩn hình mờ: Hình mờ kỹ thuật số mà Google nhúng trong các clip được tạo bởi AI có khả năng sẽ phù hợp với các tiêu chuẩn C2PA (Liên minh về Nguồn gốc và Tính xác thực của Nội dung). Nếu bạn đang xây dựng các đường ống nội dung, hãy bắt đầu suy nghĩ về cách bạn sẽ xử lý, bề mặt hoặc loại bỏ các hình mờ này trong các sản phẩm của riêng bạn.
  • Xử lý dữ liệu avatar: Avatar cá nhân yêu cầu tải lên dữ liệu gần giống sinh trắc học — một khuôn mặt và một giọng nói. Ở các thị trường như Hàn Quốc và Singapore với các quy định dữ liệu sinh trắc học nghiêm ngặt, đội pháp lý của bạn cần được đưa vào vòng lặp trước khi bạn xây dựng quy trình công việc tự động hóa tạo avatar cho người dùng.

Mô hình rộng hơn ở đây là một mô hình mà các nhà phát triển ở châu Á nên nội tại hóa: lớp công cụ để tạo nội dung hỗ trợ bởi AI đang hợp nhất bên trong các nền tảng năng suất hiện có. Google Workspace, Microsoft 365 và một số nền tảng chuyên biệt đều đang di chuyển theo cùng một hướng. Các nhà phát triển chiến thắng là những người xây dựng quy trình công việc trên các khả năng này thay vì cố gắng sao chép chúng từ