使用Google Vids的两项更新创建、编辑和出演视频

Google刚刚大大降低了为内部内容聘请视频制作团队的必要性。Google Vids的两项新功能——Gemini Omni和个人虚拟形象——让你无需接触摄像机或时间轴就能生成、优化和出演视频。

Share
Editorial illustration: A film editor's desk in stark overhead view: a glowing monitor displaying a video timeline with mult — MonstarX

使用Google Vids的两项更新创建、编辑和出演视频

Google刚刚大大降低了为内部内容聘请视频制作团队的必要性。Google Vids的两项新功能——Gemini Omni和个人虚拟形象——让你无需接触摄像机或时间轴就能生成、优化和出演视频。对于亚洲各地正在制作产品演示、入职流程和营销内容的开发者和创始人来说,这值得密切关注。

使用Google Vids的两项更新创建、编辑和出演视频不仅是提高生产力的故事。这是一个信号,表明AI辅助内容创建的发展方向——以及"专业视频"与"你在十分钟内制作的内容"之间的差距缩小的速度有多快。

发生了什么

2026年7月16日,Google宣布了Google Vids的两项重大更新:Gemini Omni进入该平台,以及个人虚拟形象的推出。这两项功能都旨在消除视频制作中最大的两个摩擦点——编辑的技术复杂性和在镜头前的尴尬。

Google Vids中的Gemini Omni让你可以使用纯文本提示生成高质量的视频片段。你还可以提供图像参考——一张照片、粗略草图、屏幕截图——Omni会将这些输入融合成与你描述的愿景相匹配的视频。编辑工作流是对话式的:与其拖动片段和调整色彩曲线,你只需描述想要改变的内容。更换背景。修复光线。让演讲者看起来不那么匆忙。Omni会处理这一切。

这是在Google 2026年2月向所有Vids用户推出Veo 3.1的基础上进行的,该版本首次将AI视频生成引入平台。Gemini Omni通过使编辑循环具有迭代性和聊天驱动性来进一步推进该基础——你分步骤优化,而不是一次性完成。

个人虚拟形象是第二项更新,可以说是更引人注目的一项。上传一张自拍和一段简短的语音录音,Google Vids会生成一个看起来和听起来都像你的数字虚拟形象。该虚拟形象可以代表你进行演讲、演练或公告——无需摄像机设置,脚本更改时无需重新录制。每个AI生成的片段都包含一个数字水印,以确保透明度。

这两项功能现在正在推出,符合条件取决于你的Google Workspace计划。

为什么这对亚洲很重要

亚洲的视频内容不是可选的——它是默认的通信层。从Bilibili和YouTube上的产品发布到通过微信和Slack共享的内部培训视频,视频是团队沟通、初创公司推介和产品解释的方式。问题一直是制作成本和时间。

在新加坡、雅加达或首尔聘请视频编辑很昂贵。自己在iMovie或Premiere中制作需要花费你没有的时间。结果是:大多数早期团队要么发布低质量的屏幕录制,要么完全跳过视频,然后想知道为什么他们的文档没有被阅读。

Gemini Omni改变了这一方程式。胡志明市的创始人现在可以用纯越南语或英语描述产品演练,参考几个UI屏幕截图,然后获得一个精美的片段。没有时间轴。没有关键帧。无需外包给三天周期的自由职业者。

个人虚拟形象功能在亚洲高语境商业文化中具有特殊意义,在这种文化中,为信息添加面孔很重要。在日本、韩国和东南亚各地的市场中,来自可识别发言人的视频信息——即使是数字形象——比幻灯片演示更能建立信任。能够生成该虚拟形象一次并在数十个视频中重复使用,如果需要,还可以使用多种语言,对小团队来说是一个真正的倍增器。

还有一个值得关注的本地化角度。随着AI视频生成的成熟,制作多语言内容的摩擦力大幅下降。一个在泰国、印度尼西亚和菲律宾拥有用户的初创公司可以现实地为每个市场维护单独的视频资产,而无需专门的内容团队。这不是假设——这是这项技术发展方向的直接后果。

Google内置的数字水印也与亚洲的监管环境相关。该地区的多个市场——包括新加坡和韩国——正在积极开发AI内容披露框架。内置水印可以让Google走在这条曲线的前面,并为受监管行业的企业团队提供可防守的审计线索。

这对开发者意味着什么

如果你在Google Workspace上构建或将Workspace工具集成到你的产品中,这些更新对你可以向用户提供的内容有具体的影响。

最直接的机会是内容工作流的开发者工具。在更大的Workspace自动化管道中使用Google Vids的团队——想象一下自动生成的发布说明、事件事后分析或客户成功更新——现在可以以编程方式触发视频生成,而不是依赖人工坐下来录制。对话式编辑模型意味着下游优化也可以被脚本化或模板化。

对于在MonstarX上构建内部工具或面向客户的平台的开发者来说,个人虚拟形象功能开启了一个特定的用例:大规模个性化视频交付。想象一个入职流程,其中创始人的虚拟形象为每个新用户演练设置步骤——生成一次,服务于数千人,通过更改脚本而不是重新录制来更新。这种体验之前只有拥有专门视频制作预算的团队才能获得。

聊天到编辑的范式也值得从UX架构的角度研究。Google打赌视频编辑最自然的界面不是时间轴——而是对话。这与大多数现代AI原生开发工具的赌注相同,包括向代码生成和部署的自然语言界面转变。如果你的用户是非技术性的,围绕对话式AI而不是传统UI控件设计你的产品的编辑或配置流程越来越是正确的选择。

从实际角度来看,开发者在这些功能推出时应该跟踪几件事:

  • API表面:Google尚未宣布Gemini Omni在Vids内视频生成的公共API。关注Google Workspace开发者文档的变化——这项功能几乎肯定会变成可编程的。
  • 水印标准:Google嵌入在AI生成的片段中的数字水印可能会与C2PA(内容出处和真实性联盟)标准保持一致。如果你在构建内容管道,开始思考你将如何在自己的产品中处理、呈现或删除这些水印。
  • 虚拟形象数据处理:个人虚拟形象需要上传生物识别相邻数据——面部和声音。在韩国和新加坡等拥有严格生物识别数据法规的市场中,在为用户构建自动化虚拟形象创建工作流之前,你的法律团队需要参与其中。

这里的更广泛模式是亚洲的开发者应该内化的:AI辅助内容创建的工具层正在现有生产力平台内整合。Google Workspace、Microsoft 365和少数几个专业平台都在朝同一方向发展。赢家是那些在这些功能之上构建工作流的开发者,而不是试图从头复制它们的开发者。