Gemini Omni Flash 视频世界模型
Google DeepMind在2026年5月19日Google I/O发布的视频世界模型,首个版本Gemini Omni Flash可接收文字、图片、音频与视频的任意组合输入生成视频,支持多轮对话式编辑并保持人物与场景一致,已上线Gemini应用、Flow与YouTube Shorts
工具界面
交互式工具即将上线
功能特点
- ✓ 任何输入生成视频:文字、图片、音频与视频可自由组合作为创作素材
- ✓ 对话式编辑:像聊天一样说“换成夜景”“把外套换掉”,逐轮精修同一段画面
- ✓ 基于Gemini对物理、历史、科学与文化知识的理解,让画面与情节更符合常理
- ✓ 自带原生音频生成,画面与声音一次成型,并嵌入SynthID水印便于识别
- ✓ 可在Gemini应用、Google Flow与YouTube Shorts、Create App等多端直接调用
使用步骤
- 在Gemini应用或Google Flow中使用具备权限的Google账号登录
- 上传图片、视频、音频或直接输入文字描述,组合成创作素材
- 生成初版视频后,用自然语言逐轮提出修改,如改光线、换道具、调运镜
- 确认成片后导出,YouTube Shorts创作者可直接在站内使用与再创作
常见问题
Gemini Omni Flash是什么?
Gemini Omni Flash是Google DeepMind在2026年5月19日Google I/O上发布的Gemini Omni家族首个模型,官方定位是一步迈向“从任何输入创建和编辑任何内容”的世界模型,首期聚焦视频生成。
它和Veo这类视频模型有什么不同?
Veo主打生成高质量视频片段,而Omni把生成、理解与编辑串在一起:它能同时读取文字、图片、音频和视频,用对话反复修改同一段画面并保持一致性,官方称其结合了Gemini的智能与Google的生成式媒体模型,是一次世界理解与多模态编辑的跃升。
免费能用吗?
Google AI Plus、Pro与Ultra订阅者可在Gemini应用和Google Flow中使用;YouTube Shorts与YouTube Create App用户自发布当周起可免费使用,是Google目前覆盖面最广的AI视频生成产品之一。
生成的视频会有水印吗?
会有。所有用Omni生成的视频都会嵌入SynthID水印,方便被识别为AI生成内容,这也是Google推进AI内容透明化的一部分,多家第三方也已采纳该标准。
它有什么已知局限?
据Google DeepMind官方模型卡,Gemini Omni Flash在多次编辑后保持完全一致性、复杂运动场景的生成以及精准渲染文字方面仍有挑战,官方会随模型迭代持续更新模型卡说明。