如何使用 Gemini Omni

Step 1

添加参考素材

上传用于引导人物、视觉风格、动作和节奏的图片、视频片段、Logo 或音频。

Step 2

描述场景或编辑要求

使用日常语言说明想要的场景。编辑现有视频时,每次描述一个明确改动,帮助 Gemini Omni 保留无关细节。

Step 3

生成并继续细化

生成视频并检查动作、光线、文字和音频,然后继续通过对话完善具体部分,满意后下载。

为什么选择 Gemini Omni

原生多模态创作

在一个创作请求中组合文字、图片、音频和视频参考。Gemini Omni 会共同理解这些素材,构建统一场景,而不是把每种输入当成彼此独立的步骤。

对话式多轮编辑

使用自然语言指令更换背景、镜头角度、物体或视觉风格。多轮编辑可逐项完善细节,同时维持整个片段的连贯性。

协调动作、音频与文字

让动作、声音与屏幕文字协调呈现,适合制作更清晰的讲解视频、品牌片段、社交视频和视觉故事,无需分别处理每一种元素。

Gemini Omni 1.1 Flash 与原版 Omni Flash 对比

当前页面

Original Omni Flash

场景延续上下文
仅参考最后 1 秒
累计延长时长
初始工作流较短
首尾帧控制
发布时未重点支持
草稿分辨率
标准生成流程
最终分辨率
较早期的输出选项
视频参考
参考工作流较受限
适用场景
标准 AI 视频生成
使用 Gemini Omni 创作
新版本

Gemini Omni 1.1 Flash

场景延续上下文
最长 10 秒
累计延长时长
累计最长 40 秒
首尾帧控制
支持
草稿分辨率
360p 快速预览
最终分辨率
1080p 或 4K 放大
视频参考
最长 3 秒
适用场景
可控制作与快速迭代
查看 1.1 Flash

谁在使用 Banoo AI?

日常创作者

将简单创意快速变成插画、社交图片和热门风格作品。还可以通过自然语言编辑个人照片,无需复杂的修图软件。

营销与商务团队

制作风格统一的商品图、AI 虚拟人物、广告素材和信息图。通过多种 AI 模型比较效果、优化版式,并保持营销视觉的一致性。

数字艺术家

通过多轮创作完善角色、场景和视觉概念。保持人物面容、服装与艺术方向一致,适用于漫画、故事板、短片及其他创意项目。

Gemini Omni 常见问题

什么是 Gemini Omni?
Gemini Omni 是 Google 面向混合输入内容生成推出的多模态模型系列。首个以视频为核心的 Gemini Omni Flash 可融合文字、图片、音频和视频参考,并支持对话式视频编辑。
可以使用哪些参考素材?
可以使用文字指令、静态图片、品牌素材、音轨和现有视频片段来引导项目。只需加入能够说明所需人物、环境、风格、动作或节奏的参考内容。
Gemini Omni 可以通过对话编辑现有视频吗?
可以。使用自然语言描述明确改动,例如替换背景或调整物体。分多轮进行聚焦修改,并说明哪些元素需要保持不变。
Gemini Omni 提示词应该怎么写?
描述所需主体、动作、环境、镜头运动、视觉风格、光线和声音。修改时,每轮调整一个主要变量,并明确指出要编辑的场景部分。
Gemini Omni 适合哪些项目?
Gemini Omni 适合社交短片、产品视觉、讲解视频、品牌内容、故事概念和电影感实验,尤其适用于需要混合参考与迭代编辑的项目。

使用 Gemini Omni 开始创作

在 Banoo AI 中汇集参考素材与创意,生成连贯视频,并通过对话继续完善细节。