TIME WAIT.
#AI Tutorials 2026年8月30日 12 MIN READ

第一次接到 500 元商单,我是怎么做完这支 AI 广告短片的

从角色一致性、关键帧、Google Flow 到 Google Vids 剪辑,一支真实 38 秒饮用水广告的完整制作流程,踩过的坑都写下来了。

第一次接到 500 元商单,我是怎么做完这支 AI 广告短片的

从角色一致性、关键帧、Google Flow 到 Google Vids 剪辑,踩过的坑都写下来了

这篇不是功能介绍,它来自一支真实做完的 38 秒饮用水广告。过程里遇到过几乎所有新手都会碰到的事。

本文里的产品、Logo 和广告语只用于演示制作方法。正式发布商业内容前,请确认人物、音乐、产品包装和品牌素材的使用授权。

配图

先把这支片拆开看

成片约 38 秒,16 比 9 横屏。它由 15 段短视频拼出来。每一段都是先有一张静态关键帧,再让 Veo 生成几秒钟动态,最后在 Google Vids 里裁短、拼接。

整条流程很朴素。

写分镜
→ 准备人物和产品参考图
→ 生成关键帧
→ Google Flow 做出一段段视频
→ 生成中文旁白和找音乐
→ 上传 Google Drive
→ Google Vids 拼接、加字、加声音、导出

你不需要在第一天把所有工具都学会。先把一件事做完,再继续下一件。

开工前先把素材放好

新手最容易在后半程乱掉。视频、旁白、产品图散在下载目录里,到了 Google Vids 只能靠缩略图猜哪个是哪个。

先在电脑里建一个项目文件夹。

饮用水广告项目
├── 01 人物参考
├── 02 产品参考
├── 03 关键帧 K01-K15
├── 04 视频 V01-V15
├── 05 旁白 VO01-VO06
├── 06 背景音乐
├── 07 Logo 和结束卡
└── 08 最终导出

之后下载一个视频,就改一次名字。不要等全部做完再整理。

V01_森林行走.mp4
V02_侧脸抬头.mp4
V14_饮水特写.mp4
V15_结束卡背景.mp4

配图

故事先写短,镜头才会清楚

这支广告的故事并不复杂。一个登山者走进雾气森林,经过溪流和山林,抵达山顶,喝下一口水。前半段是冷绿,后半段慢慢变暖。

先把这件事交给 ChatGPT,要求它给你一张镜头表。别让它直接写一支很长的广告文案。你需要的是一个能落到画面上的分镜。

请为一支 38 秒、16 比 9 的饮用水广告写分镜。

主角是一名 30 岁左右的中国女性登山者。她进入雾气森林,经过溪流和山林,最后抵达山顶并饮用产品。

前半段是冷绿色森林、薄雾和溪流。后半段逐渐转为温暖金色、山脊和日落。

人物不说话,不制作口型。镜头动作缓慢、自然、克制。产品、字幕和 Logo 都留到后期处理。

请拆成 15 个镜头。每个镜头写出时长、景别、动作、摄影机运动、环境、光线和画面留白位置。

这支片最后用了下面的节奏。你可以照着拍,也可以替换自己的题材。

Veo 生成的视频通常会比最终需要的长。没有关系。你只取最自然的一小段。

配图

先让人物站住,再去换场景

如果每个镜头都重新让模型”生成一个女登山者”,你很快会得到 15 个长得差不多但并非同一个人的角色。有人换了脸,有人换了夹克,还有人背包莫名其妙消失。

先准备两张人物图就够用。

人物设定最好从头用到尾。下面这段可以放进图片提示词,也可以放进 Flow 的角色信息。

30 至 34 岁的中国女性登山者。
椭圆脸,深棕色眼睛,黑色直发,轻薄刘海,低马尾,自然皮肤纹理。

固定服装为棕色防水连帽登山夹克、浅灰色圆领内搭、卡其色户外长裤、黑色登山鞋和橄榄棕色登山背包。

她安静、自然、坚韧。后续画面保持相同的脸部身份、发型、服装颜色、背包结构和身体比例。

产品图也要单独准备。正面清晰、背景干净就行。真实包装上的中文和 Logo 不要寄希望于模型每次都画对,特别是饮水镜头和结束卡。

配图

每段视频先有一张静态图

关键帧不是视频里的任意一帧。它是你先设计好的一张画。人物站在哪里,摄影机看向哪里,背景有多亮,文字以后留在哪里,都在这张图里定下来。

K01 到 K15 各生成一张。生成时,人物镜头都带上同一组人物参考。纯风景镜头,例如飞鸟、河谷、水下鹅卵石,不需要人物参考。

K01 可以这样写。

使用提供的人物参考图固定人物身份。

同一名中国女性登山者,保持相同的脸型、五官、黑色刘海、低马尾、棕色连帽登山夹克、浅灰色圆领内搭、卡其色户外长裤、黑色登山鞋和橄榄棕色背包。

远景建立镜头。她独自沿着中国南方山地森林中的狭窄小路向前行走。人物位于画面中央偏下,在环境中比例较小。周围是高大的树木、苔藓、蕨类、湿润落叶和淡淡晨雾。

冷绿色调,柔和散射光,28 毫米电影镜头,写实、电影感、16 比 9 横向构图。

不生成产品、字幕、文字、Logo、水印和其他人物。

产品镜头 K14 有一个小原则。动作先停在最容易成功的位置。瓶口已经贴近嘴唇,比”从拿起瓶子到喝水”稳定得多。

使用提供的人物参考图固定人物身份。严格使用提供的饮用水产品图作为产品参考。

同一名女性登山者在山顶饮水的侧脸特写。她自然握住产品瓶身,瓶口已经贴近嘴唇。远山虚化,瓶身有自然高光和少量冷凝水。

保持产品的瓶型、瓶盖、瓶身纹路、标签颜色和整体比例。保持人物脸部、发型和服装不变。

写实商业摄影,85 毫米镜头,16 比 9。

不生成第二瓶产品,不增加手指,不改变包装文字,不生成字幕和 Logo。

文字和 Logo 先不要出现在关键帧里。后面在 Google Vids 手动加,稳定得多。

配图

Flow 里的 Character,只负责记住这个人

如果你已经在 ChatGPT 或其他图像工具里生成了人物图,不要在 Flow 再造一个人。直接用现成的肖像和全身图建立 Character。

在 Google Flow 中点击 Characters,再点 New Character。上传人物肖像,填写角色信息。如果没有全身图,可以点 Create Body。已经有全身图时,上传它就好。

角色名称建议直接写 登山女主。后面在提示词框里输入 @,就能选到她。

旁白声音先不用设。角色页里的声音和后期中文旁白是两件事,这支广告没有人物口型,用 ElevenLabs 或其他配音工具会更好控制。

配图

配图

Google Flow 只做一件事,让关键帧动起来

Flow 里有几个词会让人卡住。

配图

普通镜头用 Frames 就够了。把 K01 放到 Start frame,End frame 留空。End frame 适合做明确的两图过渡,这支片大部分镜头用不到它。

V01 的动态提示词如下。

将上传的 K01 图片作为严格的起始帧。画幅为 16 比 9 横向视频。

保持第一帧中人物的脸型、五官、黑色刘海、低马尾、棕色连帽登山夹克、浅灰色圆领内搭、卡其色长裤、黑色登山鞋和橄榄棕色背包完全一致。

她沿森林小路缓慢自然地向镜头方向行走。摄影机以相同速度平稳后退,保持远景构图。她的手臂和背包随着脚步轻微运动,树间薄雾缓慢漂动,叶片只有细微晃动。

写实、电影感、冷绿色森林晨雾、自然光线、动作克制。

不生成字幕、文字、Logo、水印、产品、其他人物、对白、口型或背景音乐。不改变人物脸部,不更换服装,不增加手指,不闪烁,不突然移动镜头。

后面 15 段视频都沿着同一个思路做。镜头里的动作要少,摄影机一次只做一个动作。

配图

生成时选 4 秒、6 秒还是 8 秒,不必太纠结。最后能用的常常只有一两秒。短镜头先选系统允许的时长,剪辑时再裁。

产品镜头单独用 Ingredients

V14 不建议只用 Start frame。产品一旦参与动作,模型容易把瓶型、瓶盖和标签改掉。

切换到 Ingredients,把 K14、产品正面图和 @登山女主 放在同一次生成里。K14 管构图,产品图管包装,Character 管女主的脸和衣服。

使用当前添加的三项参考素材。

第一项是女主饮水画面的构图参考。第二项是饮用水产品的真实包装参考。登山女主是固定人物身份参考。

保持女主的脸型、五官、黑色刘海、低马尾、棕色登山夹克、卡其色长裤和橄榄棕色背包完全一致。

严格保持产品的透明 PET 瓶、白色瓶盖、瓶身纹路、标签颜色、红白布局和整体比例稳定。

瓶子已经贴近人物嘴唇。人物只做极轻微的手部和吞咽动作。瓶中水体、高光和冷凝水只做细微变化。摄影机非常缓慢地向人物和产品推进。

不旋转瓶子,不改变瓶身长度、宽度、材质和标签布局,不生成第二瓶产品,不增加手指,不改变人物脸部,不生成字幕、文字、Logo、对白或音乐。

素材先传 Drive,Google Vids 会好用很多

Google Vids 的 Uploads 面板在一些账号里只显示 Google Drive 和 Google Photos。别在剪辑时才发现文件不在里面。

新建一个 Drive 文件夹,把 15 个视频、6 段旁白、音乐、产品 PNG 和 Logo 全部上传。

娃哈哈视频素材
├── V01-V15
├── VO01-VO06
├── BGM.mp3
├── 产品透明底.png
└── 官方 Logo.png

等上传完成再开 Google Vids。后面从 Drive 点击素材,会比在多个窗口里找文件轻松得多。

配图

Google Vids 从粗剪开始

打开 vids.new,选择 Blank vid。先确认画幅是 Widescreen 16 比 9。

右侧会看到 AI Video、Voiceover、Music、Image、Uploads、Text 等按钮。视频、旁白和音乐已经在前面做好了,这里主要用 Uploads 和 Text。

先导入 V01。

  1. 点击 Uploads
  2. 在 Google Drive 中找到 V01
  3. 点一下,把它放进当前 Scene
  4. 选中视频,铺满画布
  5. 关闭 Veo 原生声音
  6. 打开 Show timing,裁剪视频

每段视频占一个 Scene。放完 V01 后点时间线末端的 + 新建 Scene 2,再放 V02。不要在同一个 Scene 里连续点两个视频,它们会叠在一起。

粗剪时长可以先按下面这张表来。前后差 0.1 秒没关系。动作顺不顺比数字更重要。

配图

V01 正面行走直接接 V02 侧脸抬头,容易显得突然。先试最短的 Fade,控制在 0.15 到 0.25 秒。两张脸重叠时,不要硬用淡化。插入半秒左右的水面或河谷空镜,再切到侧脸更自然。

配图

配图

配图

配图

文案、旁白和音乐都放在粗剪之后

画面还没排顺时,先不要急着加音乐。否则你每改一次镜头,声音都得重新对。

中文文案用 Text,不用 Captions

Captions 是逐字字幕样式。广告里的几句文案要自己摆位置,点击右侧 Text 添加文本框。

推荐样式如下。

字体  Noto Sans SC
普通文案  30 pt
结束卡广告语  42 pt
产品名称  26 pt
颜色  白色
字重  Regular 或 Medium
阴影  轻微黑色阴影
动画  Fade

找不到 Noto Sans SC 时,依次试 Noto Sans CJK SC、思源黑体、Google Sans 或 Arial。

配图

文字的时间按当前 Scene 算。选中文字框,打开 Show timing,拖动文字时间条的左右边缘。

配图

配图

旁白要拆成六段

旁白拆开以后,你可以把每句话放在对应镜头上,不需要在一条长音频里找位置。

VO01  向自然,再近一点。
VO02  一路向前,心也渐渐清澈。
VO03  每一口,都是简单的纯净。
VO04  抬起头,脚步也轻了。
VO05  这一刻,只需要一口纯净。
VO06  娃哈哈饮用纯净水。纯净相伴,一路向前。

旁白文件放进 Drive 后,在 Vids 时间线先点对应总时间,再从 Uploads 选择文件。

配图

选中旁白,将它设为 Narrative。

音乐先听节奏,再裁长度

背景音乐来自 Suno、Pixabay Music、YouTube Audio Library 或其他有授权的音乐库都可以。使用前看清下载和商用条款。Suno 的免费试听音乐不能通过录屏或录音方式绕过下载限制。

把音乐放在第 0 秒,选中音乐轨道后设置为 Background。音量先从 20% 到 30% 试起。旁白一出现,音乐还盖住人声,就继续往下调。

开始时间  第 0 秒
结束时间  视频结束
淡入  0.8 秒
淡出  1 秒

音乐有一分多钟时,只保留视频需要的部分。拖动音乐轨道右端,裁到视频结尾。想跳过前奏时,把音乐在高潮开始处切开,删除前奏,再把剩余片段拖到第 0 秒。不要把音乐加速。

配图

最后一幕用真实产品图收住

V15 的山顶视频只是背景。产品、品牌名和广告语放在后期里。

右侧  女主和山顶背景
左侧  真实产品 PNG
中间偏左  纯净相伴,一路向前。
广告语下方  产品名称或官方 Logo

产品图带白底时,可以在 Vids 里用 Edit image 尝试移除背景。处理完仍要和原产品图对照。品牌字、标签和颜色不能悄悄变掉。

结束卡至少保留四秒。最后这几秒没有复杂动作,让产品和文案停在画面上就够了。

配图

导出前,先完整看两遍

第一遍只看画面。人物有没有变脸,内搭和背包有没有变化,瓶子有没有变形,文字有没有挡住脸和产品,最后一幕有没有停够时间。

第二遍只听声音。旁白要清楚,音乐不要压住人声,产品名读音要正确,音乐结尾要自然淡出,Veo 原生声音不要残留。

完成后在 Google Vids 顶部点击 File,再选 Download as MP4。下载到电脑后,用手机播放一次。手机上最容易看出文字太小、音乐太响和产品露出不够的问题。

成品视频(片中产品因合规问题,已被替换):

视频 1920x1080 MP4

成品视频封面

/related_artifacts

Manga Colorizer Pro:基于 Google Flow 的漫画线稿 1:1 上色工作流
#AI Tutorials 2026年8月24日

Manga Colorizer Pro:基于 Google Flow 的漫画线稿 1:1 上色工作流

基于 Google Flow 的 Tool Builder,将官方草图模板改造为专业漫画上色工具,实现黑白线稿 1:1 结构锁定与高保真色彩填充。

阅读全文 arrow_right_alt
Gemini Omni Flash:Google 的对话式视频生成与编辑模型怎么用
#AI Tutorials 2026年7月01日

Gemini Omni Flash:Google 的对话式视频生成与编辑模型怎么用

Google 多模态预览模型:文生视频、图生视频与有状态编辑,统一接入 Interactions API。

阅读全文 arrow_right_alt