AI首尾帧生成视频
两张图片,一个片段。设定开场帧和结束帧,模型会生成连接两者的运动——这样你最终停留的构图,就是你自己选的那一个,而不是模型漂移过去的那一个。
- 起始帧和结束帧由你掌控
- 过渡可预期、可重复
- 复用同一帧即可做循环
- 生成的或拍摄的静态图都能用
首尾帧生成是如何工作的
这个模式用美术指导代替了写提示词。你不是在要求一个场景——而是交出框住这个场景的两帧画面,让模型解决中间的部分。
- 01
选择开场帧
上传或生成作为片段开头的静态图。这里构图比分辨率更重要:这一帧里有什么,视频的第一刻就是什么样子,模型不会重新演绎它。
- 02
选择结束帧
加入片段最终要抵达的静态图。两帧之间差别越大,模型需要自行发挥的就越多——中间部分也越容易跑偏。小而有意为之的变化效果最好。
- 03
描述运动,而不是主体
这个模式下的提示词,讲的是如何从 A 到 B:镜头推近、转头、产品旋转、光线变化。主体已经由两帧确定了。
为什么要框定镜头,而不是用提示词描述
结尾提前确定
文字生成视频到最后一帧时,给你的是模型漂移到的任意构图。框定两端则意味着最后一帧是一个明确的决定,当片段还要剪接到其他内容时,这一点很重要。
干净的循环
把同一张图片同时作为首帧和尾帧,片段就会回到起点,这是制作一个没有明显跳帧的循环最直接的方法。
两个镜头之间的转场
取一个片段的最后一帧和下一个片段的第一帧,生成连接它们的运动——转场属于素材本身,而不是叠加在上面的特效。
产品转动与揭示
从正面到四分之三侧面、从合上到打开、从空到满:两帧固定运动的两端,让产品自始至终保持原样。
用你已有的静态图
照片、渲染图、截图,或在图片工作室生成的图片,都可以作为帧使用。不需要所有素材都在同一个工具里制作。
重跑结果可以比较
因为两端都是固定的,用不同的提示词重跑同一组帧只会改变运动本身——这让调整运动成为一次真正的实验,而不是重新抽卡。
框定两端最有价值的地方
循环背景
用于网站页头或直播叠加层的氛围动态,需要无限循环播放而看不出接缝。
前后对比
一个房间、一张脸、一件衣服、一张图表——两种成对才有意义的状态,被做成一段连续的变化。
Logo 与标题动画
品牌标志动态进入完整的标志组合,停在剪辑其余部分所需要的那一帧上。
匹配剪辑
两个互相呼应的构图,用生成的运动连接,而不是用交叉溶解。
产品旋转
在两个商品图角度之间做一次可控的转动,让镜头停在其他地方已经在用的主图上。
从分镜到动态分镜
把画成关键帧的分镜生成为它们之间的运动,向客户展示节奏。
选择模型真正能连起来的两帧
首尾帧生成视频最常见的失败,是要求的变化太大。如果开场帧是夜晚的室外远景,结束帧是室内的一张脸部特写,那么根本不存在能连接它们的连续运动——于是模型会自己发明一个剪切、一段变形或一团涂抹,而这些都不是你想要的。把两帧当作同一个运镜或同一个动作的两端,结果就会保持连贯。
除预期变化之外的一切都保持一致,是让中间过程可信的关键。两帧中的光线、镜头、调色和背景保持相同,只改变应该运动的那部分。当两张静态图来源不同时——一张是拍摄的,一张是生成的——在生成前花几分钟让它们保持一致是值得的,否则模型会把整个片段都花在调和两种不同的画面风格上。
时长是另一个杠杆。在两张非常相似的帧之间生成四秒的片段,会得到缓慢而可控的运动;同样两帧拉到十二秒,模型就有空间加入你没有要求的动作。如果结果显得拖沓,缩短片段通常比重写提示词更有效。
最后要记住,两帧是锚点,而不是风格上的束缚。提示词仍然决定运动的感觉——即使两帧完全相同,手持漂移和固定机位的轨道推进也是两种不同的要求——所以在定稿之前,值得用两三种方式跑一跑同一组帧。
首尾帧常见问题
- 两帧都必须提供吗?
- 不必。只有首帧时,它就相当于普通的图片生成视频,结尾交给模型决定。第二帧才是让它变成可控运动的关键,所以只要最终构图重要,就加上它。
- 两帧可以是不同尺寸吗?
- 它们应该使用相同的画幅比例。形状不一致的帧会被裁切或加黑边以适配你选择的输出比例,这通常意味着其中一帧的一部分会被悄悄丢掉。
- 怎样做出无缝循环?
- 两帧使用同一张图片。片段会从这个构图出发再回到这个构图,所以可以首尾相接地播放,而看不出剪切。
- 哪些模型支持这个模式?
- 只有能接受起始图和结束图的模型才提供这个模式,表单也只显示这些模型。如果你想用的模型不在其中,说明它暂时还不支持首尾帧。
- 它比文字生成视频更贵吗?
- 不会。费用由模型、时长和分辨率决定——和其他任何生成一样。帧本身不收费。