JoyInAIGC
AI 营销与创作者视频

Wan 2.7 图生视频:首帧、时间轴提示词与运动控制

2026-08-05·7 分钟阅读
Wan 2.7 图生视频——一帧进,15 秒出

Wan 2.7 是一个图生视频模型:给它一张首帧和一段提示词,它就动画出一段 5–15 秒、可带音频、可逐秒控制的片子。它的强项是精确——用时间轴提示词逐秒编排“什么时候变什么”,片子就按计划走、不乱飘。本文讲清决定片子“有章法”还是“乱”的关键:怎么准备首帧、怎么写「At 00:XX」时间轴、怎么让运动和镜头稳住,以及怎么绕开它已知的弱点。这些都能在 JoyInAIGC 上做。

Wan 2.7 能做什么

Wan 2.7 把一张静态图变成一段 5 到 15 秒的短视频,还能生成配套音频。它和“一句话让图动起来”那类工具的区别在于逐帧控制:你写一条时间轴,告诉模型每一秒发生什么,片子就按计划走、不乱飘。这让它很适合商品演示、简短的出镜口播,以及任何运动需要踩点的镜头。

从一张过硬的首帧开始

首帧决定起始状态——姿势、场景、光线和整体风格。给模型一张好首帧,后面一切都更省事。让主体大约占画面 60–70%,四周留出运动空间。避免裁切的手、被挡的脸、杂乱的背景和不自然的关节角度。输入至少 1024×1024,别用刺眼的 HDR 或过度锐化——过度处理的帧一动就容易闪烁。

打开图生视频

写「At 00:XX」时间轴提示词

Wan 2.7 读一条「At 00:XX」时间轴,每秒一行。第一行 At 00:00 锚定镜头:景别、机位角度、主体、姿势、场景、光线、情绪和质量标签。之后每一行只描述“变化”——先一个小动作,再一个大一点的——而不是重复静态细节。整段提示词控制在约 50–200 词,且 5000 字符以内。

一个干净的模板,以商品转台为例:「At 00:00,平视中景,一只白色运动鞋放在哑光展台上,柔和影棚光,干净高级,对焦锐利。At 00:01,展台开始缓慢旋转。At 00:02,鞋转到露出侧面。At 00:03,完成轻缓的半圈。At 00:04,正对镜头停稳。机位保持静止。无畸变。」

运动、镜头与音频

三条规则让运动可信。每条镜头只用一个运镜——完全静止的机位是最安全的默认。用“缓慢”“轻轻”“逐渐”这类柔和的速度词描述运动,模型比处理突兀动作更稳。并在 00:00 那行设定光线,让镜头运动时保持一致。Wan 2.7 还能生成音频;简短、带情绪标注的短句比长对白效果好。

内置提示词优化

Wan 2.7 内置提示词优化:提交一段短提示词,让模型把它扩写成更完整的。用来快速起草很方便。要注意扩写可能在你在意的细节上跑偏,所以定了方向之后,把重要的东西手动锁死——主体身份、景别、姿势、镜头行为和最终时序——别全交给自动扩写。

已知局限——以及怎么绕过

三个弱点值得提前规避。纹理闪烁:蕾丝、格纹这类细密图案一动容易闪——首帧尽量用简单纹理、光线保持稳定。长视频掉质量:太长的片子会丢细节,所以把较长的动作拆成 5–8 秒的段,每段专注一个运动。面部一致性:剧烈运动会让脸变形——加上“face stable, no deformation”,减小运动幅度、机位保持不动。手也仍是常见弱点;手势简单、手远离画面边缘,涉及手时加上“fingers maintain correct anatomy”。

自己试一下

如何用 Wan 2.7 做图生视频:准备一张过硬的首帧、写「At 00:XX」时间轴提示词、控制运动/镜头/音频,以及绕开已知局限。

试试图生视频

常见问题

Wan 2.7 的片子能多长?

5 到 15 秒。为了质量,把 5–8 秒当甜蜜点,较长的序列拆成几段,每段围绕一个动作。

首帧该用多大分辨率?

至少 1024×1024。主体占 60–70%,避免裁切的手和杂乱,别过度锐化——干净的帧动起来更好。

为什么每次结果都不同?

扩散模型含受控随机性,同一提示词仍会变。生成两三个候选挑最好;更具体的提示词和明确的质量约束能收窄范围。

手或脸变形了怎么修?

手势简单、手远离边缘,加上“fingers maintain correct anatomy”和“face stable, no deformation”,减小运动幅度,涉及手或脸时多出几个版本。

Wan 2.7 还是 Seedance 2.0,用哪个?

都很强。想在图生视频里做精细的逐秒时间轴控制,Wan 2.7 出彩。Seedance 2.0 模式更全(文/图/尾帧、修改、延长)、最高 4K。用同一张首帧两个都试,留下更合适的那个。

相关阅读

Wan 2.7 图生视频:首帧、时间轴提示词与运动控制 — JoyInAIGC