Wan 2.7 图生视频:首帧、时间轴提示词与运动控制
Wan 2.7 是一个图生视频模型:给它一张首帧和一段提示词,它就动画出一段 5–15 秒、可带音频、可逐秒控制的片子。它的强项是精确——用时间轴提示词逐秒编排“什么时候变什么”,片子就按计划走、不乱飘。本文讲清决定片子“有章法”还是“乱”的关键:怎么准备首帧、怎么写「At 00:XX」时间轴、怎么让运动和镜头稳住,以及怎么绕开它已知的弱点。这些都能在 JoyInAIGC 上做。
Wan 2.7 能做什么
Wan 2.7 把一张静态图变成一段 5 到 15 秒的短视频,还能生成配套音频。它和“一句话让图动起来”那类工具的区别在于逐帧控制:你写一条时间轴,告诉模型每一秒发生什么,片子就按计划走、不乱飘。这让它很适合商品演示、简短的出镜口播,以及任何运动需要踩点的镜头。
从一张过硬的首帧开始
首帧决定起始状态——姿势、场景、光线和整体风格。给模型一张好首帧,后面一切都更省事。让主体大约占画面 60–70%,四周留出运动空间。避免裁切的手、被挡的脸、杂乱的背景和不自然的关节角度。输入至少 1024×1024,别用刺眼的 HDR 或过度锐化——过度处理的帧一动就容易闪烁。
→ 打开图生视频写「At 00:XX」时间轴提示词
Wan 2.7 读一条「At 00:XX」时间轴,每秒一行。第一行 At 00:00 锚定镜头:景别、机位角度、主体、姿势、场景、光线、情绪和质量标签。之后每一行只描述“变化”——先一个小动作,再一个大一点的——而不是重复静态细节。整段提示词控制在约 50–200 词,且 5000 字符以内。
一个干净的模板,以商品转台为例:「At 00:00,平视中景,一只白色运动鞋放在哑光展台上,柔和影棚光,干净高级,对焦锐利。At 00:01,展台开始缓慢旋转。At 00:02,鞋转到露出侧面。At 00:03,完成轻缓的半圈。At 00:04,正对镜头停稳。机位保持静止。无畸变。」
运动、镜头与音频
三条规则让运动可信。每条镜头只用一个运镜——完全静止的机位是最安全的默认。用“缓慢”“轻轻”“逐渐”这类柔和的速度词描述运动,模型比处理突兀动作更稳。并在 00:00 那行设定光线,让镜头运动时保持一致。Wan 2.7 还能生成音频;简短、带情绪标注的短句比长对白效果好。
内置提示词优化
Wan 2.7 内置提示词优化:提交一段短提示词,让模型把它扩写成更完整的。用来快速起草很方便。要注意扩写可能在你在意的细节上跑偏,所以定了方向之后,把重要的东西手动锁死——主体身份、景别、姿势、镜头行为和最终时序——别全交给自动扩写。
已知局限——以及怎么绕过
三个弱点值得提前规避。纹理闪烁:蕾丝、格纹这类细密图案一动容易闪——首帧尽量用简单纹理、光线保持稳定。长视频掉质量:太长的片子会丢细节,所以把较长的动作拆成 5–8 秒的段,每段专注一个运动。面部一致性:剧烈运动会让脸变形——加上“face stable, no deformation”,减小运动幅度、机位保持不动。手也仍是常见弱点;手势简单、手远离画面边缘,涉及手时加上“fingers maintain correct anatomy”。
常见问题
Wan 2.7 的片子能多长?
5 到 15 秒。为了质量,把 5–8 秒当甜蜜点,较长的序列拆成几段,每段围绕一个动作。
首帧该用多大分辨率?
至少 1024×1024。主体占 60–70%,避免裁切的手和杂乱,别过度锐化——干净的帧动起来更好。
为什么每次结果都不同?
扩散模型含受控随机性,同一提示词仍会变。生成两三个候选挑最好;更具体的提示词和明确的质量约束能收窄范围。
手或脸变形了怎么修?
手势简单、手远离边缘,加上“fingers maintain correct anatomy”和“face stable, no deformation”,减小运动幅度,涉及手或脸时多出几个版本。
Wan 2.7 还是 Seedance 2.0,用哪个?
都很强。想在图生视频里做精细的逐秒时间轴控制,Wan 2.7 出彩。Seedance 2.0 模式更全(文/图/尾帧、修改、延长)、最高 4K。用同一张首帧两个都试,留下更合适的那个。