Seedance 2.0提示词写成一张派活单,废片率才降得下来
本文目录
- 它到底特殊在哪,值得为它单学一套写法吗?
- 五段结构该怎么排,每段写多少?
- 三条官方文档里没写、但决定成败的规则
- 运镜这一栏,用行话比用形容词准
- 文字管什么,素材管什么?
- 分工原则只有一句
- 每个引用必须派明确的活
- 参考强度停在七到八成
- 参考素材本身的质量,比调强度重要得多
- 画面内文字怎么写才不出外星文?
- 字幕最稳,因为同步是真同步
- 标题和口号有公式,公式里每一项都承重
- 气泡台词好玩,但方差大
- 画面内文字这件事,对出海内容意味着什么
- 超过八秒的片段,为什么必须写成时间轴?
- 时间轴该切多细,每段写什么
- 视频参考和编辑能干到什么程度?
- 为什么这一块的性价比被严重低估
- 六种最常见的废片,分别是怎么来的?
- 指令过载为什么是六种里最该先治的
- 一条十五秒的视频到底多少钱?
- 想省钱有两条正路
- 做预算时按什么口径算
- 独立站要拍产品视频,这套怎么落地?
- 三个判断,按省下的痛苦排序
- 落到具体场景,哪些活值得做
- 把它接进现有的内容排期,而不是另开一摊
- 换个模型,这套写法还带得走吗?
- 一份可以直接抄走的检查表
- 写之前先确认三件事
- 写完之后逐条对照
- 出片之后按这个顺序排查
- 常见问题解答
- 提示词到底该写多长,越详细越好吗?
- 为什么我没要求配乐,出来的视频却自带背景音乐?
- 参考图放了却不起作用,角色还是换脸,问题出在哪?
- 画面里的中文字总是乱码,有救吗?
- 一条十五秒的视频到底多少钱,网上说一元是真的吗?
- 能不能直接用模特实拍照当角色参考图?
- 权威参考资料
摘要:同一个模型、同样的设置,出片差别几乎全在提示词的体裁上——它该是一张派活单,不是一段描述文。文字负责语义,素材负责标准,每个引用必须写明参考它的哪一部分,一条片段只给一个主运镜,超过八秒改写成时间轴。这篇把五段结构、十二个参考位的分工、画面内文字的三种技法、六种最常见的废片成因全部拆开,并且把网上流传的那个成本数字改正过来——按官方口径,它不是一元十五秒,而是接近一元一秒。
先看两条提示词的差别,十秒钟就能看出这篇要讲什么。
第一条是大多数人第一天会写的:一位美女走在夜晚的城市街道上,电影感,超高清,史诗级运镜,杰作。出来的是素材库画面——一个谁都像的女人,走在哪儿都像的街上,镜头在推和摇之间来回犹豫,两头不靠。因为没提声音,模型还自作主张配了一段背景音乐。
第二条换了个写法:三十多岁女性,深色头发,炭灰色羊毛大衣,走过雨后湿亮的橱窗,停步,在冷空气里呼出白气;雨后夜街,霓虹倒映在湿沥青上;运镜用四十五度角缓慢推镜,止于中近景;音频要小雨声、远处车流、店内隐约的爵士乐,不要配乐。
出来的就是分镜里画的那个镜头。具体的人,带物理后果的动作,一个有明确终点的运镜,一套自己点的声场。模型没变,设置没变,钱也差不多——差别全在提示词里。
这篇要立的总纲只有一句:Seedance 2.0的提示词是一张派活单,不是一篇描述文。文字管语义,也就是谁在做什么;素材管标准,也就是长什么样、怎么动。见过的废片里,九成的根源是这两个职责搞混了,而不是形容词写少了。
它到底特殊在哪,值得为它单学一套写法吗?
市面上的视频模型不少,为什么这一个的提示词要单独学?因为它有三个结构性特征,直接决定了写法不一样。
第一,音频和画面是一次前向生成出来的,不是先出画面再配音。这意味着声音不是后期装饰,而是和画面同一层的可控对象——你点名要什么声音,模型在生成画面的同时就在对齐它。反过来也成立:你不点名,它就替你点。绝大多数第一次用它的人踩的第一个坑就在这儿。
第二,参考素材的通道又多又杂。九张图、三段视频、三段音频,各自能承担完全不同的职责。别的模型里参考图基本只有一种用法,这里的图片可以是角色标准、可以是场景锚点、可以是精确的标识造型,而视频和音频负责的是时间维度上的东西。通道一多,分工就成了必修课。
第三,它偏听话,而不是偏发挥。这条最影响写作习惯。有些模型你给模糊指令能收获惊喜,它不会——模糊指令换来的是字面意义上的平庸:一个平均的人,走在一条平均的街上。它的上限很高,但要靠你把话说具体才够得着。
把这三条合起来看,结论就是本文的总纲:写它的提示词,靠的不是文采,是分工意识。哪些交给文字,哪些交给素材,哪些必须点名,哪些必须留白,想清楚这四件事,出片率就能翻上去。
五段结构该怎么排,每段写多少?
官方给的基础公式是主体加运动加环境加运镜加美学加音频,运动之后的部分全部标注为非必须。公式本身没错,但它长得像一张购物清单,很多人的第一反应就是每一栏都塞满。
更好用的是带预算的版本,可以直接抄:
- 主体:谁或者什么,一到两个具体特征,到此为止。
- 动作:一条主动词链,必须写出物理后果。
- 场景:地点加光线,一句话。
- 运镜:只写一个主运镜,可以补一个终点状态。
- 风格与音频:视觉基调,加上点名具体的声音;不要配乐就明写不要配乐。
三条官方文档里没写、但决定成败的规则
规则一,全文控制在六十到一百词。指令遵循度按位置急剧衰减:排在前面的两三条几乎每次都执行,写满八条通常随机命中四五条。所以排查废片的第一步不是加要求,而是砍要求——先砍到一百词以内再谈别的,一半的问题砍完就消失了。
这条规则的另一面是排序变得极其重要。既然后面的会被稀释,那就把不可妥协的那一条放最前面。想要角色一致,主体特征前置;想要那个运镜,运镜前置。词数预算逼你做取舍,而取舍本身就是导演的活。
规则二,动词比形容词值钱。惊艳、电影感、绝美的舞者,给模型的可动画信息是零;舞者骤然下沉旋转、裙摆展开、随即利落起身,给的是一段带物理后果的动作序列。同理,落叶飘散只能落到屏保上,落叶在每次踏地时四散才能落到具体运动上。
规则三,一条片段只给一个主运镜。它对专业运镜词汇的理解确实好——推镜、摇镜、环绕、跟拍、变焦、一镜到底,中文直接写就行。但它不会仲裁同一片段里的两条运镜指令:固定镜头和环绕主体写在一起,出来的是抖动、漂移,或者两头不靠的折中。要两个运镜就拆两个镜头,用切镜显式标记。
| 栏位 | 翻车写法 | 有效写法 |
|---|---|---|
| 主体 | 一位美女 | 三十多岁女性,深色头发,炭灰色羊毛大衣 |
| 动作 | 走路,很好看,电影感 | 走过雨后湿亮的橱窗,停步,在冷空气里呼出白气 |
| 运镜 | 动感镜头,史诗级运镜,环绕加变焦 | 四十五度角缓慢推镜,止于中近景 |
| 音频 | 不写 | 小雨声,远处车流,店内隐约爵士乐,不要配乐 |
音频那一行最容易被跳过。音视频在同一次生成里一起产出是这个模型的招牌能力,所以音频栏空着买到的不是安静,是一段你没点的配乐。在这个模型里,安静是一条指令,不是留白。
运镜这一栏,用行话比用形容词准
它对专业运镜词汇的理解,是整个模型里最靠谱的部分之一,而且中文直接写就行,不用翻译成英文。既然如此,就别再写动感镜头、大气运镜这类形容词了,直接点名。
- 推镜与拉镜:镜头沿着视线方向靠近或远离主体,适合把注意力收到产品细节上。
- 摇镜与移镜:机位不动只转方向,或者机位平移,适合展示环境和陈列。
- 环绕:绕着主体转,适合让一个静止的物体显出体积感,是产品视频里最常用的一个。
- 跟拍:镜头跟着运动主体走,适合开箱、使用过程这类有连续动作的内容。
- 一镜到底:明确要求全程不切镜,配合视频参考效果更好。
补一个终点状态会让结果更稳,比如缓慢推镜、止于中近景。给运镜一个终点,等于给了模型一个可判断的完成条件;不给终点,它就得自己猜什么时候停。
文字管什么,素材管什么?
这是整套方法里最值钱的一条分工,也是最容易被忽略的一条。
按火山方舟视频生成文档的口径,单次生成最多接受十二个参考文件:九张图、三段视频、三段音频,视频和音频各自的总时长不超过十五秒,在提示词里用引用符号点名。这个量级在同期竞品里没有对手——有的只收一张参考图,有的支持三到四张,而音频参考这一路,公开支持的基本只有它一家。
分工原则只有一句
文字管空间性的决定,素材管时间性和身份性的决定。
画面里有什么、光从哪来、要什么氛围,文字完全够用;但一个运镜的确切缓动、一段动作的节奏、一张脸跨角度的一致性,文字只能逼近,素材本身就是答案。用文字描述一个变焦,得到的是像那么回事的变焦;扔一段参考片进去,得到的是那个变焦。
| 你想控制的 | 用什么 | 为什么 |
|---|---|---|
| 谁在场、发生什么 | 文字 | 语义本来就是语言的活 |
| 角色跨镜头的脸和服装 | 图片引用,多视角组图 | 文字锚不住身份,图片可以 |
| 某个运镜的手感 | 视频引用 | 片段自带时序,文字只是转述 |
| 动作与手势的节奏 | 视频引用 | 节奏经不起翻译成文字 |
| 卡点、按节拍切镜 | 音频引用 | 模型按真实波形踩点 |
| 标识与产品的精确外观 | 图片引用 | 文字描述出来的标识是同人创作 |
| 情绪、光感、氛围 | 文字 | 描述成本低,不需要锚定 |
每个引用必须派明确的活
社区里最高频的翻车是裸引用:写一句参考某段视频,然后就没了。参考它的什么?运镜?动作?调色?不派活的引用会让模型全盘照抄——你只想要那段编舞,结果它的光线、构图、节奏一起污染进你的镜头。
派活单要单独写一块,把每个引用的用途一条一句写清楚:这张图只管角色形象且所有镜头保持一致,这段视频只参考运镜,这段音频只做背景节奏并按节拍切镜。引用的价值不在于你放了几个,而在于每一个都被限定了作用域。
参考强度停在七到八成
默认值七成半选得很准。拉到九成以上,角色会变成纸板人——技术上忠实于参考图,但姿态和光照失去了自然适应能力;低于六成,身份开始漂移,同一个人在第二个镜头里就换了张脸。
保险起见全拉满,是引用系统里的形容词堆砌,塌法一模一样。
参考素材本身的质量,比调强度重要得多
很多人把时间花在调强度上,却没意识到一个更基础的问题:喂进去的素材本身就不合格。
角色组图最常见的毛病是角度太单一。全是正面照,模型在需要侧脸的镜头里就只能猜,一猜就漂。合格的角色组图至少要覆盖正面、四十五度侧、正侧,最好再加一张半身带服装细节的。
运镜参考片最常见的毛病是太长太杂。你只想要那个推镜的缓动,却扔了一段十五秒、中间还切了两次的片子进去,模型不知道该学哪一段。参考片要裁到只剩你想要的那个动作,越干净越好。
音频参考的毛病则是节奏不明确。想让它按节拍切镜,就得给一段节拍清楚的音频;给一段氛围铺底的环境声,模型找不到可以对齐的点,切镜就会随缘。
画面内文字怎么写才不出外星文?
生成视频里的可读文字一直是全行业的公开短板——招牌、屏幕、标题在大多数模型上都是外星文。这一块是它少见的强项,三种技法按可靠度从高到低排。
字幕最稳,因为同步是真同步
写法是指明字幕出现的位置、字幕内容,并要求与音频节奏完全同步。因为音视频是一次生成的,这个同步不是后期贴上去的,而是生成时就对齐的。
官方文档没明说但很关键的一条:每句台词要短。长独白会漂移出口型,解法是把长台词拆到多个切镜里,一个镜头一句话。
标题和口号有公式,公式里每一项都承重
公式是文字内容加出现时机加出现位置加出现方式加文字特征。漏写时机,文字可能全程杵在画面里;漏写位置,落点随缘;漏写方式,淡入淡出还是打字机效果全看运气。
但如果品牌要的是精确的标识造型,而不是风格差不多的字,别用提示词生成,把标识作为图片引用喂进去。这条对做品牌的独立站尤其重要——一个字形不对的标识,比没有标识更伤。
气泡台词好玩,但方差大
做漫画感内容很出效果,写法是让角色说话时周围出现气泡、气泡里写着台词。缺点是气泡位置和样式的随机性偏高,同一条提示词跑三遍可能三个样。
画面内文字这件事,对出海内容意味着什么
这个能力值不值得单独在意,取决于你做的是什么内容。对纯氛围片,画面里有没有字无所谓;对电商内容,它经常是决定性的。
促销价、限时标语、产品名、卖点短句,这些东西本来就要出现在画面上。以前的做法是生成一条干净的片子,再回到剪辑软件里贴字。这条路能走通,但有两个代价:一是贴上去的字永远像贴上去的,不会跟着光影和景深走;二是每换一个语言市场就要重新排版一次。
模型直接生成的字,融进画面的程度是后期贴不出来的。但它的可靠度还没到可以闭眼用的程度,所以现实的分工是:需要精确的信息用后期贴,需要氛围感的文字交给生成。价格和法务免责声明这种一个字都不能错的,老老实实后期做。
三种技法共用两条铁律:只用常用字,不用生僻字和特殊符号;提示词的语言必须和目标文字的语言一致。中文提示词里要求生成英文字幕,或者反过来,乱码率会明显上升。这一条对中文用户最阴险,因为中英混写在语义层面大体能用,让人误以为没问题。
超过八秒的片段,为什么必须写成时间轴?
这是所有技巧里投入产出比最高的一个,也是最容易被跳过的一个。
一整段散文描述十五秒的剧情,等于把节奏的决定权还给了模型。它会自己决定哪一秒发生什么,而它的决定通常是把所有元素平铺在整段里。
改成时间轴,交出去的就是一张镜头表:一到五秒光影透过百叶窗滑过桌面、杯口升起热气;六到十秒镜头缓缓推近、店员放下杯碟;十一到十五秒画面中部渐显品牌名。
官方的建议是超过八秒就分秒段写。实践下来,长片段成功率的提升里,这一个习惯的贡献超过其他所有调整加起来。原因也不神秘:时间轴把一个开放式创作题,改成了一道填空题。
时间轴该切多细,每段写什么
切得太细会变成逐帧指挥,模型反而僵;切得太粗又回到散文。四到五秒一段是比较顺手的粒度,一段里只放一件主要的事。
每一段的内容建议按同一个顺序写:这段里画面主体在干什么、镜头怎么动、有没有文字或声音要在这一段出现。三项写全,段与段之间的衔接就有了依据。
还有一个细节容易漏:时间轴的段落之间要写出因果或延续,别写成三个不相干的镜头。比如第二段写镜头缓缓推近,第三段就该承接这个近景往下走,而不是突然切到全景。写清楚承接关系,模型才知道这是一条连续镜头而不是三个片段的拼贴。
这套写法也能直接推广到视频延长和轨道补齐上。凡是内容超过八秒的场景,无论是新生成还是改现成的,都按时间轴组织,成功率会稳定得多。
视频参考和编辑能干到什么程度?
官方指南里关于视频参考和视频编辑的两节,是真正的护城河,也恰恰是大多数人嫌太高级而跳过的部分。这两块能力加起来,它就不只是一个文生视频工具,而更接近一台用提示词驱动的剪辑台。
- 动作参考:把参考片里的表演移植给你的角色,比如让参考视频里那位主唱换成你图片里的人物,动作完全模仿。
- 运镜参考:整段偷走一个镜头运动,配合一镜到底这类词汇,能拿到纯文字写不出来的镜头。
- 特效参考:把参考片的转场和粒子效果复刻到新内容上,还能指定粒子变密、逐渐过渡到第二段。
- 元素增删改:用提示词改现成视频,换发色、在人物身后加一个物体、甚至中途翻转剧情情绪。
- 视频延长:向前或向后延长已有片段,超过八秒同样要分秒段写。
- 轨道补齐:把两三段独立素材缝成连续序列,让第一段的元素逐渐具象化再过渡到第二段。
对做电商内容的人来说,最实用的是元素增删改和轨道补齐这两项。前者意味着一条拍好的主视频可以派生出多个版本——换个季节色调、换个手持产品,不用重拍;后者意味着零散的素材片段可以被缝成一条有叙事的短片,而不是硬切。
为什么这一块的性价比被严重低估
把这些能力放到内容生产的账上算一遍,结论会有点反直觉。
从零生成一条新片,每一次都是完整成本,而且成功率不高——你在跟随机性对赌。基于一条已经过关的片子做编辑,成本更低,成功率高得多,因为大部分变量已经被锁死了。
换句话说,第一条过关的镜头不是产出,是资产。它锁定了角色、色板、光线、镜头语言,后面所有片子都可以站在它肩膀上。想明白这一点,工作流的重心就会从多生成几条,转向把第一条打磨好。
做多语言市场的团队还有一个额外杠杆:同一条主片,配不同语言的字幕和口播,用编辑模式派生。视觉资产复用,语言层单独换,比每个市场各拍一条便宜太多,也更容易保持品牌一致。
六种最常见的废片,分别是怎么来的?
上面每一招都有对应的塌法。这六种基本覆盖了社区里被解剖过的绝大多数废片,把官方指南逆向成技能文件的那个开源项目也印证了其中大部分。
| 翻车模式 | 症状 | 解法 |
|---|---|---|
| 指令过载 | 写了八条要求,随机命中四五条 | 砍到一百词以内,把不可妥协的前置 |
| 裸引用 | 参考片的光线和构图污染进你的镜头 | 每个引用写明用途,限定作用域 |
| 运镜叠加 | 抖动、漂移、镜头中途变卦 | 一条片段一个主运镜,其余用切镜 |
| 中英混写加生僻字 | 画面内文字乱码,语义解析变浑 | 一条提示词一种语言,且与目标文字一致 |
| 时长塞爆 | 五秒片段塞三个场景,糊成一团 | 复杂度匹配时长,超八秒写时间轴 |
| 强度拉满或用真人脸 | 纸板人;可辨识真人面部素材被拦 | 强度七到八成;角色参考用生成图或插画 |
指令过载为什么是六种里最该先治的
六种翻车里,指令过载排第一不是随便排的。它是唯一一个会让其他五种诊断全部失效的模式。
想象一条写满八项要求的提示词出了问题。你不知道是运镜叠加导致的,还是引用没派活导致的,还是纯粹因为第七条根本没被执行。要求越多,因果链越糊,你越没法定位。
所以排查顺序应该固定:先砍到一百词以内,跑一遍看还塌不塌;塌,再逐条往回加,加到哪一条出问题就是哪一条的锅。这个笨办法比凭感觉调快得多,通常三四轮就能定位。
它还有一个副作用值得提:砍完之后你会发现,有相当一部分要求其实根本不重要,是写的时候顺手加上去的。提示词和落地页文案一样,删掉之后没人想念的东西,本来就不该在那儿。
最后一条的后半句是合规约束,不是质量问题。清晰可辨识的真人面部素材会被直接拦截,所以角色管线从第一天就该按生成图或插画参考来设计,别做到一半才发现被拦。这一点在电商场景里格外要紧——很多团队的第一反应就是拿模特实拍照当参考图,然后卡在门口。
一条十五秒的视频到底多少钱?
这一节要专门纠一个流传很广的数字,因为它会直接影响你的排期和预算。
网上大量二手内容写的是一条十五秒视频约一元人民币。这个说法把量级搞错了十几倍。
按公布的API定价,Seedance 2.0是按词元计费的:不含视频输入的纯生成约四十六元每百万词元,含视频输入的编辑模式约二十八元每百万词元。而一条十五秒、七百二十线、每秒二十四帧的标准视频,大约消耗三十点九万词元。
把这两个数字一乘就清楚了:纯生成约十四元,编辑模式约八点七元。折算下来是接近一元一秒,不是一元十五秒。
顺手说一个可以自查的信号:那类把成本写成一元十五秒的文章,往往在同一节里又提到海外渠道按每秒零点几美元计价,两个数字放在一起差了七十多倍。同一篇文章里两个成本口径互相矛盾却没人发现,说明作者没真正跑过账。看到这种情况,两个数字都别信,回官方定价页自己算。
想省钱有两条正路
第一条是用编辑模式。含视频输入的单价接近纯生成的六折,而在实际工作流里,越到后期越多的镜头其实是在改已有片段,而不是从零生成。把管线设计成先出一条锚点镜头、后续都基于它改,成本结构会明显不一样。
第二条是用轻量档。2026年6月16日上线的mini版本把生成成本降了约五成,支持四百八十线和七百二十线两种规格,时长四到十五秒,同样是每秒二十四帧。练提示词、试分镜、跑批量方案的时候用它,定稿再上完整版,是很划算的分工。
这个价格结构也正是单变量迭代那套工作流成立的前提:练一晚上提示词的钱,和一次正经外拍的成本比,完全不是一个量级。但请注意,它便宜的是每一次尝试,不是便宜到可以霰弹枪式乱试——时间才是真正的稀缺项。
做预算时按什么口径算
按条数估预算基本一定会错,因为每条的成本随时长和模式浮动。稳妥的做法是按秒和模式来估。
拿一个具体场景走一遍:一个季度要出三十条产品短视频,每条十五秒。如果全部从零生成,光生成成本就是三十乘以十四元,四百二十元出头。如果按锚点镜头的打法,第一条从零生成,剩下二十九条走编辑模式,成本降到十四加上二十九乘以八点七,约二百六十七元,省下三成半。
再把练手成本算进去。定稿之前的试错如果全用完整版跑,很容易比正片本身还贵;改用轻量档试分镜、定稿才上完整版,这一块能再省一半。真正拉开成本差距的不是单价,是你把哪一步放在哪个档位上跑。
另外提醒一句:这些单价是随时会调的,尤其是新模型上线前后。做季度预算时按当前公布价乘以一点二留个余量,比按最优价精算靠谱。
独立站要拍产品视频,这套怎么落地?
单个技法只是招式,串成管线才有复利。下面这条流程是做多镜头内容时的固定打法。
- 先写分镜脚本,把故事拆成镜头,每个镜头不超过十五秒。
- 准备参考素材包:角色的多视角组图,加上运镜和音频的参考片段。
- 先生成锚点镜头——把角色、基调、色板全部锁定的那一个镜头。
- 其余镜头把锚点的产出当作视频引用,靠它保证跨镜头一致性。
- 不过关就回到上一步,每轮只改一个变量。
- 过关之后用视频延长和轨道补齐缝起来,最后在剪辑软件里完成标题和调色。
三个判断,按省下的痛苦排序
先生成锚点镜头,再把它喂回去。跨镜头的角色一致性是这个模型的招牌,但它不是自动的——是靠把最成功的那一条变成后续所有镜头的参考挣来的。角色、服装、色板全部到位的那一条,从此作为引用随行,模型会把它当作事实标准。
每轮迭代只改一个变量。镜头不对,本能是重写整条提示词,忍住。只动运镜,或只动动作,或只动参考强度,重新生成后对比。单变量的纪律通常三四轮就收敛,霰弹枪式重写能晃十轮还找不着北。
参考素材包要在动手之前就做好。多视角角色组图是整条管线里杠杆最高的资产,而它是个生图问题,不是生视频问题。想零成本本地出图,在Mac上用本地模型批量出多视角组图那套管线完全够用,素材还不出本机。
落到具体场景,哪些活值得做
保哥去年帮一个做美妆的独立站排过一轮视频素材,最后留下来的判断是:不要一上来就想拍品牌片,先解决那些每个月都要重做一遍的活。
| 素材类型 | 适不适合 | 关键点 |
|---|---|---|
| 产品细节展示,质地、上妆、开合 | 很适合 | 动作写物理后果,运镜只给一个推镜 |
| 多语言版本的同一支广告 | 很适合 | 提示词整条换成目标语言,别中英混写 |
| 节日主题的换季改版 | 适合,用编辑模式 | 基于去年的成片改元素,比重做便宜 |
| 真人模特出镜的口碑视频 | 不适合 | 可辨识真人面部会被拦,老实实拍 |
| 需要精确标识造型的片头 | 半适合 | 标识走图片引用,不要靠提示词生成 |
把它接进现有的内容排期,而不是另开一摊
最容易失败的落地方式,是把它当成一个新玩具单独立项,配一个人专门研究,三个月后不了了之。
更稳的做法是挂在已有的排期上。你本来每个月就要更新一批产品页,那就在这批页面的工作里加一条:哪几个页面缺一段十五秒的细节展示。素材需求从页面来,而不是从工具来,产出就有去处。
分工上也别把提示词写作当成一个新岗位。写分镜和写页面文案是同一种能力——都是先想清楚给谁看、要他记住什么,再决定放什么。已有的内容岗接过去,比新招一个懂模型的人更快上手。
验收标准提前定好,能省掉大量扯皮。三条就够:角色和产品在所有镜头里是不是同一个;有没有出现看不懂的画面内文字;十五秒里有没有一个明确的信息点。三条全过才算能上线,任何一条不过就回到单变量迭代里改。
生成出来只是开头。视频真正要被搜到、被引用,还得看落地页那一层的结构化标记和正文承载,这块和AI搜索时代视频收录规则的变化是同一件事的两头。另外,同一批素材里静态的那部分怎么复用,原创配图对自然流量的实际影响那篇里有测过的数据可以参考。
换个模型,这套写法还带得走吗?
同时用几个模型干活的人越来越多,按现在的价差,大概率你也该这么干。规律可以压成一句话:语法可迁移,控制词汇迁移不了。
| 技法 | 带得走吗 | 说明 |
|---|---|---|
| 主体加动作加场景加运镜的结构 | 完全带得走 | 这是通用语法,换哪个模型都成立 |
| 运镜的专业词汇 | 带得走 | 各家对推、摇、环绕、跟拍的理解都还不错 |
| 写出物理后果的动词链 | 完全带得走 | 可动画信息多,是所有模型都吃的一套 |
| 台词转口型 | 看模型 | 原生带音频的能一次生成,音频后处理的只能近似 |
| 多路参考与派活单 | 带不走 | 参考位数量差距太大,音频参考更是几乎独一份 |
| 画面内文字 | 带不走 | 换个模型大概率回到外星文 |
| 用提示词改现成视频 | 带不走 | 各家的编辑思路完全不同,语法也不通用 |
反方向的坑同样存在,而且更隐蔽。从奖励超详细提示词的模型那边过来的人,最大的负资产是越写越细——位置衰减会惩罚这个习惯,写到第八条基本等于没写。反过来,习惯了让模型自由发挥的人会发现这边更听话,模糊的指令换来的不是惊喜,是字面意义上的平庸。
换模型的时候,第一件该做的事不是重写提示词,是重估你的提示词里有多少是方言。把方言那部分单独拎出来,剩下的通用语法通常能原样带走七八成,这比从零学一套快得多。
还有一条路和生成式完全不同:用代码逐帧生成视频那套做法。它凭想象出不了片,但胜在精确可批量、能套模板。判断标准很简单——数据动画、榜单、价格变化这类需要每一帧都对得上的内容选程序式;氛围片、场景片、需要真实质感的内容选生成式。两条路不是竞争关系,做内容量大的团队通常两边都要留。
一份可以直接抄走的检查表
把全文压成动手前过一遍的清单,分三段:写之前、写完之后、出片之后。
写之前先确认三件事
第一,这个镜头的完成标准是什么?说得出来才动手,说不出来先回去改分镜。第二,哪些信息必须用素材锁定,哪些用文字就够?分工没想清楚就写,写多长都白搭。第三,素材包齐了吗?角色组图覆盖了几个角度,运镜参考裁干净了没有。
写完之后逐条对照
- 全文有没有超过一百词,超了就砍,不可妥协的那条是不是在最前面。
- 动作那一栏有没有物理后果,还是只有形容词。
- 运镜是不是只有一个,有没有给终点状态。
- 音频有没有点名,不要配乐有没有明写。
- 每个引用有没有派活,写没写清楚参考它的哪一部分。
- 参考强度是不是停在七到八成。
- 整条提示词是不是同一种语言,和目标画面文字对得上。
- 内容超过八秒的,有没有改写成时间轴。
出片之后按这个顺序排查
不要一看不对就重写。按下面的顺序找,通常两三轮就定位。
先看词数——砍到一百词以内重跑一次,一半问题在这一步消失。还不对,就看引用有没有派活,把裸引用补上用途。再不对,检查是不是两个运镜打了架。都排除了,才去动参考强度和素材本身。
整个过程只有一条纪律:每轮只改一个变量。改两个以上,你就永远不知道是哪一个起了作用,下次遇到同样的问题还得从头猜一遍。
常见问题解答
提示词到底该写多长,越详细越好吗?
不是。控制在六十到一百词,因为指令遵循度按位置急剧衰减,前两三条几乎必被执行,写满八条通常只随机命中四五条。排查废片的第一步应该是砍要求而不是加要求。词数预算逼你把不可妥协的那一条放最前面,而这个取舍本身就是导演该做的事。
为什么我没要求配乐,出来的视频却自带背景音乐?
因为音视频是在同一次生成里一起产出的,音频栏空着不等于安静,模型会自己补一段。想要没有音乐,必须在提示词里明确写出不要配乐,同时点名你要的环境音,比如雨声、车流、脚步。在这个模型里安静是一条指令,不是留白。
参考图放了却不起作用,角色还是换脸,问题出在哪?
大概率是两件事之一。一是裸引用,只写了参考某张图却没说参考它的什么,模型会全盘照抄或者随机取用;二是参考强度太低,低于六成身份就开始漂移。正确做法是给每个引用派明确的活,强度停在七到八成,并且先生成一条锚点镜头,后续镜头都引用它。
画面里的中文字总是乱码,有救吗?
有三条能明显降低乱码率。第一,整条提示词用中文写,别中英混写,提示词语言要和目标文字语言一致。第二,只用常用字,避开生僻字和特殊符号。第三,字幕写法比标题写法稳,标题要按内容、时机、位置、方式、特征这个公式写全。如果要的是精确的品牌标识造型,别用文字生成,把标识作为图片引用喂进去。
一条十五秒的视频到底多少钱,网上说一元是真的吗?
不是。按公布的API定价,纯生成约四十六元每百万词元,含视频输入的编辑模式约二十八元,而一条十五秒、七百二十线、每秒二十四帧的视频约消耗三十点九万词元,折算下来纯生成约十四元、编辑模式约八点七元,也就是接近一元一秒。网上那个一元十五秒的说法把量级搞错了十几倍,做预算时别照抄。
能不能直接用模特实拍照当角色参考图?
不能。清晰可辨识的真人面部素材会被直接拦截,这是合规约束不是质量问题。角色管线应该从第一天就按生成图或插画参考来设计。真要用真人出镜的口碑类视频,老老实实实拍,别指望在这条路上绕过去,否则做到一半才发现走不通,整个排期都要重来。
权威参考资料
本文标题:《Seedance 2.0提示词写成一张派活单,废片率才降得下来》
本文链接:https://zhangwenbao.com/seedance-2-prompt-writing-guide.html
版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0