Seedance 2.0提示词写成一张派活单,废片率才降得下来

张文保 更新 28 分钟阅读 2,178 阅读
本文目录
  1. 它到底特殊在哪,值得为它单学一套写法吗?
  2. 五段结构该怎么排,每段写多少?
  3. 三条官方文档里没写、但决定成败的规则
  4. 运镜这一栏,用行话比用形容词准
  5. 文字管什么,素材管什么?
  6. 分工原则只有一句
  7. 每个引用必须派明确的活
  8. 参考强度停在七到八成
  9. 参考素材本身的质量,比调强度重要得多
  10. 画面内文字怎么写才不出外星文?
  11. 字幕最稳,因为同步是真同步
  12. 标题和口号有公式,公式里每一项都承重
  13. 气泡台词好玩,但方差大
  14. 画面内文字这件事,对出海内容意味着什么
  15. 超过八秒的片段,为什么必须写成时间轴?
  16. 时间轴该切多细,每段写什么
  17. 视频参考和编辑能干到什么程度?
  18. 为什么这一块的性价比被严重低估
  19. 六种最常见的废片,分别是怎么来的?
  20. 指令过载为什么是六种里最该先治的
  21. 一条十五秒的视频到底多少钱?
  22. 想省钱有两条正路
  23. 做预算时按什么口径算
  24. 独立站要拍产品视频,这套怎么落地?
  25. 三个判断,按省下的痛苦排序
  26. 落到具体场景,哪些活值得做
  27. 把它接进现有的内容排期,而不是另开一摊
  28. 换个模型,这套写法还带得走吗?
  29. 一份可以直接抄走的检查表
  30. 写之前先确认三件事
  31. 写完之后逐条对照
  32. 出片之后按这个顺序排查
  33. 常见问题解答
  34. 提示词到底该写多长,越详细越好吗?
  35. 为什么我没要求配乐,出来的视频却自带背景音乐?
  36. 参考图放了却不起作用,角色还是换脸,问题出在哪?
  37. 画面里的中文字总是乱码,有救吗?
  38. 一条十五秒的视频到底多少钱,网上说一元是真的吗?
  39. 能不能直接用模特实拍照当角色参考图?
  40. 权威参考资料
摘要:同一个模型、同样的设置,出片差别几乎全在提示词的体裁上——它该是一张派活单,不是一段描述文。文字负责语义,素材负责标准,每个引用必须写明参考它的哪一部分,一条片段只给一个主运镜,超过八秒改写成时间轴。这篇把五段结构、十二个参考位的分工、画面内文字的三种技法、六种最常见的废片成因全部拆开,并且把网上流传的那个成本数字改正过来——按官方口径,它不是一元十五秒,而是接近一元一秒。

先看两条提示词的差别,十秒钟就能看出这篇要讲什么。

第一条是大多数人第一天会写的:一位美女走在夜晚的城市街道上,电影感,超高清,史诗级运镜,杰作。出来的是素材库画面——一个谁都像的女人,走在哪儿都像的街上,镜头在推和摇之间来回犹豫,两头不靠。因为没提声音,模型还自作主张配了一段背景音乐。

第二条换了个写法:三十多岁女性,深色头发,炭灰色羊毛大衣,走过雨后湿亮的橱窗,停步,在冷空气里呼出白气;雨后夜街,霓虹倒映在湿沥青上;运镜用四十五度角缓慢推镜,止于中近景;音频要小雨声、远处车流、店内隐约的爵士乐,不要配乐。

出来的就是分镜里画的那个镜头。具体的人,带物理后果的动作,一个有明确终点的运镜,一套自己点的声场。模型没变,设置没变,钱也差不多——差别全在提示词里。

这篇要立的总纲只有一句:Seedance 2.0的提示词是一张派活单,不是一篇描述文。文字管语义,也就是谁在做什么;素材管标准,也就是长什么样、怎么动。见过的废片里,九成的根源是这两个职责搞混了,而不是形容词写少了。

它到底特殊在哪,值得为它单学一套写法吗?

市面上的视频模型不少,为什么这一个的提示词要单独学?因为它有三个结构性特征,直接决定了写法不一样。

第一,音频和画面是一次前向生成出来的,不是先出画面再配音。这意味着声音不是后期装饰,而是和画面同一层的可控对象——你点名要什么声音,模型在生成画面的同时就在对齐它。反过来也成立:你不点名,它就替你点。绝大多数第一次用它的人踩的第一个坑就在这儿。

第二,参考素材的通道又多又杂。九张图、三段视频、三段音频,各自能承担完全不同的职责。别的模型里参考图基本只有一种用法,这里的图片可以是角色标准、可以是场景锚点、可以是精确的标识造型,而视频和音频负责的是时间维度上的东西。通道一多,分工就成了必修课。

第三,它偏听话,而不是偏发挥。这条最影响写作习惯。有些模型你给模糊指令能收获惊喜,它不会——模糊指令换来的是字面意义上的平庸:一个平均的人,走在一条平均的街上。它的上限很高,但要靠你把话说具体才够得着。

把这三条合起来看,结论就是本文的总纲:写它的提示词,靠的不是文采,是分工意识。哪些交给文字,哪些交给素材,哪些必须点名,哪些必须留白,想清楚这四件事,出片率就能翻上去。

五段结构该怎么排,每段写多少?

官方给的基础公式是主体加运动加环境加运镜加美学加音频,运动之后的部分全部标注为非必须。公式本身没错,但它长得像一张购物清单,很多人的第一反应就是每一栏都塞满。

更好用的是带预算的版本,可以直接抄:

  • 主体:谁或者什么,一到两个具体特征,到此为止。
  • 动作:一条主动词链,必须写出物理后果。
  • 场景:地点加光线,一句话。
  • 运镜:只写一个主运镜,可以补一个终点状态。
  • 风格与音频:视觉基调,加上点名具体的声音;不要配乐就明写不要配乐。

三条官方文档里没写、但决定成败的规则

规则一,全文控制在六十到一百词。指令遵循度按位置急剧衰减:排在前面的两三条几乎每次都执行,写满八条通常随机命中四五条。所以排查废片的第一步不是加要求,而是砍要求——先砍到一百词以内再谈别的,一半的问题砍完就消失了。

这条规则的另一面是排序变得极其重要。既然后面的会被稀释,那就把不可妥协的那一条放最前面。想要角色一致,主体特征前置;想要那个运镜,运镜前置。词数预算逼你做取舍,而取舍本身就是导演的活。

规则二,动词比形容词值钱。惊艳、电影感、绝美的舞者,给模型的可动画信息是零;舞者骤然下沉旋转、裙摆展开、随即利落起身,给的是一段带物理后果的动作序列。同理,落叶飘散只能落到屏保上,落叶在每次踏地时四散才能落到具体运动上。

规则三,一条片段只给一个主运镜。它对专业运镜词汇的理解确实好——推镜、摇镜、环绕、跟拍、变焦、一镜到底,中文直接写就行。但它不会仲裁同一片段里的两条运镜指令:固定镜头和环绕主体写在一起,出来的是抖动、漂移,或者两头不靠的折中。要两个运镜就拆两个镜头,用切镜显式标记。

栏位翻车写法有效写法
主体一位美女三十多岁女性,深色头发,炭灰色羊毛大衣
动作走路,很好看,电影感走过雨后湿亮的橱窗,停步,在冷空气里呼出白气
运镜动感镜头,史诗级运镜,环绕加变焦四十五度角缓慢推镜,止于中近景
音频不写小雨声,远处车流,店内隐约爵士乐,不要配乐

音频那一行最容易被跳过。音视频在同一次生成里一起产出是这个模型的招牌能力,所以音频栏空着买到的不是安静,是一段你没点的配乐。在这个模型里,安静是一条指令,不是留白。

运镜这一栏,用行话比用形容词准

它对专业运镜词汇的理解,是整个模型里最靠谱的部分之一,而且中文直接写就行,不用翻译成英文。既然如此,就别再写动感镜头、大气运镜这类形容词了,直接点名。

  • 推镜与拉镜:镜头沿着视线方向靠近或远离主体,适合把注意力收到产品细节上。
  • 摇镜与移镜:机位不动只转方向,或者机位平移,适合展示环境和陈列。
  • 环绕:绕着主体转,适合让一个静止的物体显出体积感,是产品视频里最常用的一个。
  • 跟拍:镜头跟着运动主体走,适合开箱、使用过程这类有连续动作的内容。
  • 一镜到底:明确要求全程不切镜,配合视频参考效果更好。

补一个终点状态会让结果更稳,比如缓慢推镜、止于中近景。给运镜一个终点,等于给了模型一个可判断的完成条件;不给终点,它就得自己猜什么时候停。

文字管什么,素材管什么?

这是整套方法里最值钱的一条分工,也是最容易被忽略的一条。

火山方舟视频生成文档的口径,单次生成最多接受十二个参考文件:九张图、三段视频、三段音频,视频和音频各自的总时长不超过十五秒,在提示词里用引用符号点名。这个量级在同期竞品里没有对手——有的只收一张参考图,有的支持三到四张,而音频参考这一路,公开支持的基本只有它一家。

分工原则只有一句

文字管空间性的决定,素材管时间性和身份性的决定。

画面里有什么、光从哪来、要什么氛围,文字完全够用;但一个运镜的确切缓动、一段动作的节奏、一张脸跨角度的一致性,文字只能逼近,素材本身就是答案。用文字描述一个变焦,得到的是像那么回事的变焦;扔一段参考片进去,得到的是那个变焦。

你想控制的用什么为什么
谁在场、发生什么文字语义本来就是语言的活
角色跨镜头的脸和服装图片引用,多视角组图文字锚不住身份,图片可以
某个运镜的手感视频引用片段自带时序,文字只是转述
动作与手势的节奏视频引用节奏经不起翻译成文字
卡点、按节拍切镜音频引用模型按真实波形踩点
标识与产品的精确外观图片引用文字描述出来的标识是同人创作
情绪、光感、氛围文字描述成本低,不需要锚定

每个引用必须派明确的活

社区里最高频的翻车是裸引用:写一句参考某段视频,然后就没了。参考它的什么?运镜?动作?调色?不派活的引用会让模型全盘照抄——你只想要那段编舞,结果它的光线、构图、节奏一起污染进你的镜头。

派活单要单独写一块,把每个引用的用途一条一句写清楚:这张图只管角色形象且所有镜头保持一致,这段视频只参考运镜,这段音频只做背景节奏并按节拍切镜。引用的价值不在于你放了几个,而在于每一个都被限定了作用域。

参考强度停在七到八成

默认值七成半选得很准。拉到九成以上,角色会变成纸板人——技术上忠实于参考图,但姿态和光照失去了自然适应能力;低于六成,身份开始漂移,同一个人在第二个镜头里就换了张脸。

保险起见全拉满,是引用系统里的形容词堆砌,塌法一模一样。

参考素材本身的质量,比调强度重要得多

很多人把时间花在调强度上,却没意识到一个更基础的问题:喂进去的素材本身就不合格。

角色组图最常见的毛病是角度太单一。全是正面照,模型在需要侧脸的镜头里就只能猜,一猜就漂。合格的角色组图至少要覆盖正面、四十五度侧、正侧,最好再加一张半身带服装细节的。

运镜参考片最常见的毛病是太长太杂。你只想要那个推镜的缓动,却扔了一段十五秒、中间还切了两次的片子进去,模型不知道该学哪一段。参考片要裁到只剩你想要的那个动作,越干净越好。

音频参考的毛病则是节奏不明确。想让它按节拍切镜,就得给一段节拍清楚的音频;给一段氛围铺底的环境声,模型找不到可以对齐的点,切镜就会随缘。

画面内文字怎么写才不出外星文?

生成视频里的可读文字一直是全行业的公开短板——招牌、屏幕、标题在大多数模型上都是外星文。这一块是它少见的强项,三种技法按可靠度从高到低排。

字幕最稳,因为同步是真同步

写法是指明字幕出现的位置、字幕内容,并要求与音频节奏完全同步。因为音视频是一次生成的,这个同步不是后期贴上去的,而是生成时就对齐的。

官方文档没明说但很关键的一条:每句台词要短。长独白会漂移出口型,解法是把长台词拆到多个切镜里,一个镜头一句话。

标题和口号有公式,公式里每一项都承重

公式是文字内容加出现时机加出现位置加出现方式加文字特征。漏写时机,文字可能全程杵在画面里;漏写位置,落点随缘;漏写方式,淡入淡出还是打字机效果全看运气。

但如果品牌要的是精确的标识造型,而不是风格差不多的字,别用提示词生成,把标识作为图片引用喂进去。这条对做品牌的独立站尤其重要——一个字形不对的标识,比没有标识更伤。

气泡台词好玩,但方差大

做漫画感内容很出效果,写法是让角色说话时周围出现气泡、气泡里写着台词。缺点是气泡位置和样式的随机性偏高,同一条提示词跑三遍可能三个样。

画面内文字这件事,对出海内容意味着什么

这个能力值不值得单独在意,取决于你做的是什么内容。对纯氛围片,画面里有没有字无所谓;对电商内容,它经常是决定性的。

促销价、限时标语、产品名、卖点短句,这些东西本来就要出现在画面上。以前的做法是生成一条干净的片子,再回到剪辑软件里贴字。这条路能走通,但有两个代价:一是贴上去的字永远像贴上去的,不会跟着光影和景深走;二是每换一个语言市场就要重新排版一次。

模型直接生成的字,融进画面的程度是后期贴不出来的。但它的可靠度还没到可以闭眼用的程度,所以现实的分工是:需要精确的信息用后期贴,需要氛围感的文字交给生成。价格和法务免责声明这种一个字都不能错的,老老实实后期做。

三种技法共用两条铁律:只用常用字,不用生僻字和特殊符号;提示词的语言必须和目标文字的语言一致。中文提示词里要求生成英文字幕,或者反过来,乱码率会明显上升。这一条对中文用户最阴险,因为中英混写在语义层面大体能用,让人误以为没问题。

超过八秒的片段,为什么必须写成时间轴?

这是所有技巧里投入产出比最高的一个,也是最容易被跳过的一个。

一整段散文描述十五秒的剧情,等于把节奏的决定权还给了模型。它会自己决定哪一秒发生什么,而它的决定通常是把所有元素平铺在整段里。

改成时间轴,交出去的就是一张镜头表:一到五秒光影透过百叶窗滑过桌面、杯口升起热气;六到十秒镜头缓缓推近、店员放下杯碟;十一到十五秒画面中部渐显品牌名。

官方的建议是超过八秒就分秒段写。实践下来,长片段成功率的提升里,这一个习惯的贡献超过其他所有调整加起来。原因也不神秘:时间轴把一个开放式创作题,改成了一道填空题。

时间轴该切多细,每段写什么

切得太细会变成逐帧指挥,模型反而僵;切得太粗又回到散文。四到五秒一段是比较顺手的粒度,一段里只放一件主要的事。

每一段的内容建议按同一个顺序写:这段里画面主体在干什么、镜头怎么动、有没有文字或声音要在这一段出现。三项写全,段与段之间的衔接就有了依据。

还有一个细节容易漏:时间轴的段落之间要写出因果或延续,别写成三个不相干的镜头。比如第二段写镜头缓缓推近,第三段就该承接这个近景往下走,而不是突然切到全景。写清楚承接关系,模型才知道这是一条连续镜头而不是三个片段的拼贴。

这套写法也能直接推广到视频延长和轨道补齐上。凡是内容超过八秒的场景,无论是新生成还是改现成的,都按时间轴组织,成功率会稳定得多。

视频参考和编辑能干到什么程度?

官方指南里关于视频参考和视频编辑的两节,是真正的护城河,也恰恰是大多数人嫌太高级而跳过的部分。这两块能力加起来,它就不只是一个文生视频工具,而更接近一台用提示词驱动的剪辑台。

  • 动作参考:把参考片里的表演移植给你的角色,比如让参考视频里那位主唱换成你图片里的人物,动作完全模仿。
  • 运镜参考:整段偷走一个镜头运动,配合一镜到底这类词汇,能拿到纯文字写不出来的镜头。
  • 特效参考:把参考片的转场和粒子效果复刻到新内容上,还能指定粒子变密、逐渐过渡到第二段。
  • 元素增删改:用提示词改现成视频,换发色、在人物身后加一个物体、甚至中途翻转剧情情绪。
  • 视频延长:向前或向后延长已有片段,超过八秒同样要分秒段写。
  • 轨道补齐:把两三段独立素材缝成连续序列,让第一段的元素逐渐具象化再过渡到第二段。

对做电商内容的人来说,最实用的是元素增删改和轨道补齐这两项。前者意味着一条拍好的主视频可以派生出多个版本——换个季节色调、换个手持产品,不用重拍;后者意味着零散的素材片段可以被缝成一条有叙事的短片,而不是硬切。

为什么这一块的性价比被严重低估

把这些能力放到内容生产的账上算一遍,结论会有点反直觉。

从零生成一条新片,每一次都是完整成本,而且成功率不高——你在跟随机性对赌。基于一条已经过关的片子做编辑,成本更低,成功率高得多,因为大部分变量已经被锁死了。

换句话说,第一条过关的镜头不是产出,是资产。它锁定了角色、色板、光线、镜头语言,后面所有片子都可以站在它肩膀上。想明白这一点,工作流的重心就会从多生成几条,转向把第一条打磨好。

做多语言市场的团队还有一个额外杠杆:同一条主片,配不同语言的字幕和口播,用编辑模式派生。视觉资产复用,语言层单独换,比每个市场各拍一条便宜太多,也更容易保持品牌一致。

六种最常见的废片,分别是怎么来的?

上面每一招都有对应的塌法。这六种基本覆盖了社区里被解剖过的绝大多数废片,把官方指南逆向成技能文件的那个开源项目也印证了其中大部分。

翻车模式症状解法
指令过载写了八条要求,随机命中四五条砍到一百词以内,把不可妥协的前置
裸引用参考片的光线和构图污染进你的镜头每个引用写明用途,限定作用域
运镜叠加抖动、漂移、镜头中途变卦一条片段一个主运镜,其余用切镜
中英混写加生僻字画面内文字乱码,语义解析变浑一条提示词一种语言,且与目标文字一致
时长塞爆五秒片段塞三个场景,糊成一团复杂度匹配时长,超八秒写时间轴
强度拉满或用真人脸纸板人;可辨识真人面部素材被拦强度七到八成;角色参考用生成图或插画

指令过载为什么是六种里最该先治的

六种翻车里,指令过载排第一不是随便排的。它是唯一一个会让其他五种诊断全部失效的模式。

想象一条写满八项要求的提示词出了问题。你不知道是运镜叠加导致的,还是引用没派活导致的,还是纯粹因为第七条根本没被执行。要求越多,因果链越糊,你越没法定位。

所以排查顺序应该固定:先砍到一百词以内,跑一遍看还塌不塌;塌,再逐条往回加,加到哪一条出问题就是哪一条的锅。这个笨办法比凭感觉调快得多,通常三四轮就能定位。

它还有一个副作用值得提:砍完之后你会发现,有相当一部分要求其实根本不重要,是写的时候顺手加上去的。提示词和落地页文案一样,删掉之后没人想念的东西,本来就不该在那儿。

最后一条的后半句是合规约束,不是质量问题。清晰可辨识的真人面部素材会被直接拦截,所以角色管线从第一天就该按生成图或插画参考来设计,别做到一半才发现被拦。这一点在电商场景里格外要紧——很多团队的第一反应就是拿模特实拍照当参考图,然后卡在门口。

一条十五秒的视频到底多少钱?

这一节要专门纠一个流传很广的数字,因为它会直接影响你的排期和预算。

网上大量二手内容写的是一条十五秒视频约一元人民币。这个说法把量级搞错了十几倍。

按公布的API定价,Seedance 2.0是按词元计费的:不含视频输入的纯生成约四十六元每百万词元,含视频输入的编辑模式约二十八元每百万词元。而一条十五秒、七百二十线、每秒二十四帧的标准视频,大约消耗三十点九万词元。

把这两个数字一乘就清楚了:纯生成约十四元,编辑模式约八点七元。折算下来是接近一元一秒,不是一元十五秒。

顺手说一个可以自查的信号:那类把成本写成一元十五秒的文章,往往在同一节里又提到海外渠道按每秒零点几美元计价,两个数字放在一起差了七十多倍。同一篇文章里两个成本口径互相矛盾却没人发现,说明作者没真正跑过账。看到这种情况,两个数字都别信,回官方定价页自己算。

想省钱有两条正路

第一条是用编辑模式。含视频输入的单价接近纯生成的六折,而在实际工作流里,越到后期越多的镜头其实是在改已有片段,而不是从零生成。把管线设计成先出一条锚点镜头、后续都基于它改,成本结构会明显不一样。

第二条是用轻量档。2026年6月16日上线的mini版本把生成成本降了约五成,支持四百八十线和七百二十线两种规格,时长四到十五秒,同样是每秒二十四帧。练提示词、试分镜、跑批量方案的时候用它,定稿再上完整版,是很划算的分工。

这个价格结构也正是单变量迭代那套工作流成立的前提:练一晚上提示词的钱,和一次正经外拍的成本比,完全不是一个量级。但请注意,它便宜的是每一次尝试,不是便宜到可以霰弹枪式乱试——时间才是真正的稀缺项。

做预算时按什么口径算

按条数估预算基本一定会错,因为每条的成本随时长和模式浮动。稳妥的做法是按秒和模式来估。

拿一个具体场景走一遍:一个季度要出三十条产品短视频,每条十五秒。如果全部从零生成,光生成成本就是三十乘以十四元,四百二十元出头。如果按锚点镜头的打法,第一条从零生成,剩下二十九条走编辑模式,成本降到十四加上二十九乘以八点七,约二百六十七元,省下三成半。

再把练手成本算进去。定稿之前的试错如果全用完整版跑,很容易比正片本身还贵;改用轻量档试分镜、定稿才上完整版,这一块能再省一半。真正拉开成本差距的不是单价,是你把哪一步放在哪个档位上跑。

另外提醒一句:这些单价是随时会调的,尤其是新模型上线前后。做季度预算时按当前公布价乘以一点二留个余量,比按最优价精算靠谱。

独立站要拍产品视频,这套怎么落地?

单个技法只是招式,串成管线才有复利。下面这条流程是做多镜头内容时的固定打法。

  1. 先写分镜脚本,把故事拆成镜头,每个镜头不超过十五秒。
  2. 准备参考素材包:角色的多视角组图,加上运镜和音频的参考片段。
  3. 先生成锚点镜头——把角色、基调、色板全部锁定的那一个镜头。
  4. 其余镜头把锚点的产出当作视频引用,靠它保证跨镜头一致性。
  5. 不过关就回到上一步,每轮只改一个变量。
  6. 过关之后用视频延长和轨道补齐缝起来,最后在剪辑软件里完成标题和调色。

三个判断,按省下的痛苦排序

先生成锚点镜头,再把它喂回去。跨镜头的角色一致性是这个模型的招牌,但它不是自动的——是靠把最成功的那一条变成后续所有镜头的参考挣来的。角色、服装、色板全部到位的那一条,从此作为引用随行,模型会把它当作事实标准。

每轮迭代只改一个变量。镜头不对,本能是重写整条提示词,忍住。只动运镜,或只动动作,或只动参考强度,重新生成后对比。单变量的纪律通常三四轮就收敛,霰弹枪式重写能晃十轮还找不着北。

参考素材包要在动手之前就做好。多视角角色组图是整条管线里杠杆最高的资产,而它是个生图问题,不是生视频问题。想零成本本地出图,在Mac上用本地模型批量出多视角组图那套管线完全够用,素材还不出本机。

落到具体场景,哪些活值得做

保哥去年帮一个做美妆的独立站排过一轮视频素材,最后留下来的判断是:不要一上来就想拍品牌片,先解决那些每个月都要重做一遍的活。

素材类型适不适合关键点
产品细节展示,质地、上妆、开合很适合动作写物理后果,运镜只给一个推镜
多语言版本的同一支广告很适合提示词整条换成目标语言,别中英混写
节日主题的换季改版适合,用编辑模式基于去年的成片改元素,比重做便宜
真人模特出镜的口碑视频不适合可辨识真人面部会被拦,老实实拍
需要精确标识造型的片头半适合标识走图片引用,不要靠提示词生成

把它接进现有的内容排期,而不是另开一摊

最容易失败的落地方式,是把它当成一个新玩具单独立项,配一个人专门研究,三个月后不了了之。

更稳的做法是挂在已有的排期上。你本来每个月就要更新一批产品页,那就在这批页面的工作里加一条:哪几个页面缺一段十五秒的细节展示。素材需求从页面来,而不是从工具来,产出就有去处。

分工上也别把提示词写作当成一个新岗位。写分镜和写页面文案是同一种能力——都是先想清楚给谁看、要他记住什么,再决定放什么。已有的内容岗接过去,比新招一个懂模型的人更快上手。

验收标准提前定好,能省掉大量扯皮。三条就够:角色和产品在所有镜头里是不是同一个;有没有出现看不懂的画面内文字;十五秒里有没有一个明确的信息点。三条全过才算能上线,任何一条不过就回到单变量迭代里改。

生成出来只是开头。视频真正要被搜到、被引用,还得看落地页那一层的结构化标记和正文承载,这块和AI搜索时代视频收录规则的变化是同一件事的两头。另外,同一批素材里静态的那部分怎么复用,原创配图对自然流量的实际影响那篇里有测过的数据可以参考。

换个模型,这套写法还带得走吗?

同时用几个模型干活的人越来越多,按现在的价差,大概率你也该这么干。规律可以压成一句话:语法可迁移,控制词汇迁移不了。

技法带得走吗说明
主体加动作加场景加运镜的结构完全带得走这是通用语法,换哪个模型都成立
运镜的专业词汇带得走各家对推、摇、环绕、跟拍的理解都还不错
写出物理后果的动词链完全带得走可动画信息多,是所有模型都吃的一套
台词转口型看模型原生带音频的能一次生成,音频后处理的只能近似
多路参考与派活单带不走参考位数量差距太大,音频参考更是几乎独一份
画面内文字带不走换个模型大概率回到外星文
用提示词改现成视频带不走各家的编辑思路完全不同,语法也不通用

反方向的坑同样存在,而且更隐蔽。从奖励超详细提示词的模型那边过来的人,最大的负资产是越写越细——位置衰减会惩罚这个习惯,写到第八条基本等于没写。反过来,习惯了让模型自由发挥的人会发现这边更听话,模糊的指令换来的不是惊喜,是字面意义上的平庸。

换模型的时候,第一件该做的事不是重写提示词,是重估你的提示词里有多少是方言。把方言那部分单独拎出来,剩下的通用语法通常能原样带走七八成,这比从零学一套快得多。

还有一条路和生成式完全不同:用代码逐帧生成视频那套做法。它凭想象出不了片,但胜在精确可批量、能套模板。判断标准很简单——数据动画、榜单、价格变化这类需要每一帧都对得上的内容选程序式;氛围片、场景片、需要真实质感的内容选生成式。两条路不是竞争关系,做内容量大的团队通常两边都要留。

一份可以直接抄走的检查表

把全文压成动手前过一遍的清单,分三段:写之前、写完之后、出片之后。

写之前先确认三件事

第一,这个镜头的完成标准是什么?说得出来才动手,说不出来先回去改分镜。第二,哪些信息必须用素材锁定,哪些用文字就够?分工没想清楚就写,写多长都白搭。第三,素材包齐了吗?角色组图覆盖了几个角度,运镜参考裁干净了没有。

写完之后逐条对照

  • 全文有没有超过一百词,超了就砍,不可妥协的那条是不是在最前面。
  • 动作那一栏有没有物理后果,还是只有形容词。
  • 运镜是不是只有一个,有没有给终点状态。
  • 音频有没有点名,不要配乐有没有明写。
  • 每个引用有没有派活,写没写清楚参考它的哪一部分。
  • 参考强度是不是停在七到八成。
  • 整条提示词是不是同一种语言,和目标画面文字对得上。
  • 内容超过八秒的,有没有改写成时间轴。

出片之后按这个顺序排查

不要一看不对就重写。按下面的顺序找,通常两三轮就定位。

先看词数——砍到一百词以内重跑一次,一半问题在这一步消失。还不对,就看引用有没有派活,把裸引用补上用途。再不对,检查是不是两个运镜打了架。都排除了,才去动参考强度和素材本身。

整个过程只有一条纪律:每轮只改一个变量。改两个以上,你就永远不知道是哪一个起了作用,下次遇到同样的问题还得从头猜一遍。

常见问题解答

提示词到底该写多长,越详细越好吗?

不是。控制在六十到一百词,因为指令遵循度按位置急剧衰减,前两三条几乎必被执行,写满八条通常只随机命中四五条。排查废片的第一步应该是砍要求而不是加要求。词数预算逼你把不可妥协的那一条放最前面,而这个取舍本身就是导演该做的事。

为什么我没要求配乐,出来的视频却自带背景音乐?

因为音视频是在同一次生成里一起产出的,音频栏空着不等于安静,模型会自己补一段。想要没有音乐,必须在提示词里明确写出不要配乐,同时点名你要的环境音,比如雨声、车流、脚步。在这个模型里安静是一条指令,不是留白。

参考图放了却不起作用,角色还是换脸,问题出在哪?

大概率是两件事之一。一是裸引用,只写了参考某张图却没说参考它的什么,模型会全盘照抄或者随机取用;二是参考强度太低,低于六成身份就开始漂移。正确做法是给每个引用派明确的活,强度停在七到八成,并且先生成一条锚点镜头,后续镜头都引用它。

画面里的中文字总是乱码,有救吗?

有三条能明显降低乱码率。第一,整条提示词用中文写,别中英混写,提示词语言要和目标文字语言一致。第二,只用常用字,避开生僻字和特殊符号。第三,字幕写法比标题写法稳,标题要按内容、时机、位置、方式、特征这个公式写全。如果要的是精确的品牌标识造型,别用文字生成,把标识作为图片引用喂进去。

一条十五秒的视频到底多少钱,网上说一元是真的吗?

不是。按公布的API定价,纯生成约四十六元每百万词元,含视频输入的编辑模式约二十八元,而一条十五秒、七百二十线、每秒二十四帧的视频约消耗三十点九万词元,折算下来纯生成约十四元、编辑模式约八点七元,也就是接近一元一秒。网上那个一元十五秒的说法把量级搞错了十几倍,做预算时别照抄。

能不能直接用模特实拍照当角色参考图?

不能。清晰可辨识的真人面部素材会被直接拦截,这是合规约束不是质量问题。角色管线应该从第一天就按生成图或插画参考来设计。真要用真人出镜的口碑类视频,老老实实实拍,别指望在这条路上绕过去,否则做到一半才发现走不通,整个排期都要重来。

权威参考资料

分享到
标签
版权声明

本文标题:《Seedance 2.0提示词写成一张派活单,废片率才降得下来》

本文链接:https://zhangwenbao.com/seedance-2-prompt-writing-guide.html

版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0

继续阅读
发表评论
分享到微信 或在下方手动填写
支持 Ctrl + Enter 提交