✅ 已复制到剪贴板

水果世界连续剧 · 最经济视频生产SOP + 精准提示词包

回答三个问题:能不能用即梦免费文生图 + 5.0lite图生视频做全自动?最经济多少钱?半自动怎么做到零返工?
结论先行,后附完整链路、成本表、逐镜头提示词模板,并以第3集做全套范例。
创建:2026-10-05


一、核心结论(先看这个)

1. 纯全自动做不了,但"准全自动的半自动"可以,而且必须这样。
- 卡点只有一个:图生视频的口型、表情、动作稳定性。AI一次出片会有比例漂移、五官崩坏、口型对不上,无人值守必返工。
- 但因为我们是群聊界面剧,超过 75% 的画面根本不用AI生成(用群聊UI模板、消息卡、黑屏字幕做),真正要AI出的角色镜头每集只留 15-18秒、约4-6个短镜头。
- 所以模式是:模板画面全自动批量做 + 少量AI镜头人工审一次 + 剪映拼装。人工只做"审片替换",不做创作,单集后期约 30-45 分钟。

2. 最经济成本:单集约 5 元,月产7条约 35 元。
- 文生图:即梦免费(三视图、角色定帧、卡片配图全走这)。
- 图生视频:用 Seedance 2.0 mini(即你说的便宜档),10/7前限时4折,720p约0.2元/秒;恢复刊例后约0.5元/秒。
- 配音:豆包/火山 TTS,有免费额度,整集 < 0.1元。
- 群聊UI/黑屏/字幕:剪映或AE模板,0元。

成本项 限时价(10/7前) 恢复刊例后
AI角色镜头 18s ≈4.7元 ≈11.7元
配音 TTS 0元(额度内) <0.1元
模板画面 0元 0元
单集合计 ≈5元 ≈12元
月产7条 ≈35元 ≈85元

建议:10/7前把已定稿的序幕+第1/2/3集要反复用的"角色对嘴/动作模板镜头"多囤一些,趁4折。
这与既定"单条≤5元"目标一致(限时价达标;刊例价需把AI镜头再压到10秒内或接受≤12元)。


二、为什么群聊体天生省钱(画面构成)

85秒一集的典型构成:

画面类型 时长 做法 花费
黑屏狠话片头 3-4s 固定模板换字 0
群聊消息流(文字+头像+气泡逐条弹出) 40-50s 群聊UI模板,头像用角色定帧 0
角色静态反应卡(推镜头/Ken Burns) 8-12s 文生图静帧+缩放,不用图生视频 0
AI角色动态镜头(对嘴/动作) 15-18s 图生视频,仅4-6个短镜头 5元档
金句封喉卡 + 黑场钩子 6-8s 模板 0

省钱铁律:能用"静帧+推拉摇移"表达的,绝不生成视频;只有必须看到角色说话/明显动作的高光,才用图生视频。


三、生产全链路(7步,准全自动)

  1. 剧本分镜表(我已在每集脚本里给到,补一列"画面类型"即可):标出哪些是【模板】哪些是【AI镜头】。
  2. 角色定帧:用定稿三视图 + 即梦文生图(免费)生成每个镜头的首帧静态图(同角色一致性,见第五节锁人方法)。
  3. 群聊UI批量生成:在剪映/AE里做一个《果圈互助群》界面模板——背景、气泡、头像位、消息弹出动画、"啵"/提示音全固定;每集只换头像和文字。这部分可一次搭好,永久复用。
  4. 配音先行:把全部台词丢 TTS(小荔枝固定一个音色,全剧不换),导出每句音频;按音频时长倒推每个镜头秒数(这是零返工的关键,先有声音后配画面)。
  5. AI镜头图生视频:首帧 + 精准提示词(第六节模板)生成 3-5 秒短镜头,开启对口型/音画同步(台词型镜头)。
  6. 人工审片替换:只检查 AI 镜头——口型、五官、有无崩坏;不合格就用同一首帧+同提示词重抽(短镜头重抽成本极低)。模板画面不用审。
  7. 剪映拼装:片头模板 → 群聊流 → 反应卡 → AI镜头 → 金句卡 → 黑场钩;加字幕、音效、品牌角标(荔枝红 #E84142)、片尾"本内容不替代就医"。

自动化边界:第1/2/3/4/7步可固化模板、批量;第6步必须有人看一眼。这就是"半自动但几乎全自动"。


四、配音方案(决定能不能对嘴)


五、角色一致性锁人法(避免同一角色每张脸不一样)

  1. 每个角色以定稿三视图为"身份锚",所有首帧生成都把三视图作为参考图上传(即梦支持多图参考)。
  2. 提示词里固定写死:与参考图为同一角色,相同脸型、相同服装、相同配色。
  3. 同一场景的多个镜头,首帧之间也互相参考,保证光线/服装连续。
  4. 角色道具全剧唯一(见三视图方案),提示词每次都点名道具,进一步锁人。

六、图生视频精准提示词模板(填空即用,零返工核心)

每个AI镜头都按这6格写,信息越满,AI自由发挥越少:

【角色】与参考图为同一角色:[角色名 + 一句外形 + 服装 + 专属道具]
【镜头景别】[特写/近景/半身],镜头[固定/缓慢推近],不要切换镜头
【动作】[一个且只一个主动作,幅度小],例如:抬眼、轻敲病历夹、摇头
【表情】[单一明确情绪],例如:似笑非笑、眼眶泛红
【口型】需要说话:按配音念"[这句台词]",口型与声音同步 / 或:不说话,嘴闭合
【时长与画幅】[3-5]秒,竖屏9:16,720p,动作自然不夸张,五官稳定不变形
【排除】不要新增角色、不要换服装、不要手指畸形、不要文字水印、不要剧烈运动

防返工5条:
- 一镜只给一个动作,动作幅度写小(AI做多动作必崩)。
- 台词镜头先有TTS音频,时长卡到秒,生成时按秒数要。
- 一律写"镜头固定/缓慢推近、不切换",杜绝乱运镜。
- 每次都带"五官稳定、手指正常、不换服装"的排除项。
- 首帧不满意先重出静态首帧(免费),别拿烂首帧去烧视频。


七、第3集全套镜头拆解 + 提示词(完整范例)

第3集《天天播别人,今天播她自己》。下列【模板】不花钱,【AI】走图生视频。

# 时间 画面类型 内容
1 0-3s 模板·黑屏狠话 白字"结节?你B超做了吗?"+ 群名符号
2 3-9s 模板·群聊流 山竹失踪公告→红枣姨"是不是那个……"+柠檬"别念"
3 9-15s AI镜头① 山竹锁在屋里,抱膝、眼眶红,发颤音"我播了那么多人……今天轮到我"
4 15-30s 模板·群聊流 红枣姨十结九癌、莲大爷切好几瓣、橘子"要不我切了我有指甲刀"、香蕉插嘴被翻旧账撤回
5 30-37s 反应卡(静帧) 小荔枝静帧推近,敲病历夹(静帧+缩放,不生成视频)
6 37-58s AI镜头② 小荔枝连续追问(可拆2个短镜):"B超做了吗?""TI-RADS几类?边界清楚吗?纵横比?"
7 58-66s AI镜头③ 山竹愣住,声音变小:"我……连B超都没做……"
8 66-74s AI镜头④ 小荔枝定论,似笑非笑:"没做B超就慌一礼拜,你这叫自己判死刑。3类,定期复查就行"
9 74-80s 模板·金句卡 "没做检查就下结论,是你最擅长的,也最害你"
10 80-85s 模板·黑场钩 榴莲:"我这叫排毒不吃药!"小荔枝:"你这叫拿命赌气。"

AI镜头仅4个、约17秒,其余全模板/静帧。

关键镜头提示词实例

AI①(山竹哭,台词型,约5s)

【角色】与参考图为同一角色:拟人山竹女性,深紫圆果壳、头顶绿色萼片,紫红色社区马甲,斜挎小喇叭
【景别】半身近景,镜头缓慢推近,不切换
【动作】抱膝蜷缩,另一只手摸向自己脖子,动作轻
【表情】眼眶泛红、委屈又害怕
【口型】按配音念"我播了那么多人……今天,轮到我了",口型同步
【时长画幅】5秒,9:16,720p,五官稳定
【排除】不新增角色、不换装、手指正常、无文字水印、不剧烈晃动

AI②(小荔枝追问,台词型,拆2镜各4s)

【角色】与参考图为同一角色:拟人荔枝少女护士,红青疙瘩头、粉护士裙、小护士帽、病历夹
【景别】近景,镜头固定
【动作】用病历夹轻点掌心,身体微微前倾(只这一个动作)
【表情】眼神清亮带压迫感,不笑
【口型】按配音念"B超,做了吗?"(第二镜:"TI-RADS几类?边界清楚吗?纵横比大于1吗?")
【时长画幅】4秒,9:16,720p,五官稳定不崩坏
【排除】不换装、不出现听诊器白大褂、手指正常、无文字水印

AI④(小荔枝定论,台词型,约5s)

【角色】同上小荔枝
【景别】近景,镜头极缓推近
【动作】收起病历夹往腰间一夹,抬下巴
【表情】似笑非笑、不容置疑
【口型】按配音念"没做B超就慌一礼拜——你这叫自己判死刑。3类,定期复查就行"
【时长画幅】5秒,9:16,720p
【排除】同上

其余各集照搬这套"拆镜头表 + 6格提示词",我可在每集定稿时直接附好,制作端只负责复制生成,不再二次创作。


八、开工顺序建议

  1. 先按《角色三视图更新方案》把9张三视图定稿(文生图免费,今天就能做)。
  2. 搭一个《果圈互助群》剪映/AE界面模板(一次性,约半天,之后每集复用)。
  3. 趁 10/7前4折,先把第1/2/3集的AI高光镜头生成囤好。
  4. 跑通一集完整流程、校准画风和音色后,再批量推其余集。

最经济视频生产SOP · 2026-10-05 · 伽赋科技 · 荔枝健康