前言:我们真正要建造的,不是一条 AI 视频

书前

前言:我们真正要建造的,不是一条 AI 视频#

本章目录
一部关于“把作品做成”的书本书要解决的核心矛盾这本书写给谁全书的组织方式如何使用这本书关于工具、经验和“最佳实践”最后的尺度

一部关于“把作品做成”的书#

过去几年,AI 影像最醒目的进步,常常以几秒钟为单位出现:一张人物图变成会呼吸的镜头,一段文字变成有光影和运镜的画面,一个虚构角色获得声音、表情和动作。每次能力跃迁都令人兴奋,也不断制造同一种错觉:既然镜头已经能够生成,影视作品似乎也快要能够一键生成。

真正进入生产之后,这个错觉很快就会破裂。

一个漂亮镜头不等于一个成立的场景;一个成立的场景不等于一集让人追看的短剧;一集偶然成功的样片,也不等于一套能够稳定生产几十集、控制成本、通过验收并获得商业回报的系统。人物会在相邻镜头中变脸,服装和道具会无故改变,房间的门窗会移动,演员的视线和动作接不上,音乐只会笼统地“煽情”,长旁白缺少呼吸和情绪弧线,剪辑则被迫用越来越多的补丁掩盖上游问题。更隐蔽的失败发生在故事层:画面越来越精致,观众却不知道主角究竟想要什么,也没有理由点开下一集。

所以,这不是一本教人“生成一些短剧镜头”的书。本书讨论的是一个更完整、也更困难的问题:如何借助 AI,设计、组织、生成、剪辑、检验和经营一部真正可交付的商业短剧。

这就是本书所说的“造剧”:不是生成许多彼此无关的漂亮镜头,而是让成百上千个镜头服从同一套故事事实、人物状态、视听语言、商业目标和生产秩序。AI 改变了每个工位的工具和成本,却没有取消戏剧、导演、表演、摄影、声音、剪辑、制片、法务和发行的基本责任。相反,由于生成模型缺少稳定记忆、局部结果具有随机性、工具能力快速变化,生产系统必须比传统的个人创作更明确地管理状态、资产、版本、依赖、预算和审批。

本书要解决的核心矛盾#

AI 生成擅长局部创造,连续叙事要求全局约束。

局部创造允许一个镜头独自精彩。全局约束要求同一个人物在几十集里仍然是同一个人;要求伤痕、服装、道具、知识和情绪遵循剧情时间;要求上一镜抬起的手能在下一镜继续落下;要求空间方向、光线、环境声和音乐动机共同维持世界的连续;还要求这些艺术选择服务于明确的观众承诺和商业模型。

这正是 AI 商业短剧最根本的生产矛盾。它不能只靠更长的提示词解决,也不能只靠最后的人工剪辑补救。它需要一整套从上游到下游相互咬合的方法:

  1. 把市场机会转化为可验证的观众欲望和故事承诺。
  2. 把故事承诺转化为人物、关系、秘密、证据、节拍和卡点。
  3. 把抽象剧本转化为可表演、可生成、可剪辑的镜头任务。
  4. 用角色圣经、状态机、场景地图和连续性账本维持跨镜头、跨场景和跨集的一致性。
  5. 把对白、旁白、音乐、环境声和拟音作为独立的叙事系统,而不是画面完成后的装饰。
  6. 用分层生成、合成、剪辑、调色和质量控制,把不稳定的模型输出变成稳定的交付物。
  7. 用成本、权利、验收、投放数据和复盘机制判断作品是否值得继续生产。
  8. 把这些规则写入 Agentic 制片系统,让智能体承担有边界的工位,而不是在一个聊天窗口里假装包办整部作品。

本书会沿着这八个问题一直深入到文件、字段和动作层。读者不仅会看到“应该保证人物一致性”,还会看到人物身份参考如何建立、哪些特征可以变化、哪些特征必须锁定、如何为每个镜头编译参考包、如何评分漂移、失败后应该回到关键帧、视频生成、合成还是分镜。音乐也不会停留在“选择符合情绪的 BGM”:我们会建立主题动机、变体矩阵、stems、cue sheet、音乐进入与退出点、对白 ducking、授权证据和跨集复用规则。长旁白、多人场景、动作交接、空间轴线、聊天界面、字幕避让、手机外放、故障路由和批量扩产,都将以同样的粒度处理。

这本书写给谁#

它首先写给想把 AI 影像从实验推进到作品的人:编剧、导演、制片人、剪辑师、声音创作者、视觉开发者和独立短剧团队。它也写给正在构建创作产品、工作流平台或智能体系统的工程师,因为创作自动化的难点通常不是再增加一个模型调用,而是把模糊判断编译成可靠的状态、权限、事件和验收条件。

品牌内容团队、MCN、平台从业者和投资制作方也可以把本书当作一套项目审查语言。它能帮助非技术负责人判断:所谓“AI 制作方案”究竟只是若干工具演示,还是已经回答了故事能否成立、资产如何复用、连续性如何维护、声音如何完成、成本如何封顶、权利如何追溯以及失败如何返工。

读者不必同时精通所有专业。你可以从自己的工位进入,但需要理解上下游,因为短剧中最昂贵的问题往往不是某个工位做错了,而是信息在交接时消失了。

全书的组织方式#

全书不是按某款软件的菜单排列,而是按一部商业短剧从无到有、从试播到规模化的真实决策顺序展开。

第一部建立商业与市场基础,先回答为谁制作、靠什么回收成本、什么承诺值得验证。第二部和第三部进入故事工程,把欲望、冲突和反转变成整季架构、分集节拍以及可生产剧本。第四部建立视觉世界和资产治理。第五部集中处理 AI 影像最顽固的问题:人物、状态、空间、动作、多人关系、时间与光线的连续性。

第六部把节拍翻译为镜头、构图、调度和转场。第七部进入模型评测、关键帧、图生视频、AI 表演、分层合成与失败成本。第八部完整处理声音,包括声音选角、对白、长旁白、音乐、环境声、拟音、混音和手机播放。第九部完成剪辑、节奏、字幕、屏幕图形、调色和技术输出。

第十部建立质量控制、返工和发布闸门。第十一部把前述方法编译成 Agentic 制片系统,讨论工位边界、项目状态、事件、提示词版本、调度、预算、故障恢复与自动评测。第十二部让发行数据回到故事和生产决策。第十三部处理权利、合同、预算、排期,以及从试播集扩展到整季的组织问题。

目录之后的导论会先给出贯穿全书的总模型。再往后,读者才会见到虚构短剧《逆光收购》。它不是本书的主角,也不是一套必须模仿的题材模板;它只是统一的试验台,让同一个故事问题能够在编剧、资产、镜头、声音、剪辑、投放和智能体章节中被反复追踪。如果案例与原则发生冲突,应当保留原则,替换案例。

如何使用这本书#

第一次阅读,建议按顺序走完。前半段那些看似“尚未生成画面”的工作,会决定后半段绝大多数成本。跳过商业假设、故事承诺、资产锁定和镜头记录,直接进入视频模型,通常只会更快地产生一批无法组接的素材。

第二次使用时,可以把本书当作生产手册。每章都尽量提供四类东西:判断问题的原理,执行工作的 SOP,可交接的结构化产物,以及发现失败后的返工路径。项目不必机械照搬所有表格,但不能让关键事实只存在于某个人的记忆或某一轮聊天记录中。

构建智能体系统的读者,应当把章节中的账本、状态、闸门、权限和事件看得比示例提示词更重。提示词会随着模型变化,生产语义则相对稳定。一个系统是否成熟,不在于它能不能自动点击更多按钮,而在于它能否知道当前事实是什么、下一步为什么可以开始、失败影响哪些资产,以及什么决定必须留给人。

关于工具、经验和“最佳实践”#

AI 工具会快速更替,平台规则、模型能力和成本也会变化。本书不会把某个阶段的产品排行榜伪装成长期规律。涉及具体工具时,应把它们理解为能力实例:参考图控制、首尾帧控制、角色绑定、局部修复、口型、声音克隆、分轨、自动对齐、质量检测。真正需要保存的是任务测试集、选择标准、失败记录和替换接口。

同样,本书不会承诺一种题材、一个钩子或一套自动化流程必然赚钱。商业创作不存在这种保证。我们能做的是让假设变得可检验,让成本在失控前被看见,让失败能够定位,让成功能够复现和扩展。

最后的尺度#

衡量一套 AI 短剧系统,不应只看它生成了多少分钟视频,也不应只看某一帧有多漂亮。更严格的尺度是:人物是否让观众相信,故事是否让观众继续,声音是否让情绪真正发生,镜头之间是否属于同一个世界,团队是否知道每个决定从何而来,失败是否能够以可承受的代价修复,而整套方法能否在下一集、下一季和下一支团队中继续工作。

本书要讨论的,就是如何达到这个尺度。