先建立声音架构
短剧声音至少有五条彼此独立又相互争夺注意力的层:对白、旁白、音乐、环境声和拟音。把它们全部塞进一个“生成完整音频”的任务,会失去版本、可编辑性、权利来源和混音控制。
每条声音资产都应有稳定 ID、文本或音乐版本、生成/录制参数、说话人或主题、时间码、权利来源和批准状态。剪辑时间线引用资产,不把最终音频当作无法拆解的黑盒。
音乐一致性来自主题语法
整季音乐不应循环一首歌,也不应每集随机换曲。先为核心人物、关系或秘密定义短小的主题动机,再规定它如何变化:
- 调性:明亮、暧昧、威胁、兑现;
- 速度:潜伏、推进、追逐、停滞;
- 配器:角色身份与关系归属;
- 密度:独奏、稀疏脉冲、完整编制;
- 结尾:开放、悬停、假终止、解决;
- stems:节奏、低频、和声、旋律和质感可单独控制。
音乐圣经记录主题首次出现、哪些人物可以共享变体、哪些场景禁用、最大强度和授权边界。这样不同集可以听起来属于同一个世界,同时仍对剧情状态做出反应。
Cue Sheet 是音乐的执行合同
每条 cue 至少记录进入点、退出点、故事功能、情绪起点与终点、主题与变体、强度、对白冲突区、可循环区、stems 和来源。不要只写“这里来一段紧张 BGM”。
音乐往往应该在切画前改变状态:低频先进入,观众才开始预感危险;反转发生时可能需要瞬间抽空,而不是再叠一层鼓。精确 cue 在画面时长趋于稳定后完成,但主题设计必须更早进入故事阶段。
长旁白按语义与呼吸生产
两分钟旁白不要按每 200 字机械切段。先建立韵律地图:每个思想单元的重音、速度、停顿、情绪、呼吸和与画面的关系。切分点放在思想边界,前后段保留重叠上下文,让模型或演员知道上一段如何结束、下一段向哪里推进。
统一锁定声线、采样率、响度目标、麦克风感、空间感、语速范围和发音词典。每段保留干声母版,再做去噪、齿音、呼吸和均衡处理。拼接优先放在自然停顿、爆破音前后或环境声可掩蔽的位置,并记录每个接缝。
最终批准的旁白母版应成为画面和字幕的时间主钟。后续改一个词可能改变呼吸、时长、镜头切点、音乐 cue 和字幕,因此必须创建变更请求,而不是偷偷替换音频。
对白、旁白和音乐如何共存
- 先保证语义最重要的声音可懂。
- 音乐避开关键辅音和句尾信息,不只靠整体降音量。
- 使用 stems 减少与人声同频的乐器,而不是把整首音乐压扁。
- 旁白进入时,环境声仍保留足够空间线索,避免变成真空配音。
- 在手机扬声器、普通耳机和嘈杂环境中复听,检查小音量下是否仍能理解。
权利和临时音乐
保存音乐来源、许可证、订单、下载日期、使用地区、平台、期限和是否允许广告投放。临时音乐必须显著标记,并在锁画前完成替换。AI 生成音乐也要保存模型、条款、提示、输出和相似性审查记录。
声音完成的标准不是“听起来很满”,而是观众无需费力就能理解信息、感到情绪,并相信相邻镜头共享同一个空间与时间。