第 89 章 安全与权利红队:在发布前攻击自己的系统

第十六部 工程实施与制作基础设施

第 89 章 安全与权利红队:在发布前攻击自己的系统#

本章目录
89.1 威胁建模、权限分域与提示注入89.2 供应链、肖像声音与内容安全89.3 发布防护、事件响应与证据保留89.4 安全验收与桌面推演

AI 短剧系统同时处理未公开剧本、角色身份、声音、客户材料、授权证据、供应商密钥和平台发布权。安全红队不是大型公司的奢侈品,小团队也应演练最可能造成不可逆损失的路径。

89.1 威胁建模、权限分域与提示注入#

威胁模型。

资产包括故事秘密、真人肖像与声纹、合成角色、授权文件、生成输入、发布母版、账户和预算。攻击者可能是外部人员、越权成员、恶意上传、被污染供应商响应或误操作自动化。

threat:
  id: threat_prompt_injection_research
  entry: external_research_post
  target: rights_documents
  path: untrusted_text_to_agent_instruction
  impact: confidential_upload
  controls: [content_taint, no_network_write, capability_token, egress_review]
  test_case: redteam_014

威胁模型按资产、入口、路径、影响和控制写,不用“注意数据安全”结束。

最小权限与分域。

研究代理能读公开资料,不能读授权原件;生成 Worker 能读裁剪参考,不能读完整剧本;剪辑系统能读批准媒体,不能访问账单;发布服务只能消费签署的 Release Manifest。生产、测试和个人实验账户分离。

密钥存秘密管理器,短时下发,不写 Prompt、日志或工程文件。离职与项目结束触发权限回收和访问审计。

提示注入测试。

在研究网页、字幕文件、图片元数据和供应商说明中植入恶意指令。系统应把它们作为内容数据,不提升到系统指令。上下文编译器标记来源,Agent Contract 明确外部内容无授权能力。

仅靠提示“忽略恶意指令”不够。真正控制是代理没有读取授权库、外发文件和发布的权限,即使模型被骗也无法完成攻击链。

89.2 供应链、肖像声音与内容安全#

文件与供应链。

上传文件检查类型、大小、魔数、宏、压缩炸弹、路径穿越和恶意载荷;图片元数据清理;压缩包在隔离区展开。第三方字体、插件、模型和脚本记录来源、版本和许可。

构建依赖锁版本并生成软件物料清单。紧急升级先在隔离项目测试,不直接对正在交付的工程自动更新。

肖像、声音与同意。

真人材料以明确用途、地域、平台、期限、是否允许训练、是否允许合成变形和撤回机制管理。授权证据与媒体关联,但原件限制访问。合成声音也记录来源和服务条款,不能因“AI 生成”就假设无权利风险。

撤回测试模拟某声线授权终止:系统应查出未发布对白、已发布平台包、投放派生和备份,停止新使用并生成处置清单。

内容与品牌安全。

红队尝试生成歧视、误导医疗、冒充真人、未成年人风险、过度暴力和品牌禁用内容。规则与人工按项目、平台和地区执行。拒绝结果保存最小必要证据,避免在日志重复传播敏感内容。

故事创作的复杂性不能被粗糙关键词误伤。自动系统先识别风险和上下文,边界案例由有权限的人判断并记录依据。

89.3 发布防护、事件响应与证据保留#

发布攻击面。

模拟旧版上传、未批准素材替换、封面与正片错配、字幕遗漏、平台 Token 泄漏和定时发布时区错误。发布服务验证不可变 Manifest、校验和、双人审批和目标平台。

平台凭证不由生成或剪辑代理持有。发布操作使用短时权限,完成后记录平台回执与远端内容哈希。

事件响应。

发现泄漏先停止扩散、吊销 Token、冻结相关任务并保存证据,再判断影响和通知。不要先删除日志或“把文件撤回就算了”。Runbook 定义安全负责人、法务、客户沟通和平台联络。

事后复盘攻击链的每个控制点:哪里本可阻断、为何未阻断、检测多久、恢复多久。修复进入测试,不只修改政策文档。

权利与安全的保留冲突。

审计需要保留,隐私和合同可能要求删除。采用分层策略:删除原始可识别媒体和敏感字段,保留不可逆校验、决定类型和必要法律证明。保留期限由用途与法律意见决定,不无限保存“以防万一”。

89.4 安全验收与桌面推演#

故障树。

模型泄露未来剧情:上下文最小化失败;恶意网页触发外发:内容与指令未分域且权限过大;授权撤回找不全资产:权利未进入依赖图;旧版被发布:Manifest 和校验和未强制;密钥出现在日志:秘密通过普通参数传递。

SOP、检查表与交付物。

建立威胁模型;资产分域;最小权限;隔离上传;测试提示注入;演练授权撤回;攻击发布链;验证事件响应;修复并加入回归;定期复查条款和依赖。

  • 外部内容默认不可信。
  • 模型被骗也无法获得危险权限。
  • 授权撤回可查询全部派生。
  • 发布使用不可变 Manifest 和双人门禁。
  • 安全事故有证据保存与通知路径。

练习:对试播项目执行十个红队案例,交付 threat_model.yamlpermission_matrix.csvredteam_cases/rights_revocation_report.mdincident_runbook.mdremediation_tests/

桌面推演。

模拟客户发现一条投放素材误用了未批准声音。团队在十分钟内回答:它在哪些平台、由哪个任务派生、谁批准、授权缺口是什么、怎样停止、需通知谁、替换版本是否已准备。推演主持人不断加入新信息,如平台缓存仍可访问、另一语言版本也在投放,检验依赖查询和沟通链。

推演结束不评价个人反应快慢,而是找系统缺口。若发布列表靠个人表格、法务找不到证据、运营不知道回滚入口,分别转成资产关系、权利快照和 Runbook 改进,并安排复测日期。安全成熟度来自可重复控制,不来自某位负责人记性好。