ultrazrq-design.work/video-pipeline
◉ 视频 / AI PIPELINE
/// WORK · VOL.V · VIDEO POST-PRODUCTION · 1 CASE · 40+ CLIPS № 05 / 06
VOL.V · AI PIPELINE · 2026

AIPIPELINE 后期 & 流水线 / 拆解

1 条电梯口播视频,背后是 40+ 视频同时跑 的 AI 后期流水线—— 剪口播 · ASR 字幕 · 字幕样式 · HyperFrame 渲染 · 配乐混音 · 封面生成,全部由 AI Agent 调度本地模型自动完成。 原本剪辑师 30 分钟/条的工时,被压到后台默默跑完。

SCROLL FOR 1 SAMPLE + 6-STEP PIPELINE
0:00 / 0:00
№ 01 带货口播 · 案例 SAMPLE · 1 OF 40
VOL.V · NO.05 · CASE STUDY · 2026

40 条带货口播,是怎么"被 AI 批量做出来"的?

How Forty Livestream-Style Selling Videos Were Batched-Produced by an AI Agent Pipeline

规模
40 条 60–120s 带货口播
目标
交付质量不掉、降本提效
节省工时
原 20h → 实际后台托管
人工介入点
仅字幕样式挑选
交付物
成片 + 双语字幕 + 视频封面
运行环境
本地模型 + 私有 Agent

十条带货口播同时跑,不是四十位剪辑师坐在工位上,是一条由 AI Agent 调度的本地后期流水线。 从口播剪辑、ASR 字幕、字幕样式设计、HyperFrame 渲染、配乐混音,到封面生成与发布归档, 几乎全流程都在后台托管—— 唯一会打断 Agent 安静工作的人类动作,是在十来个字幕版式里挑一个。 本文记录这条流水线的实际工作方式、技术决策与质量边界。

01

剪口播:剪映 AI 并行气口剪辑

素材进入流水线的第一关,是把"原始录制"变成"可以读的口播"。 在传统流程里,这一步叫剪辑气口——把所有"嗯""啊""那个"以及说话人的吞字、口误、犹豫段落切掉, 再把断句断得合乎标点。熟练剪辑师做这件事,平均每条 60–90s 的口播要花 6–8 分钟。

我们没有自建这一段,而是把素材统一送进剪映 AI 口播剪辑,由它在 40 条视频上并行启动任务。 任务的颗粒度是"切掉气口 + 纠错 + 重新断句",剪映的语义模型对带货口播这种"信息密度大、停顿多"的内容有比较成熟的模板。

全部完成后,统一对 40 条成片做 1.1× 加速。不是为了让视频变快,而是让节奏更紧——

电商口播的研究里,1.05×–1.15× 是"听感自然、信息密度提升"的最佳区间。

这一步没有任何"模型选型"上的纠结,剪映已经吃透了这件事。 我们做的,是把它并行起来——40 个任务一起跑,剪映本地实例吃满显存队列, 端到端通常在 10–15 分钟内全部出片。把"串行手工"换成"并行 AI",是第一道杠杆。

关键决策

不自己训练剪辑模型。剪映已经做得很对,与其自造轮子,不如把 GPU 时间花在 尚未被通用工具解决的环节——比如字幕样式与长尾视觉一致性。

02

ASR 与字幕:毫秒级时间轴与双语 Skill

剪好的口播,落到 AI Agent 手里。Agent 调本地部署的 ASR 模型跑语音识别, 输出的是一份初字幕:单词级时间轴,精确到毫秒,单条视频的识别准确率约 99%。 这一段在工程上不复杂,难点全在"下一步"——把初字幕变成真正能上字幕轨道的成稿。

我们的处理路径是:Agent 调出独家字幕 Skill,对初字幕做一次"手操级"的二次精修。 精修分成三个层次:

  1. 分段节奏——单句长度卡在 1.6–2.4s 之间, 避免出现"观众还没读完就被切走"的尴尬;超过 2.4s 强制换行或拆句。
  2. 口语化翻译——不是字面翻译,是把"听起来像在讲"的英文写出来。 比如"家人们今天给大家上一款"直译会很怪,我们会让它变成"Alright, today we've got something special"。
  3. 信息流密度——按"短时间屏幕文字信息量"做动态降载。 一帧画面同时出现的字不超过 14 个汉字 / 28 个英文字符, 否则就把长句切到下一帧,让观众的视线有"留白"。

输出格式是 .srt(主轨)和 .ass(带样式的副轨), 同时返回给 Agent 一个结构化的 JSON 描述,作为下一阶段"字幕样式"的输入。

成本对比

同样一份工作交由熟练字幕师执行,单条视频约 30 分钟,40 条总计 20 小时。 流水线以 Agent 串行调用 + 模型推理时间计,实际占用人工时间:0。 关键不是"快",是"稳"——40 条视频的字幕断句节奏、英文口吻、信息密度保持一致,不会因为剪辑师当天状态不同而漂移。

03

字幕样式:从 10 个版式到设计师确认

字幕文件本身是数据,字幕"长什么样"是设计。 在自动化与美学之间,我们选择把后者交回人,但让人在收敛的选项里做选择,而不是从零开始。

Agent 在拿到字幕文件后,会基于视频主色调、画面明暗、主体位置(人脸/产品/风景), 自动生成接近 10 个版式的字幕样式提案,每个版式包含以下设计维度:

  • 字体:思源黑体 / 思源宋体 / Inter / Manrope / 站酷高端黑 等候选, 根据视频调性(高端 / 亲切 / 科技 / 复古)自动筛选 3–4 个。
  • 字重与字号:从 400 到 800 五档可调,按"屏幕中文字占比"反推最优字号。
  • 颜色与对比:主色 + 描边 + 阴影的三层结构,确保在任意帧背景下都满足 WCAG AA。
  • 位置:底部 1/3 / 画面中央 / 人物头顶 / 侧边竖排,可叠加。
  • 动效:淡入 / 上推 / 字符逐显 / 关键词高亮扫光 等 8 种预置。

10 个版式被整理成一份"设计师审阅稿"—— 每页是 { 视频缩略图 + 字幕样式预览 + 设计说明 }。 设计师只需要做两件事:选一个,或者指出要改的地方。 Agent 接住修改意见,再生成新一版——通常 1–2 轮就收敛。

把人放在"会审美"的环节,机器放在"能批量"的环节——这是整条流水线最核心的分工哲学。

04

渲染:HyperFrame 与 VLM 选材贴图

时间轴字幕、字幕样式都齐了以后,进入真正的"视频合成"环节—— 这一段我们交给内部视频合成框架 HyperFrame 处理。

HyperFrame 在这里承担三件事:把字幕按时间轴贴到视频帧上、按设计师确认的样式渲染、 以及对画面做开篇 / 收尾的素材插入。 后者需要"看懂视频"——具体来说,需要知道:这段口播在讲哪个产品? 什么时候情绪是高潮?哪一帧适合做开篇钩子?

我们用的视觉语言模型是本地部署的 MiniCPM-V。 它的角色是 "逐帧内容审阅员": 按时间轴切片,标注每段口播对应的主题、产品露出、情绪曲线; 然后由 Agent 在素材库里挑出最合适的首尾视频,做 1.2–2s 的转场插入。

为什么是本地模型

40 条视频每条要切片 30–60 帧,总计上千次 VLM 调用。 走云端 API 既慢、又贵,还把内容数据传出去—— 带货口播经常涉及未发布的产品信息,本地部署是合规底线,不是技术偏好。

渲染输出是符合平台规格的成片:竖版 9:16 / 1080×1920 / 30fps / H.264 / 码率 6–8 Mbps。 40 条成片在 8 卡 GPU 上并发渲染,端到端约 35 分钟。

05

混音与封面:人声优先与图生图

混音和封面是两条相对独立、但与渲染并行的支线。 混音的难度不在"加 BGM",而在"让 BGM 知道什么时候让位"。 Agent 拿到成片后,会先用 VLM + ASR 的联合标注,把视频分成 人声段 / 停顿段 / 情绪高潮段,再按"人声优先"原则做动态混音:

  • 人声段:BGM 压低 -12dB,频段让 1–4kHz 给到人声。
  • 停顿段:BGM 抬起 -3dB,承接情绪不冷场。
  • 高潮段:BGM 做 0.5s 渐入 + 1s 渐出,制造"打点"感。

封面的生成走 image-to-image 模型。 流程是:先由 Agent 自动截取视频首帧作为底图, 再结合字幕文件提炼的 3–5 个关键词(例如"补水""保湿""敏感肌"), 用提示词工程生成 4–6 版封面候选—— 要求高对比、主题突出、左侧 1/3 留白便于平台 UI 叠加。 设计师或运营挑一张做最终封面。

封面的"信息密度"和"视觉呼吸感"是一对矛盾——AI 的优势在于可以一次出 6 版让你挑, 而不是把这一版调到死。

06

归档与发布:结构化输出与必要时的自动上线

完整的视频文件、字幕文件(.srt / .ass)、视频封面、生成日志、 设计师审阅意见,全部归档到结构化目录:

/output/2026-Q1/livestream-batch-01/
├── 01-raw/                  原始录制
├── 02-cut/                  剪映剪辑后
├── 03-subtitle/             字幕文件 + JSON 描述
├── 04-style/                字幕样式包 + 审阅稿
├── 05-render/               渲染成片 (mp4)
├── 06-mix/                  混音后成片 (mp4)
├── 07-cover/                封面候选 + 终选
└── 08-publish/              发布物料 (title/desc/tags)

必要时,Agent 还能自行完成发布这一步: 按预设的标题模板(产品名 + 卖点 + 钩子)生成标题、写简介、选标签、调度到各平台。 这一步目前仍保留人工确认,但 Agent 已经把"草稿"做到直接可发的程度。

复盘与边界

这条流水线不是要"取代剪辑师",是把剪辑师从 20 小时的重复劳动里解放出来, 去做只有人能做的判断——审美、节奏、卖点、情绪。机器负责"不掉",人负责"出彩"。 这是分工,不是替代。

一条流水线最难的不是建起来,是让它的输出稳定在"完美级"而不漂移。 我们跑了 6 个批次、累计超过 200 条视频, 字幕断句节奏、英文口吻、封面信息密度、混音人声比例,都收敛在很小方差内—— 这才是"流水线"三个字的真正含义。

40视频同时跑
0 min人工剪辑 / 条
~99%ASR 准确率
~10字幕样式版式
20h → 后台工时压缩
200+已跑视频数

同样的工作交由熟练剪辑师执行,单个视频需要消耗 30 分钟、总计 20 小时的工时—— AI Pipeline 让它变成"看两眼就好",并保证完美级交付。