Skip to content

第 34 章 实战 Skill · 视频剪辑生产线

做一条短视频,传统流程要经历多少步?写脚本、配音、配字幕、选 BGM、找素材、剪辑、渲染出片——每一步都是独立的工具和独立的工序。六七步走下来,一条一分钟的短视频可能要花半天。

如果这些步骤可以由一个 Skill 全部串起来,你只需要在关键节点确认,剩下的交给自动化呢?faceless-video-handdrawn 就是这样一个 Skill:一条指令触发,从脚本到成片全自动化,中间设置六步确认门,让你在关键节点把关。

这个 Skill 能干什么

faceless-video-handdrawn 是一个全自动短视频生产 Skill。它的定位是"一条指令出一条完整的视频",覆盖从创意到成片的完整链路。

环节Skill 做什么需要你做什么
脚本根据主题生成视频脚本确认脚本内容和方向
标题生成视频标题确认标题是否合适
配音调用 TTS 生成旁白确认音色是否满意
BGM匹配背景音乐确认音乐风格
品牌区生成片头片尾品牌区域确认品牌元素
视频素材组装画面、字幕、动画确认最终效果
渲染输出 MP4 成片验收

它的核心价值不是"替你做创意",而是把创意之后的全部机械工序自动化。脚本方向是你定的,但把脚本变成声音、字幕、画面、音乐并最终渲染成片的过程,不再需要你一步步手动操作。

安装与准备

从 SkillHub 安装

在 WorkBuddy 的 SkillHub 中搜索 faceless-video-handdrawn,点击一键安装即可。安装后 Skill 会出现在你的技能列表中,随时可以调用。

环境准备

这个 Skill 的渲染依赖两个本地环境:

依赖说明检查方式
Python运行渲染脚本和依赖库终端输入 python --version
ffmpeg视频编码和合成终端输入 ffmpeg -version

如果缺少任一依赖,Skill 会在运行时提示你安装。建议在首次使用前确认两个环境就绪,避免渲染到一半才发现缺环境。

开始使用

安装和环境就绪后,在 WorkBuddy 对话中直接描述你要做的视频,Skill 会自动激活。

text
用 faceless-video-handdrawn 做一条 60 秒的科普短视频,主题是"为什么早起不一定适合所有人"。
风格:知识科普,语速适中,画面简洁。

确认门:6 步逐项确认

这个 Skill 最关键的设计是"确认门"。它不会一口气从头跑到尾,而是在六个关键节点停下来等你确认。每一步确认通过后才会进入下一步,不满意可以要求修改。

第一步:脚本

Skill 会根据你的主题和风格要求生成视频脚本,包含开头钩子、正文要点和结尾。这是最关键的一步——脚本决定了整条视频的内容骨架。

text
脚本确认:
开头(0-5秒):用一个反直觉的问题做钩子——"早起真的更健康吗?"
正文(5-50秒):分三个要点讲,生物钟类型、基因差异、强行早起的负面影响
结尾(50-60秒):总结并给出行动建议——找到自己的节律比早起更重要

确认前检查:开头 3 秒是否有吸引力?正文要点是否清晰?信息量是否适合 60 秒的时长?如果脚本不过关,不要进入后续步骤——脚本是一切的基础。

第二步:标题

Skill 生成视频标题供你选择。标题通常会有几个备选,你可以挑选或要求重新生成。

text
标题候选:
1. 早起不一定适合你,原因藏在基因里
2. 为什么强行早起反而更累
3. 别再逼自己早起了——你的身体可能不适合

第三步:配音

确认脚本和标题后,Skill 调用 TTS 生成旁白音频。你可以在配置文件中指定音色(见后文参数配置)。确认环节是试听配音效果,判断音色、语速和情感是否合适。

第四步:BGM

Skill 会根据视频主题和风格匹配背景音乐。确认环节是试听 BGM,判断音乐与视频氛围是否协调、音量是否合适。

第五步:品牌区域

如果你需要在视频中放置品牌元素(片头 logo、片尾关注引导),Skill 会在这一步生成品牌区域。确认品牌位置、大小和时长是否合适。

第六步:视频素材

最后一步是组装画面。Skill 把脚本、配音、字幕、BGM、品牌区域和画面素材整合到一起,准备进入渲染。确认所有元素到位后,Skill 开始渲染输出。

确认门确认什么不过关的后果
脚本内容方向、结构、信息量全盘方向错误,后面白做
标题标题是否吸引且准确影响点击率
配音音色、语速、情感听感不好,观众流失
BGM音乐风格、音量氛围不对,影响观感
品牌区位置、大小、时长品牌展示不当
视频素材所有元素到位渲染出问题

六步确认门的设计逻辑是:越靠前的步骤影响越大,越靠后的步骤改动成本越高。脚本不过关改脚本就行,但如果渲染完才发现脚本有问题,前面配音、字幕、BGM 全部要重来。

出片与质检

渲染完成

六步确认全部通过后,Skill 开始渲染。渲染过程是自动化的,不需要你操作。渲染完成后会输出 MP4 文件到指定目录。

质检清单

成片不要只看"能不能播放"。建议按以下清单逐项检查:

检查项看什么不通过的判断标准
字幕同步字幕出现和消失的时间与旁白是否对齐明显提前或滞后超过 0.5 秒
音画同步画面切换与音频节奏是否匹配画面和声音明显错位
视觉完整文字是否被遮挡、画面是否有黑边、素材是否缺失关键内容被品牌区覆盖
BGM 音量BGM 是否盖过旁白旁白听不清
品牌区片头片尾是否正常显示品牌元素缺失或错位

验收通过

质检全部通过后,成片可以用于发布。如果某项不通过,可以回到对应的确认门重新调整,不需要从头再来。

text
渲染完成了,但字幕在第 15 秒处明显滞后于旁白,请重新对齐字幕时间轴并重新渲染。

参数配置

Skill 的配置文件是一个 TOML 格式的文件,通过修改配置可以调整视频的输出规格和风格参数。

核心参数

参数说明默认值调整建议
分辨率视频画面尺寸1080x1920(竖屏)横屏改 1920x1080
帧率视频流畅度30fps一般不需要改
BGM 音量背景音乐音量适中旁白听不清时调低
voice_id配音音色 ID默认女声换男声或其他风格

修改示例

toml
[video]
resolution = "1080x1920"
frame_rate = 30

[audio]
bgm_volume = 0.3
voice_id = "zh-CN-XiaoxiaoNeural"

[brand]
enable_intro = true
enable_outro = true

修改配置后不需要重新安装 Skill,下次运行时会自动读取新配置。建议首次使用时保持默认配置,跑通一遍流程后再按需调整。

常用配置组合

场景分辨率voice_idBGM 音量
抖音/视频号竖屏1080x1920女声0.3
B 站横屏1920x1080男声0.2
小红书竖屏1080x1920女声(温柔型)0.25

常见问题

字幕不对齐

字幕与旁白的时间轴出现偏差是最高频的问题。原因通常是 ASR(语音识别)返回的时间戳有误差,或脚本分段与配音分段不一致。

解决方式:在确认门第六步(视频素材)时,留意字幕时间轴。如果偏差明显,要求 Skill 重新对齐字幕再渲染,不需要重新生成配音。

音画不同步

画面切换与音频节奏不匹配。原因可能是渲染时帧率设置不一致或素材时长与配音不匹配。

解决方式:检查配置文件中帧率是否一致,确认配音时长与脚本预期时长是否接近。如果素材时长不够,可以让 Skill 补充画面素材。

字体缺失

渲染后字幕显示为方块或空白。原因是系统缺少配置中指定的字体文件。

解决方式:确认配置文件中引用的字体已安装。如果用自定义字体,确保字体文件路径正确。也可以改用系统默认字体。

问题典型表现排查方向
字幕不对齐字幕提前或滞后ASR 时间戳、脚本分段
音画不同步画面与声音错位帧率设置、素材时长
字体缺失字幕显示方块字体安装、字体路径配置
渲染失败无输出文件Python/ffmpeg 环境、磁盘空间

使用建议

脚本确认是最重要的一步。 六步确认门中,脚本是第一道也是最重要的一道。脚本方向不对,后面所有步骤都是浪费时间。在脚本确认环节多花两分钟审阅,比渲染完重新做省几十分钟。

首次使用保持默认配置。 第一次跑通流程时不要急着改参数。用默认配置走完整条链路,确认每一步都正常工作后再开始定制参数。这能帮你快速定位问题是出在配置还是在流程。

质检要逐项看,不要只看能不能播。 成片能播放不等于可用。字幕对不对齐、BGM 盖不盖人声、品牌区有没有遮挡内容——这些细节决定了视频的专业感。按质检清单逐项过一遍。

竖屏和横屏不要搞混。 抖音、视频号、小红书是竖屏(1080x1920),B 站、YouTube 是横屏(1920x1080)。在配置文件中确认分辨率与目标平台匹配,避免渲染完才发现方向不对。

以真实任务为主线的 WorkBuddy 实战读本 · Pixel icons by HackerNoon