手绘视频曾经需要专业美术功底,现在有人将其做成了 Skill,让 AI 自动完成绘图效果。本文分享从零开始用 AI 创作手绘视频的完整流程,涵盖文案生成、配音、SRT 字幕转换和视频合成。

步骤一:Skill 下载与安装
这个 Skill 由开发者"江哥是老登啊"开源,目前在 GitHub 上已有 2k+ 收藏。它的核心功能是:根据 SRT 字幕稿自动生成手绘白板动画视频。

SRT 字幕稿是包含字幕内容和时间轴的标准格式文件,可通过语音转文本工具从音频中提取。

安装过程非常简单,不需要打开 GitHub 或懂 Git,只需在 WorkBuddy 对话框中输入:
geeklee/srt-whiteboard-animation
帮我搜索这个 Skill,帮我安装并告诉我有什么功能

安装完成后,WorkBuddy 会自动介绍该 Skill 的功能,建议先了解再做测试。

步骤二:文案生成与优化
短视频的核心在于前 3 秒的吸引力,文案质量至关重要。推荐使用 dbskill 进行文案优化:

dontbesilent2025/dbskill
帮我搜索这个 Skill,然后安装并告诉我有什么功能
安装后用 dbskill 优化开头和正文文案,提升内容吸引力。
步骤三:音频生成
为保证自动化流程,音频需使用 AI 大模型生成。推荐使用 MiniMax,价格便宜(约 3 元/万字符),音色效果好。
首先到 MiniMax 官网注册账号,进入后台控制台:

实名认证后充值少量金额,点击"获取 API key"保存密钥供后续使用:

然后打开 音色查询网站,选择喜欢的音色并复制 Voice ID:

步骤四:完整制作流程
整体流程串联如下:
- 发送要求生成文案并优化
- 使用 MiniMax 生成音频
- 音频转 SRT 文件
- SRT 手绘 Skill 拆画面
- 生成画面、人工确认
- 线框覆盖画面元素、人工调整
- 确认覆盖元素位置
- 每个画面做绘图视频渲染
- 合并分镜头加音频接入加渲染最终视频
看似步骤很多,但基本上都在一个对话里面重复确认下一步即可,不需要记忆。
发送文案生成提示词
我需要做一个认知思维讲解的短视频,用手绘风格展现,时长两分钟。帮我生成初稿和线稿画面推荐,然后使用 dbs skill 优化文字稿。

使用 MiniMax 生成音频
将上一步生成的文案、API Key 和音色 ID 组合成提示词交给 WorkBuddy。建议将音频速度调至 1.3-1.5 倍,短视频需要稍快节奏:

音频转 SRT 文件
直接对 WorkBuddy 说"生成 srt 字幕稿"即可:

拆画面
提示词需包含两部分:要求板块(指定使用 srt-whiteboard-animation Skill)和手绘图画面建议(描述每个白板的画面内容):

生成画面并确认
Skill 会根据线稿建议生成分镜图,展示最终画面效果,确认后继续:

线框覆盖画面元素
这一步需要手动操作。Skill 会自动打开浏览器显示一个网页界面:

需要找到 WorkBuddy 的对话存储文件夹:

路径为 assets 到 whiteboard 到具体文件:

打开后需要手动调整框的位置,让每个元素都在框内,并调整出现顺序:

调整后效果:

框内的数字定义了绘制顺序,如先画柱子(1),再画人物(2),最后画底部(3):

确认覆盖元素位置
Skill 会将调整好的位置框重新渲染为 PNG 图片,并标注绘制箭头指示方向:

绘图视频渲染
每个分镜单独渲染为视频片段(十几秒):

检查每个分镜效果,有问题可单独修改,无问题则进入合并。
合并分镜加音频加渲染最终视频
所有分镜合并并添加音频,生成完整视频:

自定义笔的署名
默认视频中的笔带有原作者署名"江哥是老登"。要改成自己的署名,只需向 WorkBuddy 提问:
视频中的笔是"江哥是老登"可以改成"杰克船长的AIGC"吗?

AI 会更新 Skill 中的笔图片并替换为你的署名。
总结
手绘视频制作曾经需要文案加配音加美术加剪辑的团队,现在靠 AI 一个人 40 分钟就能完成。配音自然、画面流畅、字幕同步准确,成品可直接发布到抖音、B 站等平台。掌握工具的人,效率会大幅提升。
苏米注:AI 时代的红利在于,掌握工具的人比不会用的人效率高 10 倍。手绘视频这类传统需要美术功底的领域,现在已完全可以通过 Skill 自动化完成。