手绘动画制作一直被认为是专业领域的技能——需要绘画基础、分镜头设计、剪辑能力,整套流程下来往往需要十天半个月。
如今 AI 生成图片已经变得很简单,但将静态图片转化为连贯动画仍然需要考虑分镜逻辑、角色一致性和转场自然性等问题。
最近 GitHub 上一个名为 story-to-handdrawn-video 的开源项目(1237+ Star)把这件事串起来了。它内置 20 种手绘风格,从彩铅到水墨可以自由切换,用户只需要准备一个故事,剩下的分镜、生图、上色、转场全部自动完成,最终输出一支 3:4 竖屏动画。

简单来说,它是一个把中文故事转化为手绘漫画动画的 Agent Skill。

输入一段故事后,它会自动分段、逐页生成插图,字幕、线稿、上色、翻页转场全部自动完成。
实际运行效果
只需对 Agent 发出指令:使用 story-to-handdrawn-video,把这段故事转化成手绘动画。

它首先会将故事按句子拆分为多个分镜头。每个完整句子对应一个镜头,如果单句超过 36 个字,会在"后来""突然"等转折处继续切分。

接下来逐页生成手绘插画。默认采用彩铅日记风格——黑色毡尖笔勾勒轮廓,搭配低饱和度的彩铅上色。

也可以切换为儿童蜡笔风格,线条故意不规则,颜色不完全填满边框,很适合亲子故事场景。

上色环节的处理方式很巧妙:先用黑白线稿铺好底稿,然后从左到右逐步回填颜色。这不是让 AI 重新画一幅灰度图,而是在本地使用 FFmpeg 将同一张彩色图片转换为灰度版本,因此两幅图天然对齐。
核心功能拆解
中文故事自动分句与动态分镜
默认一页一屏,字幕每行不超过 13 个汉字,最多三行。如果超出限制会在渲染前拦截提示,避免视频生成后才发现文字溢出。这种"先校验再渲染"的设计在批量制作内容时能显著节省时间和 token 消耗。
20 种内置手绘风格
从彩铅日记、水墨写意到小豆人涂鸦、粗粝木刻社论,每种风格都附有示例图方便对比选择。


字幕渲染不是让 AI 直接在图片上绘制文字,而是在本地使用开源手写字体进行排版,避免了画面精美但字幕乱码的问题。
两种输入方式
全自动模式:把整个故事交给 AI,从分句、分镜到生图和视频合成一步到位。
素材模式:自己准备一套漫画图片,Skill 只负责制作翻页动画。适合擅长绘画的用户自主控制素材,Skill 处理最耗时的动画环节。

右下角卷页翻书转场
页面之间模拟真实翻书效果,翻页时保留上一页的淡化纹理,也可以切换为普通的 cut 转场。对于绘本和日记漫画类作品,这种转场比传统的淡入淡出更自然。

安装与使用
克隆项目到本地,安装依赖并运行检查:
git clone https://github.com/gnipbao/story-to-handdrawn-video.git
cd story-to-handdrawn-video
npm ci
npm run check
然后将 Skill 包复制到 Agent 的 skills 目录下:
cp -R skill-package/story-to-handdrawn-video ~/.codex/skills/
Codex 用户也可以直接在对话中安装:
帮我安装 https://github.com/gnipbao/story-to-handdrawn-video.git
安装完成后,在 Codex 中输入:
用 $story-to-handdrawn-video 把这个故事转化成可以后期配音的手绘动画。
还可以指定风格:
用 $story-to-handdrawn-video 把这个故事转化成可以后期配音的手绘动画。
风格:彩铅日记
当前限制
- 目前只能输出 3:4 竖屏动画,横屏需要自行修改代码。
- 输出视频不含声音,需要后期自行添加配音或 BGM。
- 图片生成环节会消耗 token,具体费用取决于使用的模型。
总结
story-to-handdrawn-video 的价值不在于"能不能自动做出一支绘本动画",而在于它把拆镜、生图、排版、转场等一系列操作全部封装为 Skill 后可重复执行。当这些环节被自动化后,做动画这件事正在从一种"技能"转变为一种"表达能力"——你只需要把故事讲清楚,其余的交给 Agent。
项目基于 MIT 协议开源,感兴趣的用户可以前往 GitHub 仓库 查看源码和文档。