分享一个多模态模型的"邪修玩法":不用视频模型,也可以给视频加上炫酷字幕。
字幕效果完全不需要 MiniMax H3 或者 Seedance 系列模型,只需要一个多模态模型(如 doubao-seed-evolving)和 Agent 工具即可完成。
实现过程
1. 获取原视频
准备一段需要添加字幕的视频片段,算力充足的话一整部电影也可以。
2. 用多模态模型分析视频内容
使用 h3-prompt-expert skill(MiniMax 官方提供)分析视频并生成贴字效果的 prompt。GitHub 地址:https://github.com/MiniMax-AI/MiniMax-H3/tree/main/skills

提示词生成完成后,自行检查字幕内容是否需要调整。

3. 开始生成视频字幕
将步骤 2 生成的提示词直接发给多模态模型,或调用本地 ffmpeg 进行视频字幕的生成。入参包括视频和提示词。

为什么需要 Agent 工具
光把提示词丢给聊天模型,它顶多回一段文字,并不会真的渲染视频。多模态模型只负责"看"和"想",而 Agent 工具负责执行:调用 ffmpeg 渲染 → 截图 → 用多模态模型逐帧检查效果 → 改参数 → 重新渲染,循环直到达标。全程不用人盯着,它自己推进、自己验收。
实际执行过程
模型会先检查环境(ffmpeg 和 python),分析视频分辨率、帧率、时长和音频。然后提取关键帧确认文字摆放位置。


使用 ffmpeg 渲染视频,模型逐帧观看生成效果,不符合要求的自动修改。

为什么选择 Doubao-Seed-Evolving
1. 专门适配 Agent 场景的多模态模型。2. 8 月 27 日刚完成最新一次更新,多模态能力提升。3. 价格亲民:coding plan 9.9 元/月,agent plan 40 元/月。



官方提供了详细的接入说明,市面上常用的 Agent 工具均可使用。官方地址:https://ark.volcengine.com/

总结
整个流程体现了 Doubao-Seed-Evolving 在任务拆解、步骤衔接与复杂业务流程执行方面的高水平。不用视频模型,靠多模态理解 + ffmpeg 渲染,就能批量产出带炫酷字幕的视频。