做视频最难的是哪一步?
我以前会说是"持续更新"。后来发现不是。
是剪。
写脚本、录口播,都还好。真正耗你的是剪——拖素材、对齐字幕、贴片头、调封面、加背景音乐。一个三五分钟的视频,剪映里半小时到一小时。
时间全花在重复劳动上,真正该花心思的判断反而被挤掉了。
后来我换了个思路:==这些重复劳动,能不能让 AI 来做?== 现在我做视频的流程变成这样了:
知识库找文章 → 让 AI 写成口播文案 → 录音 → 把音频和图片给 AI → AI 全自动出片
这篇把每一步怎么走拆给你看。都是我在用的真实做法,不画饼。
思路:人做判断,AI 干活
传统做视频要干这些事:
- 写脚本
- 录口播
- 剪视频:拖素材、对齐字幕、贴片头、加背景音乐
- 单独做一张封面图
- 写标题、描述
- 发到不同平台
前两步是创作,躲不开。后四步全是重复劳动,占你 80% 的时间。
我的思路很简单:==创作的事留给人,重复劳动交给 AI==。我只需要告诉 AI 我要什么,AI 选方案、帮我把活干了。
我实际的工作流
第一步:从知识库里找一篇文章
我的 Obsidian 知识库里攒了不少素材——有自己写的笔记,有从飞书文档和公众号扒下来的资料。想做个视频的时候,就从库里挑一篇适合的。
这一步是纯判断——哪篇内容值得讲、适合视频讲。机器帮不了。
第二步:让 AI 写成口播文案
选好文章后,我把它丢给 AI,说:帮我把这篇变成短视频的口播文案。
AI 会给我一份结构好的口播稿——开头怎么钩人、中间分几段讲、每段讲什么、结尾怎么收。我看看,改一改,定稿。
这一步 AI 做的是转化——把书面内容变成说话的口吻。我还是得判断"这个说法对不对""这个例子要不要换"。
第三步:录音
拿着定稿的口播文案,用手机或者电脑录一段口播。录完就是一段普通的音频文件。
第四步:把音频和图片给 AI
==最关键的一步来了==——我把录好的音频、想要的图片素材(如果有的话),一起给 AI。然后 AI 自动帮我处理后面所有的事。
AI 背后用的是一套视频生成技术搭出来的方案——主要是 Python 和 Remotion(一套用写网页的方式生成视频的技术框架)。当然,你完全不需要懂这些,AI 会自己选方案、写代码、跑流程。你只需要知道它确实能做,然后把素材给它就行。
- 自动写配置:AI 根据我的口播稿内容和分段,自动生成一份视频分镜配置(JSON 格式,每一页讲什么、放什么图、停留多久)
- 自动出字幕:AI 把录音转成带时间戳的字幕,按标点和时长自动分行(底层用的 Whisper 语音转文字模型,是 OpenAI 开源的,准确率很高)
- 自动混音:人声和背景音乐合并,背景音乐压低不抢话(AI 自动调用了音频处理工具做音量平衡和格式统一)
- 自动加一点倍速:整体加 15% 的速度,听着不拖也不变调(AI 自动做了音频变速计算,保证声音不走样)
- 自动做封面:第 0 帧就是一张设计好的封面页(用 Remotion 的渲染能力直接当帧生成,平台抓首帧就是封面)
- 自动加底部进度条:走哪页亮哪段(也是 Remotion 渲染时自动生成的 UI 元素)
- 自动渲染成片:几分钟后,一个完整的 MP4 视频文件就出来了(底层用 Chromium 浏览器无头渲染,逐帧输出合并成视频)
也就是说,==配置文件、代码脚本、命令行运行,全部是 AI 做的==。我完全不碰这些东西。我只管前面三步:找文章、要文案、录音。
第五步:发布
成片出来后,上传到对应平台。同一份素材我还可以扩成长文发公众号,缩成短文发朋友圈。
截图教程类视频:也能走同一条路
以前做截图教程——软件操作一步步演示那种,是另一套做法。
现在也并进来了。做法一样:截图素材给 AI,AI 自动处理——能区域放大、能画箭头和步骤编号标注、能分步推进。
==观点类和教程类,用的是同一套视觉体系==——标题卡、进度条、配色、字幕风格完全统一。
复刻这套需要什么
你可能会觉得"这听起来很技术,我不会写代码怎么办"。
其实你真正需要做的,只是前面三步:
- 找一篇值得讲的素材——这是判断,不是技术
- 让 AI 帮你写口播文案——告诉 AI 你想要什么风格就行
- 录音——按按钮的事
后面的配置、代码、渲染,AI 全包了。你不需要懂 JSON、不需要打开命令行、不需要碰任何代码。
==最难的不是技术,是把"先做什么后做什么"想清楚==。流程想通,执行交给 AI。
下一步
这套流水线跑了大半个月,最大的感受是:持续产出这件事变得不痛苦了。
下一步我打算继续优化截图教程那条线,把更多视频类型并进来,统一视觉风格。
如果你也想做类似的事,我的建议是别追求全自动,先把一条线跑通。能交给 AI 解决的,就不要自己一帧帧挪。
这篇先到这。想试的,评论区说一声。