SHORT VIDEO GEN · v5.0.0

文稿到成品,
一条 AI 短视频流水线

你只需要准备一份文稿(文章、讲稿、笔记都行),丢进去就能自动完成精简、配音、分镜、出图、生成视频、合成成片。无需剪映,直出可发布的竖屏 MP4。

📝 输入 任意文稿,自动精简到 ≤60s 🎙️ 稳重知性女声 🎨 现代扁平插画风 🎬 直出成品 MP4
Glossary · 关键概念

这条流水线到底在做什么

整条流水线其实就是:文字 → 语音 → 画面 → 拼起来。下面是每个环节用到的工具和它的作用,用人话说清楚。

文字 → 语音
🎙️AI 配音
把写好的稿子交给 AI,让它用真人声音读出来。同时会记录每个字出现在第几秒,方便后续把字幕对准画面。本流程用的是 MiniMax。
配音 → 镜头
🎞️分镜拆解
一段配音可能有一分钟长,不能一张图放到底。所以要按每 4–10 秒切成多个「镜头」,每个镜头配一句字幕和一幅画面描述。
文字 → 图片
🖼️生成首帧图
根据每个镜头的画面描述,让 AI 先画一张静态图。这张图就是后面视频的「起点画面」,所有镜头画风统一靠它保证。
图片 → 视频
🎬让画面动起来
把上面画好的静态图喂给视频 AI(比如 Veo),它会基于这张图「脑补」出几秒的动态画面——风吹、云飘、人物微动之类的。
4秒 → 拉长
⏱️慢放对齐
视频 AI 每次只出 4 秒片段,但一个镜头可能需要 6–8 秒才能念完台词。解决办法:把 4 秒片段慢放拉长到目标时长,就像慢动作回放一样。
字幕烧进画面
💬硬字幕
把字幕直接画在视频画面上(不是后期挂上去的)。好处是发到任何平台都不会丢字幕,抖音、小红书、B 站都兼容。
剪映工程文件
📦可二次编辑
流程可以导出一个剪映工程文件,你导入剪映后还能自己调顺序、换音乐、加特效。适合想手动微调的人。也可以跳过这步直接出成品 MP4。
配音 + 配乐混合
🎵加背景音乐
在成片上叠一层背景音乐。关键点:要把配乐音量压得很低(大约 -18dB),确保人声清晰不被盖住——也就是「配乐为辅、原声为主」。
Setup · 事前准备

跑流程前,要开通这些服务

整条流水线靠两个 API 中转站驱动:一个负责「声音」,一个负责「画面」。各自充值拿到 API Key 后填入 skill 配置即可。

MiniMax
必须 · REQUIRED
负责「声音」——文稿配音 + 字幕时间戳。
  • 用途步骤2 TTS 配音,输出 MP3 与字级时间戳
  • 要拿API Key(控制台创建)
  • 充值按字符计费,单条短片成本极低
  • 音色用公共音色,默认稳重知性女声
前往 MiniMax 开放平台 →
APIYI
必须 · REQUIRED
负责「画面」——文生图 + 图生视频,一个 Key 全包。
  • 用途步骤4 出首帧图 + 步骤5 出视频片段
  • 模型NanoBanana2 / Seedream(图)、Veo / Seedance(视频)
  • 要拿API Key(API易中转站)
  • 充值按调用量计费,出视频是主要开销
前往 API易 中转站 →
你的文稿
你来准备
唯一的输入——一篇文稿,剩下的全交给流水线。
  • 格式不限——公众号文章、PPT 讲稿、读书笔记、口播草稿都行
  • 长度随意——AI 会自动精简到 220–240 字(约 60 秒),精简前会给你确认
  • 举例本次案例是一篇 1900 字的《AI 速读阅读分级指南》文章
直接发给 AI 对话即可,无需任何格式处理
ffmpeg
本地 · 自动
负责「合成」——拼接、慢放、烧字幕、混音轨。
  • 用途步骤6 方案B 直出成品 MP4
  • 无需安装Mac 无 ffmpeg 时,自动用 pip install imageio-ffmpeg 拉全功能版
  • 隔离装在虚拟环境,不污染系统
流程内自动处理,无需手动开通
Pipeline · 步骤流程

7 步,从一段文字到一条短片

单向流水线,每一步的产出是下一步的输入。带 NEW 标记的是本次私有化改造新增 / 优化的环节。

1

文稿精简改写 NEW · 核心

把原始长文(几百到上千字)强制精简改写成「60 秒内能念完」的口播稿,提炼 1 核心主张 + 2–3 支撑点 + 1 收尾钩子。这是唯一不花钱的确认关卡。

输入 原始文稿产出 口播稿 ≈220–240字
2

TTS 配音 MiniMax

用稳重知性女声(female-chengshu)把口播稿转成配音,语速 1.0 沉稳不赶,同时产出字幕时间戳。

输入 口播稿产出 配音MP3 + 时间戳
3

分镜拆解

按 4–10 秒规则把配音切成若干镜头;60 秒成片约 9–13 镜。匿名主持人贯穿开场 / 结尾,自然融入场景、不张嘴。

输入 配音 + 时间戳产出 分镜脚本 JSON
3.5

合规自动检查

脚本自动校验:镜头时长合规、主持人开场+结尾出镜、画风统一等,不合规自动标记修复。

输入 分镜脚本产出 校验报告 + 修复
4

生成首帧图 NanoBanana2

每镜生成一张静态首帧,默认现代扁平插画风(米白底 + 青绿/珊瑚/芥末/墨蓝,低饱和色块)。100 路并发批量出图。

输入 画面提示词产出 首帧图 ×N
5

图生视频 Veo

把首帧图喂给 Veo(fast 版固定 4 秒)让画面动起来,Seedance 作降级备选。异步轮询拿结果。

输入 首帧图产出 视频片段 ×N
6

合成成品 双方案

方案A:导出 FCPXML 剪映工程,自己微调。方案B(新):直出成品 MP4——慢放对齐 → 拼接 → 烧字幕 → 叠配音,还能加 BGM。打开即播、直接发布。

输入 视频片段 + 配音 + 字幕产出 成品 MP4 / 剪映工程
Materials · 过程资料

真实产物,点开看细节

以《AI 速读阅读分级指南》为例,下面是流程各环节的真实中间产物——文稿、配音音频、分镜脚本、56 张首帧图、视频片段、画风模板、合成命令。点击任意一条展开。

📝 文稿精简:1900 字 → 242 字步骤1 · 看「改写而非截断」是怎么做的 展开
原始文稿(节选)≈1900字 / 6分钟
AI 帮你 10 分钟读完一本书,这是穷人的知识付费,是拯救忙碌生活的救命稻草……(含大量铺垫、四点失去的逐条展开、四点得到的逐条论述、红楼梦/资本论等具体书单、审美语感段落)
精简口播稿242字 / ≈60秒
AI 10 分钟读完一本书,听着很爽。可这到底是赚了,还是亏了?AI 速读拿走了精华,也删掉了所谓的"杂质"。但被删掉的人物心理和推敲过程,往往才是一本书的灵魂……记住,AI 是加速器,人是定盘星。
▦ 取舍逻辑
保留 · 砍掉
保留:核心钩子「赚了还是亏了」、失去什么(共情/思考/专注三合一)、分级落点(工具书交给AI / 经典亲自读)、金句收尾。
砍掉:「穷人的知识付费」等铺垫、四点逐条展开、具体书名清单、审美语感段落。
🎙️ 配音音频 + 配乐步骤2 · AI 旁白原声与背景音乐,点开试听 展开
▦ 两条音轨
🗣️
AI 配音旁白 MAIN · 原声主音轨
MiniMax speech-2.8-hd · 稳重知性女声 · 6:08 · 流程自动生成
🎵
背景配乐 BGM · 用户提供
《Eyes wide open》· 3:06 · 循环铺满全片,压到约 -18dB 垫底
混音逻辑 · 配乐为辅、原声为主
配乐是你额外提供的输入,不参与生成、只在最后合成时叠加。用 amix normalize=0 保证叠加后旁白原声音量不被压低;配乐循环铺满 6 分钟、首尾淡入淡出。实测:加配乐后整体响度仅 +0.8dB、峰值不变,原声稳稳主导。
🎞️ 分镜脚本 JSON步骤3 · 56 镜头中的真实结构 展开
▦ 单镜头数据结构
// 每个镜头包含字幕、起止时间、时长
{
  "shot_id": 1,
  "subtitle": "AI 帮你 10 分钟读完一本书,但你到底失去了什么?这是一份精准阅读分级指南。",
  "start_time_ms": 0,
  "end_time_ms": 7574,
  "shot_duration_sec": 7.57
}

{
  "shot_id": 2,
  "subtitle": "在这个每天都被信息轰炸的时代,我们似乎都在追求更快。想读书?没时间。",
  "start_time_ms": 7740,
  "end_time_ms": 15539,
  "shot_duration_sec": 7.8
}
▦ 关键规则
每镜 4–10 秒;字幕与配音时间戳对齐;镜头1/2 与末镜必须出现匿名主持人;主持人仅描写神态与肢体,不张嘴说话。
🎨 画风提示词模板步骤4 · 现代扁平插画风(全片统一) 展开
▦ 统一画风模板(占位符替换)
核心主体:[描述主体],出现人物时使用亚洲人面部特征。
整体为现代扁平矢量插画风格,造型简洁几何化,色块平整干净,
边缘清晰,轻微长投影营造层次。
配色:米白底,主色青绿/珊瑚橙/芥末黄/墨蓝点缀,整体低饱和、和谐柔和。
质感细节:[细节],用简洁色块与少量描边线条表现,避免复杂纹理。
背景基底:[背景],米白或浅米灰纯色背景,简洁留白。
光影风格:扁平柔和,无强烈高光硬阴影。渲染风格:现代扁平商业插画。
逆向提示词:铅笔素描质感、写实照片、3D塑料金属、高饱和刺眼色彩、杂乱纹理。
只替换 4 个占位符,其余固定不变,保证 56 个镜头画风高度统一。主持人形象在项目开始时固定一份「形象规范」,开场结尾复用。
🖼️ 首帧图 · 全 56 张步骤4 · 每个镜头先出一张首帧图,再图生视频 展开
▦ 56 张首帧图(点击放大)
说明
这些是 NanoBanana Pro 按统一画风模板生成的每镜首帧图,是「图生视频」的输入。全片 56 张风格高度一致:米白底、低饱和色块、现代扁平插画。此处为压缩预览图,点击可看大图。
🎬 视频片段 · 精选 8 段步骤5 · 首帧图喂给 Veo 生成的 4 秒动态片段 展开
▦ 代表性镜头片段(共 56 段,此处精选 8 段)
#1 开场·主持人
#6 问题钩子
#10 第一·失去共情
#24 专注力萎缩
#37 分级·交给AI
#45 分级·亲自慢读
#53 金句·加速器
#56 结尾·主持人
说明
每段是 Veo 3.1 fast 基于首帧图生成的原始 4 秒片段(未慢放、未烧字幕、无配音)。最终合成时会按分镜目标时长慢放对齐、再拼接烧字幕。完整 56 段在 skill 跑通后的「视频片段」目录里。
⚙️ 成片合成命令步骤6 方案B · 慢放 + 烧字幕 + 混音 展开
▦ 慢放对齐(4s → 目标时长)
# factor = 目标时长 / 视频实际时长
vf = "scale=720:1280:force_original_aspect_ratio=increase,
      crop=720:1280,setpts={factor}*PTS,fps=30"
▦ 加背景音乐(配乐为辅、原声为主)
$FF -i 成片.mp4 -stream_loop -1 -i bgm.mp3 \
 -filter_complex "[1:a]volume=0.12,afade=t=in:st=0:d=2[bgm];
   [0:a][bgm]amix=inputs=2:duration=first:normalize=0[a]" \
 -map 0:v -map "[a]" -c:v copy -c:a aac 成片_配乐版.mp4
实测验证
BGM 压到约 -18dB 垫底。响度对比:原声版 -22.4dB → 配乐版 -21.6dB(仅 +0.8dB),峰值不变 → 确认原声仍主导。视频流 copy 不重编码,秒出无损。
Result · 成片呈现

这条流水线跑出来的成品

《AI 速读阅读分级指南》成片(含配乐版)。720×1280 竖屏,字幕已烧录,打开即播。

6:08
成片时长
720×1280
竖屏 30fps
56
视频镜头
59MB
H.264 + AAC
说明
这是旧规则(6 分钟版)的成片,用于演示完整流水线效果。改造后的新规则会把同一文稿精简到 60 秒以内,镜头数降到约 9–13 个,成本与时间大幅下降。
Cost · 成本核算

生成一分钟视频,要花多少钱?

按 60 秒成片、约 11 个镜头的典型规模估算。成本几乎全压在「图生视频」一环,其余可忽略。汇率按 1 USD ≈ 7.3 RMB。

环节模型单价数量小计
图生视频Image → Video Veo 3.1 fastAPIYI 中转 $0.3 / 次按次计费,非按秒 11 段 ¥24
生成首帧图Text → Image NanoBanana Pro ¥0.3 / 张 11 张 ¥3.3
配音 TTSText → Speech MiniMax speech-2.8-hd 约 ¥0.18 / 万字内 242 字 ¥0.2
合成成品Compose 本地 ffmpeg 免费 ¥0
合计(所有镜头一次成功的理想值) ≈ ¥27.5
¥27.5
理想值
一次全过
¥32–38
实际预期
含 15–25% 废片重跑
¥123
旧 6 分钟版
56 镜光 Veo 一项
1/5
精简到 1 分钟后
成本直降比例
关键认知 Veo 是按次计费——不管一个镜头是 4 秒还是 8 秒,都是 $0.3/次。所以决定成本的是镜头数量,不是视频时长。9 镜约 ¥22,13 镜约 ¥31。这也是为什么把脚本精简到 60 秒能立竿见影省钱:镜头从 56 个砍到 ~11 个,成本直接降到约 1/5。
Optimize · 优化建议

还能更省、更像你想要的风格

两个方向:一是把单条成本再压下去,二是让画面风格按你的审美定制。下面是实操路径。

💰
关于省钱Cut the cost per video

① 拉长镜头时长 省约 1/3

现在是 3–6 秒一个镜头,调整到 6–10 秒一个镜头。镜头总数减少,而 Veo 按次计费,镜头变少 = 调用次数变少,整体大概节省 1/3

② 换更便宜的视频模型 < ¥1 / 镜

把视频模型换成 海螺 hailuo 2.3 fast、分辨率用 768p,一个 6 秒镜头的成本就能压到不到 1 块钱。相比 Veo 的 $0.3/次(≈¥2.2),单镜直接腰斩还多。

🎨
关于风格调整Make it your own look

① 逆向提示词,替换 skill 默认画风

这个完全可以用 skill 复刻你喜欢的风格:找到你想要的画面,截图几帧给 AI,让它逆向出提示词,再把这套提示词替换进 skill 里的「画风模板」(step4.md / templates/prompt_template.txt)。之后全片就按你的风格出图。

② 还不够像?带原图 + 强约束参考

如果逆向提示词仍不够还原,进一步:截图原图,让 AI 每次生图都带上这张参考图,并在提示词里明确约束「严格参考参考图风格」

⚠️ 副作用:这种方式有时 AI 会困在原图的构图里,画面变化不大。还原度与构图自由度需要权衡取舍。

📦 下载这个 skill

完整的「短视频生成 skill」工作流包,含全部步骤文档、脚本、配置模板与 API 文档。解压放入技能目录即可使用。

short-video-gen-skill.tar.gz
📁 ~109 KB 🏷️ v5.0.0 🐍 Python ≥3.8 🔑 需 MiniMax + APIYI Key
short-video-gen/
├─ SKILL.md — 总入口,7步流程定义
├─ config/ — default.yaml(时长/音色/画风)
├─ steps/ — step1~6 文档 + 批处理脚本
│   ├─ step1.md … 文稿精简改写规则
│   ├─ step6_compose_mp4.py … 直出成品MP4
│   └─ step6_fcpxml_editor.py … 剪映工程
├─ api_docs/ — MiniMax/Veo/NanoBanana 等接口文档
└─ templates/ — 分镜结构 + 画风提示词模板