你只需要准备一份文稿(文章、讲稿、笔记都行),丢进去就能自动完成精简、配音、分镜、出图、生成视频、合成成片。无需剪映,直出可发布的竖屏 MP4。
整条流水线其实就是:文字 → 语音 → 画面 → 拼起来。下面是每个环节用到的工具和它的作用,用人话说清楚。
整条流水线靠两个 API 中转站驱动:一个负责「声音」,一个负责「画面」。各自充值拿到 API Key 后填入 skill 配置即可。
pip install imageio-ffmpeg 拉全功能版单向流水线,每一步的产出是下一步的输入。带 NEW 标记的是本次私有化改造新增 / 优化的环节。
把原始长文(几百到上千字)强制精简改写成「60 秒内能念完」的口播稿,提炼 1 核心主张 + 2–3 支撑点 + 1 收尾钩子。这是唯一不花钱的确认关卡。
用稳重知性女声(female-chengshu)把口播稿转成配音,语速 1.0 沉稳不赶,同时产出字幕时间戳。
按 4–10 秒规则把配音切成若干镜头;60 秒成片约 9–13 镜。匿名主持人贯穿开场 / 结尾,自然融入场景、不张嘴。
脚本自动校验:镜头时长合规、主持人开场+结尾出镜、画风统一等,不合规自动标记修复。
每镜生成一张静态首帧,默认现代扁平插画风(米白底 + 青绿/珊瑚/芥末/墨蓝,低饱和色块)。100 路并发批量出图。
把首帧图喂给 Veo(fast 版固定 4 秒)让画面动起来,Seedance 作降级备选。异步轮询拿结果。
方案A:导出 FCPXML 剪映工程,自己微调。方案B(新):直出成品 MP4——慢放对齐 → 拼接 → 烧字幕 → 叠配音,还能加 BGM。打开即播、直接发布。
以《AI 速读阅读分级指南》为例,下面是流程各环节的真实中间产物——文稿、配音音频、分镜脚本、56 张首帧图、视频片段、画风模板、合成命令。点击任意一条展开。
// 每个镜头包含字幕、起止时间、时长 { "shot_id": 1, "subtitle": "AI 帮你 10 分钟读完一本书,但你到底失去了什么?这是一份精准阅读分级指南。", "start_time_ms": 0, "end_time_ms": 7574, "shot_duration_sec": 7.57 } { "shot_id": 2, "subtitle": "在这个每天都被信息轰炸的时代,我们似乎都在追求更快。想读书?没时间。", "start_time_ms": 7740, "end_time_ms": 15539, "shot_duration_sec": 7.8 }
核心主体:[描述主体],出现人物时使用亚洲人面部特征。 整体为现代扁平矢量插画风格,造型简洁几何化,色块平整干净, 边缘清晰,轻微长投影营造层次。 配色:米白底,主色青绿/珊瑚橙/芥末黄/墨蓝点缀,整体低饱和、和谐柔和。 质感细节:[细节],用简洁色块与少量描边线条表现,避免复杂纹理。 背景基底:[背景],米白或浅米灰纯色背景,简洁留白。 光影风格:扁平柔和,无强烈高光硬阴影。渲染风格:现代扁平商业插画。 逆向提示词:铅笔素描质感、写实照片、3D塑料金属、高饱和刺眼色彩、杂乱纹理。
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56# factor = 目标时长 / 视频实际时长 vf = "scale=720:1280:force_original_aspect_ratio=increase, crop=720:1280,setpts={factor}*PTS,fps=30"
$FF -i 成片.mp4 -stream_loop -1 -i bgm.mp3 \ -filter_complex "[1:a]volume=0.12,afade=t=in:st=0:d=2[bgm]; [0:a][bgm]amix=inputs=2:duration=first:normalize=0[a]" \ -map 0:v -map "[a]" -c:v copy -c:a aac 成片_配乐版.mp4
《AI 速读阅读分级指南》成片(含配乐版)。720×1280 竖屏,字幕已烧录,打开即播。
按 60 秒成片、约 11 个镜头的典型规模估算。成本几乎全压在「图生视频」一环,其余可忽略。汇率按 1 USD ≈ 7.3 RMB。
| 环节 | 模型 | 单价 | 数量 | 小计 |
|---|---|---|---|---|
| 图生视频Image → Video | Veo 3.1 fastAPIYI 中转 | $0.3 / 次按次计费,非按秒 | 11 段 | ¥24 |
| 生成首帧图Text → Image | NanoBanana Pro | ¥0.3 / 张 | 11 张 | ¥3.3 |
| 配音 TTSText → Speech | MiniMax speech-2.8-hd | 约 ¥0.18 / 万字内 | 242 字 | ¥0.2 |
| 合成成品Compose | 本地 ffmpeg | 免费 | — | ¥0 |
| 合计(所有镜头一次成功的理想值) | ≈ ¥27.5 | |||
两个方向:一是把单条成本再压下去,二是让画面风格按你的审美定制。下面是实操路径。
现在是 3–6 秒一个镜头,调整到 6–10 秒一个镜头。镜头总数减少,而 Veo 按次计费,镜头变少 = 调用次数变少,整体大概节省 1/3。
把视频模型换成 海螺 hailuo 2.3 fast、分辨率用 768p,一个 6 秒镜头的成本就能压到不到 1 块钱。相比 Veo 的 $0.3/次(≈¥2.2),单镜直接腰斩还多。
这个完全可以用 skill 复刻你喜欢的风格:找到你想要的画面,截图几帧给 AI,让它逆向出提示词,再把这套提示词替换进 skill 里的「画风模板」(step4.md / templates/prompt_template.txt)。之后全片就按你的风格出图。
如果逆向提示词仍不够还原,进一步:截图原图,让 AI 每次生图都带上这张参考图,并在提示词里明确约束「严格参考参考图风格」。
完整的「短视频生成 skill」工作流包,含全部步骤文档、脚本、配置模板与 API 文档。解压放入技能目录即可使用。
⬇ short-video-gen-skill.tar.gz