4 步做出 VOX 风格视频:Codex 工作流教材
想一起学 AI 视频、自动化工作流和实用工具,可以扫码加微信,我会把你拉进学习交流群。群里会不定期分享免费工具、安装包和实操案例。
做 Codex、Claude Code 或各类 Skill 时,如果需要稳定的模型 API,推荐使用跃云中转站。部分 Skill 调用的模型接口也可以走这里。注册或充值时填写优惠码 DC96236305AA3EA0,可获赠免费体验额度。
做知识类、自媒体口播视频时,最费时间的往往不是“想说什么”,而是分镜设计、统一画面风格、逐镜出片,以及最后把素材对齐口播节奏。
这期分享的是一套适合 VOX 风格报纸拼贴视频 的四步工作流:
- 在 Codex 里用
vox-director把口播拆成画面和分镜提示词 - 用 GPT 生图能力生成统一风格的分镜图
- 把分镜图丢进 Google Flow,用 Omni Flash 转成视频片段
- 回到 Codex,用 ChatCut 自动对齐口播、字幕和节奏,剪成成片
这套工作流适合做什么
| 内容类型 | 为什么适合 |
|---|---|
| 知识科普 | 报纸拼贴、信息图、镜头推拉很适合讲概念 |
| 观点口播 | 画面跟着观点切换,信息密度高 |
| 个人成长 / 故事片 | 分镜能把故事拆成清晰段落 |
| 产品介绍短片 | 每拍一张“会动的海报”,节奏干净 |
如果你追求的是:
- 撕纸、胶带、半调网点、报纸剪贴
- 大胆色块 + 大号标题
- 镜头运动清楚、信息图能看懂
那这套流程就很对口。
你需要准备什么
1. 工具清单
| 工具 | 作用 | 获取方式 |
|---|---|---|
| Codex(桌面版) | 跑 Skill、生图、调用 ChatCut 剪辑 | OpenAI / ChatGPT 桌面端中的 Codex |
| vox-director | 拆口播、写分镜、给生图/视频提示词 | GitHub 开源仓库 |
| GPT 生图(Image / GPT Image) | 生成统一风格分镜图 | Codex / ChatGPT 内置生图能力 |
| Google Flow | 图生视频主战场 | labs.google/fx/tools/flow |
| Gemini Omni Flash | 把分镜图变成视频片段 | Google Flow / Gemini 中选择 Omni Flash |
| ChatCut | 在 Codex 里合并、对齐、剪辑成片 | 官方插件页 / 插件仓库 |
2. 账号与权限提醒
- Google Flow + Omni Flash 通常需要对应的 Google AI 订阅档位(以 Google 当前页面为准)。
- ChatCut 需要 ChatCut 账号,并在 Codex 桌面端完成插件安装与登录。
- 若你走官方
vox-director全自动路线,还需要 Atlas Cloud API Key;本文主推的是“半自动四步法”,不一定强依赖 Atlas。
安装:vox-director 和 ChatCut
安装 vox-director(Codex)
开源地址:
https://github.com/Alisa0808/vox-director
在终端执行:
# macOS / Linux
git clone https://github.com/Alisa0808/vox-director.git ~/.codex/skills/vox-director
Windows PowerShell 可用:
git clone https://github.com/Alisa0808/vox-director.git "$env:USERPROFILE\.codex\skills\vox-director"
装好后重启 Codex 或新建任务。确认目录里至少有:
SKILL.md/SKILL.zh.mdAGENTS.mdreferences/scripts/
安装 ChatCut(在 Codex 里用)
官方安装入口:
最省事的方法(推荐):
- 打开 ChatGPT / Codex 桌面端(不要只在网页端装,网页端装不上本地插件)。
- 新建对话,直接发送:
阅读 chatcut.io/chatgpt ,帮我安装 ChatCut 插件并创建一个新任务。
- 按提示完成浏览器登录授权。
- 安装成功后,一定要换到新对话再开始剪辑(安装对话里往往还读不到新插件工具)。
也可以让 Codex 用官方插件市场命令安装(由桌面端自带的 Codex CLI 执行):
# 添加 ChatCut 插件市场
codex plugin marketplace add https://github.com/ChatCut-Inc/agent-plugin.git --ref main
# 查看市场名称
codex plugin marketplace list
# 安装插件(把 <MARKETPLACE> 换成上一步看到的名称)
codex plugin add chatcut@<MARKETPLACE>
# 登录授权
codex mcp login chatcut
安装完成后可以验证:
codex mcp get chatcut --json
ChatCut 装好后,常见用途包括:导入素材、改时间线、加字幕、清理口播、补 B-roll、做 MG、导出视频。
这期会用到的模型
| 环节 | 推荐模型 / 能力 | 你怎么理解它 |
|---|---|---|
| 拆分镜 / 写提示词 | vox-director Skill | 把口播拆成“每一拍画面 + 运镜 + 元素运动” |
| 生分镜图 | GPT Image / GPT 生图 | 让所有镜头共享同一种拼贴风格 |
| 图转视频 | Gemini Omni Flash(在 Google Flow 中使用) | 把静态分镜图“演活” |
| 自动剪辑 | ChatCut(Codex 插件) | 对齐口播、字幕、节奏并合并成片 |
如果你走官方 vox-director 全自动流水线,仓库当前默认组合是:
| 环节 | 默认模型(以仓库说明为准) |
|---|---|
| 拼贴关键帧 | google/nano-banana-2/text-to-image |
| 非真人动效 | google/gemini-omni-flash/image-to-video |
| 真人 / 品牌 | kwaivgi/kling-video-o3-pro/image-to-video |
| 旁白 | xai/tts-v1 |
| 配乐 | minimax/music-2.6 |
四步工作流(跟着做)
第 1 步:用 vox-director 拆分镜
在 Codex 里新建任务,把口播稿或选题丢给它。可以说:
使用 vox-director,帮我把下面这段口播做成 VOX 报纸拼贴风格视频方案。
要求:
1. 先给分镜表(每段旁白、画面描述、标题字、运镜、元素运动)
2. 先不要直接生图、也不要直接生成视频
3. 画幅用 9:16,总时长大约 45–60 秒
4. 风格偏信息图 + 撕纸拼贴,适合抖音/视频号
口播稿:
(把你的口播全文贴在这里)
你要重点检查三件事:
- 第一段是不是钩子(3 秒内能抓住人)
- 每段是不是够短(常见建议:大约 4–6 秒切一次画面)
- 相邻镜头运镜是否重复(不要连续两镜都推近)
确认分镜后,再让 Codex 输出两套提示词:
- 每镜的 生图提示词(拼贴海报)
- 每镜的 图生视频提示词(镜头运动 + 元素运动)
第 2 步:在 Codex 里生成统一风格分镜图
分镜确认后,继续在同一个项目里让 Codex 生图:
分镜已经确认。
请按统一 VOX 拼贴风格,为每一镜生成分镜图。
要求:
1. 所有镜头色板、撕纸质感、字体风格保持一致
2. 标题字尽量烧进画面(尤其是建立镜头)
3. 输出文件命名按镜头编号,例如 shot-01.png、shot-02.png
4. 先生成前 2 张给我看风格,确认后再批量生成剩余镜头
实操建议:
- 先出 1–2 张“风格样片”,再批量,避免整套返工。
- 拼贴基因必须长在图里:撕边、胶带、半调、报纸底、大色块。图弱了,后面 Flow 再怎么动也救不回来。
- 同一条视频里,尽量固定画幅(9:16 或 16:9),不要中途混画幅。
第 3 步:把分镜图丢进 Google Flow,用 Omni Flash 转视频
- 打开 Google Flow
- 选择 Gemini Omni Flash
- 上传第 2 步的分镜图
- 粘贴该镜对应的“图生视频提示词”
- 逐镜生成,下载全部片段
提示词可以长这样:
Animate this paper-collage poster. Keep the collage look intact.
Camera: slow push-in.
Element motion: newspaper clippings shift slightly, chart bars rise, torn paper edges flutter.
No morphing text, keep Chinese titles readable, 2D editorial motion.
下载时建议:
- 文件名和镜头编号对齐:
shot-01.mp4、shot-02.mp4 - 单独建一个项目文件夹:
口播.wav/mp3、分镜图/、视频片段/、字幕.srt
第 4 步:回到 Codex,用 ChatCut 自动剪辑合并
确保 ChatCut 已安装并登录,然后新建对话(不要继续装插件的那个旧对话),把素材路径和目标发给它:
请用 ChatCut 帮我剪这条 VOX 风格视频。
素材:
- 口播音频:/path/to/voice.wav
- 视频片段目录:/path/to/clips/ (shot-01.mp4 到 shot-12.mp4)
- 口播文稿 / 字幕:/path/to/script.txt
剪辑要求:
1. 按口播节奏对齐每个片段
2. 自动加中文字幕,风格干净可读
3. 片段之间用轻快切,不要花哨转场
4. 保留信息图文字可读性
5. 先给我剪辑方案和时间线说明,确认后再导出成片
ChatCut 适合补这些事:
- 口播停顿清理
- 字幕
- 片段顺序与时长对齐
- 背景音乐音量压低(ducking)
- 简单包装和导出
如果它打开了可编辑时间线,你也可以随时进 ChatCut 界面手调:字幕位置、某一镜多留 0.5 秒、BGM 音量等。
一条可直接复制的“总提示词”
你也可以把四步压缩成一次下达(仍然建议在关键节点人工确认):
我要用 Codex 做一条 VOX 报纸拼贴风格短视频。
流程固定为 4 步:
1) 用 vox-director 根据口播生成分镜表 + 生图提示词 + 图生视频提示词
2) 用 GPT 生图生成统一风格分镜图
3) 我会把图拿到 Google Flow,用 Omni Flash 逐镜转视频
4) 视频片段下载后,你用 ChatCut 按口播对齐字幕和节奏,导出成片
请从第 1 步开始,先只输出分镜方案给我确认,不要直接生图。
口播稿:
(粘贴全文)
常见问题与避坑
1. 为什么画面像“会动的 PPT”,不像 VOX?
多半是生图阶段拼贴不够。回去加强:撕纸边、胶带、半调、报纸剪报、大标题字,而不是只写“信息图风格”。
2. 为什么 Omni Flash 出片后字糊了?
图生视频时提示词要明确“标题文字保持清晰、不变形、不融化”。建立镜头尽量少剧烈旋转。
3. ChatCut 装了却调不动?
确认三点:是否在桌面端安装、是否 mcp login chatcut 成功、是否已经新建对话再剪辑。
4. 必须用 Atlas Cloud 吗?
不一定。官方 skill 全自动路径依赖 Atlas Cloud;本文这套“Codex 拆分镜 + GPT 生图 + Google Flow + ChatCut”更适合日常手动可控出片。
5. 口播很长怎么办?
先把口播压到 45–90 秒版本再拆分镜。镜头太多会拖垮统一风格和后期对齐。
最小可行练习(30 分钟)
- 写一段 20–30 秒口播(只讲 1 个观点)。
- 让 vox-director 拆成 4–6 个镜头。
- 生 4–6 张统一风格分镜图。
- 在 Flow 里用 Omni Flash 各转 1 段视频。
- 用 ChatCut 合并 + 加字幕导出。
跑通一次后,再做 60 秒完整内容会轻松很多。