学习交流 学 AI 视频和自动化工作流

想一起学 AI 视频、自动化工作流和实用工具,可以扫码加微信,我会把你拉进学习交流群。群里会不定期分享免费工具、安装包和实操案例。

加入 AI 学习交流群的企业微信二维码
扫码加微信进群
API 中转 推荐中转站:跃云 yue-yun.com

做 Codex、Claude Code 或各类 Skill 时,如果需要稳定的模型 API,推荐使用跃云中转站。部分 Skill 调用的模型接口也可以走这里。注册或充值时填写优惠码 DC96236305AA3EA0,可获赠免费体验额度。

访问 yue-yun.com

做知识类、自媒体口播视频时,最费时间的往往不是“想说什么”,而是分镜设计、统一画面风格、逐镜出片,以及最后把素材对齐口播节奏。

这期分享的是一套适合 VOX 风格报纸拼贴视频 的四步工作流:

  1. 在 Codex 里用 vox-director 把口播拆成画面和分镜提示词
  2. 用 GPT 生图能力生成统一风格的分镜图
  3. 把分镜图丢进 Google Flow,用 Omni Flash 转成视频片段
  4. 回到 Codex,用 ChatCut 自动对齐口播、字幕和节奏,剪成成片

这套工作流适合做什么

内容类型 为什么适合
知识科普 报纸拼贴、信息图、镜头推拉很适合讲概念
观点口播 画面跟着观点切换,信息密度高
个人成长 / 故事片 分镜能把故事拆成清晰段落
产品介绍短片 每拍一张“会动的海报”,节奏干净

如果你追求的是:

  • 撕纸、胶带、半调网点、报纸剪贴
  • 大胆色块 + 大号标题
  • 镜头运动清楚、信息图能看懂

那这套流程就很对口。

你需要准备什么

1. 工具清单

工具 作用 获取方式
Codex(桌面版) 跑 Skill、生图、调用 ChatCut 剪辑 OpenAI / ChatGPT 桌面端中的 Codex
vox-director 拆口播、写分镜、给生图/视频提示词 GitHub 开源仓库
GPT 生图(Image / GPT Image) 生成统一风格分镜图 Codex / ChatGPT 内置生图能力
Google Flow 图生视频主战场 labs.google/fx/tools/flow
Gemini Omni Flash 把分镜图变成视频片段 Google Flow / Gemini 中选择 Omni Flash
ChatCut 在 Codex 里合并、对齐、剪辑成片 官方插件页 / 插件仓库

2. 账号与权限提醒

  • Google Flow + Omni Flash 通常需要对应的 Google AI 订阅档位(以 Google 当前页面为准)。
  • ChatCut 需要 ChatCut 账号,并在 Codex 桌面端完成插件安装与登录。
  • 若你走官方 vox-director 全自动路线,还需要 Atlas Cloud API Key;本文主推的是“半自动四步法”,不一定强依赖 Atlas。

安装:vox-director 和 ChatCut

安装 vox-director(Codex)

开源地址:

https://github.com/Alisa0808/vox-director

在终端执行:

# macOS / Linux
git clone https://github.com/Alisa0808/vox-director.git ~/.codex/skills/vox-director

Windows PowerShell 可用:

git clone https://github.com/Alisa0808/vox-director.git "$env:USERPROFILE\.codex\skills\vox-director"

装好后重启 Codex 或新建任务。确认目录里至少有:

  • SKILL.md / SKILL.zh.md
  • AGENTS.md
  • references/
  • scripts/

安装 ChatCut(在 Codex 里用)

官方安装入口:

最省事的方法(推荐):

  1. 打开 ChatGPT / Codex 桌面端(不要只在网页端装,网页端装不上本地插件)。
  2. 新建对话,直接发送:
阅读 chatcut.io/chatgpt ,帮我安装 ChatCut 插件并创建一个新任务。
  1. 按提示完成浏览器登录授权。
  2. 安装成功后,一定要换到新对话再开始剪辑(安装对话里往往还读不到新插件工具)。

也可以让 Codex 用官方插件市场命令安装(由桌面端自带的 Codex CLI 执行):

# 添加 ChatCut 插件市场
codex plugin marketplace add https://github.com/ChatCut-Inc/agent-plugin.git --ref main

# 查看市场名称
codex plugin marketplace list

# 安装插件(把 <MARKETPLACE> 换成上一步看到的名称)
codex plugin add chatcut@<MARKETPLACE>

# 登录授权
codex mcp login chatcut

安装完成后可以验证:

codex mcp get chatcut --json

ChatCut 装好后,常见用途包括:导入素材、改时间线、加字幕、清理口播、补 B-roll、做 MG、导出视频。

这期会用到的模型

环节 推荐模型 / 能力 你怎么理解它
拆分镜 / 写提示词 vox-director Skill 把口播拆成“每一拍画面 + 运镜 + 元素运动”
生分镜图 GPT Image / GPT 生图 让所有镜头共享同一种拼贴风格
图转视频 Gemini Omni Flash(在 Google Flow 中使用) 把静态分镜图“演活”
自动剪辑 ChatCut(Codex 插件) 对齐口播、字幕、节奏并合并成片

如果你走官方 vox-director 全自动流水线,仓库当前默认组合是:

环节 默认模型(以仓库说明为准)
拼贴关键帧 google/nano-banana-2/text-to-image
非真人动效 google/gemini-omni-flash/image-to-video
真人 / 品牌 kwaivgi/kling-video-o3-pro/image-to-video
旁白 xai/tts-v1
配乐 minimax/music-2.6

四步工作流(跟着做)

第 1 步:用 vox-director 拆分镜

在 Codex 里新建任务,把口播稿或选题丢给它。可以说:

使用 vox-director,帮我把下面这段口播做成 VOX 报纸拼贴风格视频方案。
要求:
1. 先给分镜表(每段旁白、画面描述、标题字、运镜、元素运动)
2. 先不要直接生图、也不要直接生成视频
3. 画幅用 9:16,总时长大约 45–60 秒
4. 风格偏信息图 + 撕纸拼贴,适合抖音/视频号

口播稿:
(把你的口播全文贴在这里)

你要重点检查三件事:

  1. 第一段是不是钩子(3 秒内能抓住人)
  2. 每段是不是够短(常见建议:大约 4–6 秒切一次画面)
  3. 相邻镜头运镜是否重复(不要连续两镜都推近)

确认分镜后,再让 Codex 输出两套提示词:

  • 每镜的 生图提示词(拼贴海报)
  • 每镜的 图生视频提示词(镜头运动 + 元素运动)

第 2 步:在 Codex 里生成统一风格分镜图

分镜确认后,继续在同一个项目里让 Codex 生图:

分镜已经确认。
请按统一 VOX 拼贴风格,为每一镜生成分镜图。
要求:
1. 所有镜头色板、撕纸质感、字体风格保持一致
2. 标题字尽量烧进画面(尤其是建立镜头)
3. 输出文件命名按镜头编号,例如 shot-01.png、shot-02.png
4. 先生成前 2 张给我看风格,确认后再批量生成剩余镜头

实操建议:

  • 先出 1–2 张“风格样片”,再批量,避免整套返工。
  • 拼贴基因必须长在图里:撕边、胶带、半调、报纸底、大色块。图弱了,后面 Flow 再怎么动也救不回来。
  • 同一条视频里,尽量固定画幅(9:16 或 16:9),不要中途混画幅。

第 3 步:把分镜图丢进 Google Flow,用 Omni Flash 转视频

  1. 打开 Google Flow
  2. 选择 Gemini Omni Flash
  3. 上传第 2 步的分镜图
  4. 粘贴该镜对应的“图生视频提示词”
  5. 逐镜生成,下载全部片段

提示词可以长这样:

Animate this paper-collage poster. Keep the collage look intact.
Camera: slow push-in.
Element motion: newspaper clippings shift slightly, chart bars rise, torn paper edges flutter.
No morphing text, keep Chinese titles readable, 2D editorial motion.

下载时建议:

  • 文件名和镜头编号对齐:shot-01.mp4、shot-02.mp4
  • 单独建一个项目文件夹:口播.wav/mp3、分镜图/、视频片段/、字幕.srt

第 4 步:回到 Codex,用 ChatCut 自动剪辑合并

确保 ChatCut 已安装并登录,然后新建对话(不要继续装插件的那个旧对话),把素材路径和目标发给它:

请用 ChatCut 帮我剪这条 VOX 风格视频。

素材:
- 口播音频:/path/to/voice.wav
- 视频片段目录:/path/to/clips/  (shot-01.mp4 到 shot-12.mp4)
- 口播文稿 / 字幕:/path/to/script.txt

剪辑要求:
1. 按口播节奏对齐每个片段
2. 自动加中文字幕,风格干净可读
3. 片段之间用轻快切,不要花哨转场
4. 保留信息图文字可读性
5. 先给我剪辑方案和时间线说明,确认后再导出成片

ChatCut 适合补这些事:

  • 口播停顿清理
  • 字幕
  • 片段顺序与时长对齐
  • 背景音乐音量压低(ducking)
  • 简单包装和导出

如果它打开了可编辑时间线,你也可以随时进 ChatCut 界面手调:字幕位置、某一镜多留 0.5 秒、BGM 音量等。

一条可直接复制的“总提示词”

你也可以把四步压缩成一次下达(仍然建议在关键节点人工确认):

我要用 Codex 做一条 VOX 报纸拼贴风格短视频。
流程固定为 4 步:

1) 用 vox-director 根据口播生成分镜表 + 生图提示词 + 图生视频提示词
2) 用 GPT 生图生成统一风格分镜图
3) 我会把图拿到 Google Flow,用 Omni Flash 逐镜转视频
4) 视频片段下载后,你用 ChatCut 按口播对齐字幕和节奏,导出成片

请从第 1 步开始,先只输出分镜方案给我确认,不要直接生图。

口播稿:
(粘贴全文)

常见问题与避坑

1. 为什么画面像“会动的 PPT”,不像 VOX?
多半是生图阶段拼贴不够。回去加强:撕纸边、胶带、半调、报纸剪报、大标题字,而不是只写“信息图风格”。

2. 为什么 Omni Flash 出片后字糊了?
图生视频时提示词要明确“标题文字保持清晰、不变形、不融化”。建立镜头尽量少剧烈旋转。

3. ChatCut 装了却调不动?
确认三点:是否在桌面端安装、是否 mcp login chatcut 成功、是否已经新建对话再剪辑。

4. 必须用 Atlas Cloud 吗?
不一定。官方 skill 全自动路径依赖 Atlas Cloud;本文这套“Codex 拆分镜 + GPT 生图 + Google Flow + ChatCut”更适合日常手动可控出片。

5. 口播很长怎么办?
先把口播压到 45–90 秒版本再拆分镜。镜头太多会拖垮统一风格和后期对齐。

最小可行练习(30 分钟)

  1. 写一段 20–30 秒口播(只讲 1 个观点)。
  2. 让 vox-director 拆成 4–6 个镜头。
  3. 生 4–6 张统一风格分镜图。
  4. 在 Flow 里用 Omni Flash 各转 1 段视频。
  5. 用 ChatCut 合并 + 加字幕导出。

跑通一次后,再做 60 秒完整内容会轻松很多。

资料来源