← 跨境老登火箭叔Alex 首页跨境出海 · AI 工具链

用嘴剪视频:我和AI聊了10分钟,剪出4条口播视频github video use用聊天剪视频

2026-07-09
图片

本文记录了我用开源工具 video-use + Claude Code,全程靠聊天完成视频剪辑的真实过程。所有对话原文保留,没有演绎。看完你会发现——用自然语言编程,已经到来了。


一、video-use 极简4步部署教程

以下操作全部由 AI 自动完成,我只需确认和执行。

步骤 ① 克隆仓库

git clone https://github.com/browser-use/video-use ~/Developer/video-use cd ~/Developer/video-use

步骤 ② 安装 ffmpeg 和 Python 依赖

pip install -e .

根据操作系统选择 ffmpeg 安装方式:

# Windows winget install "FFmpeg (Essentials Build)"  # macOS brew install ffmpeg  # Ubuntu / Debian sudo apt-get install -y ffmpeg

步骤 ③ 注册技能到 Claude Code

mkdir -p ~/.claude/skills ln -sfn ~/Developer/video-use ~/.claude/skills/video-use

步骤 ④ 配置 API 密钥(用于语音转写)

去 elevenlabs.io/app/developers/api-keys 创建密钥,粘贴给 AI:

cp .env.example .env # 编辑 .env 填入 ELEVENLABS_API_KEY

【此处插入 ElevenLabs API 密钥创建页面截图】

图片

如果密钥权限不足,AI 会主动给出替代方案——使用本地 Whisper 模型转写,调用 GPU 加速,免费且无需联网。


二、16轮对话流水账:从素材到成片

以下是完整对话记录,每一轮用表格区分:左栏为轮次,右栏上方为用户发言(浅蓝),下方为 AI 执行摘要(浅灰)。

第 1 轮
👤 我:
"2026-07-04 164000.mov 这个文件你可以帮我剪辑吗"
🤖 AI 用 ffprobe 扫描素材:iPhone 17 Pro 拍摄,1920×1080 竖屏(旋转 -90°),时长 11 分 47 秒,2.0GB,拍摄地点深圳。询问视频内容和用途。
第 2 轮
👤 我:
"口播,太长了,剪成 3 到 4 个视频,每个 3 分钟以内,发抖音"
🤖 AI 启动 Whisper 转写(RTX 3060 GPU,约 4 分钟),输出 2626 个词级时间戳。打包生成可读文稿,分析内容结构,提出 V1-V4 分集方案。
第 3 轮
👤 我:
确认方案后 → "开始剪"
🤖 渲染 V1 预览,发现输出为 3414×1920 横屏拉伸,非预期竖屏。AI 自动诊断问题。
第 4-6 轮
👤 我:
(AI 自动排查修复,无需人工干预)
🤖 诊断根因:① is_portrait_source() 未检测旋转元数据 ② ffprobe CSV 尾随逗号导致解析失败。修复 get_rotation() 和 is_portrait_source() 函数。V1 重渲染成功,720×1280 竖屏正确。
第 7-10 轮
👤 我:
(等待渲染完成)
🤖 V1-V4 全部草稿渲染完成。V4 原时长 3:08 略超限制,AI 自动微调剪辑点至 2:52。全部竖屏 720×1280、内嵌字幕、3 分钟以内。
第 11 轮
👤 我:
"字体太大了啊,三个字一屏,字幕"
🤖 理解问题:Whisper 对中文按字分词,每行 2 词 = 2-3 个字。修改字幕分词组从 2 到 10,字号 18→13,去掉中文全大写。重新渲染全部 4 条视频。
第 12 轮
👤 我:
"字幕字体和样式要怎么选?"
🤖 从视频提取一帧画面,生成 HTML 预览页面(手机模拟框 + 4 种字幕样式可切换 + 滑块调节每行字数)。在浏览器实时预览效果。
第 13 轮
👤 我:
"你做个 video-use 的说明书,html 版"
🤖 生成完整 video-use 使用说明书 HTML,包含项目介绍、核心功能、工作流程、12 条硬规则、目录结构、常用命令、技术原理。
第 14-16 轮
👤 我:
"我要写一篇公众号,重点是我的实操环节,做成公众号后台 html 版"
🤖 生成第一版公众号文章 HTML。你说排版需严格适配公众号后台,AI 重新输出这份严格按公众号规范排版的文章——就是你现在看到的内容。

三、一个很实际的问题:对话框里剪视频,没有预览

剪到这里,我必须说一个很真实的体验——在 Claude Code 里剪视频,全程都是对话框。你跟 AI 说"帮我剪一下",它就去渲染了,然后告诉你"渲染完成"。但你看不到画面,看不到字幕到底长什么样。

跟手机上直接操作、或者剪映电脑版里实时拖拽看到效果,完全是两码事。手机剪辑你点一下字幕就改了,立马看到;剪映里拖一下时间线就知道剪得顺不顺。但在 AI 对话框里,你得"脑补"——AI 说"字幕已添加",你只能想象它长什么样。

所以当我说"字体太大了"的时候,AI 虽然立刻改了代码重新渲染,但我还是需要再渲染一次才能看到效果。如果还要调,就得再渲染一次……循环往复,非常低效。

这时候 AI 做了一个很有灵性的操作:

它没有继续"渲染→我看→再渲染→再看"的循环,而是从视频里提取了一帧画面,生成了一份 HTML 字幕预览页面。这个页面长这样:

【此处插入字幕预览页截图:手机模拟框 + 4种字幕样式切换按钮 + 滑块】

图片
  • 📱 一个手机模拟框,背景是视频截图
  • 🔤 4 种字幕样式可以点击切换(粗体大号 / 半透明底 / 紧凑小字 / 当前样式)
  • 🎚️ 一个滑块,拖动就能调整每行显示的字数
  • 🔄 字幕内容自动轮播,模拟视频播放效果

我在浏览器里打开这个 HTML 文件,点了几下,拖了拖滑块,10 秒钟就知道什么样式适合我的视频了。不需要反复渲染、下载、查看、反馈、再渲染。

这件事给我的启发是:AI 会变通。 它没有死板地守着"你说问题→我改代码→渲染→你看→再说"这个循环,而是换了一个更高效的方式——既然你看不到效果,那我就做一个你能看到效果的页面。这其实就是人类协作中的"换位思考"。


四、AI 自动修 BUG:值得单独拿出来说

第一次渲染 V1 时输出 3414×1920(横屏拉伸),AI 的诊断和修复过程完全自主完成:

  1. 根因 1:is_portrait_source() 未读取旋转元数据(iPhone 视频 1920×1080 带 -90° 旋转)。
  2. 根因 2:ffprobe CSV 尾随逗号导致解析失败,始终返回 False。
  3. 修复:重写 get_rotation() 解析 Display Matrix 元数据 + 修正 CSV 解析逻辑。

整个诊断→修复→重渲染,AI 自主完成,零人工干预。


五、最终成果

  • 视频 1:
    🎯 做账号是为了信任 —— 2 分 35 秒
  • 视频 2:
    🤖 AI 自动化 + GPT 写代码实操 —— 2 分 44 秒
  • 视频 3:
    🔍 交叉验证 + 活人感 —— 2 分 33 秒
  • 视频 4:
    💡 AI 数字员工降本增效 —— 2 分 52 秒

全部竖屏 9:16(抖音适配),含内嵌中文字幕,neutral_punch 调色,30ms 音频淡入淡出防爆音。当前草稿质量 720p,确认样式后渲染 1080p 最终版。


六、这就是"用嘴编程"

回顾整个过程,我说过的每一句"指令":

"这个文件你可以帮我剪辑吗" "口播,剪成 3 到 4 个视频,发抖音" "开始剪" "字体太大了" "你做个说明书" "写成公众号文章"

没有打开剪映,没有拖拽时间线,没有搜索字体下载。所有剪辑决策——内容分析、分集方案、剪辑点选择、调色、字幕样式——都是 AI 理解意图后自动执行。遇到 BUG 自己修,结果不对自己调。

这,就是低代码 / 自然语言编程的终极形态。

你不需要学会写代码,不需要记住命令参数。你只需要知道你想要什么,然后用自然语言说出来。


本文基于 video-use 开源项目 + Claude Code 生成
https://github.com/browser-use/video-use
技术栈:Python 3.10+ · ffmpeg 8.1 · Whisper medium · CUDA · Claude Code

图片

更多文章