用嘴剪视频:我和AI聊了10分钟,剪出4条口播视频github video use用聊天剪视频
本文记录了我用开源工具 video-use + Claude Code,全程靠聊天完成视频剪辑的真实过程。所有对话原文保留,没有演绎。看完你会发现——用自然语言编程,已经到来了。
一、video-use 极简4步部署教程
以下操作全部由 AI 自动完成,我只需确认和执行。
步骤 ① 克隆仓库
git clone https://github.com/browser-use/video-use ~/Developer/video-use cd ~/Developer/video-use步骤 ② 安装 ffmpeg 和 Python 依赖
pip install -e .根据操作系统选择 ffmpeg 安装方式:
# Windows winget install "FFmpeg (Essentials Build)" # macOS brew install ffmpeg # Ubuntu / Debian sudo apt-get install -y ffmpeg步骤 ③ 注册技能到 Claude Code
mkdir -p ~/.claude/skills ln -sfn ~/Developer/video-use ~/.claude/skills/video-use步骤 ④ 配置 API 密钥(用于语音转写)
去 elevenlabs.io/app/developers/api-keys 创建密钥,粘贴给 AI:
cp .env.example .env # 编辑 .env 填入 ELEVENLABS_API_KEY【此处插入 ElevenLabs API 密钥创建页面截图】
如果密钥权限不足,AI 会主动给出替代方案——使用本地 Whisper 模型转写,调用 GPU 加速,免费且无需联网。
二、16轮对话流水账:从素材到成片
以下是完整对话记录,每一轮用表格区分:左栏为轮次,右栏上方为用户发言(浅蓝),下方为 AI 执行摘要(浅灰)。
|
|
|
|
|
|
|
|
|
三、一个很实际的问题:对话框里剪视频,没有预览
剪到这里,我必须说一个很真实的体验——在 Claude Code 里剪视频,全程都是对话框。你跟 AI 说"帮我剪一下",它就去渲染了,然后告诉你"渲染完成"。但你看不到画面,看不到字幕到底长什么样。
跟手机上直接操作、或者剪映电脑版里实时拖拽看到效果,完全是两码事。手机剪辑你点一下字幕就改了,立马看到;剪映里拖一下时间线就知道剪得顺不顺。但在 AI 对话框里,你得"脑补"——AI 说"字幕已添加",你只能想象它长什么样。
所以当我说"字体太大了"的时候,AI 虽然立刻改了代码重新渲染,但我还是需要再渲染一次才能看到效果。如果还要调,就得再渲染一次……循环往复,非常低效。
这时候 AI 做了一个很有灵性的操作:
它没有继续"渲染→我看→再渲染→再看"的循环,而是从视频里提取了一帧画面,生成了一份 HTML 字幕预览页面。这个页面长这样:
【此处插入字幕预览页截图:手机模拟框 + 4种字幕样式切换按钮 + 滑块】
📱 一个手机模拟框,背景是视频截图 🔤 4 种字幕样式可以点击切换(粗体大号 / 半透明底 / 紧凑小字 / 当前样式) 🎚️ 一个滑块,拖动就能调整每行显示的字数 🔄 字幕内容自动轮播,模拟视频播放效果
我在浏览器里打开这个 HTML 文件,点了几下,拖了拖滑块,10 秒钟就知道什么样式适合我的视频了。不需要反复渲染、下载、查看、反馈、再渲染。
这件事给我的启发是:AI 会变通。 它没有死板地守着"你说问题→我改代码→渲染→你看→再说"这个循环,而是换了一个更高效的方式——既然你看不到效果,那我就做一个你能看到效果的页面。这其实就是人类协作中的"换位思考"。
四、AI 自动修 BUG:值得单独拿出来说
第一次渲染 V1 时输出 3414×1920(横屏拉伸),AI 的诊断和修复过程完全自主完成:
- 根因 1:is_portrait_source() 未读取旋转元数据(iPhone 视频 1920×1080 带 -90° 旋转)。
- 根因 2:ffprobe CSV 尾随逗号导致解析失败,始终返回 False。
- 修复:重写 get_rotation() 解析 Display Matrix 元数据 + 修正 CSV 解析逻辑。
整个诊断→修复→重渲染,AI 自主完成,零人工干预。
五、最终成果
- 视频 1:
🎯 做账号是为了信任 —— 2 分 35 秒 - 视频 2:
🤖 AI 自动化 + GPT 写代码实操 —— 2 分 44 秒 - 视频 3:
🔍 交叉验证 + 活人感 —— 2 分 33 秒 - 视频 4:
💡 AI 数字员工降本增效 —— 2 分 52 秒
全部竖屏 9:16(抖音适配),含内嵌中文字幕,neutral_punch 调色,30ms 音频淡入淡出防爆音。当前草稿质量 720p,确认样式后渲染 1080p 最终版。
六、这就是"用嘴编程"
回顾整个过程,我说过的每一句"指令":
"这个文件你可以帮我剪辑吗" "口播,剪成 3 到 4 个视频,发抖音" "开始剪" "字体太大了" "你做个说明书" "写成公众号文章"没有打开剪映,没有拖拽时间线,没有搜索字体下载。所有剪辑决策——内容分析、分集方案、剪辑点选择、调色、字幕样式——都是 AI 理解意图后自动执行。遇到 BUG 自己修,结果不对自己调。
这,就是低代码 / 自然语言编程的终极形态。
你不需要学会写代码,不需要记住命令参数。你只需要知道你想要什么,然后用自然语言说出来。
本文基于 video-use 开源项目 + Claude Code 生成
https://github.com/browser-use/video-use
技术栈:Python 3.10+ · ffmpeg 8.1 · Whisper medium · CUDA · Claude Code