编程 video-use:让 Agent 读转录文本做视频剪辑的开源技能

2026-09-03 00:04:48

video-use:让 Agent 读转录文本做视频剪辑的开源技能

video-use(github.com/browser-use/video-use)是 browser-use 开源的一个视频编辑技能,给 Claude Code 这类能执行 Shell 命令的 Agent 用。把原始素材放进文件夹,对 Agent 说一句剪辑需求,它会在目录里产出 final.mp4。核心做法不是让 LLM 逐帧看视频,而是先把素材折算成 LLM 能读的紧凑转录文本,在少数需要确认画面的决策点再补视觉参考;剪辑按词粒度对齐时间戳,不需要预设模板。覆盖去口头禅、自动调色、音频处理、动画叠加几个方向,面向访谈、教程、Vlog 等以人声推进的内容。

双层感知与处理管线

项目把“理解视频”拆成两层,避免海量视频帧直接把上下文打爆:

  • Layer 1:转录文本为主。 用 ElevenLabs Scribe 生成带时间戳、带说话人分离的紧凑转录,约 12KB,作为 LLM 的主要决策依据。删句、切段、选片段基本都在这层完成。
  • Layer 2:按需视觉合成。 只在歧义停顿、切点检查这类需要确认画面连续性的时刻,生成包含胶片条、波形和词标签的合成图 timeline_view 供 LLM 参考;平时不喂帧。

处理管线固定为:

Transcribe -> Pack -> LLM Reasons -> EDL -> Render -> Self-Eval

(EDL:Edit Decision List,剪辑决策列表。)每次剪切边界都会跑自检,重点查视觉跳变、音频爆音、字幕遮挡,发现问题自动修复并重渲染,最多重试 3 次。

核心特性

文本优先感知。 LLM 不直接看视频帧,而是读约 12KB 的转录文本做语义理解和剪辑决策,绕开帧画面带来的 Token 噪声和上下文溢出,推理延迟和 API 调用成本都可控。

按需视觉合成。 只在歧义暂停、复杂切点、需要确认视觉连贯性的时刻动态生成 timeline_view 图像。混合模态策略,精度和成本之间取一个折中。

渲染自评估循环。 成片交付前自动检查每个剪切边界的视觉跳跃、音频爆音、字幕遮挡,发现问题触发修复,最多 3 次重试。

并行子代理动画。 动画覆盖层可用 HyperFrames、Remotion、Manim 或 PIL 生成,每个动画任务由独立子代理并行处理,不是串行渲染。

会话记忆持久化。 编辑状态、决策历史、项目配置写到 project.md,跨会话不丢上下文,中断后能接着改。

使用场景

口播视频精剪。 自动识别并切掉 umm、uh 等填充词和片段的静音死区,保留流畅表达。适合知识分享、产品演示这类对语言节奏敏感的内容,省掉逐帧清理。

多源素材混剪。 访谈、旅行、教程这类零散素材,Agent 先自动盘点分析,给出结构化剪辑策略让用户确认,再出成片。适合从杂乱素材里拉叙事线的场景。

自动化后期批处理。 把自定义 FFmpeg 调色链、30ms 音频淡入淡出、风格化字幕烧录固化成自然语言指令复用,系列内容风格一致。

远程无人值守剪辑。 配合 Browser Use Box 放到 VPS 或 Telegram 上,7×24 跑:上传素材、发指令,云端完成从转录到渲染全流程,不吃本地硬件和时间。

文本优先的取舍

这套设计的成立前提是:剪辑决策主要由“说了什么、停顿多久”决定。转录文本把一小时口播压成约 12KB 的文本,省 token、省延迟,还给了 EDL 一个稳定的对齐单位——词。代价是模型对画面只有“抽样视力”:除了少数采样点的胶片条和波形,构图、运动、画面主体变化基本不可见。所以它适合口播、访谈、录屏讲解,这类任务的修口癖、去静音、按话题分段都能从转录推导;不适合音乐卡点快剪、体育集锦、靠画面构图和运动做节奏的片子——那里决策依据在帧里,不在词里。

另外,转录错误会直接进 EDL。Scribe 转错的词会被当成“原文”切进成片,而 3 次自检只查画面和音频的物理瑕疵,不查语义对错。正式交付前值得人工过一遍转录稿。

安装步骤

克隆仓库并注册为 Claude Code 技能:

git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use

安装 Python 依赖:

cd ~/Developer/video-use
uv sync

安装 ffmpeg(macOS 用 brew,其他平台用对应包管理器):

brew install ffmpeg

配置环境变量:

cp .env.example .env

转录走 ElevenLabs,.env 里至少要把 ElevenLabs 的 API key 配好。

使用示例

初始化项目并把技能注册到当前 Agent:

Set up https://github.com/browser-use/video-use for me. Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.

整段粘贴给 Claude Code 或其他支持 Shell 的 Agent 执行。

后续剪辑会话进入素材目录:

cd /path/to/your/videos
claude

然后直接输入自然语言需求,例如 edit these into a launch video

使用环境

  • 核心依赖:ffmpeg
  • API 密钥:ElevenLabs(Scribe 转录,key 自己备)
  • 编程语言:Python(uv 或 pip)
  • 运行方式:能访问终端的 Agent,如 Claude Code、Codex、Hermes、Openclaw
  • 无人值守场景:需要额外准备 Browser Use Box 及 VPS/Telegram 运行环境

相关资源

  • GitHub 仓库:https://github.com/browser-use/video-use
  • 官方云服务:https://cloud.browser-use.com/v4
  • 功能演示:https://tiktok.com/@browser_use/video/7639824093721758989
复制全文 生成海报 video-use AI视频剪辑 Claude Code LLM ffmpeg

推荐文章

程序员茄子在线接单