编程 claude-video:让Claude能看视频的工具,自动下载抽帧转录+时间戳定位,4200 Star

2026-09-05 19:03:23

claude-video:让Claude能看视频的工具,自动下载抽帧转录+时间戳定位,4200 Star

以前想让Claude看视频基本只能靠猜:要么从标题推断,要么拉个字幕文本丢给它,但字幕经常少了90%的屏幕内容。即使把视频链接给Claude,它也会说"我不能看视频"。

claude-video 就是来解决这个问题的,已经有4200多个Star。说白了,它就是让Claude能看视频的工具——给一个B站链接或者本地视频文件,它会自动下载、提取帧、转录字幕,并把所有内容交给Claude,让Claude像人一样看完视频后再回答你的问题。

从技术上讲,Claude并没有获得"视频理解能力",只是把视频分成了它可以理解的图像和文字。

实际使用

拿到一个5分钟的B站视频,以前要从头看到尾或跳跃式看,容易遗漏重要信息。现在只需说一句:

/watch https://www.bilibili.com/video/BV15G756VEYY/ 总结一下

1. 下载视频:先用yt-dlp查看是否有原生字幕,有就直接提取,不用把整个视频下载下来。大多数公开视频都配有字幕,这一环节基本免费且很快。

2. 自动提取帧:ffmpeg根据视频时长自动控制帧数,一个5分钟的视频大约抓取30帧左右,涵盖从头到尾的重要画面。这些帧本质上是512像素宽的JPEG图片,Claude可以直接"看懂"。

3. 音频转文字:字幕和帧都带有时间戳,比如"t=1:42"表示第42秒的画面及相应台词。Claude不仅能看到画面、能听见声音,还能像人一样把视频看完。

4. 提问回答:问"30秒讲的是什么",它会看第30秒的帧和字幕直接回答,不需要你打开视频去找。

核心技术

1. 多平台视频抓取:支持大多数主要视频平台——油管、TikTok、X、Instagram和本地文件。底层用yt-dlp,可识别几百个视频源。

2. 自适应帧提取:这是项目的核心创新点,根据视频时长动态采样帧数:30秒以内密集抽取约30帧,1-3分钟抽取约60帧,3-10分钟抽取约80帧,超过10分钟控制在约100帧以内。不会因为视频太长把context window撑爆。

3. 双重转录方式:优先使用视频原字幕,免费、快速、相对准确;如果没有字幕就用Whisper API。大多数公开视频都配有字幕,用户不用花费API费用。

4. 智能去重:很多视频有重复帧——屏幕录制中静止的画面、演示文稿里一张幻灯片停留几十秒。工具自动检测并删除非常相似的帧,防止浪费token。

5. 时间段精准定位:如果只对视频某一部分感兴趣,可以用--start--end参数指定时间段,工具在该范围内密集提取帧而不是对整个视频稀疏采样,转录时也只提取对应时间范围的内容,节省token。非常适合分析Bug录屏、病毒视频开头、竞品广告创意等重要片段。

安装方式

Claude Code用户:

/plugin marketplace add bradautomates/claude-video
/plugin install watch@claude-video

直接把这两行命令放到Claude Code里,插件就装好了。

其他平台用户:

npx skills add bradautomates/claude-video -g

支持Codex、Cursor、Copilot、Gemini CLI等50多个平台。首次运行自动检查依赖,macOS自动安装brew install ffmpeg yt-dlp,Linux和Windows会打印具体安装命令需手动执行。

当前局限

  • 不支持私有视频,不能处理需要登录的视频或付费内容,只能处理公开URL和本地文件
  • 超过10分钟的完整视频帧率会变得稀疏,查看重要片段建议用--start--end指定时间段
  • 依赖ffmpeg和yt-dlp,虽然会自动安装但可能失败需要手动处理
  • 字幕质量和原始视频有关,如果自动生成字幕质量不好,Claude的理解会受影响;Whisper质量一般比原始字幕好,但需要花费API费用

这个工具的价值不在技术有多高深,而是让Claude的能力边界从文本和图片扩展到了视频。本质上是图片和文本的结合,但对用户来说体验就是"Claude可以看视频了"。

项目基于 MIT 协议开放。

开源地址:https://github.com/bradautomates/claude-video

推荐文章

程序员茄子在线接单