claude-video是什么:让Claude看懂任何视频的终极神器
【免费下载链接】claude-videoGive Claude the ability to watch any video. /watch downloads, extracts frames, transcribes, hands it all to Claude.项目地址: https://gitcode.com/GitHub_Trending/cl/claude-video
claude-video 是一个给 Claude 装上"眼睛和耳朵"的开源视频理解插件——一条/watch命令,就能让 Claude 自动下载视频、逐帧抽画面、提取字幕或语音转写,然后像一个真正看过视频的人一样回答你的问题。无论你是想总结 YouTube 长视频、拆解爆款内容的开头钩子,还是从一段屏幕录屏里定位 Bug,这个免费的 Claude 视频插件都能帮你省下亲眼看一遍的时间。
为什么需要 claude-video?
平时让 Claude 读网页、跑脚本、浏览代码仓库都没问题,但视频一直是它的短板:你丢一个 YouTube 链接过去,它只能靠标题瞎猜,或者抓一份残缺的转写文本。
claude-video 补齐了这块缺口。安装后,粘贴 URL 或本地视频路径 + 一个问题,Claude 就会:
- 用 yt-dlp 下载视频(支持 YouTube、Loom、TikTok、X、Instagram 等数百个平台,也支持本地
.mp4、.mov、.mkv文件) - 用 ffmpeg 按自动计算的帧率抽取画面
- 优先抓取平台原生字幕(免费),没有字幕时自动调用 Whisper API 转写
- 把每一帧当作图片"读"进上下文,再结合带时间戳的转写文本回答问题
回答不再是"根据标题推测",而是"我亲眼看到了第 30 秒的画面"。
快速安装:3 种方式一键上手
方式一:Claude Code 插件(推荐)
在 Claude Code 中执行两行命令即可:
/plugin marketplace add bradautomates/claude-video /plugin install watch@claude-video后续用/plugin update watch@claude-video即可升级。
方式二:claude.ai 网页版
- 从 Release 下载
watch.skill文件 - 进入 Settings → Capabilities → Skills,点
+上传 - 记得先开启 "Code execution and file creation",因为技能需要调用 ffmpeg 和 yt-dlp
方式三:Codex 或手动克隆
git clone https://gitcode.com/GitHub_Trending/cl/claude-video ~/.codex/skills/watch手动开发者也可以克隆到~/.claude/skills/watch目录。
第一次运行:零配置自动装依赖
首次调用/watch时,技能会运行 scripts/setup.py 做预检:
- macOS:自动通过 brew 安装 ffmpeg 和 yt-dlp
- Linux:打印对应的 apt / dnf / pipx 安装命令
- Windows:打印 winget / pip 命令
- Whisper API 密钥:自动在
~/.config/watch/.env中生成占位配置(0600 权限),填入 Groq 或 OpenAI 密钥即可
关键点:大部分公开视频有免费字幕,完全不用花钱。只有当视频没有字幕轨道时(本地文件、TikTok、部分 Vimeo),才需要 Whisper API 密钥。设置完成后,预检静默通过,后续运行几乎零开销。
核心用法:一条命令看懂视频
基本格式就是/watch <视频地址> <你的问题>:
/watch https://youtu.be/xxx 第30秒发生了什么? /watch ~/Movies/screen-recording.mp4 界面什么时候出问题的?聚焦某个时间段是省 Token 的利器——加上--start/--end后,帧预算会变得更密:
/watch 视频链接 --start 2:15 --end 2:45其他常用参数(传入 scripts/watch.py):
| 参数 | 作用 |
|---|---|
--max-frames N | 压低帧数上限,更省 Token |
--resolution 1024 | 加宽帧宽,用于读屏幕上的文字 |
--fps F | 手动指定抽帧频率(最高 2 fps) |
--no-whisper | 完全禁用转写,只看画面 |
它是怎么"看懂"视频的?
整个流程由 scripts/watch.py 编排,核心模块各司其职:
- scripts/download.py:yt-dlp 下载 + 抓取原生字幕
- scripts/frames.py:ffmpeg 抽帧,含"按时长自动缩放帧率"的逻辑
- scripts/transcribe.py:VTT 字幕解析、去重,以及 Whisper 回退调度
- scripts/whisper.py:Groq(优先,更便宜更快)/ OpenAI 转写客户端
抽出的帧带t=MM:SS时间戳,转写文本同样带时间戳,Claude 会把两者对齐——看到"第 45 秒屏幕报错",就能对应到"第 45 秒他说的那个按钮"。
帧预算:为什么视频长短决定回答质量
图片是最烧 Token 的部分,所以 claude-video 采用"按时长分配帧预算"的策略:
| 视频时长 | 默认帧数 | 覆盖效果 |
|---|---|---|
| ≤30 秒 | 约 30 帧 | 密集,基本覆盖每个关键时刻 |
| 30 秒–1 分钟 | 约 40 帧 | 依然密集 |
| 1–3 分钟 | 约 60 帧 | 舒适 |
| 3–10 分钟 | 约 80 帧 | 稀疏但可用 |
| >10 分钟 | 100 帧 | 稀疏扫描,建议聚焦重跑 |
硬性上限是2 fps、100 帧。超过 10 分钟的视频脚本会打印"稀疏扫描"警告,此时用--start/--end聚焦你真正关心的片段,效果远好于硬扫全片。
典型使用场景
- 📈拆解别人的内容:
/watch <爆款视频> 他开头用了什么钩子?Claude 看前几帧画面 + 开场转写,直接帮你分析结构 - 🐛从录屏诊断 Bug:
/watch bug-repro.mov 哪里出问题了?它常能定位到出错的帧并描述屏幕内容 - 📝快速总结长视频:
/watch <链接> summarize this,比 2 倍速看完还快 - 🔍回答细节问题:
/watch <链接> 她提到了哪些工具?
使用限制与常见问题
- 最佳精度:10 分钟以内的视频;更长请用聚焦模式
- Whisper 上传上限 25 MB:约等于 50 分钟音频(16 kHz 单声道)
- 不支持需要登录的平台:技能不会登录任何账号,yt-dlp 拿不到的
/watch也拿不到 - 安全设计:视频本身绝不上传到任何 API,只有无字幕时才上传提取出的音频片段;不访问平台账号、不缓存密钥
项目结构与版本
项目结构非常清晰,技能契约定义在 SKILL.md:
- SKILL.md:技能主契约,三种安装面共用
- scripts/:全部核心脚本(watch、download、frames、transcribe、whisper、setup)
- hooks/hooks.json:Claude Code 的会话启动状态钩子
- CHANGELOG.md:版本历史(当前 0.1.3,2026-05)
项目采用 MIT 开源协议,构建在 yt-dlp、ffmpeg 和 Claude 多模态 Read 工具之上。装好之后,"视频"这个 Claude 此前看不懂的输入源,从此可以像文档一样直接交给它。
【免费下载链接】claude-videoGive Claude the ability to watch any video. /watch downloads, extracts frames, transcribes, hands it all to Claude.项目地址: https://gitcode.com/GitHub_Trending/cl/claude-video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考