claude-video Token消耗指南:如何用最少的Token看最多的视频
【免费下载链接】claude-videoGive Claude the ability to watch any video. /watch downloads, extracts frames, transcribes, hands it all to Claude.项目地址: https://gitcode.com/GitHub_Trending/cl/claude-video
claude-video 是一个让 Claude 拥有"看视频"能力的开源技能:一条/watch命令即可下载视频、自动抽帧、提取字幕转写,然后把画面和文字一起交给 Claude 回答你的问题。由于视频帧是 Token 消耗的大头,掌握本文的省 Token 技巧,你能用更少的 Token 看懂更多的视频。
为什么看视频费 Token:帧就是 Token 💡
Claude 原生不支持视频输入。claude-video 的解法是:用 ffmpeg 把视频抽成一张张 JPEG 帧,让 Claude 逐张"读图"。于是:
- 每一帧都是一次图像 Token 消费。官方估算:80 帧、512px 宽 ≈ 5~8 万图像 Token
- 字幕转写非常便宜:10 分钟视频的转写文本通常只有几千 Token
- 分辨率越高越贵:把帧宽从 512px 升到 1024px,单帧图像 Token 大约翻 4 倍
结论很简单:帧数 × 分辨率 = 你的 Token 账单。所有省 Token 技巧都围绕这两个变量展开。转写成本的细节见 scripts/whisper.py。
claude-video 默认帧预算表:按时长自动分配 ⏱️
好消息是,脚本不会无脑抽帧。scripts/frames.py 里的 auto-fps 逻辑会按视频时长分配帧预算:时长越长,抽帧越稀疏;硬上限为 2 fps、100 帧。
| 视频时长 | 默认帧预算 | 效果 |
|---|---|---|
| ≤ 30 秒 | 约 30 帧 | 密集,几乎不遗漏关键时刻 |
| 30 秒 ~ 1 分钟 | 约 40 帧 | 依然密集 |
| 1 ~ 3 分钟 | 约 60 帧 | 舒适区间 |
| 3 ~ 10 分钟 | 约 80 帧 | 稀疏但够用 |
| > 10 分钟 | 100 帧 | 触发"稀疏扫描"警告 |
也就是说:短视频自动密集、长视频自动封顶,这本身就是一层免费的 Token 保护。
6 个实操技巧:用最少的 Token 看最多的视频 🎯
技巧 1:聚焦片段--start/--end,最省 Token 的用法
只关心某一段时("2:30 左右发生了什么"),加上起止时间进入聚焦模式。聚焦模式有独立的密集预算,比"全片稀疏扫一遍"信息量大得多,帧数却更少。示例:
/watch video.mp4 --start 2:15 --end 2:45 这段界面哪里出问题了?这是长视频问题的首选姿势。
技巧 2:压低帧数--max-frames,收紧预算
默认帧上限为 80(硬顶 100)。如果只是想粗略了解内容,直接压低:
/watch <视频> --max-frames 40 总结这个视频帧数减半,图像 Token 就近乎减半——这是最直接的省钱开关。
技巧 3:分辨率保持默认 512px,只在读屏时升 1024
只有当 Claude 需要辨认画面上的文字(幻灯片、终端、代码截图)时,才加--resolution 1024。日常问答一律用默认 512px,避免单帧成本翻 4 倍。
技巧 4:优先免费字幕,Whisper 选 Groq
转写分两层成本:
- 原生字幕:免费。yt-dlp 会优先抓取平台自带字幕,覆盖大部分公开视频,零 API 费用
- Whisper 兜底:仅在无字幕时触发。两个后端中,SKILL.md 推荐Groq 的 whisper-large-v3——更便宜、更快;OpenAI 的 whisper-1 作为备选
如果问题只关心画面,还可以加--no-whisper彻底跳过转写,只出帧不出文本。
技巧 5:追问不重跑,白嫖上下文
同一会话里看过一个视频后,继续追问时 Claude 直接复用已有的帧和转写,不会重新抽帧。所以别自己再敲一次/watch——那才是真正烧钱的行为。
技巧 6:长视频策略——先问,再聚焦
超过 10 分钟的完整扫描只能给你稀疏的 100 帧,脚本还会打印警告。更省的做法是:先问一句"这视频大概讲了什么",拿到大致结构后,再用--start/--end聚焦到真正关心的 30 秒窗口,密集看细节。
场景速查表:按视频类型选参数 ⚡
| 场景 | 推荐参数 | 说明 |
|---|---|---|
| 短视频(<10 分钟)求细节 | 默认即可 | 自动密集抽帧 |
| 长视频问某一段 | --start/--end | 聚焦模式,性价比最高 |
| 只要大概内容 | --max-frames 40 | 减半成本 |
| 画面里有关键文字 | --resolution 1024 | 仅此时升分辨率 |
| 纯口播 / 播客 | 默认(字幕足够) | 转写免费或极便宜 |
| 只看画面不听声音 | --no-whisper | 跳过转写 |
省 Token 常见误区 ⚠️
- 误区一:整片扫描长视频。10 分钟以上的稀疏扫描信息密度低,聚焦 30 秒窗口往往更好更省
- 误区二:习惯性升到 1024px。不读屏就别升,4 倍成本换来的多数是浪费
- 误区三:每个问题都重跑一遍。同一视频追问直接复用上下文,成本为零
结语
claude-video 把"看视频"变成了可量化、可调控的 Token 问题:帧数定预算、分辨率定单价、聚焦定范围。记住这条主线——默认参数起步、聚焦代替全扫、分辨率按需升、追问不重跑——你就能用尽可能少的 Token,看懂尽可能多的视频 📺。
更多参数说明见 README.md 的 Usage 章节,完整技能契约见 SKILL.md,入口脚本为 scripts/watch.py。
【免费下载链接】claude-videoGive Claude the ability to watch any video. /watch downloads, extracts frames, transcribes, hands it all to Claude.项目地址: https://gitcode.com/GitHub_Trending/cl/claude-video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考