AutoCut 实战:改字幕文本,视频就剪好了
【免费下载链接】autocut用文本编辑器剪视频项目地址: https://gitcode.com/GitHub_Trending/au/autocut
一小时播客,想删掉口误和停顿,得反复拖动进度条找位置。每一刀都要对帧,剪完人已经累了。AutoCut 换了一种做视频剪辑的方式:它先给视频自动生成字幕,你只勾选要保留的句子,它就把对应片段裁出来。
字幕驱动剪辑:为什么改文本比拖时间轴更快
传统剪辑软件里,剪切意味着在时间轴上靠耳朵找入点出点。AutoCut 把"听"变成了"读"。
Whisper 是 OpenAI 的语音识别模型,它先把音频转成带时间戳的句子,写进 Markdown 文件。说白了:机器听写,你来勾选。文件里每行一个句子,带时间戳和一个复选框。你在想保留的句子前打勾,剩下的交给工具。
判断的粒度是句子。整段删掉一句话,比拖边界快得多。.md 文件里还嵌了一个视频播放器,边勾选边播放,能随时听上下文核对。不习惯 Markdown 的话,也可以直接编辑 .srt 字幕文件,删掉不想要的行。
🎬 工作流三步:从生成字幕到剪出视频
输入:丢一个视频文件进去。
autocut -t 22-52-00.mp4处理:生成 .srt 字幕文件和 .md 编辑文件。用 VS Code 或 Typora 打开 .md,勾选要保留的句子,再把开头的"编辑完成"标记行勾上。
输出:
autocut -c 22-52-00.mp4 22-52-00.srt 22-52-00.md得到 22-52-00_cut.mp4,外加一份新的预览文件,可以立刻复查结果。
一天的录像都丢进同一个文件夹,跑autocut -d 文件夹名,它会监听文件夹、持续给新文件转录。多个视频都剪完后,在 autocut.md 里勾选,再合并成一个 autocut_merged.mp4。
Whisper + FFmpeg:背后的技术搭档
分工很明确。
Whisper 是听写的。本地模式支持 openai-whisper 和速度更快的 faster-whisper,也可以走 OpenAI API 让机器在外面跑。模型从 tiny 到 large 可选,默认 small,模型越大越准,也越慢。
FFmpeg 是开源的音视频处理工具包,它是拿剪刀的剪辑师。裁剪、重新编码、导出,都由它完成;moviepy 负责多段拼接。
还有两个配角:VAD 语音活动检测把"没有人声"的段目标成 No Speech,静音段一目了然;opencc 把字幕里的繁体转成简体。
代码布局也直白:转录在 autocut/transcribe.py,剪切合并在 autocut/cut.py,文件夹监听在 autocut/daemon.py。
三个具体场景:字幕驱动剪切什么时候好用
用 OBS 每天录课的老师。把 OBS 文件名格式设成%CCYY-%MM-%DD/%hh-%mm-%ss,录像自动按日期进文件夹。挂一个autocut -d在后台,录完就有字幕。讲完课后勾选几句,一版初剪就出来了,不用每天对时间轴半小时。
每周做双人节目的播客主。素材长,口头禅和停顿多。生成字幕后按句删,删完还能对剪出的结果再跑一轮,直到满意。
想批量处理存量视频的开发者。pip install autocut-sub之后,代码里from autocut import Transcribe直接调用;怕环境麻烦的,用仓库里的 Dockerfile 或 Dockerfile.cuda 构建 CPU / GPU 镜像。
⚡ 快速上手:一条命令出字幕,一条命令剪视频
门槛就三步。
- 装 FFmpeg:Ubuntu 上
sudo apt install ffmpeg,Mac 上brew install ffmpeg。 pip install autocut-sub装好工具。autocut -t 视频.mp4生成字幕,勾选 .md 里的句子,再跑autocut -c 视频.mp4 视频.srt 视频.md。
有 Nvidia 显卡的话,先装好对应版本的 PyTorch,转录时加--whisper-model large换更大模型,准确率会更高。更多选项看 README.md 的常见问题。
AutoCut 不是全能剪辑软件,不会加转场,也不做调色。它只做一件事,而且做得扎实:把"听着判断"变成"看着勾选"。如果你经常产出讲课、播客、远程会议这类以人声为主的素材,想快速拿到一版初剪,这套字幕驱动的开源视频剪辑工具值得试。
【免费下载链接】autocut用文本编辑器剪视频项目地址: https://gitcode.com/GitHub_Trending/au/autocut
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考