手动对齐字幕太痛苦?这款免费开源的AI视频剪辑工具把视频当文稿来剪
【免费下载链接】FunClipFunASR-powered video transcription, subtitle generation, and LLM-assisted clipping tool with a local Gradio UI.项目地址: https://gitcode.com/GitHub_Trending/fu/FunClip
凌晨一点,剪辑师还在时间轴上一帧帧找话——3小时的采访要剪成2分钟高光,光是"人声对齐字幕"就耗掉大半天。这是体力活,不是剪辑。FunClip 就是这样一款免费开源的AI视频剪辑工具,专治这种场景:把视频交给它,机器先"听懂"所有语音,你像删改文稿一样勾选想留下的句子,裁剪自动完成。本地部署、代码全开,素材不出你的电脑。
它凭什么能做到?先弄懂三件事 🧠
FunClip 的底层其实只有三件事,每件都对应一个真实场景。
语音识别,把视频变成可搜索的文稿。它调用阿里巴巴通义实验室开源的 Paraformer-Large 模型,识别中文语音并同步预测时间戳,这是目前效果最好的开源中文识别方案之一。当你想知道"第几分钟讲了什么"时,不用反复拖进度条,直接在逐句文本里搜索就行。官方文档:docs/
说话人分离,分清"谁在说话"。集成 CAM++ 说话人识别模型,自动给每句话打上说话人 ID。做访谈剪辑时,输入一个 ID,受访者的所有发言被一次性抽出,主持人的提问一句不留。
语义理解,听懂"哪段才是重点"。这是最特别的部分:接入 GPT、Qwen 等大模型后,你只要说清楚要什么(比如"保留产品卖点,删掉寒暄"),模型通读一遍字幕,自动圈出对应时间戳,裁剪随之完成。
第一次使用:5分钟跑通全流程 ⚡
安装只需要三条命令:
git clone https://gitcode.com/GitHub_Trending/fu/FunClip cd FunClip pip install -r requirements.txt再启动本地服务:
python funclip/launch.py浏览器打开 localhost:7860,界面就绪。剩下的全是鼠标操作:上传视频 → 点击"识别"(想区分说话人就点"识别+区分说话人")→ 在识别结果里勾选文本段落,或填入说话人 ID → 点击"裁剪"。系统会自动返回全视频 SRT 字幕和选中段落的字幕文件,多段自由剪辑同样支持。第一次从上传到出片,5分钟内可以完成。
进阶玩法:让识别更准、剪得更聪明 🎯
热词定制:在热词框输入人名、专业术语、品牌名,识别时优先匹配,错字率明显下降。适合记者的专访整理,以及律师、医生处理带大量专有名词的录音。
切换识别引擎与语言:启动时加-l en进入英文模式;加-m sensevoice切换 SenseVoice 模型,支持多语种识别,还附带情绪标签和音频事件检测。适合做海外内容或处理多语料库的团队。
大模型配置与提示词:在 LLM 区域选模型、填 API Key,再写下你的专属 Prompt——"提炼决策点""挑出情绪高潮",把裁剪标准固化下来。适合内容团队批量处理素材,一次配置,反复复用。
三个真实用法:不同身份,同一个动作 🚀
内容创作者(场景:一条 40 分钟直播要拆成 5 条短视频)→ 操作:识别后用 LLM 按主题切分 → 产出:5 个带字幕的高光片段,当天就能发布。
教师(场景:90 分钟讲座,想让学生看精华的 15 分钟)→ 操作:热词加入课程术语,识别后按知识点勾选 → 产出:带时间戳的复习切片,还能单独抽出教师或学生的发言。
会议记录员(场景:周会多人抢话、杂音多)→ 操作:说话人分离 + 关键词提取 → 产出:按人归类的发言文本和关键决策片段,纪要初稿半小时内成型。
下一步:让工具长成你想要的样子 🌱
FunClip 的源码与模型权重完全开放,核心源码:funclip/llm/ 里就是大模型调用的全部实现。装上 Python、拉下仓库,你可以改 Prompt、换模型、甚至把它接进自己的业务管线——这正是本地部署工具最大的自由:它不只是一个剪辑软件,而是一块随时可以改装的积木。现在就把仓库 clone 到本地,让第一次"文稿式剪辑"从今晚开始。
【免费下载链接】FunClipFunASR-powered video transcription, subtitle generation, and LLM-assisted clipping tool with a local Gradio UI.项目地址: https://gitcode.com/GitHub_Trending/fu/FunClip
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考