开源、准确且易于使用的视频语音识别和剪辑工具。集成了基于LLM的AI剪辑。
FunClip 是一款完全开源、本地部署的自动化视频剪辑工具。它利用阿里巴巴通义语音实验室开源的 FunASR Paraformer 系列模型对视频进行语音识别,之后用户可以从识别结果中自由选择文本片段或说话人,点击剪辑按钮即可获得所选片段对应的视频剪辑。 该工具集成了阿里巴巴开源的工业级模型 Paraformer-Large,能够一体化地准确预测时间戳。它融合了 SeACo-Paraformer 的热词定制功能,允许用户在 ASR 过程中指定某些实体词、人名等作为热词,以提升识别效果。它还集成了 CAM++ 说话人识别模型,使用户能够将自动识别的说话人 ID 作为剪辑目标,从而剪辑特定说话人的片段。 功能通过 Gradio 交互实现,安装简单、易于使用,该工具还可以部署在服务器上并通过浏览器访问。FunClip 支持多片段自由剪辑,并自动返回完整视频 SRT 字幕和目标片段 SRT 字幕。它还支持 LLM 辅助剪辑,包括通过 OrcaRouter(一个兼容 OpenAI 的智能路由网关)进行路由。 模型选择选项包括用于中文视频剪辑的默认 Paraformer、旗舰版 Fun-ASR-Nano 检查点、用于多语言 ASR 并带有情感和音频事件标签的 SenseVoice、用于长音频 ASR 并带有匿名说话人标签和时间戳的 MOSS,以及用于英文视频剪辑的 Paraformer 英文模型。

团队使用 FunClip 转录视频,并通过从识别结果中选择文本来剪辑片段。
团队使用 FunClip 利用自动识别的说话人 ID 剪辑特定说话人的片段。
团队使用 FunClip 通过指定热词来提高实体词和人名的 ASR 准确率。
团队使用 FunClip 自动生成完整视频和目标片段的 SRT 字幕。
团队使用 FunClip 通过兼容 OpenAI 的网关执行 LLM 辅助剪辑。
团队使用 FunClip 在服务器上部署 Gradio 服务,并通过浏览器访问。
团队使用 FunClip 运行带有情感和音频事件标签的多语言 ASR。