工具
开源 AI 视频剪辑工具 Clips Kitty:本地生成竖屏短片
Clips Kitty 是开源本地运行的 AI 视频剪辑工具,可自动从长视频生成竖屏短片,含说话人跟踪、词级字幕与多语言…
2026.08.31 · 周一约 3 分钟阅读
Clips Kitty 是一款开源的 AI 视频剪辑工具,全部流程在用户本地电脑上运行,无需云端订阅或按次付费。该项目原名 Clips Studio,在 1.1.3 版本后为符合 Microsoft Store 命名规范更名为 Clips Kitty,代码、数据与功能均保持一致。开发者将其定位为 OpusClip 等付费工具的开源替代方案,主要面向单人运营频道的内容创作者。
功能概览
Clips Kitty 接受 YouTube、Twitch、Kick 链接或本地视频文件作为输入,自动完成以下工作:
- 从长视频中检测最具传播力的片段
- 通过人脸与说话人跟踪将画面裁剪为 9:16 竖屏
- 烧录与音频对齐的字幕
- 生成标题、描述与话题标签
- 支持 19 种语言的翻译、字幕或 AI 配音
工具特别针对直播、IRL、访谈、播客与健身等长视频场景优化,这些内容结构松散,单靠字幕难以定位高光时刻。
技术流水线
完整处理流程分为七个阶段,全部在本地执行:
- 转写:基于 faster-whisper 输出词级时间戳,优先使用 CUDA,否则回退 CPU。
- 多模态评分:将音频响度、爆发密度、视觉变化、反应信号整合为 1 秒粒度的事件时间线;Twitch 聊天或 YouTube 热度图等真实受众数据可作为小幅加权。
- 本地 LLM 打分与重排:小模型同时看到字幕与事件时间线进行评分;为避免小模型评分集中在窄区间,所有候选在一次重排中两两比较。
- 画面裁剪:YOLOv8 人体姿态估计叠加 TalkNet 说话人检测,自动跟随当前发言者。
- 字幕与编辑:词级同步字幕,烧录前可编辑;所有剪辑操作为非破坏式存储,渲染时再应用。
- 多语言与配音:内置 19 种语言支持,提供术语表保护频道名与赞助商;TTS 配音支持试听。
- 导出:按平台整理文件夹结构并写入元数据。
硬件与平台支持
- 操作系统:Windows、macOS、Linux
- 视频编码自动检测 NVENC、AMF、QSV,必要时回退 CPU
- LLM 通过 Ollama 在 GPU 上运行
- 提供图形界面与命令行两种使用方式
创作者画像与可选能力
工具会为每位创作者建立知识库,记录常用话题、系列、合作者与重复梗,在打分时作为额外加分项(可关闭)。此外提供 16:9 长视频处理路径,可输出横版剪辑、Twitter 长度切片,或生成去除冷场的完整直播录像。
作为完全本地化的方案,Clips Kitty 适合希望控制成本、保护素材隐私、并对自动化剪辑流程有定制需求的创作者与小型工作室使用。
