桃子桃子快讯
←返回首页
工具

Jevcut:用代码选边界、用模型评成片的视频自动切片工具

Show HN 项目 Jevcut 把视频切成可独立播放的短片,由代码枚举候选切点、Jev 模型判断成片质量,号称在 3…

2026.09.26 · 周六约 4 分钟阅读

Jevcut 是一款在 Hacker News 上发布的视频自动切片工具,目标是把长视频(播客、访谈、脱口秀、直播等以口头内容为主的素材)切成可以独立播放的短片,用于 Shorts、Reels、TikTok 或精选集。它的核心思路是:用代码枚举所有可能的「切点」,让大模型只负责评判「这一刀切下去能不能立住」,而不是直接让模型决定时间戳。

设计思路:代码管边界,模型管成片

作者认为,市面上自动切片工具普遍存在同一问题——切出来的片段起于句中、开头是代词找不到指代对象、或者在笑点之前就结束。这本质上是「边界问题」,而不是「找兴趣点」问题。Jevcut 的应对方式有三条:

  • 代码枚举候选边界:句末、≥ 350ms 的停顿、说话人切换都作为候选切点,模型永远不被允许直接命名一个时间戳。
  • 模型只做评判:TypeSafe 的 System One 模型(代号 Jev)只回答「这一段是否值得切」「独立观看是否成立」「包袱有没有落在切出来的范围内」这类问题。
  • 显式的「独立观看」门控:每个候选边界都被送评一次,任何一条都救不回来的片段直接丢弃——宁可少切,不出废片。

根据作者自述,最初尝试让 Jev 直接从一个 Choice 里选切点,效果不佳;改为规则切边后,在 8 个标注视频上有 57% 的片段因「毛边」被废。后来改成枚举候选再交由模型评判,先导集上的 recall 从 0.23 提升到 0.41。

基准与成本

在 38 个手工标注、覆盖 13 种类型的视频上,Jevcut 与五种更简单的方法做了对比,包括逐句打分、固定窗口、给最高分句子加 padding,以及两个保留 Jev 的「切点选择」但把边界交给规则实现的版本。结果显示,Jevcut 在 recall、「两条边界都落在标注者接受区间内」的比例和 precision 上均高于上述基线。完整数字见项目中的 BENCHMARKS.md,作者也把早期对照实验放在 eval/experiments/ 下供复核。

成本方面,按 2026 年 9 月 24 日对 8 段、共 4.6 小时的先导评估集测算,每小时视频:

  • Lemonfox 转写:约 0.17 美元
  • 扫描候选时刻:约 85 次 Jev 请求
  • 边界搜索(开头、结尾、广告检查):约 430 次 Jev 请求
  • Jev 调用合计:约 520 次,约 0.03 美元

按文中给出的费率,每次 Jev 请求约 0.05 美元 / 1,000 次,因此模型调用比转写便宜约 5 倍;改用本地 Whisper 可免掉转写费,但会漏掉一些时刻。Jev 每分钟允许 1,200 次请求,按每小时视频 520 次计算,单账户约可每分钟回填 2 小时视频。请求数被压低主要靠三个手段:扫描阶段按窗口而非逐句读文本、开头由一次 Choice 在全部候选起点中选一个、结尾按时间顺序两两比较并在第一个成立的边界停下。

适用范围与局限

Jevcut v1 明确把范围划在「含口头内容的素材」,因为评判器只看转写文本——车祸、尖叫、特技这类「没有台词的高光时刻」对其天然不可见,作者将其作为有意为之的边界而非疏漏,并在 issue 021 中做了说明。项目同时提供了直播检测的回看环形缓冲机制:直播判断天然滞后,触发时通过一次回溯 Choice 在已缓冲的切点里找回真实起点。

相比同列出的几款 Jev 系工具——jevmeter(取 10–15 秒窗口均值最高的能量段)、jev-skip(按句末对齐的 30 秒字幕窗口)、youtube-sponsor-detection(扫描后回溯到 lead-in),Jevcut 公开表示吸收并泛化了后者「先锚定再回溯」的思路,并指出其调研过的开源切片工具多数没有对输出片段做自洽性检查。

ROADMAP.md 和 issue 列表中记录了已实现和待做的工作;项目以「测量而非断言」为口号,把每一项主张都绑定到一个带指标的 issue 上。

信源