桃子桃子快讯
返回首页
工具

OpenCode Senses:本地视觉插件为编码 Agent 补上眼睛

开发者发布 OpenCode Senses 视觉插件,集成 Photon 推理引擎,可在本地完成 OCR、目标检测、图像…

2026.08.27 · 周四3 分钟阅读

独立开发者近日在 Reddit r/LocalLLaMA 发布了一款名为 OpenCode Senses 的本地视觉插件,专为 OpenCode 编码 Agent 设计。其核心卖点是「完全本地运行」——无需 API Key、不上传数据,所有视觉推理都在用户机器上完成,旨在为文本类开源编码模型补足多模态短板。

13 项视觉工具覆盖完整工作流

插件以工具集形式向主 Agent 暴露能力,每项工具对应一个常见视觉任务:

  • inspect:理解图像场景、布局、元素并生成描述与 OCR。
  • ocr:精确提取文本,包括代码片段和错误信息。
  • detect:基于边界框定位物体或 UI 元素。
  • point:输出物体或元素的中心点坐标。
  • segment:将物体从图像中分离。
  • crop:按归一化坐标裁剪指定区域。
  • zoom:对小区域上采样后重新分析细节或文字。
  • colors:返回确定性颜色、调色板、亮度与 RGB 数据。
  • diff:对比两张图像并标记差异区域。
  • annotate:将检测框与点绘制回图像。
  • metadata:查看格式、尺寸、大小、DPI 与 EXIF 信息。
  • reverse:本地或通过 Yandex(亦可选 SauceNAO、TraceMoe)反向搜图。
  • status:检查模型、设备、显存、推理耗时与运行状态。

这套工具集对 UI 设计调试、界面截图分析等「文本模型看不见」的场景较为友好。

本地推理与性能数据

插件后端采用 Python 与 TypeScript 混合架构,集成了 Photon Inference Engine(kestrel)进行本地视觉推理。作者给出的性能参考为:在 RTX 3050 上单次工具调用响应时间约 300 ms,经优化后降至 84 ms,最低记录 38 ms;速度差异取决于主模型的 tokens/sec。该表现被作者拿来与「前沿模型」做对比,定位为轻量、低延迟的本地替代方案。

插件与主 Agent 之间的通信层被刻意设计得较窄,使其仍像「同一个多模态 Agent 的一部分」,而非外挂的独立视觉工具。

当前局限与社区请求

项目目前由单人维护,作者明确指出尚未覆盖 AMD 硬件支持(已有人在 GitHub 上请求 9070XT 适配),社区可前往相关 issue 留言。另一项被频繁问到的功能是 Pi agent 适配,作者认为 Pi agent 生态较分散,呼吁贡献者参与。

此外,插件可与 OpenCode 内置的网络搜索服务(如 Exa)协同工作,并能直接查看互联网上发布的图片(配有小型本地缓存)。反向搜图功能默认无需 API Key,也可选择 Yandex 等第三方服务。

项目地址

作者表示项目仍在迭代中,欢迎在 GitHub issue 或评论区提交建议与批评。

信源