OpenCode Senses:本地视觉插件为编码 Agent 补上眼睛
开发者发布 OpenCode Senses 视觉插件,集成 Photon 推理引擎,可在本地完成 OCR、目标检测、图像…
独立开发者近日在 Reddit r/LocalLLaMA 发布了一款名为 OpenCode Senses 的本地视觉插件,专为 OpenCode 编码 Agent 设计。其核心卖点是「完全本地运行」——无需 API Key、不上传数据,所有视觉推理都在用户机器上完成,旨在为文本类开源编码模型补足多模态短板。
13 项视觉工具覆盖完整工作流
插件以工具集形式向主 Agent 暴露能力,每项工具对应一个常见视觉任务:
- inspect:理解图像场景、布局、元素并生成描述与 OCR。
- ocr:精确提取文本,包括代码片段和错误信息。
- detect:基于边界框定位物体或 UI 元素。
- point:输出物体或元素的中心点坐标。
- segment:将物体从图像中分离。
- crop:按归一化坐标裁剪指定区域。
- zoom:对小区域上采样后重新分析细节或文字。
- colors:返回确定性颜色、调色板、亮度与 RGB 数据。
- diff:对比两张图像并标记差异区域。
- annotate:将检测框与点绘制回图像。
- metadata:查看格式、尺寸、大小、DPI 与 EXIF 信息。
- reverse:本地或通过 Yandex(亦可选 SauceNAO、TraceMoe)反向搜图。
- status:检查模型、设备、显存、推理耗时与运行状态。
这套工具集对 UI 设计调试、界面截图分析等「文本模型看不见」的场景较为友好。
本地推理与性能数据
插件后端采用 Python 与 TypeScript 混合架构,集成了 Photon Inference Engine(kestrel)进行本地视觉推理。作者给出的性能参考为:在 RTX 3050 上单次工具调用响应时间约 300 ms,经优化后降至 84 ms,最低记录 38 ms;速度差异取决于主模型的 tokens/sec。该表现被作者拿来与「前沿模型」做对比,定位为轻量、低延迟的本地替代方案。
插件与主 Agent 之间的通信层被刻意设计得较窄,使其仍像「同一个多模态 Agent 的一部分」,而非外挂的独立视觉工具。
当前局限与社区请求
项目目前由单人维护,作者明确指出尚未覆盖 AMD 硬件支持(已有人在 GitHub 上请求 9070XT 适配),社区可前往相关 issue 留言。另一项被频繁问到的功能是 Pi agent 适配,作者认为 Pi agent 生态较分散,呼吁贡献者参与。
此外,插件可与 OpenCode 内置的网络搜索服务(如 Exa)协同工作,并能直接查看互联网上发布的图片(配有小型本地缓存)。反向搜图功能默认无需 API Key,也可选择 Yandex 等第三方服务。
项目地址
- GitHub:https://github.com/itsmeadarsh2008/opencode-senses
- NPM:https://www.npmjs.com/package/opencode-senses
- Hacker News:https://news.ycombinator.com/item?id=49289890
作者表示项目仍在迭代中,欢迎在 GitHub issue 或评论区提交建议与批评。
