工具
开发者发布 OpenCode 缓存友好型上下文压缩插件
针对本地模型场景优化 OpenCode 上下文压缩流程,将耗时从 10 分钟以上压缩到 1–2 分钟。
2026.09.23 · 周三约 2 分钟阅读
近日,开发者 lennartschoch 在 GitHub 开源了一款针对 OpenCode 的缓存友好型上下文压缩插件「opencode-cache-compact」,主要面向在本地运行大模型的用户群体。该插件尝试解决 OpenCode 默认压缩机制下本地推理速度过慢的问题。
解决本地模型的上下文压缩痛点
OpenCode 默认的上下文压缩机制会从对话开头剥离大量 token,包括系统提示、工具描述等历史内容。这一做法对托管模型并无明显影响,但对于本地模型而言,每次压缩都需要重新预填充整段对话,导致原本已被缓存的内容被丢弃,压缩过程耗时显著增加。
据开发者介绍,新插件在压缩流程中保留对话原始状态,仅提示模型生成一段总结,再将除系统提示、工具定义和总结之外的内容移除。由于整段对话始终保持在缓存中,压缩速度大幅提升。
实际效果与运行环境
- 在 Strix Halo(AMD 高端 APU 平台)上测试,压缩耗时通常在 1–2 分钟;
- 此前使用默认机制时,同类操作耗时通常超过 10 分钟。
开发者表示这是其在本地 LLM 领域的首个开源项目,希望获得社区关于实用性和改进方向的反馈。
适用范围与局限
该插件目前仅针对 OpenCode 的本地推理场景优化,依赖对话能够被完整缓存这一前提,对显存容量、上下文长度有一定要求。功能较为单一,未提供更多自定义选项,也缺少与主流本地推理框架(如 llama.cpp、vLLM、Ollama 等)的性能对比数据,实用效果仍需更多用户在更多硬件上验证。
