桃子桃子快讯
返回首页
工具

本地编码智能体 Ante 0.2 发布,主打 llama.cpp 离线管理

Ante 0.2 上线离线模式,自动管理 llama.cpp 与本地 GGUF 模型,无需联网即可运行编码智能体循环。

2026.08.10 · 周一3 分钟阅读

本地优先的编码智能体项目 Ante 近日发布 0.2 版本,重点更新是「离线模式」(offline mode)。开发者将本地推理视为智能体的一类运行方式,由 Ante 自身负责推理引擎的安装、校验与生命周期管理,模型文件在磁盘上即可完全脱离网络运行。

离线引擎管理

Ante 内置 llama.cpp 管理器,会根据用户硬件自动匹配官方构建:Apple Silicon 使用 Metal,Linux 可选 CUDA、Vulkan 或纯 CPU,并对下载文件进行 pinning 与 checksum 校验;当 pinned 版本更新时会提示升级。

模型发现覆盖三类本地路径:

  • ~/.ante/models 目录
  • llama.cpp 缓存
  • Hugging Face 缓存

同时探测本地端口上已经在跑的 llama.cpp 服务。加载前会基于模型大小、KV cache 与上下文窗口估算所需的 RAM/VRAM,并在下载、张量加载、GPU offload 各阶段提供实时进度。服务进程可从 TUI 内启动、监督与关闭,也支持退出后保留后台运行以便下次 reattach。

使用方式

进入方式分两步:

  • TUI 内执行 /offline-mode
  • 或在脚本中一行调用:ante --offline-model /path/to/model.gguf "your prompt here"

ante serve --offline-model <path> 可一次性加载模型并对外共享,所有接入客户端共用同一份推理。若模型目录下存在 mmproj-*.gguf 多模态投影文件,视觉输入会自动启用。已加载的本地模型在 provider 列表中与云端模型并列,可用 /providers 在会话中途切换,方便先用前沿模型草拟,再切到本地处理敏感仓库。任意 OpenAI 兼容服务(Ollama、vLLM、LM Studio、自建服务)都可接入同一目录体系。

关于本地性能基准

开发团队坦言,本地模型与前沿闭源模型之间存在真实差距,并以同样的 harness、固定公开构建与可审计流程给出基准数据:Qwen3.6 27B(约 17 GB 下载量)在 Terminal-Bench 2.1 上跨 445 次试验取得 56.2%。该成绩可在线查看,官方同时维护一份「实际跑得动」的模型清单,避免用户下载数十 GB 后才发现效果不佳。

其他更新与现状

0.2 版本其他要点包括:单文件自包含二进制(内置重写的 ripgrep 与本地 PDF/OCR)、steering、多 provider 直接调用、子智能体与 skills 等 harness 功能,--profile 可精简为 pi 风格的极简模式。自预览版上线以来累计处理近 7 万亿 token,几乎每日都有新版本发布。

信源