本地编码智能体 Ante 0.2 发布,主打 llama.cpp 离线管理
Ante 0.2 上线离线模式,自动管理 llama.cpp 与本地 GGUF 模型,无需联网即可运行编码智能体循环。
本地优先的编码智能体项目 Ante 近日发布 0.2 版本,重点更新是「离线模式」(offline mode)。开发者将本地推理视为智能体的一类运行方式,由 Ante 自身负责推理引擎的安装、校验与生命周期管理,模型文件在磁盘上即可完全脱离网络运行。
离线引擎管理
Ante 内置 llama.cpp 管理器,会根据用户硬件自动匹配官方构建:Apple Silicon 使用 Metal,Linux 可选 CUDA、Vulkan 或纯 CPU,并对下载文件进行 pinning 与 checksum 校验;当 pinned 版本更新时会提示升级。
模型发现覆盖三类本地路径:
- ~/.ante/models 目录
- llama.cpp 缓存
- Hugging Face 缓存
同时探测本地端口上已经在跑的 llama.cpp 服务。加载前会基于模型大小、KV cache 与上下文窗口估算所需的 RAM/VRAM,并在下载、张量加载、GPU offload 各阶段提供实时进度。服务进程可从 TUI 内启动、监督与关闭,也支持退出后保留后台运行以便下次 reattach。
使用方式
进入方式分两步:
- TUI 内执行
/offline-mode - 或在脚本中一行调用:
ante --offline-model /path/to/model.gguf "your prompt here"
ante serve --offline-model <path> 可一次性加载模型并对外共享,所有接入客户端共用同一份推理。若模型目录下存在 mmproj-*.gguf 多模态投影文件,视觉输入会自动启用。已加载的本地模型在 provider 列表中与云端模型并列,可用 /providers 在会话中途切换,方便先用前沿模型草拟,再切到本地处理敏感仓库。任意 OpenAI 兼容服务(Ollama、vLLM、LM Studio、自建服务)都可接入同一目录体系。
关于本地性能基准
开发团队坦言,本地模型与前沿闭源模型之间存在真实差距,并以同样的 harness、固定公开构建与可审计流程给出基准数据:Qwen3.6 27B(约 17 GB 下载量)在 Terminal-Bench 2.1 上跨 445 次试验取得 56.2%。该成绩可在线查看,官方同时维护一份「实际跑得动」的模型清单,避免用户下载数十 GB 后才发现效果不佳。
其他更新与现状
0.2 版本其他要点包括:单文件自包含二进制(内置重写的 ripgrep 与本地 PDF/OCR)、steering、多 provider 直接调用、子智能体与 skills 等 harness 功能,--profile 可精简为 pi 风格的极简模式。自预览版上线以来累计处理近 7 万亿 token,几乎每日都有新版本发布。
- 离线模式文档:https://ante.run/local/overview
- GitHub:https://github.com/AntigmaLabs/ante
- Harness 影响的对比实验:https://antigma.ai/blog/2026/08/04/harness-matter
