Qubitz:面向本地 7B–35B 大模型的代理框架
Qubitz 是一款本地优先的 AI 代理工具,通过 harness + wrapper 架构让小型开源模型在工具调用与…
Qubitz 是一款本地优先(local-first)的 AI 代理工具,专为 7B–35B 规模的本地大模型设计,运行于 llama.cpp 的 GGUF 模型之上。它不依赖任何云端推理、订阅或付费托管服务,所有路由、工作区处理、检索与工具编排均由外层 wrapper 接管,避免小型模型在面对复杂指令时出现"忽略指令、误用工具或偏离任务"的问题。
核心定位
相较于当前主流的几类 AI 代理,Qubitz 将自己定位为"强 harness + wrapper 驱动"的本地代理:
- 云端 / API 代理:上手快、模型强,但依赖 API、订阅与厂商策略。
- IDE 代理:体验好、与代码库结合紧密,但通常绑定特定编辑器或托管模型。
- 本地聊天包装:隐私友好,但作为真正可用的代理,工具路由与恢复路径往往偏弱。
- 研究型代理框架:灵活,但常过度复杂、脆弱,未针对单台工作站优化。
Qubitz 主要面向本地代码仓库工作流,强调隐私、无付费依赖、对 WSL / Windows 混合环境友好,以及由 wrapper 主导的可预测行为。它并不试图在前沿代码智能上超越云端代理,而是把"本地可控"作为首要设计目标。
架构与功能特点
Qubitz 的核心思路是"不让小模型决定一切"——wrapper 拥有路由、执行事实与快速路径,模型只负责语言与推理层面。其主要设计包括:
- 本地检索与 embedding:项目上下文通过本地 embedding 模型提供,不走云检索。
- 直接执行能力:可绕过模型改写,直接调用工作区内已有的脚本与命令,例如
.py、.ps1、.sh、.bat、.cmd、uv run、npm run、pnpm run、make等任务。 - 多入口形态:同时提供 Tk GUI、CLI 与 stdio MCP 服务器三种交互模式。
- WSL2 / Windows 桥接:专门处理 WSL 子系统与 Windows 主机之间的混合工作区,这是许多同类代理的薄弱环节。
- 后台任务与插件:本地后台任务、wrapper 本地沙箱与工具编排。
- Agentic Behavioral Contracts:基于行为契约的代理控制机制,让策略层与运行时事实分离。
所有变体脚本统一使用 BAAI 的 BGE-Code-v1 作为 embedding 模型,配合各自的主模型工作。
已适配的模型变体
根据仓库中提供的脚本,Qubitz 当前已列出针对以下本地模型的变体:
- 12 GB 显存:
- Qwen Team Qwen-3.5-9B(Q5 Dense)
- Qwen Team AgenticQwen-8B(Q5 Dense)
- IBM Granite-4.1-8B(Q5 Dense)
- 24 GB 显存:
- Z.AI GLM-4.7-Flash-30B-A3B(MoE Q4)
- Cohere North-Mini-Code-1.0-30B-A3B(MoE Q4)
- NVIDIA Nemotron-Cascade-2-30B-A3B(MoE IQ4)
- NVIDIA Nemotron-3-Nano-30B-A3B(MoE IQ4)
- OpenAI GPT-OSS-20B(F16)
- DeepReinforce AI Ornith-1.0-35B-A3B(MoE Q4)
- Qwen Team AgenticQwen-30B-A3B(MoE Q4)
- Qwen Team Qwen-3.6-35B-A3B(MoE Q4)
- Google Gemma-4-31B-IT(QAT Q4)
不同变体对应不同的显存档位(12 GB 与 24 GB),便于用户在消费级 GPU 上比较不同模型在代理任务下的实际表现。
适用场景与局限
Qubitz 更适合作为"本地爱好者的实用代理"或"通用框架代理的替代品",用于本地仓库任务、脚本调度与 WSL / Windows 混合环境的自动化。它在前沿智能上不及云端顶级编程代理,但在隐私、无订阅、纯本地控制与可预测的 wrapper 行为方面更具优势。官方也明确,其目标场景是单台真实工作站,而非云端规模化部署。
