桃子桃子快讯
返回首页
工具

Qubitz:面向本地 7B–35B 大模型的代理框架

Qubitz 是一款本地优先的 AI 代理工具,通过 harness + wrapper 架构让小型开源模型在工具调用与…

2026.08.10 · 周一5 分钟阅读

Qubitz 是一款本地优先(local-first)的 AI 代理工具,专为 7B–35B 规模的本地大模型设计,运行于 llama.cpp 的 GGUF 模型之上。它不依赖任何云端推理、订阅或付费托管服务,所有路由、工作区处理、检索与工具编排均由外层 wrapper 接管,避免小型模型在面对复杂指令时出现"忽略指令、误用工具或偏离任务"的问题。

核心定位

相较于当前主流的几类 AI 代理,Qubitz 将自己定位为"强 harness + wrapper 驱动"的本地代理:

  • 云端 / API 代理:上手快、模型强,但依赖 API、订阅与厂商策略。
  • IDE 代理:体验好、与代码库结合紧密,但通常绑定特定编辑器或托管模型。
  • 本地聊天包装:隐私友好,但作为真正可用的代理,工具路由与恢复路径往往偏弱。
  • 研究型代理框架:灵活,但常过度复杂、脆弱,未针对单台工作站优化。

Qubitz 主要面向本地代码仓库工作流,强调隐私、无付费依赖、对 WSL / Windows 混合环境友好,以及由 wrapper 主导的可预测行为。它并不试图在前沿代码智能上超越云端代理,而是把"本地可控"作为首要设计目标。

架构与功能特点

Qubitz 的核心思路是"不让小模型决定一切"——wrapper 拥有路由、执行事实与快速路径,模型只负责语言与推理层面。其主要设计包括:

  • 本地检索与 embedding:项目上下文通过本地 embedding 模型提供,不走云检索。
  • 直接执行能力:可绕过模型改写,直接调用工作区内已有的脚本与命令,例如 .py.ps1.sh.bat.cmduv runnpm runpnpm runmake 等任务。
  • 多入口形态:同时提供 Tk GUI、CLI 与 stdio MCP 服务器三种交互模式。
  • WSL2 / Windows 桥接:专门处理 WSL 子系统与 Windows 主机之间的混合工作区,这是许多同类代理的薄弱环节。
  • 后台任务与插件:本地后台任务、wrapper 本地沙箱与工具编排。
  • Agentic Behavioral Contracts:基于行为契约的代理控制机制,让策略层与运行时事实分离。

所有变体脚本统一使用 BAAI 的 BGE-Code-v1 作为 embedding 模型,配合各自的主模型工作。

已适配的模型变体

根据仓库中提供的脚本,Qubitz 当前已列出针对以下本地模型的变体:

  • 12 GB 显存:
    • Qwen Team Qwen-3.5-9B(Q5 Dense)
    • Qwen Team AgenticQwen-8B(Q5 Dense)
    • IBM Granite-4.1-8B(Q5 Dense)
  • 24 GB 显存:
    • Z.AI GLM-4.7-Flash-30B-A3B(MoE Q4)
    • Cohere North-Mini-Code-1.0-30B-A3B(MoE Q4)
    • NVIDIA Nemotron-Cascade-2-30B-A3B(MoE IQ4)
    • NVIDIA Nemotron-3-Nano-30B-A3B(MoE IQ4)
    • OpenAI GPT-OSS-20B(F16)
    • DeepReinforce AI Ornith-1.0-35B-A3B(MoE Q4)
    • Qwen Team AgenticQwen-30B-A3B(MoE Q4)
    • Qwen Team Qwen-3.6-35B-A3B(MoE Q4)
    • Google Gemma-4-31B-IT(QAT Q4)

不同变体对应不同的显存档位(12 GB 与 24 GB),便于用户在消费级 GPU 上比较不同模型在代理任务下的实际表现。

适用场景与局限

Qubitz 更适合作为"本地爱好者的实用代理"或"通用框架代理的替代品",用于本地仓库任务、脚本调度与 WSL / Windows 混合环境的自动化。它在前沿智能上不及云端顶级编程代理,但在隐私、无订阅、纯本地控制与可预测的 wrapper 行为方面更具优势。官方也明确,其目标场景是单台真实工作站,而非云端规模化部署。

信源