桃子桃子快讯
返回首页
行业动态

4060Ti 16GB 跑 27B 量化模型完成多轮编码任务

Reddit 用户报告在 4060Ti 16GB 上用 Qwen 3 27B IQ3_K_XXS 量化权重首次完成多文件…

2026.08.25 · 周二3 分钟阅读

一位长期关注本地大模型的 Reddit 用户近日发帖称,他在单张 NVIDIA RTX 4060Ti 16GB 显卡上,使用 Unsloth 发布的 Qwen 3 27B IQ3_K_XXS 量化权重,首次完整跑通了一套需要多文件编辑、并通过代码评审与合并的编码 agent 流程。该用户在帖子中强调,过去他认为「本地模型」只能用于通用聊天,无法承担带工具调用的编码任务。

运行环境

用户在硬件配置上做了明显取舍,以腾出更多显存给上下文与 KV cache:

  • 模型:Qwen 3 27B IQ3_K_XXS(Unsloth 量化)
  • 显卡:RTX 4060Ti 16GB,去掉 mmproj 和 MTP 后「几乎 100k」上下文可用
  • 量化上下文:Q8
  • 推理速度:平均约 800 token/s prefill、20 token/s decode;超过 64k 上下文后解码速度约 17 token/s
  • 调度框架:llama-swap,配合自研的 Pi harness 作为前端

本次任务

任务目标是为一个自研框架增加「从 XDG 路径加载额外配置并覆盖内置默认值」的能力,并把重载功能暴露到 UI,同时严格遵守既有的插件架构与关注点分离。

流程与时间线大致如下:

  • 约 12:00 启动任务,先由 agent 调研代码与现有架构决策记录(ADR),给出实现方案
  • 约 12:20 进入「完全自主编码」阶段
  • 约 13:00 完成任务,期间发生 3 次上下文压缩(compaction)
  • 约 13:10 完成人工 code review 并通过合并

用户特别指出,agent 在整个过程中稳定地以「并行工具调用」方式推进,仅在文本编辑步骤上出现少量失败,没有发生「用 bash 覆写整个文件」等破坏性行为。

与过往失败经历的对比

发帖人同时回顾了此前的几次尝试,作为本次结果的对照:

  • GPT-OSS 20B:尝试多 agent 协同编辑同一共享文件时频繁失败,文件经常被一方整体覆盖
  • Qwen 30B-A3B Q4_K_XL:在 Aider 中无法正确编辑代码文件
  • 本次的 27B IQ3_K_XXS:在 IQ3 级别的强量化「脑损伤」下,仍然能完成规划、并行工具调用与同文件多位置编辑

一些附带细节

帖子附带了几条随手记录:

  • 27B 在一次会话中提示「我把两次编辑发到了错误的文件」
  • 用户让该模型依据个人日记、时间表和食谱知识库,生成了连续 7 天的菜单与对应购物清单
  • 发帖人计划继续测试 Gemma 31B Q3XXS 与 Muse Glimmer Q3XXS

该帖本质仍属个人使用体验,缺乏系统性基准评测与对照组,但其量化配置、速度数据与工具调用稳定性,对使用同档显卡研究「本地 agent 可行性」的读者有一定参考意义。

信源