桃子桃子快讯
返回首页
行业动态

24GB 笔记本跑本地 AI:一场被内存价格劝退的尝试

一位开发者在 24GB Mac 上折腾本地大模型数月,因硬件上限与 AI 驱动的内存涨价被迫重回云端,仅保留一个 Gem…

2026.07.30 · 周四3 分钟阅读

一位博主在 24GB 内存的 Mac 上花了数月尝试本地运行大模型,最终被硬件上限和 AI 引发的内存涨价联合劝退:除一个 Gemma MoE 简历分析脚本外,其余稍具判断力的任务仍要回到云端。

24GB 听起来不少,但留给模型的远没有标签上的数字

博主购入时觉得 24GB 已经相当充裕,但真正加载语言模型后,系统本身就要先切走一大块,留给模型的可用内存大概只有贴纸数字的三分之二。具备一定可靠度的模型体量恰好压在或略超这个上限,由此陷入两难:

  • 选小一些的模型,能跑得动,但能力平庸;
  • 选更聪明的大模型,机器就开始吃力和卡顿。

直观解法是加大内存,但博主发现当下并非升级硬件的好时机。

AI 自己抬高了「本地 AI」的门槛

文章援引的硬件市场行情相当戏剧化:

  • DRAM 自 2025 年初以来价格约翻倍,分析机构预计 2026 年还将再上涨约 70%;
  • SSD 所用的 NAND 晶圆价格较去年同期涨到约 8 倍,一块 4TB 固态从大约 250 美元涨到 700 美元以上;
  • 大型数据中心建设预计将吞噬全球约 70% 的高端内存产能,云厂商已签下覆盖未来数年的产能合同;
  • 美光甚至关停了面向消费者的 Crucial 品牌,将资源全部转向 AI 市场。

换言之,让本地独立运行的小模型显得诱人的那场 AI 浪潮,恰恰也是把大多数用户挡在门外的那场浪潮。

工具换了一圈,瓶颈仍在硬件

在承认硬件限制之前,博主先把怀疑对象放在软件层面,先后试用了 Pi、OpenCode、Hermes 等本地 LLM 工具链。最终留下 Pi 的原因不是功能最多,而是模型在其上跑得更快、摩擦更小。但作者很快意识到,框架不是瓶颈:模型本身及其所依赖的内存才是那道墙,"换什么界面都跨不过去"。

由此带来的现实是:本地模型目前只敢承担风险低的轻量任务,比如改写一句话、问个无关紧要的小问题;任何需要真正判断力的工作,作者几乎是不假思索地切回云端。这并非单纯出于成本——当下云端 token 的补贴相当可观,云模型大概率在算力成本上仍然胜出——而是源于对云厂商故障、政策与单方面变更的警惕。

一个真正能跑起来的本地工作流

也有跑得动的场景:求职广告批量分析。脚本负责拉取招聘信息、过滤明显无效的内容,再把剩下的交给笔记本上的本地模型,对照一份预先写好的简介给出契合度评分。整个流程离线运行,简历不离开本机,也不受云端 AI 宕机影响。

这套方案能成立,关键在 Gemma 模型采用了混合专家(MoE)架构:每次只唤醒回答问题所需的那部分参数,而不是整网全开。代价是每次分析一条招聘大约 30 秒,但作为后台批量任务,这并不影响日常使用。

暂时的妥协

作者并未放弃本地 AI:MoE 已经把「能跑且能思考」的门槛下移过一次,未来很可能还会再下移;模型正在变得更聪明/GB,而不是单纯更大;内存价格终将回落。也许一两年后,本地运行所有任务会变得毫无悬念。但在 2026 年的当下,作者手里只有一个完全属于自己的本地工作流,其余一切仍然「打电话回家」。

信源