2026.08.25 · 周二工具
←返回首页话题 · Topic
#Llama.cpp
共 101 条相关资讯
2026.08.24 · 周一工具
DFlash2 与 MTP 投机解码实测:Qwen3.8-27B 量化方案对比
2026.08.24 · 周一工具
llama-cpp-turboquant 集成 ConvRot 量化方法
2026.08.24 · 周一工具
MTP 加速现已可用于 GLM-4.5-Air
2026.08.23 · 周日工具
AMD 自维护 llama.cpp 分支实测:Strix Halo 提示处理速度翻倍
2026.08.23 · 周日工具
在 128GB 内存 + 双 3090 上魔改 llama.cpp 跑 DeepSeek-V4-Flash
2026.08.23 · 周日开源
社区开发者推出 llama.cpp AMD GFX906 优化分支
2026.08.22 · 周六工具
本地大模型新基准 ctx-cliff:定位 VRAM 与上下文极限
2026.08.22 · 周六工具
GLM-5.2 本地推理基准:ubatch 尺寸显著影响长 prompt 吞吐
2026.08.22 · 周六工具
llama.cpp 正式发布 0.2.0 版本
2026.08.22 · 周六开源
dots3-note 开源权重亮相:280B MoE 多模态模型
2026.08.22 · 周六工具
Llama.cpp 出现 DSpark PC Tree 推测解码分叉
2026.08.21 · 周五工具
DFlash2 对比 MTP 投机解码实测:速度快两成但上下文缩水近四成
2026.08.20 · 周四开源
llama.cpp 新 PR:用 AVX2 大幅加速 IQ 量化 CPU 推理
2026.08.20 · 周四工具
4070 Ti 跑 35B MoE 实测:Ornith-1.5-A3B 推理约 55 tok/s
2026.08.20 · 周四开源
社区为新模型 Ornith 1.5 提供量化版本并发布对比数据
2026.08.20 · 周四开源
DFlash2 推测解码加速 Qwen3 实测:推理速度最高提升约 3 倍
2026.08.19 · 周三工具
llama.cpp 拟新增稠密模型 CPU 卸载选项,可让 16GB 显存运行 27B 模型
2026.08.19 · 周三工具
DFlash 2 发布:支持 Qwen 3.8 27B 与 Muse Glimmer 的推测解码方案
2026.08.19 · 周三开源
1-bit 与 Ternary 低比特模型生态进展汇总
2026.08.19 · 周三开源
Ling-3.0 正式支持 llama.cpp,Intel Arc B580 推理基准出炉
2026.08.18 · 周二工具
DeepSeek V4 Flash Q4 量化版在 4×RTX 3060 上的实测记录
2026.08.18 · 周二工具
llama.cpp 引入自适应 MTP 模式:动态调整推测解码深度
2026.08.17 · 周一工具
llama.cpp 切换语义化版本号,首个正式标签 v0.1.0 发布
2026.08.17 · 周一开源
Ling 3.0 两款推理模型合并支持进 llama.cpp
2026.08.17 · 周一工具
llama.cpp 升级 ROCm 至 7.14,Radeon 780m iGPU 基准对比 Vulkan
2026.08.16 · 周日开源
Qwen3 27B 推理档位实测:xhigh 画质更佳但耗时约为 low 的 7 倍
2026.08.16 · 周日工具
M1 Max 本地跑 Qwen3 量化版,一句话生成网页俄罗斯方块
2026.08.16 · 周日工具
privibe:面向本地推理的 Mistral Vibe 隐私分支
2026.08.16 · 周日行业动态
Qwen 3.8 27B 在苹果芯片上量化与 MTP 的反直觉性能差异
2026.08.14 · 周五工具
llama.cpp 服务器 WebUI 新增沙箱容器内执行工具命令能力
2026.08.14 · 周五工具
玩家用 RTX 5090 + 5060 Ti 本地跑通 2.4T 参数 Qwen3 MoE
2026.08.13 · 周四开源
llama.cpp 新 PR 利用 F16C 指令优化提示处理提速 17-31%
2026.08.12 · 周三工具
老矿卡跑大模型:四块 GA100 64GB 实战测评
2026.08.11 · 周二开源
ROCm 7.14 加入 llama.cpp 构建目标,首次采用 TheRock 系统
2026.08.10 · 周一工具
本地编码智能体 Ante 0.2 发布,主打 llama.cpp 离线管理
2026.08.10 · 周一开源
llama.cpp 新增 Muse Glimmer 模型 Day 0 推理支持
2026.08.10 · 周一工具
Qubitz:面向本地 7B–35B 大模型的代理框架
2026.07.31 · 周五工具
CPU 推理优化实战:重写输入格式让小模型快 6.5 倍
2026.07.30 · 周四工具
llama.cpp 合并支持 Ternary-Bonsai-8B-Q2_0 的 CUDA 推理 PR
2026.07.30 · 周四工具
MindControl for llama.cpp 发布基准测试,推理 token 减半且精度不损
2026.07.30 · 周四工具
双卡 4090+5060Ti 本地推理实测:35B MoE 达 206 t/s
2026.07.30 · 周四工具
llama.cpp 默认加载 MTP 张量,即便未启用推测解码也会占用额外显存
2026.07.30 · 周四工具
Kimi K3 社区首测:768GB DDR5 + 双 5090 跑出 50–70 t/s 预填充
2026.07.29 · 周三开源
llama.cpp 合并 PR:新增 GLM-5.2 推测解码支持
2026.07.29 · 周三工具
Kimi 大模型 GGUF 本地推理实测:速度仅 0.23 tok/s
2026.07.28 · 周二工具
llama.cpp 合并 DSpark 推测解码 支持 DeepSeek 系列加速推理
2026.07.27 · 周一工具
开发者推出 llmux:统一管理 vLLM 与 llama.cpp 的模型参数切换
2026.07.27 · 周一开源
MiniMax-M3 视觉支持已合并至 llama.cpp
2026.07.27 · 周一开源
MiniMax M3 模型支持合并入 llama.cpp
2026.07.26 · 周日研究论文
MI50 推理功耗实测:50W 即可获得七成峰值速度
2026.07.26 · 周日工具
llama.cpp 全面支持 MCP,本地模型可实现代理式对话
2026.07.26 · 周日工具
Slipstream:让 36GB 内存 MacBook 流式跑 35B–480B MoE 模型
2026.07.26 · 周日开源
TensorSharp 开源 LLM 推理引擎亮相,自称对 llama.cpp 不落下风
2026.07.25 · 周六工具
llama.cpp 原生 MTP 推测解码实测:稠密提速明显,MoE 收益有限
2026.07.25 · 周六工具
CachyLLama:给 llama.cpp 加持久化 KV 缓存的本地推理分支
2026.07.25 · 周六行业动态
推测解码:本地大模型的免费加速开关
2026.07.25 · 周六工具
CachyLLama:llama.cpp 分支加入持久化 KV 缓存,缓解本地智能体长会话卡顿
2026.07.25 · 周六工具
实测发现:Qwen MoE 模型用 llama.cpp 推理时,E 核反而比 P 核更快
2026.07.23 · 周四工具
Atomic TurboQuant:面向小量化模型的运行时与 6.4 倍 KV cache 压缩
2026.07.23 · 周四工具
Atomic 开源本地智能体 Atomic Agent
2026.07.23 · 周四行业动态
llama.cpp 拟正式接受 AI 生成代码贡献,社区反应不一
2026.07.23 · 周四工具
Poolside 修复 Laguna S 2.1 推理模式模板缺陷
2026.07.23 · 周四工具
MindControl:基于 llama.cpp 分支的推理过程注入引导工具
2026.07.22 · 周三工具
llama.cpp 新增 Laguna XS.2 与 M.1 模型支持
2026.07.22 · 周三开源
llama.cpp 新增对 Laguna XS.2 与 M.1 两款 MoE 编程模型的支持
2026.07.21 · 周二工具
AI 编程工具 pi 0.81.0 集成 llama.cpp 支持
2026.07.21 · 周二开源
llama.cpp 新 PR:ROCm 提示处理提速约 15%,修复 Q2_K 性能 bug
2026.07.20 · 周一工具
BeeLlama.cpp v0.4.0 发布:聚焦 KV cache 量化,新增 KVarN 与精度尾部机制
2026.07.14 · 周二工具
Atomic Chat 推出 DFlash,本地 Qwen 模型推理提速 2.2 倍
2026.07.09 · 周四工具
llama.cpp 修复 DeepSeek V4 Flash 卡死与崩溃
2026.07.08 · 周三工具
llama.cpp 合并 Q2_0 量化 支持 1.58-bit 三元 Bonsai 模型
2026.07.08 · 周三开源
DFlash 投机解码登陆 llama.cpp,Qwen3.6-27B 长上下文实测 4.44 倍提速
2026.07.07 · 周二工具
mistral.rs v0.9.0 发布:CPU 解码速度较 llama.cpp 最高提升 1.8 倍
2026.07.06 · 周一工具
llama.cpp 为 ARM 端 NVFP4 添加查表优化,CPU 推理速度提升超 5 倍
2026.07.06 · 周一工具
llama.cpp 提交 HIP 构建启用 ffast-math,AMD GPU 推理小幅提速
2026.07.06 · 周一工具
llama-server 跨重启丢 KV 缓存的根因与修复
2026.07.06 · 周一工具
开发者推出 Kivarro:面向 llama.cpp / mistral.rs 的本地推理桌面工作台
2026.07.06 · 周一工具
开发者发布 Kivarro 本地大模型推理一体化工作台
2026.07.05 · 周日工具
开源本地 LLM 推理工作台 Kivarro 发布 v0.1 Alpha
2026.07.05 · 周日工具
Rust 从零写的 LLM 推理引擎 Kortex:20GB 显卡跑 70B 模型
2026.07.03 · 周五工具
用户实测 DeepSeek V4 Pro 本地批量推理性能
2026.07.03 · 周五开源
Step 3.7 Flash 长推理卡顿问题或在 llama.cpp 中得到修复
2026.07.03 · 周五工具
社区补丁让 RTX 5090 本地跑 DeepSeek V4 Flash 1M 上下文
2026.07.02 · 周四工具
DGX Spark + Strix Halo 拆分推理实测
2026.07.02 · 周四工具
Kimi K2.7 Code 混合推理基准:Mac 加 RTX PRO 6000 的 RPC 实测
2026.07.02 · 周四工具
llama.cpp Windows CUDA 12.4 构建遭 Defender 误报为木马
2026.07.01 · 周三工具
DeepSeek-V4-Flash MXFP4 推理显存异常:KV 缓存量化类型影响计算缓冲区约 3 倍
2026.06.30 · 周二工具
Qwen3.6-27B 单卡 3090 推测解码横评:ik_llama 最快,mainline 最稳
2026.06.30 · 周二工具
社区发布 Qwen3.5/3.6 MTP 张量 GGUF 子集
2026.06.30 · 周二工具
llama.cpp 个人分支新增循环检测采样器
2026.06.30 · 周二工具
Ornith 35B 搭配 DFlash 草稿模型,本地推理获 30–40% 加速
2026.06.30 · 周二开源
DeepSeek V4 支持合并入 llama.cpp,本地推理即将可用
2026.06.29 · 周一工具
Off Grid:Mac 本地一体化运行聊天、图像与语音 AI 工具发布
2026.06.29 · 周一行业动态
NASA 测试本地大模型 为深空任务打造 AI 医疗助手
2026.06.29 · 周一工具
llama.cpp 社区分支实现运行时跳过 Transformer 层
2026.06.29 · 周一开源
llama.cpp 出现 DeepSeek V4 支持 PR
2026.06.29 · 周一开源
Ornith-35B GGUF 引入 MTP 投机解码
2026.06.28 · 周日开源
DFlash 推测解码支持合并进 llama.cpp
2026.06.28 · 周日行业动态
DuckDuckGo 对本地 LLM 搜索请求弹出 CAPTCHA
2026.06.28 · 周日研究论文
