2026.08.12 · 周三工具
←返回首页话题 · Topic
#量化
共 26 条相关资讯
2026.08.12 · 周三工具
社区开发者发布 Muse Glimmer 30B 多档 GGUF 量化版本
2026.08.12 · 周三开源
DeepSeek V4 0731 量化与基准测试:发现转换漏洞并对比 38 个版本
2026.08.12 · 周三开源
Ling-3.0-flash 量化测试:单卡全档速度几乎持平
2026.08.10 · 周一研究论文
KLQ 量化新法:免训练 W4A4KV4 接近训练方案
2026.07.30 · 周四工具
llama.cpp 合并支持 Ternary-Bonsai-8B-Q2_0 的 CUDA 推理 PR
2026.07.30 · 周四开源
社区自量化 Kimi K3:Q3_K_S 版 1.1 TB 可在纯 CPU 推理
2026.07.30 · 周四开源
Unsloth 发布 Kimi K3 量化版本,最低 594GB 可本地运行
2026.07.28 · 周二研究论文
DeepSeek V4 Flash 在 AMD Strix Halo 上跑出 32 tok/s
2026.07.28 · 周二开源
DeepSeek V4 Flash 在 128GB 锐龙 AI MAX+ 上跑到 32 tok/s
2026.07.27 · 周一研究论文
Qwen3.6-27B 投机解码跨量化基准测试:DFlash 综合最快
2026.07.25 · 周六研究论文
IST-DASLab 提出 SLQ 量化方法:3.3 比特实现任务级无损压缩
2026.07.24 · 周五工具
社区定制内核把 Qwen3.5 35B A3B 推到 RTX 5060 Ti 上 55 tok/s
2026.07.24 · 周五行业动态
梁文锋的两种面孔:AI 梁圣与量化代表
2026.07.19 · 周日研究论文
任务导向压缩研究:消费者敏感度决定编码胜负
2026.07.08 · 周三工具
llama.cpp 合并 Q2_0 量化 支持 1.58-bit 三元 Bonsai 模型
2026.07.08 · 周三工具
Qwen3.6-27B KV 缓存量化实测:Q6 不量化 KV 接近 Q8 水平
2026.07.05 · 周日工具
Qwen 3.6 27B VLLM 基准测试:BF16 / FP8 / NVFP4 量化对比
2026.07.01 · 周三开源
社区上线 DeepSeek V4 Flash 多比特 GGUF 量化版
2026.06.30 · 周二开源
Bartowski 发布 DeepSeek-V4-Flash 的 GGUF 量化版本
2026.06.30 · 周二开源
NVIDIA 上架 Qwen3.6-27B NVFP4 量化权重
2026.06.29 · 周一工具
纯 CPU 跑 GLM 5.2:512GB 内存 Epyc 服务器实测
2026.06.29 · 周一行业动态
社区实测:低量化大模型能否击败高量化小模型?
2026.06.29 · 周一开源
Ornith-35B GGUF 引入 MTP 投机解码
2026.06.28 · 周日开源
4×3090 实测 Step-3.7-Flash:全驻留量化反超更高级别,MTP 与视觉互斥
2026.06.28 · 周日研究论文
