2026.08.13 · 周四行业动态
←返回首页话题 · Topic
#基准测试
共 87 条相关资讯
2026.08.12 · 周三研究论文
研究发现可完全解码 Claude 与 GPT 隐藏推理过程
2026.08.12 · 周三行业动态
AI 智能体加速半导体新材料发现,YC 团队发布材料发现基准
2026.08.12 · 周三模型发布
通义 Qwen 模型在 Legal Research Bench 排名升至第 4
2026.08.12 · 周三研究论文
Reddit 用户实测:32GB 显卡跑 Qwen 27B/35B,前沿模型仍更可靠
2026.08.12 · 周三开源
DeepSeek V4 0731 量化与基准测试:发现转换漏洞并对比 38 个版本
2026.08.12 · 周三工具
LocalLLaMA 用户实测:Muse Glimmer 30B 与 Qwen 27B、Gemma 31B 推理对比
2026.08.11 · 周二研究论文
USC 研究:音频大模型「听」不如「读」,语音情感理解普遍偏弱
2026.08.10 · 周一模型发布
韩国 Motif-3 模型发布,综合基准略胜 Qwen 3.7 Max
2026.08.09 · 周日行业动态
Together AI:DeepSeek V4 Flash 编码任务成本约为 GPT-5.6 Luna 三分之一
2026.08.07 · 周五行业动态
Together AI 对比 DeepSeek-V4 Flash 与 GPT-5.6 Luna:前者成本约 1/6,性能达八成
2026.08.06 · 周四模型发布
Qwen3.8-Max 登上 Artificial Analysis 智能与智能体指数前列
2026.08.06 · 周四行业动态
Kimi K3 传在法律基准上接近 Claude 两倍得分
2026.08.06 · 周四行业动态
Together AI 声称在 Kimi K3 多项推理基准中领先
2026.08.06 · 周四模型发布
DeepSeek V4 Flash 基准跑分反超 V4 Pro Preview
2026.07.30 · 周四行业动态
前沿 AI 基准测试正失去人类基线对比
2026.07.30 · 周四工具
MindControl for llama.cpp 发布基准测试,推理 token 减半且精度不损
2026.07.30 · 周四研究论文
多模态大模型动机推理受质疑:新基准 MultivationBench 揭示短板
2026.07.30 · 周四研究论文
新基准 StatMechBench-v0 评估 AI 智能体发现统计力学结构的能力
2026.07.30 · 周四行业动态
OpenAI 发文谈基准测试与长时智能体的推理延续
2026.07.30 · 周四研究论文
OpenAI 透露 GPT-5.6 Sol 数学与 ARC-AGI-3 实测细节
2026.07.30 · 周四产品功能
Ideogram 称 Object Remover 在 RemovalBench 排名第一
2026.07.30 · 周四工具
Kimi K3 社区首测:768GB DDR5 + 双 5090 跑出 50–70 t/s 预填充
2026.07.28 · 周二工具
Apple Silicon 上 LLM 推理速度实测:开源原始基准数据
2026.07.28 · 周二研究论文
35B 编码模型 120 轮对比:KAT-Coder 效率领先
2026.07.28 · 周二模型发布
微软推出网络安全模型 MAI-Cyber-1-Flash 与多智能体框架 MDASH
2026.07.27 · 周一研究论文
研究:22 款前沿大模型在网络安全基准测试中普遍作弊
2026.07.27 · 周一研究论文
SCOPE 基准与 SCION 流水线:面向文本的 Schema 归纳与融合评估
2026.07.26 · 周日行业动态
IOAI 2026 新增 AI 模型赛道,首向智能体颁发官方奖牌
2026.07.26 · 周日开源
23 款 Gemma 4 E4B 衍生模型对比:下载量最高者反而最差
2026.07.26 · 周日工具
LLM 评测的两个噪声来源与处理方法
2026.07.26 · 周日研究论文
UC Berkeley 联合 Anthropic、OpenAI、Google 发布 ExploitGym 基准
2026.07.25 · 周六工具
FoodTruck Bench:让 AI 当 30 天餐车老板,谁更会做生意?
2026.07.24 · 周五研究论文
AI 写基准:Codex 自主生成元评测论文
2026.07.24 · 周五研究论文
InferenceBench:衡量 AI 智能体优化大模型推理能力的新基准
2026.07.23 · 周四研究论文
GPT/Claude/Gemini/Kimi 真实任务成本差 10.6 倍,隐性推理 token 是元凶
2026.07.23 · 周四工具
LocalMaxxing:聚焦本地 LLM 推理的社区基准平台
2026.07.23 · 周四研究论文
研究者严格测试:AI 实验室是否在「骑自行车的鹈鹕」上做过优化
2026.07.23 · 周四研究论文
骑自行车的鹈鹕:1008 张图实测 AI 实验室是否在刷榜
2026.07.22 · 周三研究论文
端侧语音识别基准第二轮:苹果原生引擎紧追英伟达 Parakeet
2026.07.22 · 周三研究论文
无需重训练即可跨方言泛化:模式约束解码在 MLIR 上的基准与评估
2026.07.22 · 周三研究论文
SysAdmin 基准:前沿大模型权力寻求倾向如何
2026.07.22 · 周三行业动态
Kimi K3 登顶 ErrataBench 前十,成首个突破 90% 的开放权重模型
2026.07.22 · 周三行业动态
Laguna-S-2.1 本地实测:速度领先,但事实幻觉严重
2026.07.21 · 周二行业动态
GPT-5.6 三档与 Claude Fable 5 物理建模对决:Fable 以 0.889 加权分领跑
2026.07.21 · 周二研究论文
DeepSWE:评估 AI 编程代理的新基准
2026.07.21 · 周二研究论文
DeepSWE:面向 AI 编程智能体的新一代基准
2026.07.20 · 周一研究论文
研究提出 AI 代理管理「胁迫与欺骗」基准
2026.07.20 · 周一行业动态
四项独立指标交叉印证:AI 能力「曲棍球杆」拐点出现
2026.07.19 · 周日研究论文
ASCIITermDraw-Bench:用纯文本画图,考验视觉语言模型的另一项硬功夫
2026.07.18 · 周六行业动态
Reddit 用户称 Kimi K3 登顶 SpreadsheetBench 2
2026.07.18 · 周六行业动态
Together AI 称 Kimi 在编程任务上以约三折价格追平 Claude
2026.07.17 · 周五开源
Kimi K3 基准表现亮眼,开放权重预计 7 月 27 日发布
2026.07.11 · 周六行业动态
TestingCatalog 称 Grok 4.5 在 WANDR 基准上居首
2026.07.10 · 周五行业动态
传闻:OpenAI GPT‑5.6 智能体表现抢眼,Agents' Last Exam 创新高
2026.07.09 · 周四模型发布
OpenAI 语音模型 GPT-Live-1 曝光,多项基准超越 Advanced Voice Mode
2026.07.08 · 周三研究论文
本地小模型技术问答实测:RAG 加持下准确率显著提升
2026.07.08 · 周三行业动态
沃顿教授点评微软 MAI-1:自测基准逊于 Sonnet 4.6,独立验证尚缺
2026.07.07 · 周二研究论文
AAI Labs 发布 DGX Spark 本地大模型行政任务基准
2026.07.07 · 周二产品功能
SageMaker AI 推出 MLflow 集成,自动流式记录推理基准结果
2026.07.06 · 周一研究论文
小型 TTS 模型 CPU 基准:Pocket TTS 架构独特,UTMOS 评分存盲区
2026.07.06 · 周一工具
Pocket TTS:CPU 上跑 5 秒声音克隆的 MIT 开源模型
2026.07.06 · 周一工具
FlowerBench:面向企业真实工作流的 AI 智能体基准
2026.07.06 · 周一研究论文
企业Agent真实任务评测:EnterpriseClawBench基准
2026.07.06 · 周一研究论文
AI 能否胜任事实核查?专业核查员与基准测试给出的答案是:还不行
2026.07.05 · 周日工具
Qwen 3.6 27B VLLM 基准测试:BF16 / FP8 / NVFP4 量化对比
2026.07.05 · 周日研究论文
13 款本地大模型长上下文实测:prefill 才是关键
2026.07.05 · 周日研究论文
AI Agent 一周挑战三道核工程基准
2026.07.04 · 周六研究论文
Reddit 用户实测 8 款本地模型:Gemma-4-31B 领跑奇幻 RP 基准
2026.07.03 · 周五工具
用户实测 DeepSeek V4 Pro 本地批量推理性能
2026.07.03 · 周五研究论文
社区推出 Surface Evolver Bench:用物理仿真代码生成能力测试 LLM
2026.07.03 · 周五行业动态
Together AI:GLM 5.2 以两成价格达 Sonnet 5 八成能力
2026.07.03 · 周五研究论文
拉马努金挑战赛上线:用 AI 证明数学常数公式
2026.07.03 · 周五行业动态
RTX 3090 本地实测:三款开源模型基准对比
2026.07.02 · 周四工具
开发者开源 VCCB 基准:测试多模态模型读懂日历截图
2026.07.01 · 周三研究论文
研究提出 CoPref 框架:AI 智能体应帮用户构建偏好,而非仅被动询问
2026.07.01 · 周三研究论文
Hugging Face 发布 ScarfBench:AI Agent 企业级 Java 框架迁移基准
2026.07.01 · 周三模型发布
Anthropic 推出 Claude Sonnet 5,性能接近 Opus 4.8
2026.07.01 · 周三产品功能
Cursor 接入 Claude Sonnet 5,CursorBench 得分提升 8 个百分点
2026.07.01 · 周三研究论文
OpenAI 发布 GeneBench-Pro 基准,衡量 AI 代理生物数据判断力
2026.07.01 · 周三研究论文
OSWorld2.0 发布:长链路真实任务下的电脑操作 Agent 基准
2026.06.30 · 周二研究论文
Graph-RAG 还是无图多跳 RAG?社区基准测试引发讨论
2026.06.30 · 周二研究论文
AIMAC 代码无障碍榜单:GPT 5.4 Mini 居首
2026.06.30 · 周二行业动态
AI 智能体真实任务仅完成约三分之一,可靠性随步骤指数衰减
2026.06.29 · 周一研究论文
社区测试:去拒绝训练后 MoE 模型数学与代码反超原版
2026.06.29 · 周一研究论文
NormAct 基准:多模态大模型在具身规划中难以遵循隐性社会规范
2026.06.28 · 周日行业动态
