桃子桃子快讯
返回首页
行业动态

小米 MiMo-V2.6 实测翻车:跑分亮眼,安全与稳定性堪忧

Reddit 资深开发者实测小米 MiMo-V2.6 Pro 与 Flash,发现尽管 AA 基准领先,但实操中存在严重…

2026.09.24 · 周四4 分钟阅读

小米旗下 MiMo-V2.6 系列模型近期在开源社区引发关注。在 Artificial Analysis(AA)基准上,MiMo-V2.6-Pro 取得 46 分的开源模型领先成绩,定价也极低;Flash 版本虽尚未登陆 AA,但在小米自家基准上略低于 Pro,云端价格不到 Pro 一半,且参数量可塞进 192GB 显存,被该作者视为 Gorgon Halo 设备的首批实用场景之一。然而,一位自称资深软件工程师的 Reddit 用户在 r/LocalLLaMA 发文称,亲手测试两款模型后发现,实际能力与基准成绩严重不符,存在明显的安全与稳定性问题,再次引发关于「基准刷分」现象的讨论。

Pro 版:安全审计形同虚设

作者将一项安全敏感任务交给 MiMo-V2.6-Pro:在一个 bubblewrap 沙箱中实现允许 git push、但阻止 --force 等破坏性命令的逻辑,并提供 --no-git 完全关闭 GitHub 写权限的选项。模型在执行前主动提出了若干设计上的边界问题,表现尚可;输出代码后,仅需简单一行命令(如设置环境变量 GIT_STATUS 后再次 git push)即可绕过 --no-git 限制,整体防护水平被形容为「15 年前脚本小子水准」。

随后作者用 GLM-5.3(满血版)对该改动进行安全复审,仅用 3 分钟就发现 9 处明显漏洞,典型例子包括:

  • 默认受限模式下,git push 可正常工作
  • git push --force 与 git push -f 被正确拦截
  • git push -uf 仍可成功覆盖远端
  • 通过 git config alias 可注册别名绕过限制
  • env -u GIT_CONFIG_COUNT /usr/bin/git push --force 直接突破

此外,MiMo 在对话中的文字表达也被吐槽晦涩难懂,频繁需要读两遍才能理解意思,可读性明显逊于 GLM、DeepSeek 与 Qwen。

Flash 版:简单任务消耗 80k token 失控

在 Flash 版本上,作者给出一个相对简单的任务:在 master 上新建分支并 cherry-pick 另一个分支的单个 commit,但指定的工作目录实际上已损坏。理想的「非常聪明」的模型本应注意到沙箱中还有主 git 仓库、同名分支仍可用,并据此恢复;MiMo-V2.6-Flash 却消耗约 80k token 进行了一连串反常操作,先尝试定位主仓库,失败后开始篡改 /tmp、尝试 mount --bind 等危险操作。作者担心,若未做沙箱隔离,模型极有可能已经把主仓库破坏掉。

按官方自发布基准粗略估算,Flash 大致与 GLM-5.3-Flash (high)、Qwen3.8-Flash 同档;但作者实测认为,Flash 的实际能力远不及后者。推理速度约 25 tok/s,作者表示这只是上线初期的供给问题,预计几天内随更多服务商接入会改善。

作者的最终选型建议

基于上述体验,作者明确反对为 MiMo-Flash 专门购置 Gorgon Halo,并建议沿用以下组合:

  • 默认日常使用:DSv4.1 Flash
  • 超低成本场景:GLM-5.3-Flash (high)
  • 高难度任务:GLM-5.3 满血版
  • 本地部署(3080 显卡上 Flash 较慢):Qwen3.8-Flash 与 Qwen3.8-27B

这一案例再次提示业界:基准分数与真实场景下的代码能力之间存在显著落差,仅看厂商自报成绩容易踩坑,对模型进行真实任务级别的安全与可靠性评测不可忽视。

信源