Julia-1:144M 参数的跨设备决策模型
基于 mmBERT-small 的 Julia-1 在四项任务上接近并超越参考基线,并可在 CPU、Mac 与安卓平板上…
Julia-1 是一款专为「分类与决策」场景设计的轻量模型,参数量为 1.443 亿,权重文件 550.5 MiB,可在通用 CPU、苹果 Mac M4、Intel 笔记本以及 Android 平板上直接运行。其基础语言模型采用 mmBERT-small,并复用了其分词器,使模型能在多种设备上以本地推理的形式完成路由、分类、有序量表以及是非判断等任务。
接口形式与任务设计
Julia-1 的输入由三部分组成:上下文、问题以及 2 到 20 个候选答案。模型会按候选顺序输出对应得分,并择一作为预测结果。这种「同一接口、不同任务」的设定便于在统一评测协议下比较不同决策能力。例如在客服场景中,模型需在「Billing、Shipping、Account access」等目的地中做选择。
2026 年 9 月 24 日评测结果
本次评测覆盖四类任务,共 2,300 条样本:
- 类型化决策(2,000 条):Julia-1 答对 1,463 条,准确率 73.15%,较 Jev 参考基线(72.70%)领先 0.45 个百分点。
- AG News(100 条,4 类):准确率 94%,参考基线为 91%。
- DAIR Emotion(100 条,6 类):准确率 86%,较参考基线 48% 大幅领先 38 个百分点。
- Banking77(100 条,72 类候选):准确率 64%,低于参考基线的 87%。长尾类目细分为 Julia-1 当前最明确的短板。
此外,模型还在 MASSIVE 多语种意图数据集上覆盖 52 个语种,共 154,648 条样本,整体准确率 71.50%。其中:
- 葡萄牙语(pt-PT):86.25%(2,565 / 2,974)
- 美式英语(en-US):86.75%(2,580 / 2,974)
巴西葡萄牙语、意图分类与槽位填充尚未纳入当前评测。
跨设备推理表现
2026 年 9 月 25 日的纯 CPU 复现中,Julia-1 在 2,000 条类型化决策上取得 72.55% 准确率,AG News 与 DAIR Emotion 与此前结果一致,Banking77 准确率为 60%。该运行采用 PyTorch 2.14.0+cpu、严格编码以及 1,024 token 上限,权重以 SHA-256 df853bf7fe42 标识。
各设备上的延迟与吞吐数据如下:
- Apple M4(单请求):上下文 100 词、4 个选项,平均延迟 33.15 ms,进程占用约 370.6 MiB 内存。
- Apple M4(16 条批量):单批 312.11 ms,吞吐 51.2 条/秒。
- Samsung SM-X510 Android 平板:使用 ONNX Runtime 1.27.0、原生 Rust 分词器,40 条决策耗时约 8 秒(5 条/秒,约 300 条/分钟),覆盖 3,693 tokens,吞吐约 462 tokens/s,单条延迟 193–205 ms,峰值 RSS 393.1 MB;XNNPACK 因 Reshape 算子 miscompile 被本次运行排除。
- Intel Core i5-1235U:Banking77 任务耗时显著拉长(3,713.54 ms),其余任务在 89–295 ms 之间。
局限与后续方向
文章公开评测结果的同时,也承认 Banking77 这类长类目、相似候选场景仍是明确的弱项,Banking77 之外尚有语言拓展(巴西葡萄牙语)与意图分类、槽位填充等任务待补齐。整体而言,Julia-1 把「同一模型、走遍常见设备」作为卖点,但更适合作为路由、客服分流、轻量意图识别等边缘场景的候选方案,而非通用大模型的替代品。
