桃子桃子快讯
返回首页
开源

Om AI 联汇完成数亿元融资,同日开源端侧多模态模型 VLX-Seek 1.5

Om AI 联汇 8 月 6 日宣布完成数亿元融资,并开源端侧流式多模态模型 VLX-Seek 1.5,含 3B 与 1…

2026.08.10 · 周一4 分钟阅读

AI 公司 Om AI 联汇于 8 月 6 日同步宣布两件事:一是由前海母基金领投完成数亿元融资;二是旗下端侧流式多模态模型 VLX-Seek 1.5 正式开源,提供 3B 与 10B 两个参数版本。该模型定位面向具身智能、无人机巡检、智能终端等物理 AI 场景,强调「端侧原生」架构与「流式多模态」输入方式。

融资与开源同步落地

Om AI 联汇此次融资规模为「数亿元」,领投方为前海母基金。公司同时宣布 VLX-Seek 1.5 向开发者开放。官方将这一组合类比云原生早期阶段:一方面通过开源吸引开发者接入,另一方面以资本投入验证路线价值。不过,融资金额、参与方细节以及开源仓库地址等具体信息,原文未给出。

「端侧原生」与「端侧部署」的区别

物理 AI 场景对延迟、功耗、隐私和部署成本有较高要求,工厂机器人、巡检无人机与家庭终端往往不能完全依赖云端。传统的「端侧部署」做法是先把大模型训练好,再通过压缩、蒸馏、量化等方式迁移到端侧。Om AI 联汇强调 VLX 系列在架构设计阶段就以端侧算力、延迟、功耗、部署成本为约束条件,主张「端侧原生」而非「迁移式部署」。这一区分是公司对外叙事的主要技术立论点。

三层心智链路与流式多模态

VLX-Seek 1.5 接收持续视频流输入,在端侧实时理解并输出决策,包含三层结构:

  • Flow:持续注意力层,让模型从「看不见」到「看得清」;
  • Seek:精细推理层,让模型从「看不准」到「看得准」;
  • Go:执行控制层,让模型从「动不了」到「自主行动」。

相比传统视觉语言模型(VLM)的「拍一帧→上传云端→等待推理→返回结果」批处理模式,VLX-Seek 1.5 试图在端侧完成连续视频流处理,避免将物理世界的连续感知切割为静态快照。

公开评测结果

官方测试覆盖通用目标检测、指代表达理解、无人机视角感知、具身空间推理与目标幻觉等多个方向,主要对比对象为英伟达 LocateAnything 系列及其他开源或闭源模型。以下数据均来自原文:

  • 通用检测(LVIS Mean):VLX-Seek 1.5-3B 达到 57.5,相比 LocateAnything-3B 的 50.7 提升 13.4%;
  • 指代表达理解(RefCOCOg test Mean):VLX-Seek 1.5-3B 达到 80.2,相比 LocateAnything-3B 提升 3.4%;
  • 无人机视角(RefDrone):VLX-Seek 1.5-3B 的 F1 指标达到 73.2,相比 LocateAnything-3B 的 52.3 提升 40%;实例准确率 Acc 达到 58,相比 35.6 提升 62.9%;
  • 目标幻觉(RefDrone FP/GT):VLX-Seek 1.5 为 18,LocateAnything-3B 为 71.3。

上述评测均为公司自测,测试条件、对比基线与第三方复现情况尚未见公开披露。

商业化与生态布局

围绕 VLX 基座,Om AI 联汇构建了若干面向端侧的智能体与应用:

  • OmAgent:定位「一脑多形」智能体平台,用于推动 AI 走进物理场景;
  • OttoPlex 御行:已在具身场景落地(具体客户与规模未披露);
  • OttoBox AI Studio:与联想、苹果合作推出 AI PC 产品;
  • Homer AI:自研可穿戴 AI 视觉中枢,原文称已服务全国近 10 万视障用户,平台月均 AI 调用达千万次。

公司表示,VLX-Seek 1.5 开源的核心意图是争夺物理 AI 基础能力标准的定义权,借助开发者生态形成反馈飞轮。其商业路径是否成立,仍有待后续落地数据与第三方验证。

信源