工具
HFlow 评测:开源视觉模型处理第一人称数据逼近 Gemini
开源框架 HFlow 对比多款开源 VLM 与 Gemini 2.5 Flash 在第一人称数据上的表现,Gemma 系…
2026.08.31 · 周一约 2 分钟阅读
开源视觉语言模型(VLM)在第一人称视角数据处理领域正快速逼近闭源旗舰水平。社区项目 HFlow 近日基于 Build AI 的 Egocentric-10k 数据集,对多款主流开源权重 VLM 进行了系统评测,结果显示 Gemma 系列表现尤为亮眼,与 Gemini 2.5 Flash 的基线水平几乎持平,而成本仅为后者约 5%。
评测方法
该评测沿用了 Build AI 此前使用 Gemini 2.5 Flash 测量手部可见性与主动操作(active manipulation)能力时所用同一套提示词与数据集,仅替换底层模型,从而保证不同模型之间的结果可直接比较。HFlow 本身是一个开源评估框架,开发者可通过 GitHub 自行获取并复现整套实验。
各模型表现对比
以 Gemini 2.5 Flash 在 Egocentric-10k 上取得 91.65% 作为基线,各开源模型的吻合度如下:
- GLM 5.3 Flash:91.00%
- Gemma 4 26B-A4B:90.87%
- Qwen 3.8 27B:90.79%
- Inkling Small:85.21%
其中 Gemma 系列最为突出:在与 Gemini 2.5 Flash 几乎打平的情况下,成本降低约 19 倍,性价比优势显著。
私有化部署的现实意义
Gemma 与 Qwen 两类模型均具备较为友好的自托管条件,开发者可在自有硬件上完成推理,避免数据外传。对于涉及个人隐私或敏感场景的第一人称应用,这一特性具有较高的实用价值。
行业启示
评测结果表明,现代开源权重 VLM 已具备处理大规模第一人称数据的可用能力。在模型能力趋于同质化的背景下,成本、吞吐量、输出稳定性与自托管便利度正成为新的差异化竞争点。对于正在优化多模态处理流程的开发者而言,HFlow 提供了一种可复用的评估手段,可结合自身提示词与候选模型快速完成横向比较。
