桃子桃子快讯
返回首页
研究论文

社区实验:为 DeepSeek V4 Flash 训练视觉连接器

Reddit 用户通过训练 4000 万参数的连接器,让纯文本模型 DeepSeek V4 Flash 具备基础视觉能力…

2026.08.11 · 周二3 分钟阅读

一位 Reddit 用户在 r/LocalLLaMA 板块分享了一项实验:通过训练一个 4000 万参数的连接器,让纯文本大模型 DeepSeek V4 Flash 获得了基础视觉理解能力。实验中只有这个小型连接器参与训练,原始语言模型和视觉编码器均被冻结。

实验架构

系统由三个组件构成:

  • DeepSeek V4 Flash:284B 总参数 / 13B 激活参数的 MoE 模型,保持冻结
  • MoonViT-3d:来自 Kimi K2.6 的 4.17 亿参数图像编码器,保持冻结
  • 4000 万参数的连接器:唯一可训练的组件

图像处理流程为:图像送入 MoonViT 得到 1152 维特征,每 2×2 patch 合并后通过小型 MLP 连接器映射为 4096 维嵌入,最终输入 DeepSeek V4 Flash。每张图像最多使用 512 个视觉 token,训练序列最大长度为 2048 token。

训练数据与设置

训练数据来自 HuggingFaceM4/the_cauldron,采样 10 万条图文对,但其中仅有 39619 张唯一图像,部分子集对同一图像提出多问题。数据混合涵盖通用图文问答、OCR 与文字密集图像、文档与信息图、图表与示意图、科学问答、空间推理、网站截图与 UI 描述等场景。

关键训练参数:

  • 可训练参数:40119040
  • 全局 batch size:128,优化器步数 782
  • 优化器:AdamW,学习率 1e-3,精度 BF16
  • 硬件:5× H200,吞吐约 4938 样本/小时
  • 末段 loss 由 1.0225 降至 0.8301

完整端到端项目支出约 2000 美元,包含数据准备、模型转换、推理验证等环节。

实际效果

最终模型以 NVFP4 量化权重加载,可在 4 张 B200 上运行,对真实图像提示能给出回答,例如识别街道图中的人物、箱体与店铺招牌,识别浏览器截图中的「Upload file」控件,回答 UI 定位问题等。一个 36 token 的图像回答耗时约 7.49 秒,对应生成速度约 4.81 token/秒。

作者将结果定位为「可工作的基础视觉」,而非可与 Qwen3.6-VL 等成熟 VLM 竞争的通用方案,仍存在回答过短、漏读小字、臆造细节、复杂 UI 定位失败等问题,主因是训练规模与多样性不足,而非连接器方案本身无效。

下一步:数据规模是关键

作者建议下一阶段将数据扩展到约 100 万条精心筛选的图文样本,提高唯一图像占比,并覆盖网站与应用界面、文档表格、多种分辨率 OCR、定位问答、空间关系、自然场景、多步视觉指令、负样本等场景。按当前配置线性外推,100 万样本需约 202.5 小时(约 8.4 天)连续训练;考虑到数据集准备、高分辨率特征生成、消融实验与 B200 部署验证等额外环节,完整 100 万样本阶段的合理预算估算为 15000–20000 美元。

信源