桃子桃子快讯
返回首页
研究论文

C4 评测框架:测试多模态大模型能否「读懂」中文成语的跨概念创意

研究者提出基于中文成语的 C4 评测集,测试十款多模态大模型在跨概念创意理解任务上的表现,最强闭源模型准确率仅约 50%…

2026.08.10 · 周一3 分钟阅读

多模态大模型(MLLM)在图像描述、视觉问答等任务上进展迅速,但它们能否像人类一样,从非显而易见的概念关联中「解码」出创作者想要表达的含义,仍是一个相对空白的评测方向。arXiv 上发表的一篇论文提出了名为 C4 的认知启发式评测框架,专门考察 MLLM 在中文成语语境下的「跨概念创意」理解能力。

C4 框架的设计思路

作者将跨概念创意理解拆解为两个过程:跨概念编码(item construction)与跨概念解码(model inference)。前者把成语中的目标概念,映射到一张由人工标注并经第三方审核的「跨概念网络」中可被图像化的替代概念上,并记录下连接二者的「桥接路径」。后者则模拟模型在看到图像后,能否逆向还原出原本的成语语义。

这套设计带来三个直接收益:一是支持批量生成结构明确的题目;二是难度可由桥接数量与深度量化;三是每道题都有确定的正确答案,便于自动评估。

评测集 C4-Eval 的构成

基于上述框架,作者构建了 C4 评测集(C4-Eval),共包含两部分:

  • 184 道合成题目,依据桥接路径自动生成;
  • 37 道来自网络的人工创作跨概念成语图,由作者手工构建并审核其概念关系、桥接路径与推理过程。

每道题被实例化为五种任务设置,最终得到 884 个主要的「答案还原」测试用例,覆盖从纯视觉到含提示辅助的不同难度梯度。

十款主流 MLLM 的实测结果

研究团队在 C4-Eval 上测试了十款多模态大模型,覆盖闭源与开源两条路线。主要发现包括:

  • 最强的闭源模型在主任务上准确率分别为 50.7% 与 48.0%,均未过半;
  • 开源模型整体表现明显更低,与闭源模型存在可见差距;
  • 在作答时加入「候选概念约束」可显著拉升准确率;
  • 提供桥接提示或要求模型给出解释,所带来的提升相对有限。

这一结果说明,即便具备较强的视觉与语言能力,当前主流 MLLM 在「通过跨概念关系解码被创意编码的含义」这一认知层面,依然存在相当大的能力空缺。

研究意义与局限

C4 把人类语言中一类高密度、依赖文化与联想的创意表达——中文成语——转化为可量化、可复现的评测对象,为衡量 MLLM 的高阶认知能力提供了一种新工具。同时,作者明确指出了评测边界:题目以中文成语为载体,对其他语言或非成语类跨概念创意的泛化性仍待进一步验证;论文代码随补充材料发布,方便后续研究复现与扩展。

信源