研究论文
新基准揭示大模型几何作图短板:解题强,构图弱
研究者发布包含 954 道奥赛几何题的基准,测试大模型绘制准确几何图的能力,结果平均编译成功率仅 36.14%。
2026.08.20 · 周四约 2 分钟阅读
近期一项发表于 arXiv 的研究指出,当前主流基础模型(如 GPT、Claude)虽然在奥赛级几何解题上表现突出,但「解题」与「作图」并非同一种能力——能否根据题意构造出忠实、可渲染的几何图,是一项尚未被充分评估的独立技能。为此,研究团队发布了一个聚焦「图表推理」(diagrammatic reasoning)的新开源基准,专门衡量模型绘制几何图的能力。
基准构成
该数据集共收录 954 道自包含的奥赛几何题,其中包含 297 题的「困难子集」,每道题均配有完整解题过程以及由人工编写、可在 Asymptote 矢量图形语言中渲染的高保真几何图。研究者同时设计了一套覆盖文本、代码、图像、视觉语言模型(VLM)与几何约束的复合评估指标,用于全面衡量模型输出的作图质量。数据集与代码已在 Hugging Face 公开。
关键发现
在主流基础模型上的评测揭示了一个明显的「解题—构图鸿沟」:模型所生成的图在几何要素的准确性与一致性上远逊于其解题表现,几何代码的平均编译成功率仅为 36.14%。这一结果表明,强大的数学推理能力并不自动等同于构造精确几何图的能力,视觉与几何构造仍是当前模型的薄弱环节。
研究意义
现有几何评测基准(如 MathVista、MathVerse)多聚焦于「答案是否正确」,而该工作首次将「能否画对图」单独剥离出来评测,填补了相关空白。对于关注多模态推理、视觉语言模型以及 AI 在数学与几何领域能力上限的研究者而言,这一基准提供了一个可复现、可量化的测试入口,也有望推动后续工作关注「解题」之外的图形构造能力。
资源获取
- 论文:arXiv:2608.18111v1
- 数据集与代码:https://huggingface.co/datasets/max98765/hard_geometry_problems_with_diagrams
