空间智能包括丰富的能力,包括形状的可视化和变换、物体的心理旋转、判断关系位置和容纳能力及估计数量。然而,这仍然是多模态大型语言模型(MLLM)面临的一项关键未解决挑战。为填补这一空白,我们提议将欧几里得几何问题解决作为替代任务。具体而言,我们精心构建了一个策划的多模态数据集,称为Euclid30K,包含约30K平面和立体几何问题。为了使模型能够从这些几何问题中获取和应用欧几里得原理,我们采用了群体相对策略优化(GRPO)对Qwen2.5VL系列和RoboBrain2.0系列进行了微调,以激励模型识别形状、计数、关联实体并使用欧几里得原理进行多步推理实验。我们的实验表明,结果模型在四个空间推理基准测试(Super-CLEVR,Omni3DBench,VSI-Bench和MindCube)上获得了显著的零样本增益,而无需任何任务特定的调整。值得注意的是,在对Euclid30K进行训练后,所有评估模型在VSI-Bench上的平均准确率从34.5%上升到40.5%,提高了5.5个百分点。其中,RoboBrain2.0-Euclid-7B达到了49.6%的准确率,超越了之前的最先进模型Spatial-MLLM。据我们所知,这是首次系统性研究表明几何中心微调可以赋予视觉语言模型广泛可转移的空间技能。代码和Euclid30K数据集可以在https://zgca-ai4edu.github.io/EuclidsGift找到。
Lian等人(Mon,)研究了这个问题。