← 返回研究 多模态评测 · COLM 2025

SEAM

同一份体检报告,纸质版和手机截图不该得出两种诊断;视觉语言模型的答案,却常随格式而变。SEAM 把这种不一致量化出来。

arXiv OpenReview GitHub Dataset Leaderboard
21评测模型
16任务
4领域
3,200基础题目
9,600评测条目

同一个棋局,可以画成棋盘,也可以写成一行记谱;同一个分子,可以画成结构图,也可以写成一串字符。信息完全相同,只是形式不同。我们默认“既能看图又能读文字”的 AI 模型在两种形式下会给出同一个答案——SEAM 的测量显示,目前远非如此。

平均准确率(%)30405060708030405060语言—视觉一致性(%)· 同一道题的文字版与图像版一致性 60%准确率 60%高准确率,低一致性四个模型准确率越过 60%,一致性却无一越过 60%。GPT-5 · GPT-5-miniClaude-4.1-OpusClaude-4-SonnetClaude-3.7-SonnetGPT-5-nanoGPT-4oQwen2.5-VL-72BLlama3.2-11B
据论文重绘,数值为近似值。21 个视觉语言模型的平均准确率与语言—视觉一致性——同一道题的文字版与图像版给出相同答案的比例。只有 GPT-5 与 GPT-5-mini 在两个维度上同时越过 60%。

换一种形式,答案就变了

能同时处理图像与文字的大模型,统称视觉语言模型(VLM)。它们在演示中读图表、答文档,表现常常令人印象深刻。但要把判断托付给这样的系统,有一个更基础的要求:同一份信息,无论以图片还是文字呈现,结论应当一致。答案会随文件格式改变的助手,无法让人放心使用。

过去的多模态测试大多把文字截图进图片里,属于 OCR 式测试(OCR:从图片中识别文字),分不清模型究竟是“看不懂图”还是“读不懂题”。SEAM 把“同一语义、不同模态”做成可控实验:每道题都有文字版、图像版和图文并排版,模型在三种条件下分别作答,结果互相对照。

四个领域的等价表示

可控的关键在于“等价”。SEAM 选择了四个天然拥有成熟文字记法与视觉表示的领域:国际象棋有 FEN(用一行字符完整记录棋盘局面的标准记法)与棋盘图,化学有 SMILES(用字符串描述分子结构的化学记法)与分子图,音乐有 ABC 记谱(用字母符号记录乐谱的文本格式)与五线谱,图论有邻接矩阵(用表格记录节点连接关系)与节点边图。文字和图像各自是该领域的原生表示,承载的信息严格相同。

如此构造出的成绩差异,只能来自模型对不同表示形式的处理,而与任务难度无关。

领域Chess · Chemistry · Music · Graph theory
任务16 个任务,每个领域 4 个
条目3,200 道基础题;语言、视觉、图文三种条件共 9,600 次评测
模型21 个前沿 VLM,覆盖闭源与开源系统

21 个模型的一致性测量

全部 9,600 次评测覆盖 21 个前沿 VLM,包括闭源与开源系统。总体规律清晰:模型在文字侧通常更强,视觉侧明显更弱;更值得注意的是,同一个模型对同一道题的文字版和图像版,经常给出不同答案。这说明系统尚未学到稳定的跨表示推理。

国际象棋化学音乐图论文字图像图文文字图像图文文字图像图文文字图像图文GPT-50.7100.7460.7340.9100.7580.9330.8060.3430.7640.7910.6840.999GPT-4o0.6240.6440.6240.6500.5730.6530.5400.3280.4950.7250.3820.738Claude-4.1-Opus0.8060.7180.7940.9450.8510.9460.5810.3480.5800.9740.3940.936Claude-3.5-Haiku0.6230.5490.6350.5740.5290.5890.3610.3010.2900.5610.3530.471Qwen2.5-VL-72B0.5420.5860.5710.5750.5590.6090.4250.3410.3730.6470.4140.524InternVL3-78B0.5490.5490.5600.4680.4460.5050.4110.2850.3610.5740.4300.502Llama3.2-90B0.4950.5380.5350.5010.3630.5510.3310.2690.2760.4090.3670.393Gemma3-27B0.5220.5450.5170.5290.4990.5150.4300.3300.3540.5810.3390.414单元格为准确率。每个领域各评测三次:原生文字记法、图像、图文并排。同一批图论题目:Claude-4.1-Opus 文字输入 0.974,图像输入只剩 0.394。
据论文重绘。21 个模型中取 8 个,在四个领域、三种输入条件下的准确率。文字侧几乎在所有位置领先视觉侧;把五线谱当作图像来读是整个基准的下限,完整表格中没有任何模型越过 0.41。
系统之间的两两一致性 · 文字条件GPT-5GPT-5miniGPT-5nanoClaude4.1 OpusClaude4 SonnetClaude3.7 SonnetGPT-51.0000.8640.8090.7490.7330.698GPT-5-mini0.8641.0000.7990.7560.7440.708GPT-5-nano0.8090.7991.0000.6830.6640.643Claude-4.1-Opus0.7490.7560.6831.0000.8220.777Claude-4-Sonnet0.7330.7440.6640.8221.0000.778Claude-3.7-Sonnet0.6980.7080.6430.7770.7781.000同一厂商内部:0.777–0.864 · 跨厂商:0.643–0.756任何一对跨厂商模型的一致性,都低于最弱的同厂商模型对。
据论文重绘。两个系统在文字条件下对同一道题给出相同答案的比例。两个厂商家族各自成块;换成图像输入后,同样的模型对之间降至 0.50–0.66。
  • 视觉常常落后于语言。即便信息等价,视觉通道仍更容易掉分。
  • 一致性不会自动出现。同一题换一种表示,答案就可能改变。
  • 错误可诊断。文字侧常见符号解析失败;视觉侧常见结构幻觉——模型“看到”图中并不存在的棋子、化学键或连线。

给多模态评测的新坐标

给“模态无关推理”一个干净坐标。SEAM 让研究者能看清模型到底是看不懂、读不懂,还是不能把两种表示映射到同一语义。
适合作为 VLM 回归测试。新模型如果只提升平均分但不提升一致性,仍然不能说自己真正更稳。
从展示能力转向诊断能力。比起更多能力演示,多模态系统更需要能定位失败源头的基准。

访问数据集与排行榜

SEAM 已开放代码、数据和排行榜,方便团队持续追踪模型的一致性。

arXiv OpenReview GitHub Dataset Leaderboard