












AI看图能力可能是“演出来的”:它在没看图时,也能答对80%
这一现象已被多项前沿研究所证实——多模态大模型(MLLM)在“未实际接收图像输入”的情况下,仅凭问题文本就能答对高达70%~80%的视觉问答题。这并非模型真的“看懂了图”,而是通过语言先验知识、数据偏差和任务模式识别“演”出了看图能力。这种现象被学界称为 “视觉幻觉”(Visual Hallucination)或 “无图推理”(Text-Only Reasoning)。
🔍 一、核心证据:研究发现
✅ 1. 中科大等团队实验(2024)
✅ 2. Meta 研究(2025)
✅ 3. 化学奥赛测试(科大讯飞,2025)
🧠 二、为何能“无图答题”?三大机制
1. 语言先验压倒视觉输入
问:“图中有几只猫?” → 模型从训练数据中学到“此类问题答案常为 1–3”;
问:“香蕉是什么颜色?” → 直接回答“黄色”,无需看图 。
2. 问题本身包含足够线索
3. 训练数据偏差导致“套路化”
⚠️ 三、后果:AI 并未真正“理解视觉”
|
场景 |
模型行为 |
风险 |
|
医疗影像 |
回答“有肿瘤”,但图中无病灶 |
误诊风险 |
|
自动驾驶 |
报告“前方无障碍”,但实际有行人 |
安全事故 |
|
教育评测 |
答对化学题,但看不懂分子式 |
能力误判 |
💡 正如研究者所言:“AI 不是在看图,而是在读题” 。
🔬 四、如何验证模型是否真看图?
研究人员提出 “对抗性测试” 方法:
✅ 1. 替换图像内容
✅ 2. 注入矛盾信息
✅ 3. 零样本迁移测试
🛠️ 五、改进方向:让 AI 真正“看图”
🔚 结论
当前多数 AI 的“看图能力”是语言先验与数据偏差共同作用的结果,本质是一种高明的“表演”。
它能在 80% 的常规问题上蒙混过关,但在需要真实视觉理解的场景(如异常检测、科学推理)中极易失效。
正如 Meta 研究所揭示:文字训练埋下了“视觉种子”,但种子不等于眼睛 。要让 AI 真正看懂世界,还需跨越从“模式匹配”到“因果理解”的鸿沟。
参考文献:
Meta 揭大模型“看图”之谜(2025)
中科大:大模型不看图也能答对视觉问题(2024)
科大讯飞:AI化学奥赛研究(2025)
CLIP 与零样本迁移的局限性分析
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。