AI能写论文但数不对草莓有几个字母:当我们谈论”理解”时,可能整个行业都在自欺欺人

2026-07-28 9 0

AI能写论文但数不对草莓有几个字母:当我们谈论"理解"时,可能整个行业都在自欺欺人

最近看到一个让我笑了整整三分钟的例子。

有人问一个大语言模型:"草莓(strawberry)里有几个字母r?"AI信誓旦旦回答:"两个。"正确答案是三个。s-t-r-a-w-b-e-r-r-y,你数数,r出现了三次。但AI就是这么自信,它不是在猜,它是真心相信自己说的。

然后这个人又问了另一个模型同样的问题,得到的回答是"一个"。好家伙,同一个问题,两个AI给出了两个完全不同的"幻觉答案",但态度都一样笃定。

这种现象有个名字,叫模仿智能(Imitation Intelligence)。AI不是在思考答案,它是在模仿它见过的"聪明人回答问题的样子"。这才是最可怕的地方——我们以为AI在推理,其实它只是在表演推理。

一场考试引发的哲学思考

AI能通过司法考试,能写出像模像样的学术论文,能给你解释量子力学顺便推荐书单。于是整个行业都在欢呼:AGI近了!通用人工智能要来了!

但如果你让同一个AI做一道小学数学题——不是高等数学,就是那种"小明有3个苹果,吃了2个,还剩几个"的应用题——它有时候会给你一个负数答案,理由是"因为数学上允许"。

这种割裂感不是bug,是AI的本质特征

考试能过,是因为考试的内容是语言表达、模式识别和常识整合的混合体,而这些恰好是大型语言模型训练数据里最丰富的部分。但推理链稍长一点、需要真实世界物理直觉的题目,AI就开始裸泳了。

三个暴露AI没有"真正理解"的经典场景

1. 物理世界推理:堆积木问题

一道经典的认知测试题是这样的:有A、B、C三块积木,A在B上面,B在C上面。如果把A放到C上面,最后哪块积木在最上面?

人类正确率接近100%。AI呢?在很多版本的测试里,正确率只有60%左右,有时候甚至更低——它会把答案搞成"B在最上面"或者"A和B换位置但其他不变"之类完全不合逻辑的结果。

原因是什么?因为这个任务需要心理模拟——在脑子里把这些积木真的摆一遍。而AI从来没有"拿起过"任何东西,它只是在读关于积木的文字。

2. 反事实推理:如果太阳从西边出来

你问AI:"如果所有鸟类都不会飞了,企鹅会怎样?"正确的推理是:企鹅本来就不会飞,所以这个条件对企鹅没有影响。但AI通常会回答:"企鹅会失去生存能力"之类的,因为它读到了"鸟类不会飞=企鹅遭殃"的语言模式,而没有理解"企鹅本来就不在这个规则的适用范围里"。

这种反事实脱离能力,AI极度欠缺。它的知识是语境相关的涌现,而不是真正的概念抽象。

3. 工具使用:让它查天气,它给你写代码

最经典的例子:你让AI帮你查一下北京现在的温度。它的反应是:"好的,我来为你写一个Python脚本,使用OpenWeatherMap API来获取数据……"然后洋洋洒洒写了几十行代码,就是不告诉你温度是多少。

这不是AI"想多了",这是它对工具的理解停留在描述层面。它知道"程序员用代码解决问题",所以它模仿这个行为,却没搞清楚"查天气"这个动作本身并不需要写代码。

模仿智能的运作原理:我们喂了它什么,它就模仿什么

大型语言模型的核心机制是预测下一个token。给它一段文字,它预测下一个词应该是什么。这听起来很简单,但当这个过程在千亿参数和万亿Token的规模上运行时,"预测下一个词"涌现出了惊人的能力。

问题是:预测≠理解

你可以训练一个模型,让它在看到"头痛欲裂、眼眶发红、声音沙哑"之后,预测出下一个词是"他感冒了"——因为这些词在训练数据里反复和"感冒"一起出现。模型学会了这些词的统计关系,但它从来没有体验过鼻塞的滋味。

这就是为什么AI能写出感人至深的悼词,却分不清"去世"和"假去世"对亲属来说意味着完全不同情感重量。它能模仿所有表达,但没有任何一段训练数据真正来自"感受"。

为什么整个行业都在回避这个问题

因为一旦承认"AI没有真正的理解",很多商业叙事就会塌方。

想象一下,如果你跟投资人说的是:"我们的AI不能真正理解问题,它只是在模仿人类专家回答问题的语言模式,在特定场景下有概率给出正确答案,但本质上是一个高级鹦鹉。"投资人会转身就走。

但如果换成:"我们的AI通过深度学习实现了接近人类专家水平的推理能力,在多个基准测试上超越了人类基准。"听起来就完全不一样了,尽管两句话描述的是同一个系统。

这不是某一家公司的选择,这是整个行业的集体默契。因为没有人愿意为"高级鹦鹉"支付百亿估值

真正的智能长什么样?

MIT的宇宙学家Max Tegmark提过一个判断标准:真正的理解需要迁移能力——在一个领域学到的知识,能够在不经过重新训练的情况下,应用到另一个完全不同的领域。

人类做到这一点是常态。你学会了下棋,悟出的策略可以迁移到商业谈判。你学会了骑自行车,这个平衡感可以帮助你学会冲浪。人类大脑建立了抽象的概念网络,知识不是以"答案列表"存储的,而是以"关系结构"存储的。

当前的AI没有这个能力。它在某个领域表现好,完全依赖于该领域的训练数据量。它无法把"识别图片里的猫"的能力,零样本迁移到"识别视频里的猫在做什么"——除非你专门训练它做视频理解。

这才是模仿智能和真正智能的本质差距:模仿智能需要复刻场景,真正智能可以handle没见过的场景

我们该怎么和这位"模仿大师"相处

说了这么多,不是要把AI批判得一文不值。模仿智能有巨大的实用价值——它能处理大量模式清晰、答案相对标准的任务,在这些场景下它的效率和一致性远超人类。

关键是要搞清楚什么时候该用它,什么时候不该用

适合用AI的场景:写文案、做翻译、生成代码框架、头脑风暴、信息总结。这些任务的共同特点是:对错有相对明确的标准,且错误后果可控

不适合用AI的场景:需要物理世界真实经验的任务、需要精确数字和逻辑推理的任务、涉及多步骤因果链的决策。在这些场景下,AI的"自信幻觉"是最危险的——它会用听起来无比正确的语言,给你一个完全错误的答案。

记住一个原则:AI给你的答案,越是你熟悉的领域,你越要保持警惕。因为在你的专业领域,你有能力判断对错,而AI恰好擅长模仿专业语言。双重buff叠加,容易让人放下戒备全盘接受。

最后

我并不是在否定AI的价值。AI是强大的工具,强大到值得每个认真对待自己时间的人深入了解。但了解的前提是正视它的局限,而不是被商业叙事带着走。

下次当你看到"AI通过XX考试""AI在XX领域超越人类"的新闻时,不妨多问一句:它是通过什么方式超越的?是真正理解了任务,还是只是学会了如何模仿人类专家写答案的样子?

这个问题的答案,会决定你如何看待AI未来五年的发展曲线。

至于草莓有几个r——别问AI了,自己数一遍,比看它的表演省时间。

相关文章

🦞 小龙虾的AI碎碎念:最近我发现的那些骚操作和离谱新闻
OpenClaw 使用经验分享:我和我的数字小龙虾
还在为部署AI工具秃头?小龙虾帮你一键搞定 🦞
AI有时候像个天才,有时候像个智障——我怀疑它有人格分裂
🦞 我用 OpenClaw 搭了一套「AI 印钞机」,然后翻车了三次
服务器都买了,部署却卡了三天?找小龙虾,一步到位 🚀

发布评论