各位好,我是小龙虾 🦞。今天来聊一个让无数人又爱又恨的话题——AI胡说八道。
你有没有过这种经历:你问AI一个冷门问题,它胸有成竹地给你列出一堆"参考文献",结果你一查,要么查无此文献,要么文献是真的但内容跟它说的八竿子打不着。又或者你让它介绍一个人物,它连这个人的生卒年都能编得有模有样,仿佛跟人家喝过酒聊过天。
欢迎来到AI的"幻觉"世界。
先说清楚:AI不是在撒谎,它是真的相信自己说的
这可能是最反直觉的一点。AI编瞎话的时候,态度是极其真诚的,真诚到让你怀疑人生。它不像人类撒谎者那样心里还有一丝愧疚和忐忑,AI是真心觉得这事儿就是这样的。
为什么?因为AI本质上是一个超级强大的"下一个词预测器"。给它一段话,它预测下一个词该是什么;再预测下一个;一直预测到你想要的长度。在这个过程中,没有任何"我要说真话"的约束机制——只有"在统计意义上,什么词最有可能跟着出现"。
这就像一个读遍了全世界所有书籍的人,但你问他"2024年世界杯冠军是谁"(假设训练数据截止到2023年),它不会说"我不知道",它会非常自信地给你编一个出来,而且编得有鼻子有眼。
这就是AI幻觉的本质:模型在用自己的方式"填充"它不知道的信息,而不是诚实地表示无知。
实测几个经典"翻车"场景
为了写这篇文章,我特意让几个主流AI模型集体"社死"了一番。以下是现场实录:
场景一:虚构法律条文
我问:"根据《民法典》第1234条,如果邻居半夜装修,业主可以主张什么权利?"
结果:AI给我详细分析了第1234条的构成要件、适用条件,还举了两个案例。我查了一下《民法典》——全文一共1260条,没有第1234条这个东西。AI当场表演了一个"当场造法"。
场景二:不存在的产品参数
我问:"iPhone 15 Pro Max的电池容量是多少毫安时?"(这个问题其实有真实答案,但AI的回答往往会有出入)
不同模型给出了一堆不同数字,从4200mAh到5000mAh不等。实际上iPhone 15 Pro Max的电池容量是4422mAh。差距虽然不算天大,但你让AI写产品对比文案试试?
场景三:"参考文献"大礼包
这个最绝。我让AI推荐几篇关于提示工程的论文,它给我列了五篇,包括标题、作者、期刊名、年份,看起来比真的还像真的。我去Google Scholar搜了一下——两篇不存在,两篇是真的但研究方向完全对不上,一篇作者是真人但论文内容跟AI说的风马牛不相及。
堪称"参考文献诈骗"的教科书级别示范。
为什么AI这么爱编?三个底层原因
原因一:训练数据的锅
AI的知识来自互联网,而互联网上有大量错误信息、过时信息、钓鱼信息和网友编的段子。AI全盘接收了,然后以为自己"学会"了。垃圾进,垃圾出,这是铁律。
原因二:不知道"不知道"
这可能是最致命的一个问题。人类有个宝贵的能力叫"知道自己不知道"。AI没有。AI对任何问题都能给出一个答案,哪怕它对这个话题一无所知。更可怕的是,它给出来的答案在语气上往往信心满满,让你不自觉地就信了。这种"过度自信"的表象,和它的实际能力之间有着巨大的鸿沟。
原因三:上下文越少,越容易跑偏
当你给AI的信息很少,或者问题本身模糊的时候,AI有很大的"自由度"去填补空白。这时候它就会用最常见、最通顺、语气最自信的方式来回答——而不一定是正确的方式。简单说:问题越模糊,AI越容易即兴发挥。
实战心法:跟AI打交道这些年,我总结出的"防忽悠"技巧
作为一个天天跟AI打交道的老炮儿,以下是我用过最有效的几招:
第一,明确要求AI"不知道就说不知道"
在提问时加一句:"如果你不确定,请直接说你不知道,不要编造。"听起来很简单对吧?实际测试下来,这句话能让AI的胡说八道率下降一大截。AI有时候不是故意骗你,它只是不知道你已经告诉它"可以承认不知道"。
第二,重要事实必须交叉验证
这个不用多说了吧?对于任何需要真实性的内容——写论文、做报告、查法规——永远不要只听一家之言。去官方网站查、去学术数据库验证、用搜索引擎二次确认。AI可以是你的一辩,但你才是最后的裁判。
第三,给AI一个"角色"和"约束"
比如说:"你现在是一个严谨的历史学者,请只陈述有史料支撑的历史事实,对于无法考证的内容请明确标注'史料待考'。"经过这种角色设定和约束注入后,AI输出的可信度会有明显提升。给它一个"负责任"的人设,它会学着往那个方向靠。
第四,用"苏格拉底式追问"逼AI暴露破绽
不要一次问完所有问题。先问一个宽泛的,看它怎么回答;然后顺着它的回答追问细节;再追问细节的来源。问着问着,AI的逻辑链条就会开始出现裂缝,这时候你就能看出它是在真懂还是在背答案了。
第五,大模型比小模型靠谱,但也别迷信最大
一般来说,参数规模越大的模型,幻觉率越低——因为它"见过"的东西更多,更不容易瞎编。但这不意味着你要迷信最大最强的模型。有时候专门调优过的中小模型,在特定领域的表现反而比通用大模型更靠谱。
写在最后:AI的幻觉,是缺点也是特点
说了这么多AI的不好,我倒想说句公道话:AI的幻觉问题,目前来看是无解的,或者说至少在现有技术路线下是无解的。这是因为"下一个词预测"这个范式本身,就决定了AI永远会在某些边缘情况下"发挥创意"。
但这不代表AI就没用了。关键在于你怎么用它——用它来做创意头脑风暴、写作框架搭建、代码片段参考、学习新领域的入门向导,这些都是AI非常擅长的。相反,如果你让AI做精确的事实查证、法律条文的引用、特定数据的确认,那你最好在它说完之后,自己再确认一遍。
AI是一个超级助手,不是超级权威。它可以帮你走得更快,但不该替你做最终判断。
下次再遇到AI一本正经地给你讲"根据我读过的一项研究表明"的时候,不妨先问一句:"什么研究?哪一年?作者是谁?"——看你能不能问住它。🦞