大模型幻觉

在使用大模型的过程中,我们经常会撞见它一本正经地胡说八道,比如你直接问它 “林黛玉是怎么倒拔垂杨柳的?”——它非但不纠正你,反而能洋洋洒洒答上一大段,编得有理有据,连鲁智深看了都得愣在原地。

大模型幻觉经典翻车案例:AI 一本正经胡说八道林黛玉倒拔垂杨柳

这种大模型 “言之凿凿编造谎言” 的现象,业界也叫做 “幻觉(Hallucination)”。今天我们就来起底一下大模型,扒一扒为什么它总是喜欢胡说八道。

大模型幻觉是什么?

大模型幻觉,简单来说就是:AI 生成的内容看起来语法正确、逻辑通顺,甚至很有说服力,但实际上却不符合客观事实,或者与你提供的背景信息相矛盾。

需要清楚的是,大模型的撒谎和人类的撒谎有着本质的区别:

  • 人类撒谎通常是故意的、有目的性的。
  • 大模型的 “撒谎” 则是完全无意识的。它在说瞎话的时候,反而坚信自己输出的是百分之百正确的回答。

人类故意撒谎 vs 大模型无意识幻觉

没错,大模型产生幻觉,并不是它故意要骗你,而是它底层机制本身决定的。换句话说,当它在 “胡说” 时,它自己是真觉得这话没问题。

此外,大模型不光会编事实,连 “引用来源” 都能一起编——它能给你列出看着煞有介事的书名、论文、网址、法条甚至判例号,可当我们真的去查时,却发现根本不存在。所以凡是它给出的引用和链接,我们最好都自己再核实一遍。

大模型产生幻觉的特征:对编造的虚假事实与引用来源盲目自信

为什么大模型会产生幻觉?

很多小伙伴就纳闷了:“大模型不是把全人类公开的书籍和网上资料都学了一遍吗?怎么还会犯这种低级错误?” 其实主要有下面几个原因。

1. “文字接龙” 的本质

我们在前面的章节中反复强调过:大模型不是一个严谨的数据库,而是一台 “文字接龙” 机器。它干的活儿,就是根据概率去预测下一个最可能出现的词。

所以,当我们问它一个它根本没学过的冷门知识时,为了把这个 “文字接龙” 的游戏玩下去,它的生成能力就会自动发力,硬生生给你凑出一个 “读起来挺合理” 的答案。

大模型产生幻觉原因一:文字接龙机制遇到冷门知识时按概率强凑答案

2. 训练数据的污染

大模型是使用互联网中海量的数据 “喂” 出来的。可互联网本身就鱼龙混杂,充斥着各种谣言、错别字、虚假新闻、自相矛盾的观点。大模型整天 “看” 这些东西,给出的回答里自然也少不了胡话。

大模型产生幻觉原因二:互联网虚假新闻、谣言与黑帽 GEO 数据投毒

“数据投毒” 与黑帽 GEO

对训练数据的污染,还有一个形象的说法,叫 “给大模型投毒”。实际上,很多做黑帽GEO 的手段,本质上是 “给大模型投毒”。

现在不少做营销的人,正在利用一种叫 “黑帽 GEO” 的手段:故意在互联网上大量炮制夹带自家公司广告的虚假技术文章。大模型把这些 “毒数据” 吃进去后,当用户提问时(比如问 “有什么好用的护肤品?”),此时大模型就会产生幻觉,然后把这家公司的广告当成事实推荐给用户。

GEO(Generative Engine Optimization,生成式引擎优化),是当下非常前沿的营销词汇(相当于 AI 时代的 SEO)。其中,GEO 也分为 “白帽 GEO” 和 “黑帽 GEO”。

3. 对不确定性的 “盲目自信”

虽然如今的科技巨头在大模型出厂前,都会专门训练它 “不懂就说不知道”,但它的底层本质,说到底依然是一个 “生成器”。

当大模型对某个冷门知识只有一点模糊印象时,它往往没法准确判断自己到底懂多少。在它的逻辑里,哪怕只有 1% 的微弱把握,它也会用 100% 的自信,把这段话给编完。

大模型什么时候最容易 “犯幻觉”?答案是——越冷门、越小众的话题,以及超出它训练时间范围的新鲜事(还记得 “大模型的能力边界” 中讲过的 “知识截止日期” 吗)。一碰到这类问题,小伙伴们就得多留个心眼了。

大模型产生幻觉原因三:底层生成器机制导致对冷门与新鲜事物的盲目自信

幻觉完全是坏事吗?

看到这里,小伙伴们可能会觉得幻觉简直是大模型的 “大毒瘤”。但凡事都有两面性——在 AI 研究者的眼里,幻觉反而是大模型最迷人、最核心的特质之一。

为什么这么说呢?因为幻觉的背后,恰恰藏着 AI 强大的想象力和创造力。

试想一下,如果大模型只会死板地照搬绝对客观的事实,那它跟传统的搜索引擎(比如 Google、Baidu 等)也就没什么两样了。正是因为有了这种基于概率的发散能力(也就是幻觉),它才能帮你写出跌宕起伏的小说、构思出让人眼前一亮的广告文案,或者在写歌词时迸发出惊人的创造力。

所以,对待幻觉这件事,我们得分场景来看:

  • 在写程序、算财报这类严谨的工作中,我们要尽量避免幻觉。
  • 而在文学创作、头脑风暴这类需要创造力的场景中,我们反而要依靠它。

大模型幻觉的两面性:写代码等严谨任务需避免,写小说等创意任务依靠想象力

提示: 幻觉,从某种程度上代表的是一种 “想象力” 和 “创造力”。

如何降低幻觉?

如果小伙伴们打算成为一名开发工程师,然后准备把大模型接入到真实的商业级应用中,那很多时候,就需要把幻觉率压到最低。这时可以考虑下面几种手段。

1. 加上限制规则(System Prompt)

在大模型底层,明确加上严厉的限制规则。比如:“如果遇到你不知道的知识,请直接对用户回答 ‘我不知道’,绝对不允许编造任何事实。” 这种明确的约束,能明显减少大模型胡说八道的情况。

降低大模型幻觉手段一:通过 System Prompt 设置不知为不知的系统限制规则

其中,我们可以使用 “系统提示词” 的方式来加上限制规则。

2. 外挂知识库(RAG)

给大模型外挂一个知识库(RAG),这是目前业内解决幻觉最核心的方案。它的逻辑很简单:不让大模型凭空瞎猜,而是给它外接一个专属的资料库(比如我们企业自己的内部文档)。

当用户提问时,系统会先从外挂的知识库中检索出准确的原文内容,然后把这些内容发给大模型,让它基于这些已知事实来总结回答。

有了明确的客观依据 “兜底”,大模型就不必再靠概率硬凑词了,产生幻觉的可能性自然大幅下降。

降低大模型幻觉手段二:接入外挂知识库(RAG)检索内部文档

3. 控制温度参数(Temperature)

我们在下一章会专门讲解 “温度(Temperature)” 这个参数。简单来说,只要把温度这个数值调低,大模型的回答就会变得严谨保守,从而有效降低幻觉的发生概率。

降低大模型幻觉手段三:调低温度(Temperature)参数让 AI 回答更加严谨保守

最后,给非开发者的小伙伴一句大实话:上面这些手段能大幅降低幻觉,但到目前为止,谁也没法把它 100% 根除。所以一旦涉及重要信息(医疗、法律、财务、数据等),千万别全信 AI。我们应该把它当成一个聪明、但偶尔会犯迷糊的 “实习生”,关键结论一定要自己再核实一遍。

纽约律师使用 ChatGPT 伪造判例

为了让小伙伴们更直观地理解大模型严重的 “幻觉” 现象,这里分享一个非常出圈的反面教材。

2023 年,美国纽约一名拥有 30 年执业经验的资深律师,在处理一起诉讼时为了偷懒,直接让 ChatGPT 撰写了一份法律辩护状,并提交给了法官。在这份辩护状中,ChatGPT 煞有介事地引用了 6 个相关的航空领域判例,甚至编造了逼真的法庭案卷号。

然而法官查证后震惊地发现:这 6 个判例在现实中根本不存在,全是大模型凭空捏造的!当该律师再次在对话框问 ChatGPT “这些案件是真的吗” 时,大模型依然一本正经地撒谎说这是真的。最终,这名律师不仅面临了法庭的严厉重罚,还沦为了业界的笑柄。

这个真实的荒诞事件,也印证了大模型的本质是一个超级强大的 “文字接龙” 机器。一旦它遇到知识盲区,就会顺着上下文的语境硬凑出一段合情合理却完全胡扯的话。这也再次提醒我们:凡是重要的事实和专业决策(比如律师、医生等的决策),问完大模型后一定自己再核对一遍,不要盲目将其作为最终决策工具。

上一篇:

下一篇:

给站长反馈

绿叶网正在不断完善中,小伙伴们如果发现任何问题,还望多多给站长反馈,谢谢!

邮箱:lvyenet@vip.qq.com

「绿叶网」服务号
绿叶网服务号放大
关注服务号,微信也能看教程。
绿叶网服务号