了解完闭源模型和开源模型之后,很多小伙伴可能已经跃跃欲试,觉得只要接入了大模型,自己就能瞬间变身全能大神,所有工作都能甩给 AI。理想很丰满,但现实往往比较“骨感”。
大模型虽然很聪明,但它并不是万能的。你可以把它当成一名员工——只有先摸清它的 “长处” 和 “短板”,才能更好地给它分配合适的活儿。

大模型 “最擅长” 的事
大模型最强大的地方,在于它对人类语言的深度理解和重组能力。在以下这几个方面,它的表现非常出色:
- 文本创作与润色:无论是写周报、写邮件、写营销软文,还是把一篇枯燥的技术文档润色成通俗易懂的教程,大模型都能在几秒钟内完成,而且文笔相当不错。
- 海量信息压缩:丢给它一份几十万字的长篇报告,它能很快提炼出核心大纲和关键结论。
- 编程辅助与查错:对于开发者来说,大模型简直就是神器。我们可以让它帮忙写各种代码,或者把一堆报错信息扔给它,它往往一眼就能看出 Bug 在哪。
- 角色扮演:你可以让它扮演一位资深面试官,对你进行模拟面试;也可以让它扮演一位英语老师,陪你练口语、纠正你的语法和用词。

大模型 “容易翻车” 的事
可即便大模型再聪明,一旦我们让它做下面这些事情,也很可能会翻车。
1. 精确的复杂数学计算
很多初学者有一个误区:觉得既然是大模型,那数学计算肯定特别拿手。恰恰相反,大模型不是计算器,如果我们让它做复杂的数学计算(比如解高等代数题),它很可能会算错。因为它不是在 “计算”,而是凭概率 “猜测” 下一个数字应该是什么。
小伙伴们在公众号或 B站这些地方,肯定刷到过这样一个笑话:有人问大模型(比如 ChatGPT):“9.11 和 9.9 哪个数字更大?” 不少大模型会信誓旦旦地回答 “9.11 更大”。这背后的真正原因,其实和我们常说的 “Token” 有关。

大模型在处理这些数字时,并不会像计算器那样去对齐小数点,而是可能把它们切分成了 “9”、“.”、“11” 和 “9”、“.”、“9” 这样几个独立的 Token。再加上它的训练数据里包含了大量的 “软件版本号”,于是在按 “文字概率” 推测时,它就理直气壮地给出了违背数学常识的答案。
提示: 在软件行业中,版本号 “9.11” 是比版本号 “9.9” 更新更大。
不过,现在会 “慢思考” 的推理模型,数学能力已经强了不少,像 “9.11 和 9.9 谁大”这种题,很多新模型都能答对了。而且只要给它配上 “计算器”、或让它 “写代码来算”,再复杂的计算也能算准——这一点,等后面介绍 AI Agent 时我们就会看到。
2. 严重的 “幻觉”
这是大模型目前最大的痛点。当你问它一个非常冷门、甚至根本不存在的知识时(比如 “林黛玉是怎么倒拔垂杨柳的?”),它不会老老实实说 “我不知道”,反而会一本正经地给你编出一个听起来合情合理、实则完全胡扯的故事。
3. 缺乏最新时效性
绝大多数大模型的知识,都停留在它训练完成的那一天。你要是问它昨天发生的新闻,只要没给它开 “联网搜索” 这类外挂能力,它就完全答不上来。
4. 长对话遗忘 (金鱼记忆)
每个大模型都有一个叫 “上下文窗口” 的限制。如果你跟它的聊天记录太长、超过了这个窗口的 Token 上限,它就会像金鱼一样,把最开头聊过的内容忘得一干二净,导致后面的回答严重跑题(甚至开始产生幻觉)。
5 无法感知空间与物理
大模型其实并不理解现实世界里的物理规则。如果你让它规划一条复杂的自动驾驶避障路线,或者画一张带精确尺寸的建筑图纸,它给出的结果往往看着挺像样,实则完全违背物理常识。
为什么大模型会一本正经地胡说八道?
很多小伙伴想不通:“大模型学了那么多知识,都比我大学老师还厉害了,怎么还会犯幻觉这种低级错误呢?”
其实,大模型的本质是一个超级强大的 “文字接龙” 机器。它并不是从某个绝对严谨的数据库里复制粘贴现成答案,而是根据你给的上文,去计算、推测下一个最可能出现的词。
一旦它遇到知识盲区,它那股顽强的 “生成欲” 就会自动发作,硬是顺着上下文的语境凑出一段话来。这,就是幻觉产生的根本原因。
所以在实际应用中,我们应该把大模型当成一个极有创造力、但偶尔会粗心的 “偏科文科生”。
所以咱们平时在用的时候,记住几个小窍门,就能少踩很多坑:凡是重要的事实、数字、计算,问完一定自己再核对一遍;想知道最新消息,就把 “联网搜索” 打开;要精确算数,就让它 “写代码” 或者干脆自己用计算器。
那么,在开发真正的商业产品时,我们要怎么解决它的 “幻觉”、“没记性”、“数学差” 这些毛病呢?这就得请出行业里目前最核心的两大技术架构了:
- 为了解决 “没记性” 和 “缺乏时效性”,我们要给它配一个 “外挂知识库”。
- 为了解决 “数学差” 和 “无法操作物理世界”,我们可以使用 “AI Agent” 给它配上计算器和手脚(让它学会调用代码和 API)。

在后续章节中,我们也会详细介绍 “外挂知识库(RAG)” 和 “AI Agent(智能体)” 相关的内容。
最后再提醒一句:上面这些 “边界” 并不是一成不变的。随着多模态、超长上下文、推理模型和各种工具不断加入,今天的 “翻车点”,明天可能就被补上了。所以我们想判断 AI 到底能不能干某件事,最靠谱的办法,永远是拿最新的模型亲自试一试。
