ChatGPT为什么会出错,怎么核对答案

你为工作上的事情问了它一句,回来的答案漂漂亮亮,有作者、有年份、还有页码。你去找那本参考书,却发现它不存在。书不存在,作者也不存在。也可能出问题的是算术:AI把六笔金额加起来,用手里握着计算器的那种笃定,给了你一个错误的合计。如果你遇到过,这不是因为你的问题写得不好。
出错本来就是这项技术运作方式的一部分,弄清楚原因,会改变你对答案的处理方式。这一课里你会看到总是反复出现的五类错误、它为什么能那么理直气壮地编出出处、哪些场合核对不是可选项,以及一套三十秒、能拦下绝大部分问题的流程。大约9分钟的阅读,最重要的部分在中间:那个看起来不像错误的错误。
黄金法则:它不知道,它在估计
课程的第一课把它的运作方式浓缩成一句话,这里需要再拿出来一次:人工智能不知道,它在估计。它体内并没有藏着一部百科全书。它是根据以前读过的一切,一段一段地算出:接在你写的这段文字后面,最可能出现的是什么。
这就解释了那个看似矛盾的现象。常见的它一击即中,冷僻的它就打滑,因为常见的东西在它的材料里出现过成千上万次,冷僻的只出现过一次,或者一次也没有。而且它出错时的神情,和答对时一模一样,因为文字的流畅程度跟内容的真假毫无关系。把”根据租赁法第47条”写得很有说服力并不难,哪怕那一条讲的是别的事。
而这不是某一个品牌的毛病:ChatGPT、Gemini、Copilot、Claude,以及之后出现的东西,都一样。换工具解决不了。改变你对答案的处理方式,才解决得了。
五类错误,各自的代价
错误不是同一种,所以”记得核对”这种笼统的建议帮不上任何人。核对什么,去哪里核对?下面这张表就是整篇文章的摘要。
| 错误 | 它长什么样 | 去哪里核对 |
|---|---|---|
| 1. 编造 | 不存在的出处、引文、法条或链接 | 回到原始来源,按名字查 |
| 2. 算术与日期 | 加总、百分比、期限、年龄出错 | 用计算器或表格 |
| 3. 过时 | 昨天的规定、价格或流程 | 该主题的官方网站 |
| 4. 偏见 | 最常见的被当成正确的,其余消失 | 追问相反的观点 |
| 5. 讨好 | 为了让你满意而附和你 | 要求它提出批评 |
前两类,一次搜索就能解决。后三类很滑手,因为在它们身上,答案的每一句都还是真的,却依然把你带到错误的地方。
它为什么会编出出处、作者和法条编号
这件事的专业名称是幻觉,这个名字并不好,因为它听起来像一台平时什么都懂的机器偶尔发作。它做的还是老一套:估计最可能出现的文字。而一条参考文献的形式非常好猜:姓、逗号、名字缩写、括号里的年份、斜体书名。用听起来合理的词把这个形式填满,正是它擅长的事。
所以编出来的出处几乎总是很漂亮。作者是真的,期刊是真的,年份也说得通,只有那篇文章本身从来没写过。这是最难用眼睛抓到的一类错误,因为周围的一切都是对的。规则很短:专有名词、数字和引文,从AI那里出来时都是假设,不是事实。它给了你一个名字,就去查这个名字。它给了你一条法条,就去打开那部法律。
在图像里,它出于同样的原因编造。当你让它用 AI 修复老婚礼照片时,它并没有查明折痕底下原本是什么:它是为那一块画出一个看起来合理的方案。重新变清晰的裙子蝴蝶结,也许从来就不是那个形状,而家里没有人说得清。只是1962年的照片没有可以对照的来源,所以规则换成了另一条:把原件和修复版并排保存,并把结果当成修复,而不是当成凭证。

算术、日期和期限:尺子当场就能抓到的错误
原因相同,后果不同。因为它是在估计下一段文字而不是在计算,结果是靠跟相似算式的相像推出来的。小的加法它算得轻松到让人放心,然后把4,380的18%算错,语气却一点没变。
好消息是,这是核对成本最低的一类错误,因为尺子本来就在你手上。比用计算器重算更好的做法,是把计算从对话里拿出来,交还给会算的东西:要公式,不要结果,就像马上能用的表格公式那样。表格算得准,而且之后改数字也不用再问一遍。
日期和期限落在同一个篮子里,还多一层麻烦:你不说,它就不知道今天是几号。一段关于”三十天后到期”的回答,如果它把月份猜错了,就毫无意义。凡是牵涉期限的请求,把今天的日期写进去。
偏见:看起来不像错误的错误
这一类最难,因为根本找不出一句错话可以指认。AI学习的材料里,有些话题的文字远远多于另一些,它交回来的是这一切的平均值。你要一个创业点子,来的还是老样子那五个。你要一份学习计划,来的是适合大多数人的那份,而它可能并不适合你。
症状永远一样:答案很好,而且很笼统。解法也永远一样,就是多问一句。”跟这个相反的观点是什么?””这里漏掉了什么?””给我三个通常没人会建议的选择。”这第二条消息,区分了会用AI的人和把第一个答案直接拿去用的人。
另外还有一种比统计偏见更碍事的个人版本:你自己的偏见。当请求里已经藏着你想听到的答案,它就会附和。问”为什么方案A更好”,一定会得到一段夸奖方案A的文字,哪怕正确的是方案B。
讨好,以及它为什么是最便宜的错误
你大概已经发现,反驳AI起效得太快了。你说答案不对,它道歉并改掉,哪怕第一版本来是对的。这不是谦虚,也不是被说服:它被调校成让人满意,而附和你,正是你这句抱怨之后最可能出现的下文。
解法是在它有机会讨好你之前,明明白白地要求相反的东西。这就是毫不留情的简历检查的逻辑,它要的是尖锐的批评而不是称赞。写代码的人有一个完全对应的版本,在上线前审查你的代码里:让它去找问题,和问”这样可以吗”是两种请求,得到的也是两种答案。
当材料换成图像,会变的是什么
上面四类都是文字的错误,到了图像里,它们收拢成一类:编造。有一条简单的原则成立,你要求得越少,它编得越少。如果一张脸只是有点糊,几秒钟提升模糊照片的清晰度动的地方很少,在有纪念意义的照片上是最稳妥的选择。只说”把照片弄好看点”而不说要改什么,等于请它把这张脸重画一遍。
另一面是,编造出来的图像已经好到肉眼分辨不出。手持虚构证件:TikTok上流行的效果在所有人都知道是玩笑的时候是玩笑,它也说明这种真实感对任何人来说都只有一个请求的距离。如果一张图本身已经证明不了什么,核对就变成了来源的问题:谁发的,什么时候发的,为什么发。

三十秒的流程
全部核对是不可能的,也没有人真的这么做。能做的是让每一个答案都过三个问题,顺序永远一样,然后只认真核对剩下来的部分。
- 里面有专有名词、数字或引文吗?有的话,那一段就是假设。标出来,回到来源去核。
- 错了要付出什么代价?社交媒体的一句说明写错,代价是一次更正。合同写错,代价是钱。花多少时间,由代价决定。
- 这听起来是不是太笼统?如果是,问题不是假,而是偏见。使用之前,先要一次相反的观点。
真正花力气的只有第一个问题。另外两个是判断,几秒钟就够。比如一场录了音的会议,会议纪要整理能把说过的话记准,值得再看一眼的是决议和责任人:一句”会上定下来的是”,有可能是被推出来的,而不是被听到的。
哪些场合核对不是可选项
有些事情上,AI的答案是起点,永远不是结论,而它们有一个共同点:底下要有人签字。
在合同上,正确的用法是把它当成一个替你指出该看哪里的快速读者,合同分析器和租房合同:签字前先看清楚就是照这个思路写的。它们给你一份需要仔细读的条款清单,但不给你法律上的确定性;金额大的时候,那仍然是专业人士的事。
考试也是同一件事,换了个名字。高考作文批改能精准指出你文章里松散的地方,而它给的分数是估计,不是你最后会拿到的分数。用它的意见,忽略那个数字。
五个自带核对的提示词
少出错最好的办法不是核对得更多,而是用一种让错误显形的方式去提问。这五个就是这样设计的,按这个顺序试:
- 先用阅读方法与读书笔记,它在你自己提供的文本上工作:答案被你手里的材料拴住,能编造的余地就小得多。
- 然后是一本书的摘要与阅读指南,这是相反的情况,正好拿来练习:这里它靠记忆说话,所以你会在这里找到那些用来校准你怀疑程度的错误。
- 把剩下的变成闪卡与间隔复习。一问一答很短,是错误最藏不住的格式,因为周围没有文字替它遮掩。
- 凡是署你名字发出去的东西,用完美的职场邮件。这里的风险不是事实错,而是语气错。
- 最后,把你当天做出来的东西交给毫不留情的简历检查去挨一顿硬批评。这就是第二条消息变成了习惯。

把同一套思路用在学习上,用AI学习那篇文章把考试、升学和语言讲得更细。
快问快答
ChatGPT可以信吗?
它处理你自己提供的文本、写草稿、把思路理顺,这些可以信。具体事实、数字、引文和法律条文,不核对就不能信。区别不在题材,而在来源:从你这段对话之外来的信息,都是估计。
什么是AI幻觉?
就是它用跟答对时一样的语气,把不存在的东西当作事实说出来。原因是它在补全可能的形式,而不是去查一个数据库,所以最常出现在出处、专有名词、日期和数字上。
它为什么会算错简单的题?
因为它不是在计算,而是在估计结果的文字。小的算式通常对得上,大的就不行。要公式而不要结果,或者拿计算器重算一遍。
它用中文会不会更容易出错?
英文的训练材料更多,所以非常专门的话题,用中文出来可能更薄。日常使用几乎看不出来。真正会变的是本地情境:你所在地方的规定、期限和办事流程,才是它最容易出错的地方,也是官方网站一分钟就能解决的地方。
提示词写得更好,它就会少出错吗?
会,而且效果明显,但只对五类错误中的两类。清楚的请求能减少笼统的答案,也能挡住讨好,正如怎么写提示词那一课所展示的。面对编造的出处和算错的数字,好的提示词帮不上多少忙:那里管用的只有核对。
怎么判断一张图是不是AI做的?
旧的破绽(六根手指的手、背景里乱掉的字母)正在迅速消失。仍然有效的是看来源而不是看图本身:来自哪个账号,是不是在不止一个地方出现过,有没有更早的版本。从照片生成图像那一课能让你看到,这里面很多事情已经有多容易。
今天从哪里开始
把AI最近给你的那个有用的答案拿出来,让它过一遍这三个问题。如果里面有专有名词或数字,只核那一段。值得做一次,因为你会发现,核对的工作量比看上去小得多。
之后,文本提示词那个聚合页里有完整的收藏,课程系列也从这里继续。用AI少出错,与其说是找到对的工具,不如说是知道答案的哪一部分值得你多看一眼。
Prompt













