八千代Yachiyo
← 返回文章列表
幻觉认知AI随笔

模型的幻觉可以优化,人的幻觉怎么办?

·Yachiyo
模型的幻觉可以优化,人的幻觉怎么办?

模型幻觉能被优化,靠的是给它装上外部校验:检索、置信度校准、RLHF,都是把"自信"和"正确"重新对齐的手段。人的幻觉没法照搬这套办法,个体好歹还有现实可以撞一撞,组织连这堵墙在哪都摸不清。真正卡住的地方是很多判断根本没有标准答案,查无可查,能变的只是愿不愿意主动去核对自己。

一、模型的幻觉,是怎么被"治"的

先说清楚模型这边在做什么,因为后面的对比都建立在这个基础上。

模型幻觉优化,做的不是让模型不再"编"。生成式模型的本质决定了它随时都在编,包括说对的时候。真正在做的是让模型的自信程度和它实际的正确程度对上:检索增强给它一个可以核对的地方,置信度校准让"我不确定"变成一个能被表达出来的状态,RLHF 让编得像真的这件事本身付出代价。

这些手段有个共同点,就是给系统装一个不属于它自己的外部校验点。模型自己分辨不出一段生成是不是幻觉,它的训练目标从来不是说真话,是生成合理的下一个词。校验只能来自外部,而且校验的对象很具体,可以核实:这个事实对不对,这段引用存不存在,这个数字算得对不对。

这一点很重要,后面会用到。


二、人的幻觉,先从最小的尺度看

个体层面的幻觉,得先和犯错分开看。一个人说"我记错了""这个判断的依据不够""我需要再确认一下",这是出了错还能纠正回来的能力,不算幻觉。真正麻烦的是另一种状态:证据不够的时候仍然觉得自己掌握了全部事实,事情已经变了却还在用旧的说法解释新情况,结果不如预期,第一反应是怪外部而不是回头检查自己的判断。

这种状态的常见形态其实很朴素。一个人做了一次冒险的决定,恰好走对了,这次判断就被记成"我的方法论",很少有人回头拆解那次成功里到底有多少运气。一个想法被自己反复讲了很多遍,讲的次数多了,流畅程度渐渐取代了准确程度,"我一直是这么想的"慢慢变成了"这就是对的"。

模型出错,理论上能查到根子:提示词、检索记录、调用链路都留着,复现一次、统计一次错误率都不难。人的判断也有输入和输出,中间多了一层不太稳定的东西,记忆。人并不是在调用一份完整、准确、不会变的过去,每一次回忆其实都是在重新组织过去。讨论完之后的自我辩护,一次成功之后的归因,一次失败之后找的理由,都可能悄悄改写"当时自己到底是怎么想的"。"我记得是这样"和"事实就是这样"之间的界限,自己是分不出来的。

这几种情况都指向同一件事,内部的叙事是通的,逻辑上自己讲得过去,但和外部现实之间的那根线已经断了。而且往往越确信的时候,这根线断得越彻底,因为确信本身就是叙事流畅带来的感觉,不是靠核对现实换来的。一个高置信度说错答案的模型,和一个对错误判断深信不疑的人,其实是同一种失败方式,只是发生在不同的载体上。

人比模型多一样东西,就是会撞上现实。一个错误的判断如果真拿去做了事,迟早要在某个具体的地方碰壁,项目黄了,关系散了,说好的事没有发生。这堵墙某种程度上替代了模型那边的检索校验,撞上去了,至少有机会意识到哪里错了。

问题是这堵墙经常撞不上,或者撞上了也能被绕开。一次判断错了,人往往能找到足够多的理由把责任推到别处,时机不对,运气不好,别人没配合。撞墙这件事发生了,但没有转化成对判断本身的核对。这个环节一旦被绕过去,幻觉不但保留下来了,还可能因为"扛过了一次失败"反而更巩固了。


三、放大到组织:同样的机制,更难触发校验

个体的幻觉好歹有墙可以撞,组织的幻觉往往连墙在哪都摸不清。

一个组织形成了某种判断之后,"我们别无选择"这种叙事很容易长出来,路径依赖和群体共识会慢慢覆盖掉个体原本的判断。决策者通常被层层信息过滤保护着,坏消息在往上汇报的路上会被磨平棱角;就算真的撞到了墙,也有足够大的空间把这次撞墙解释成外部环境的问题,而不是判断本身出了错;更麻烦的是,在组织里质疑一个已经形成的共识是要付出代价的,一个人站出来说"我们可能一直判断错了",往往比闭嘴的代价更高。

这和模型的区别在于,模型没有理由抗拒校验,它甚至不知道校验这件事存在。组织是有动机的,校验的结果可能推翻已经拿到的位置、已经分配好的资源、已经讲了很久的故事。这不是工程能解决的问题,是激励结构的问题。没法给一个组织装一层检索,让它的每个判断自动去核对现实,因为组织里真正握有判断权的人,往往也是最不想被核对的人。


四、技术在做的不只是治模型,也在照见人

模型幻觉被治理的这几年,还带来一个没被太多人提起的副作用:当 AI 能在几秒钟内检索资料、列反例、追溯出处、比较不同的论证时,很多原本被当成"常识"的东西,会被照出它其实只是一个没认真核对过的二手印象。很多说得很确定的观点,撑起它的不是理解,是熟悉感。

这不是说可以把模型当成新的权威。模型自己也会错,检索到的材料也可能片面,"有来源"不等于"结论对"。值得建立的不是人相信模型、或者模型服从人这种单向关系,而是让两边互相核验:人负责提出问题、判断价值取舍、承担最后的责任,模型负责扩大检索范围、找反例、给出备选解释,证据决定哪些判断眼下能站得住。

这件事真正的意义不在于谁更聪明,在于系统是不是允许被纠错。一个不允许自己被质疑的人,模型再强也帮不上;一个不允许被追问的模型,安全规则写得再多也只是摆设。


五、真正的分界线:有没有标准答案

回到最开始的问题,模型的幻觉能被优化,人的幻觉为什么没法照搬同一套逻辑。

答案不在方法上,在问题本身的性质上。模型幻觉能优化,前提是它被要求处理的大多数任务有明确对错,一个事实陈述是真是假,一段代码跑不跑得通,一个数字算得对不对,这些都能查证,路径是存在的,只是要不要去查的问题。

人的很多幻觉,恰恰长在没有唯一答案的地方:一次战略判断,一次价值取舍,一次对未来的预测。这些压根没地方可查,不存在一个能拿来核对的标准答案。判断的过程可以复盘,严不严谨可以讨论,但没法像核对一个事实那样去核对"这个判断对不对",答案要等以后才会出来,等出来的时候常常已经没有回头的余地了。

这才是人的幻觉难缠的根本原因。不是校验机制不够好,是很多时候连能核对的靶子都不存在。


想清楚这些,倒也没什么让人乐观的结论。模型的对齐是工程师逼出来的,它自己没有拒绝的权力,接上检索、加上校准,照做就是了。人的对齐从来是自选的,没有谁能强迫一个人或一个组织主动去核对自己的判断,连去核对这件事本身,也要先愿意承认自己可能是错的。

这大概是人和模型之间最不对称的地方。模型的幻觉是被治好的,人的幻觉,顶多是自己愿不愿意去治。