大模型危险的根源
人的知识和记忆都是有限的,这决定了人通常只能足够深入地掌握某一个领域或某一类知识。
同时,人需要为自己的行为承担后果,甚至承担连带后果。因此,人在分享知识、经验和方法时,天然会有一种戒备心:哪些可以说,哪些不应该说,哪些说出来可能带来危险,都会受到现实后果的约束。
通过技术手段,我们也可以让大模型在某些领域分享知识时具备类似人类的“戒备心”。但是,大模型掌握的知识过于庞大,不同领域的知识又可能在某个过程中产生内在联系。当多方面知识发生交叉时,大模型原本在单一领域中建立起来的限制,就可能被绕过或失效。
这种问题难以完全避免。根本原因在于:对于人来说,由于知识有限,一个人通常不会同时深入掌握大量彼此交叉的危险知识,因此很少遇到这种情况。而大模型不同,它同时掌握了大量领域的知识,并且能够在不同知识之间建立联系。危险也正是从这里产生的。