展开讲讲一些关于大语言模型的理解的问题在哪里。
这些评论通常归结为这句话:大语言模型「只不过是把语料中的统计相关性复现出来而已。」但这句话是错的,其错误程度就像是在 AlphaGo 出现的时候说「AlphaGo 只不过是在背诵它见过的棋谱而已」一样。
很多人对大语言模型(或者更一般地说,大神经网络)的理解还停留在两三年前。而过去两年里重要的两个研究方向(并不只有这两个,但它们对下面要说的事最关键)显示出它终于开始初步跳出贝叶斯的陷阱,展现出了一点通用智能的模样。这两者一是思维链条(chain of thought, CoT),二是自发性地结构涌现(英文文献里一般就直接简称为 emergence)。
如果你看过《思考快与慢》这本书,你可能知道传统的大神经网络是标准的快思考模式。输入一个样本,网络直接输出一个答案,没有推理过程,本质上是直觉。人们长期以来对神经网络的诟病也在于此:人之所以区别于动物,是因为人除了直觉之外还会慢思考,也就是逐步推理型的思考。长期以来人们认为神经网络无法实现这样的思考。
登录后可查看完整内容,参与讨论!
立即登录