什么是大语言模型(LLM)?
大语言模型(Large Language Model,LLM)——也就是 Claude 背后的技术——做的其实是一件看似极其简单的事:它读取文本,然后预测接下来会出现什么,一次预测一小块。就这么简单。其余的一切,都是把这件事做到惊人地好之后自然涌现出来的。
- 掌握一句话的心智模型:大语言模型就是一种非常高级的自动补全
- 看清模型如何在循环中一次一个词元地构建出答案
- 理解为什么这一机制既能解释它的强项,也能解释它的怪癖
- 知道大语言模型不是什么——以及这会如何改变你使用它的方式
一句话的心智模型
大语言模型就是一种非常高级的自动补全:它读过海量文本,学会了语言——以及语言所承载的思想——通常会如何延续下去的规律。
当你提出一个问题时,模型并不是在“查找”答案。它是在逐个词元地生成你这段文本最合乎情理的延续(参见 词元与上下文)。一个好问题最合乎情理的延续,通常就是一个好答案——这正是它之所以行得通的原因。
:::tip 类比:开了挂的输入法联想 想想你手机上那个会推荐下一个词的自动补全功能。现在再想象一下,它读过互联网上几乎所有的书籍、文章和代码——而且它推荐的不只是下一个词,而是一整篇与之契合的文章、译文或程序。这就是理解大语言模型的直觉。 :::
一次一个词元
整个引擎就是一个循环:读取目前为止的全部内容,预测下一小块,把它接上去,再重复。
- 模型把你的提示词,加上到目前为止已生成的全部内容,作为一整块文本读进去。
- 它为“下一个词元可能是什么”计算出概率。
- 它选出一个词元。这一步是确定性的、还是带点随机,正是像温度(temperature)这样的采样控制项所调节的。
- 被选中的词元被加到文本里,这段稍微变长的文本再被送回去——如此循环,直到答案完成。
每一步都只预测一个词元,然后把稍微变长的文本再送回去。模型一开始并没有针对整段答案的计划——连贯性是把这种预测做到极好、重复成千上万次之后涌现出来的。“挑选一个词元”这一步的行为方式(贪婪选取还是带点随机),正是像温度这样的采样控制项所调节的。
为什么这能解释它的强项
因为它从写作、代码和推理中学到了规律,大语言模型可以流畅地写作、总结、翻译、解释和编程——这些任务本质上都是“合理地把这段文本继续下去”。给它一个清晰的开头,它就能产出一段有力的延续。这就是为什么提示词如此重要:你是在塑造它要去延续的那段文本的开头。
为什么这能解释它的怪癖
同样的机制也能解释它那些粗糙的边角:
- 它可能自信地犯错。 一段听起来很流畅的延续未必就是真实的——这就是幻觉。
- 它并不真正“知道”今天发生的事实,除非你把这些事实提供给它,或者它有工具可以去查。
- 它在不同对话之间没有记忆,除非你给它一些。
大语言模型不是什么
:::warning 调整你的预期,你就会得到更好的结果
- ❌ 不是数据库或搜索引擎。 它是在生成,而不是在检索经过核实的记录。
- ❌ 不是计算器。 它能就数学进行推理,但不保证精确——这种情况要给它配工具。
- ❌ 不是人。 没有情感、意图,也没有连续的记忆。它是一台强大的文本引擎。 :::
把它当成一位才华横溢、反应飞快、博览群书、但偶尔会记错的助手——并且对于重要的内容,要去核实。
关键术语
- 大语言模型就是一种非常高级的自动补全——它预测下一个词元,而不是去查找答案
- 连贯性是靠一次一个词元地运行这个预测循环、重复成千上万次而涌现出来的
- 同一机制既解释了它的强项(写作、总结、翻译、解释、编程),也解释了它的怪癖(自信地犯错、没有实时事实、没有记忆)
- 它不是数据库、不是计算器,也不是人——对于重要的内容要去核实