2.4 大模型如何生成回答?
前几节建立了三个认识:LLM 从大量语言示例中学习规律;“大”代表规模而不是正确保证;提问时是在使用已经训练好的模型。现在把这些认识连成一次回答过程。
当你输入一句话,模型会把文字处理成更小的片段。它根据当前可见内容,计算接下来哪些片段更合适,选出一个,再重复这个过程。第 3 章会给这种文字片段一个正式名称:Token。
正在加载交互实验...
正在加载概念检查...
前面的选择会改变后面的方向
假设开头是“今天”。接下来选择“天气”,后文可能谈晴雨;选择“会议”,后文可能谈时间或决定。生成的每一步都会加入已经出现的内容,影响下一步。
真实模型不是从屏幕上的两三个按钮中选择,而是在非常多的可能片段之间计算。教学实验把选项缩少,只为了让过程可见。
模型还会参考当前问题、之前的对话、产品给出的规则,以及允许读取的文件或工具结果。这些共同组成当时可用的信息。因此,同一句问题放在不同对话中,可能得到不同回答。
为什么同一问题会有不同答案?
很多位置不只有一个合理的后续。产品可以偏向较稳定的表达,也可以允许更多变化。即使要求相同,生成过程中的选择也可能走向不同措辞、例子和结构。
正在加载交互实验...
正在加载概念检查...
变化有时是优点:头脑风暴需要多个想法,改写也可能有许多正确表达。但需要准确日期、数字或引用时,多样性不能代替核实。模型选择的是“在当前文字中看起来合适的后续”,并不是每一步都在查阅事实档案。
因此,对普通用户最重要的结论是:
- 自然流畅来自强大的语言生成能力。
- 不同回答是逐步选择可能产生的正常现象。
- 流畅与事实正确是两件事,重要信息仍要核实。
正在加载本节练习...
正在加载本节练习...