大语言模型为什么能一句一句写出答案?

开场问题:它是在查答案,还是在现场写答案?

当你输入一个问题,大语言模型很快就能写出完整回答。它似乎先想好了全文,又像在资料库里找到了标准答案。实际过程都不完全相同:模型根据当前上下文,反复预测“下一个 token 最可能是什么”,选出后再继续预测。

这个机制听起来像文字接龙,却能形成解释、方案甚至代码。因为模型在训练中接触了大量语言模式,并用参数记录词语、句式和概念之间的统计关系。它不是简单复制某篇文章,也不是先写完再逐字播放。

大语言模型根据上下文逐个预测下一个 token 的过程图解

图解:模型读取已有上下文,为下一小段内容计算多个可能方向,选定一个 token 后再把它加入上下文继续预测。

核心解释一:token 是模型处理文字的基本片段

模型不会直接把整句话当成整体,也不总按“一个汉字”或“一个单词”读取。文本会先被分词器切成 token。token 可能是汉字、词的一部分、常见词组、数字或标点,具体切法取决于词表和分词规则。

例如,“今天适合散步吗?”可能被切成若干文字片段和标点。模型先把 token 变成编号,再转换成便于计算的数字表示。切分方式不同,同一句话在不同模型里消耗的 token 数也可能不同。

核心解释二:训练就是反复练习预测下一个 token

训练时,模型会接触大量文本片段。假设输入是“雨后路面比较”,后文出现了“湿滑”。模型先给候选 token 分配概率;预测不理想时,训练算法就根据误差微调参数。反复练习后,模型逐渐掌握语法、表达习惯、常见关系和文体结构。

这里的“学会”不是把所有句子塞进可搜索仓库,也不是像人一样形成生活经验。它更像把大量模式浓缩进参数:词语怎样搭配、问题怎样回答、论证怎样展开。之后还可能经过指令训练和人类反馈,使模型更能遵循请求并适应对话。

日常对话属于推理阶段,模型通常不会继续修改核心参数;对话能影响当前回答,主要因为内容被放进了上下文。

核心解释三:概率预测如何变成连贯段落

收到问题后,模型计算候选 token 成为下一步的概率。它可以选择概率最高者,也可以按概率分布采样;实际系统还常用 top-k、top-p 等方式限制候选范围。选择越保守,表达通常越稳定;抽样越开放,措辞更多样,偏题风险也会增加。“温度”等设置调节的是这种选择,不是模型的情绪。

模型输出一个 token 后,会再次读取“原问题 + 已生成内容”,继续预测。循环直到出现结束标记、达到长度限制或被停止。句子开头会约束后文,前一段的结构也影响后一段,因此连续预测能形成连贯内容。

核心解释四:上下文决定它此刻能参考什么

上下文包括系统指令、你的问题、前面对话、上传材料和刚生成的文字。模型通过注意力机制判断哪些联系值得关注。例如,你先说“请面向新员工解释”,后面再问“能举例吗”,模型会结合前文给出浅显例子。

上下文窗口有容量限制。内容太长时,早期信息可能无法保留;即使仍在窗口内,也未必被正确关注。它也不是永久记忆,能否跨会话保存取决于具体产品设置。

生活化类比:一位读过很多范例的即兴接稿员

可以把模型想象成读过大量范例的即兴接稿员。你递给他背景和要求,他每次写一个短片段,回看当前稿件后再决定下一笔。训练带来常见写法,上下文则像桌上的任务说明和参考资料。

局限也很明显:接稿员擅长把文字写得像样,却可能拼错相近事实;没有可靠资料时,还可能补出听起来合理的说法。流畅不代表事实经过验证。

常见误区

第一个误区是“模型每次只看前一个词”。实际上,它会在上下文窗口内综合许多前文 token,只是任务形式仍是预测下一个 token。

第二个误区是“概率最高就等于事实正确”。高概率表示某种续写在模型学到的模式中更合适,不是现实世界的真伪证明。

第三个误区是“回答相同,说明模型保存了固定答案”。生成会受到提示方式、上下文和抽样设置影响,同一问题可能出现不同措辞甚至不同结论。

第四个误区是“语言自然说明模型理解一切或具有意识”。模型能够处理复杂关系并生成有用内容,但这不足以证明它拥有人的体验、自我意识或意图。

实践建议:给模型更好的上下文,并为结果设检查点

提问时,尽量说明任务、对象、材料、格式和限制。例如,不只说“写个方案”,还要说明给谁看、解决什么问题、控制多长、依据哪些资料。让模型区分“材料明确写明”“合理推断”和“不确定”,可以降低无依据补全的风险。

重要事实应回到原始文件、官方网站或专业人员处核验。长任务可以先列提纲,再逐段写作,最后检查一致性。涉及合同、财务、医疗、隐私或对外承诺时,还要设置人工审核。

简短总结

大语言模型生成答案的基本链条是:文本被切成 token,模型利用训练得到的参数和当前上下文,为下一个 token 计算概率,选出一个后继续循环。训练提供广泛的语言模式,上下文提供眼前的任务线索,概率选择带来连贯性与变化。理解这条链,就能同时看见它为什么有用,以及为什么仍需要清晰提示、可靠资料和人工核验。

系列导读

这是“AI 科普入门”系列第 2 篇。上一篇:AI、机器学习、深度学习与生成式 AI,到底是什么关系?;下一篇:提示词不是咒语:怎样把问题对 AI 说清楚?

代码世界的构建师,现实生活的悠游者。