大模型的基本工作方式
解释大语言模型、Token、参数、概率生成、上下文、采样、幻觉与涌现能力,以及模型能力为何不等于可靠产品。
「产品经理的大模型基础」系列之一
系列入口 · 下一篇:大模型的训练与推理
第一次使用大模型时,人很容易产生一种错觉:它似乎在理解问题、查找知识,然后像人一样组织答案。
这种感受并非完全错误。大模型确实表现出了很强的语言理解和生成能力。但如果把它直接理解成搜索引擎、知识库或一个真正知道答案的人,就很难解释几个常见现象:为什么相同问题每次回答略有不同?为什么它有时会忘记前文?为什么它会自信地说出并不存在的事实?
理解这些现象,需要先掌握几个相互关联的概念:Token、参数、概率生成、上下文、采样、幻觉和涌现能力。
一、大模型究竟是什么
大语言模型(Large Language Model,LLM)是一类在大规模文本数据上训练、以神经网络参数表示语言规律,并根据上下文生成内容的模型。
用大白话说:它既不是在答案库里逐条找现成句子,也不是严格按照产品经理预先写好的规则执行。它会结合眼前材料,计算接下来最可能出现什么,再一步步生成结果。
这解释了它与几个传统系统的区别:
| 系统 | 核心工作方式 | 更擅长什么 |
|---|---|---|
| 搜索引擎 | 从已有内容中检索和排序 | 找网页、原文和来源 |
| 数据库 | 按字段和条件返回已保存记录 | 精确状态、金额和业务数据 |
| 规则程序 | 按预先定义的逻辑执行 | 稳定、可重复的确定性流程 |
| 大语言模型 | 根据上下文进行概率生成 | 理解语言、归纳、改写和开放式生成 |
真实 AI 产品通常不是四选一,而是把它们组合起来:数据库提供事实,搜索或 RAG 提供资料,规则程序控制权限和流程,大模型负责理解与表达。
二、Token:模型处理文字的基本单位
人阅读的是字、词和句子,大模型处理的是 Token。
Token 可以是一个汉字、一个完整单词、单词的一部分、数字或标点。具体怎样拆分,由模型使用的分词方式决定。因此,一个 Token 并不严格等于一个汉字或一个英文单词。
例如,“产品经理”在人看来是一个职业名称,模型可能把它拆成几个 Token;一个较长的英文单词,也可能被拆成词根和词尾。
Token 之所以重要,是因为大模型的几个关键限制都与它有关:
- 模型一次能处理多少内容,通常按 Token 计算。
- API 的输入和输出用量,通常也以 Token 为重要统计单位。
- 输入越长、输出越长,通常需要更多计算时间和成本。
所以,产品文档有多少页,并不能直接说明模型能否一次读完。真正影响模型的是文档被转换后占用了多少 Token,以及系统还向上下文中加入了多少历史对话、系统规则和工具说明。
三、参数:模型训练后留下的能力载体
参数(Parameters)是模型内部经过训练得到的大量数值。训练过程会不断调整这些数值,使模型更擅长预测和处理语言。
用大白话说,参数有点像长期学习后形成的“脑内连接方式”。它们不是一份可以逐条打开的百科全书,而是把词语关系、表达习惯、知识关联和任务模式分散地编码在模型内部。
参数规模经常被用来描述模型大小,但参数更多不自动等于产品效果更好。训练数据、模型架构、后训练方法、推理方式和产品系统同样重要。一个参数较少但任务适配良好的模型,可能比更大的模型更适合某个具体场景。
还要区分两种信息:
- 参数中的知识:训练过程中形成,更新成本较高,也不容易精确引用来源。
- 上下文中的信息:本次调用临时提供,可以来自用户、知识库或工具。
企业最新制度和实时订单通常不应只依赖参数记忆,而应在运行时从外部系统提供。
四、概率生成:模型怎样写出一句话
大模型最基础的生成过程,可以简化为“预测下一个 Token”。
假设输入是:
这个功能最需要解决的问题是……
模型不会先从数据库中找到一个唯一答案。它会根据前文,为可能出现的后续 Token 计算概率。“效率”“成本”“协作”“用户体验”都可能成为候选。系统从候选中选出一个 Token,把它接到前文后面,再继续预测下一个。
这个过程不断重复,最终形成一段完整回答。
“预测下一个 Token”听起来很简单,但为了在大量复杂文本中持续预测正确,模型必须学习语言结构、概念关系、常见文档格式,以及许多任务的表达模式。这也是为什么同一种生成机制,既可以续写句子,也可以翻译、摘要、分类和编写代码。
五、Temperature 与 Top-p:控制候选怎样被选择
因为下一个 Token 往往有多个候选,所以系统需要决定是更倾向高概率候选,还是允许更多低概率候选参与生成。这个过程叫采样(Sampling)。Temperature 和 Top-p 是两种常见控制参数。
可以粗略地理解为:
- Temperature 较低,模型更倾向概率最高的候选,输出通常更稳定、更保守。
- Temperature 较高,候选范围更分散,输出通常更多样、更有变化。
Top-p 又称核采样(Nucleus Sampling)。它会从高概率候选开始累加,只保留累计概率达到指定阈值的一组候选。用大白话说,Temperature 更像调整“敢不敢选冷门答案”,Top-p 更像先划定“这次允许从多大的候选池里选”。
不同模型平台对这些参数的实现和默认值可能不同,产品中也不一定需要同时调整两者。理解它们的目的,比背某个推荐数值更重要。
创意标题、故事和营销文案可能需要一定多样性;信息提取、分类和政策回答通常更希望稳定。
但采样参数不是“正确率开关”。把 Temperature 调低或缩小候选范围,可以减少表达波动,却不能把错误知识变成正确事实。如果模型缺少最新政策,它可能只是更稳定地重复一个错误答案。
六、上下文:模型这一次能够看到什么
上下文是模型在本次生成时能够使用的信息集合。它通常包括:
- 系统对模型的基本要求。
- 用户当前的问题。
- 部分历史对话。
- 检索到的文档片段。
- 工具说明和工具返回结果。
上下文窗口则是这些信息能够占用的总空间。
可以把它理解为一张有限的办公桌。系统把本次任务需要的材料放到桌上,模型只能基于桌面上的内容工作。材料没有放上去,模型就无法直接使用;材料太多、太乱或互相冲突,模型也可能抓错重点。
上下文窗口不等于长期记忆。聊天界面里仍然能看见一个月前的消息,不代表系统会在每次调用时把所有历史完整交给模型。一个 Agent 能否长期记住事情,还取决于系统怎样保存、筛选和重新取回信息。
七、幻觉:为什么模型会说出不存在的内容
幻觉通常指模型生成了语言上合理,但事实错误、缺少依据或根本不存在的内容。
幻觉并不神秘。大模型的基本目标是生成符合上下文的后续内容,而不是在每一句话生成前自动完成事实核查。当信息不足时,它仍然可能根据训练中学到的相似模式补全空白。
例如,让模型分析一份用户访谈,却没有要求每条结论引用原文。模型可能把常见的产品需求写进报告,使报告读起来很专业,但部分结论并不来自这次访谈。
因此,减少幻觉不能只依赖一句“不要编造”。更有效的做法包括:
- 给模型提供完成任务所需的可靠资料。
- 要求重要结论附带来源或原文证据。
- 允许模型在信息不足时明确说不知道。
- 用数据库、计算器或其他工具提供确定性结果。
- 对高风险结果增加程序校验或人工确认。
八、涌现能力:规模增加后为什么会出现复杂表现
涌现能力(Emergent Abilities)通常指模型规模、数据量或训练计算增加后,某些复杂能力表现突然变得明显,例如少样本学习、多步任务或新的组合能力。
用大白话说,模型并没有被逐条教过所有任务,但当它积累了足够多的语言和模式关系后,可能开始完成训练者没有单独编写规则的新任务。
不过,“涌现”不应被理解成模型突然产生意识,也不意味着能力只由参数数量决定。研究中观察到的“突然出现”,有时也与测试指标、评分阈值和任务设计有关。对产品经理更实用的理解是:模型能力会随规模和训练方式发生非线性变化,但具体业务能力仍然需要真实测试,不能只根据模型大小推断。
九、“模型知道”与“系统能可靠完成”是两回事
模型能够回答某个知识问题,只能说明它在这次上下文中生成了一个看似合适的答案。一个产品要可靠完成任务,还需要更多条件:
- 需要的事实是否最新、完整并且有权限访问。
- 输出是否符合业务规则和结构要求。
- 金额、状态等确定性结果是否由真实系统提供。
- 错误是否能被发现、重试、撤销或转人工。
- 最终动作是否真的执行成功。
例如,模型可能知道“退款通常需要检查订单状态”,但它不能凭参数记忆知道某位用户的订单是否已发货。可靠系统需要查询订单工具、执行政策规则、计算金额并在必要时让人确认。
所以,模型能力决定的是可用原材料,系统设计决定这些能力能否稳定转化为产品结果。
十、这些概念怎样连在一起
可以把一次大模型回答概括为:
系统把当前任务所需信息放入上下文
→ 文本被拆成 Token
→ 参数决定模型如何加工这些 Token
→ 模型计算下一个 Token 的概率
→ 采样参数影响候选选择
→ Token 逐个生成,形成回答幻觉则可能出现在这个过程中:上下文缺少事实,模型仍根据概率生成了一个看似合理的补充。
这套机制解释了大模型产品为什么不能只关注“回答看起来是否聪明”。产品还需要考虑资料从哪里来、上下文怎样组织、结果如何验证,以及错误会带来什么后果。
十一、产品经理容易产生的几个误解
误解一:模型就是一个知识库
模型参数包含大量知识关联,但不适合承担需要实时更新、精确引用和权限控制的业务知识。此类信息通常需要外部知识库或业务系统。
误解二:上下文越长越好
更多信息会增加成本,也可能带来噪声和冲突。关键不是放入所有资料,而是放入与当前任务最相关的资料。
误解三:输出稳定就说明输出正确
稳定性和事实正确性是两个维度。一个系统可以每次都给出同一个错误答案。
误解四:模型说得流畅,说明它理解得准确
语言表达是大模型最擅长的能力之一。表达流畅只能说明文本连贯,不能单独证明事实和推理正确。
本篇小结
这篇文章最重要的不是记住技术细节,而是建立一个基本心智模型:
大模型把训练形成的参数能力应用到当前上下文,以 Token 为单位进行概率生成。它擅长理解和组织语言,但模型“会回答”不等于产品“能可靠完成”。
下一篇将在这个基础上继续回答:模型为什么会具备这些能力?Transformer、注意力、预训练、后训练和推理分别是什么?
下一篇:大模型的训练与推理