大语言模型入门:LLM 是如何工作的
大语言模型(LLM)已经成为现代 AI 应用的核心。这篇教程用尽量通俗的方式讲清楚 LLM 到底是怎么工作的,帮助你建立正确的直觉,为后续学习打好基础。
作者:AI Resource Hub
什么是大语言模型
大语言模型是一种在海量文本上训练的神经网络,它的核心能力其实只有一个:根据已有的文字,预测下一个最可能出现的词。
看似简单的"预测下一个词",在超大规模的参数与数据下,涌现出了对话、翻译、写代码、总结等复杂能力。
Token:模型眼中的文字
模型并不直接处理字符,而是先把文本切分成 token(词元)。一个 token 可能是一个完整的词、一个子词,或几个字符。
英文大约每 4 个字符对应 1 个 token,中文通常每个字对应 1–2 个 token。API 的计费和上下文长度限制,都是以 token 为单位计算的。
模型如何生成文本
给定一段输入(prompt),模型会为词表里每个 token 计算一个概率,再根据采样策略选出下一个 token,并把它拼接回输入,循环这个过程直到生成结束。
temperature(温度)参数控制随机性:值越低输出越确定、越保守;值越高越有创造性,但也更容易偏离主题。
上下文窗口
模型一次能"看到"的 token 总量称为上下文窗口。超出窗口的内容会被截断或遗忘,这也是长对话需要做摘要、长文档需要切分处理的原因。
局限与幻觉
LLM 会"一本正经地胡说八道",这种现象叫幻觉(hallucination)。它并不真正"知道"事实,只是在预测最像答案的文字。
因此在需要准确信息的场景,应结合检索增强(RAG)、工具调用或人工校验来降低风险。
LLM 是如何训练的
LLM 的训练分阶段进行。第一阶段是预训练:模型阅读数万亿 token,来源包括公开互联网、书籍、代码仓库和授权数据集。在这个阶段它学习语法、世界知识和推理模式——但还不太会遵循指令,也可能生成不安全内容。
接下来是微调阶段:人工编写高质量的问答对,模型学会遵循指令并拒绝有害请求。最后,基于人类反馈的强化学习(RLHF)进一步将模型行为与人类偏好对齐。正是这条流水线,使得原始预训练模型和 ChatGPT 这样的成品虽然共享同一架构,行为却天差地别。
实际应用场景
LLM 已渗透到几乎所有类型的软件中。常见应用包括:写作助手(邮件草稿、博客文章、广告文案)、编程副驾驶(自动补全、代码审查、测试生成)、客服聊天机器人、文档摘要、非结构化文本的数据抽取以及翻译。在教育领域,LLM 充当私人辅导员;在医疗领域,帮助起草临床笔记;在法律领域,加速合同审查。
如何选择合适的 LLM
不是每个 LLM 都适合每项工作。选择时需要考虑:(1) 任务适配——它是否擅长你的特定用例(编程、创意写作、摘要)?(2) 上下文窗口——能否处理你的文档长度?(3) 延迟和成本——在你的预期用量下,API 定价是否在预算内?(4) 隐私——能否自托管,还是云端 API 即可?(5) 多语言支持——在目标语言中表现如何?在最终决定前,用自己的数据对 2-3 个候选模型做基准测试;排行榜能给出粗略信号,但无法替代真实工作负载的测试。