入门阅读时长 15 分钟·
大语言模型入门:LLM 是如何工作的
大语言模型(LLM)已经成为现代 AI 应用的核心。这篇教程用尽量通俗的方式讲清楚 LLM 到底是怎么工作的,帮助你建立正确的直觉,为后续学习打好基础。
作者:AI Resource Hub
什么是大语言模型
大语言模型是一种在海量文本上训练的神经网络,它的核心能力其实只有一个:根据已有的文字,预测下一个最可能出现的词。
看似简单的“预测下一个词”,在超大规模的参数与数据下,涌现出了对话、翻译、写代码、总结等复杂能力。
Token:模型眼中的文字
模型并不直接处理字符,而是先把文本切分成 token(词元)。一个 token 可能是一个完整的词、一个子词,或几个字符。
英文大约每 4 个字符对应 1 个 token,中文通常每个字对应 1–2 个 token。API 的计费和上下文长度限制,都是以 token 为单位计算的。
模型如何生成文本
给定一段输入(prompt),模型会为词表里每个 token 计算一个概率,再根据采样策略选出下一个 token,并把它拼接回输入,循环这个过程直到生成结束。
temperature(温度)参数控制随机性:值越低输出越确定、越保守;值越高越有创造性,但也更容易偏离主题。
上下文窗口
模型一次能“看到”的 token 总量称为上下文窗口。超出窗口的内容会被截断或遗忘,这也是长对话需要做摘要、长文档需要切分处理的原因。
局限与幻觉
LLM 会“一本正经地胡说八道”,这种现象叫幻觉(hallucination)。它并不真正“知道”事实,只是在预测最像答案的文字。
因此在需要准确信息的场景,应结合检索增强(RAG)、工具调用或人工校验来降低风险。
LLM大模型入门原理