AI 术语表
用通俗语言解释关键 AI 概念,从 LLM、RAG 到微调与 Agent。
大语言模型(LLM)
在海量文本上训练的神经网络,通过预测下一个词元来驱动对话、写作、编程等能力。
词元(Token)
模型处理文本的基本单位,英文约 4 个字符、中文约 1–2 个字为一个 token。计费与上下文限制都以 token 计。
检索增强生成(RAG)
从知识库检索相关文档并喂给模型,使其基于你的数据作答的技术。
嵌入(Embedding)
将文本(或图像)表示为捕捉语义的数值向量,从而实现相似度检索。
微调(Fine-Tuning)
在预训练模型基础上用自有数据继续训练,使其掌握特定风格、格式或任务。
LoRA(低秩适配)
一种参数高效微调方法,冻结原始权重、只训练小的低秩矩阵,大幅降低成本。
提示词工程
设计输入(提示词)以稳定获得模型高质量输出的技艺。
AI 智能体(Agent)
能够自主规划、调用工具并多步执行以达成目标的 AI 系统。
模型上下文协议(MCP)
一种开放标准,让模型以统一方式连接外部工具与数据源。
上下文窗口
模型一次能处理的最大 token 数,超出部分会被截断或遗忘。
幻觉
模型自信地生成虚假或捏造内容的现象。可用 RAG、工具调用与校验来缓解。
多模态
能理解并生成文本、图像、音频、视频等多种数据类型的模型。
推理(Inference)
运行已训练模型产生输出的过程,与训练相对。
开源 / 开放权重
源代码或权重公开,可自由使用、研究并自托管的模型或工具。
向量数据库
存储嵌入向量并进行快速相似度检索的数据库,是 RAG 系统的核心。
Transformer 架构
现代大模型背后的神经网络架构,通过自注意力并行处理所有词元。
注意力机制
一种机制,让模型为每个输出词元衡量输入中哪些部分最重要。
分词器(Tokenizer)
将原始文本拆分为模型可处理的词元、并能反向还原的组件。
扩散模型
一种生成模型,通过逐步去噪随机噪声来生成图像,支撑 Stable Diffusion 等工具。
人类反馈强化学习(RLHF)
一种训练技术,基于人类评分学习奖励模型,使模型对齐人类偏好。
思维链(CoT)
一种提示技巧,让模型逐步推理,提升复杂任务的准确率。
少样本学习
在提示中提供少量示例来引导模型,无需额外训练。
温度(Temperature)
控制随机性的采样参数:值越低越专注确定,值越高越具创造性。
量化(Quantization)
降低模型权重的数值精度(如降至 4-bit),以缩小体积并在更低硬件上运行。
GGUF 格式
一种存储量化模型的文件格式,广泛用于 llama.cpp、Ollama 等本地运行 LLM。
混合专家(MoE)
一种架构,将每个词元路由到少数专家子网络,在不成比例增加成本的情况下提升容量。
函数调用 / 工具使用
让模型输出对外部函数或工具的结构化调用的能力,支撑 Agent 与集成。
知识蒸馏
训练较小的“学生”模型模仿较大的“教师”模型,以更低成本保留大部分质量。
AI 对齐
专注于确保 AI 系统行为符合人类价值观与预期目标的领域。
零样本(Zero-Shot)
不提供任何示例就让模型完成任务,完全依赖其预训练知识。
Agentic AI(自主智能体)
能自主追求目标的 AI 系统——会规划、调用工具、多步执行,而不只是回应单次提示。
Vibe Coding(氛围编程)
一种编程方式:用自然语言描述你想要的效果,让 AI 生成并迭代代码,关注意图与结果,而非逐行手写。
推理模型
一种经过训练、会在作答前“思考”的大模型——花费额外算力进行内部逐步推理,以解决更难的数学、编程与逻辑问题。
文生视频
直接根据文字描述生成视频片段的 AI 模型,通过提示词控制场景、运动与风格。
基础模型
在海量数据上训练的大型通用底座模型,可通过提示或微调适配众多下游任务。
护栏(Guardrails)
围绕 AI 系统的安全控制:过滤有害内容、限制工具权限并强制执行策略,约束其言行边界。
系统提示词
在用户消息之前设定 AI 助手角色、规则与风格的隐藏指令,是其行为的基础。