跳到内容

AI 术语表

用通俗语言解释关键 AI 概念,从 LLM、RAG 到微调与 Agent。

大语言模型(LLM)

在海量文本上训练的神经网络,通过预测下一个词元来驱动对话、写作、编程等能力。

词元(Token)

模型处理文本的基本单位,英文约 4 个字符、中文约 1–2 个字为一个 token。计费与上下文限制都以 token 计。

检索增强生成(RAG)

从知识库检索相关文档并喂给模型,使其基于你的数据作答的技术。

嵌入(Embedding)

将文本(或图像)表示为捕捉语义的数值向量,从而实现相似度检索。

微调(Fine-Tuning)

在预训练模型基础上用自有数据继续训练,使其掌握特定风格、格式或任务。

LoRA(低秩适配)

一种参数高效微调方法,冻结原始权重、只训练小的低秩矩阵,大幅降低成本。

提示词工程

设计输入(提示词)以稳定获得模型高质量输出的技艺。

AI 智能体(Agent)

能够自主规划、调用工具并多步执行以达成目标的 AI 系统。

模型上下文协议(MCP)

一种开放标准,让模型以统一方式连接外部工具与数据源。

上下文窗口

模型一次能处理的最大 token 数,超出部分会被截断或遗忘。

幻觉

模型自信地生成虚假或捏造内容的现象。可用 RAG、工具调用与校验来缓解。

多模态

能理解并生成文本、图像、音频、视频等多种数据类型的模型。

推理(Inference)

运行已训练模型产生输出的过程,与训练相对。

开源 / 开放权重

源代码或权重公开,可自由使用、研究并自托管的模型或工具。

向量数据库

存储嵌入向量并进行快速相似度检索的数据库,是 RAG 系统的核心。

Transformer 架构

现代大模型背后的神经网络架构,通过自注意力并行处理所有词元。

注意力机制

一种机制,让模型为每个输出词元衡量输入中哪些部分最重要。

分词器(Tokenizer)

将原始文本拆分为模型可处理的词元、并能反向还原的组件。

扩散模型

一种生成模型,通过逐步去噪随机噪声来生成图像,支撑 Stable Diffusion 等工具。

人类反馈强化学习(RLHF)

一种训练技术,基于人类评分学习奖励模型,使模型对齐人类偏好。

思维链(CoT)

一种提示技巧,让模型逐步推理,提升复杂任务的准确率。

少样本学习

在提示中提供少量示例来引导模型,无需额外训练。

温度(Temperature)

控制随机性的采样参数:值越低越专注确定,值越高越具创造性。

量化(Quantization)

降低模型权重的数值精度(如降至 4-bit),以缩小体积并在更低硬件上运行。

GGUF 格式

一种存储量化模型的文件格式,广泛用于 llama.cpp、Ollama 等本地运行 LLM。

混合专家(MoE)

一种架构,将每个词元路由到少数专家子网络,在不成比例增加成本的情况下提升容量。

函数调用 / 工具使用

让模型输出对外部函数或工具的结构化调用的能力,支撑 Agent 与集成。

知识蒸馏

训练较小的“学生”模型模仿较大的“教师”模型,以更低成本保留大部分质量。

AI 对齐

专注于确保 AI 系统行为符合人类价值观与预期目标的领域。

零样本(Zero-Shot)

不提供任何示例就让模型完成任务,完全依赖其预训练知识。

Agentic AI(自主智能体)

能自主追求目标的 AI 系统——会规划、调用工具、多步执行,而不只是回应单次提示。

Vibe Coding(氛围编程)

一种编程方式:用自然语言描述你想要的效果,让 AI 生成并迭代代码,关注意图与结果,而非逐行手写。

推理模型

一种经过训练、会在作答前“思考”的大模型——花费额外算力进行内部逐步推理,以解决更难的数学、编程与逻辑问题。

文生视频

直接根据文字描述生成视频片段的 AI 模型,通过提示词控制场景、运动与风格。

基础模型

在海量数据上训练的大型通用底座模型,可通过提示或微调适配众多下游任务。

护栏(Guardrails)

围绕 AI 系统的安全控制:过滤有害内容、限制工具权限并强制执行策略,约束其言行边界。

系统提示词

在用户消息之前设定 AI 助手角色、规则与风格的隐藏指令,是其行为的基础。