跳到内容
//
AI RESOURCE
HUB
资源索引
用途
合集
对比
提示词
教程
术语表
搜索资源...
⌘K
简体中文
首页
/
术语表
/
推理(Inference)
推理(Inference)
运行已训练模型产生输出的过程,与训练相对。
推理速度通常以每秒 token 数衡量,延迟对对话体验很关键。vLLM 等服务引擎与 Groq 等硬件专门优化推理吞吐与成本。
相关资源
vLLM 高性能推理框架
vLLM 是面向大语言模型的高吞吐推理与服务引擎,通过 PagedAttention 技术大幅提升显存利用率和吞吐量。它支持连续批处理、张量并行和 OpenAI 兼容 API 服务,是大规模部署 LLM 的首选方案。
Groq 高速推理 API
Groq 通过自研 LPU 硬件实现超快 LLM 推理,以极低延迟提供热门开源模型的 API 调用。它非常适合聊天机器人和代码助手等对速度有要求的实时应用,按 token 用量计费。