跳到内容

推理(Inference)

运行已训练模型产生输出的过程,与训练相对。

推理速度通常以每秒 token 数衡量,延迟对对话体验很关键。vLLM 等服务引擎与 Groq 等硬件专门优化推理吞吐与成本。

相关资源