跳到内容
开源高级

llama.cpp

轻量级 C/C++ 推理引擎,在 CPU 与 GPU 上高效运行开源大模型,是众多本地 AI 工具的底层基石。

资源概览

《llama.cpp》是 AI Resource Hub 收录的一份「开源」类资源,归属 开源工具 分类,适合高级水平的学习者。该资源由 ggml community 提供,最近更新于 2026-07-24,本站编辑评分为 4.8/5。点击右侧「访问资源」可前往原始页面。

标签

本地大模型推理GGUF

核心特性

  • 高效的 GGUF 模型 CPU/GPU 推理
  • 量化后可在普通硬件运行大模型
  • 服务模式提供 OpenAI 兼容 API

优点

  • +几乎处处可跑,无需 Python
  • +众多工具的底层参考引擎

不足

  • 命令行优先,图形界面靠生态提供

常见问题

选 llama.cpp 还是 Ollama?

Ollama 在 llama.cpp 之上封装了便捷模型管理;追求极致控制与轻量则直接用 llama.cpp。