入门阅读时长 8 分钟·

本地部署开源大模型:Ollama 实战

把大模型跑在自己的机器上,既能保护数据隐私,也方便离线开发与实验。Ollama 让这一切变得像装一个 App 一样简单。

作者:AI Resource Hub

为什么选择本地部署

本地部署意味着数据不出本机,适合处理敏感资料;同时没有 API 费用,方便反复实验和集成到本地工作流。

安装并运行第一个模型

从官网安装 Ollama 后,一条命令即可拉取并运行模型,首次运行会自动下载权重。

# Pull and chat directly
ollama run llama3.2

# Or just download the model
ollama pull qwen2.5

通过 API 调用

Ollama 启动后会在本地 11434 端口提供 HTTP 接口,可以像调用云端 API 一样集成到你的应用中。

curl http://localhost:11434/api/chat -d '{
  "model": "llama3.2",
  "messages": [{ "role": "user", "content": "Hi, please introduce yourself" }],
  "stream": false
}'

如何选择合适的模型

模型越大效果通常越好,但对显存和内存要求也更高。先根据本机配置选择合适的参数规模(如 7B/8B),再权衡速度与质量。

可以在 Ollama 的模型库中找到 Llama、Qwen、Mistral、Gemma 等多种开源模型,按需切换。

性能调优与 GPU 建议

Ollama 在有 GPU 时会自动加速。Apple Silicon Mac 开箱即用 Metal;Linux + NVIDIA 需确保安装 CUDA 驱动和 Ollama CUDA 版本。显存不足时,尝试更小的量化(如 Q4_K_M 替代 Q8_0)或更小的模型系列。设置 OLLAMA_NUM_PARALLEL 可在内存充裕的机器上处理并发请求。

与你的应用集成

Ollama 的 API 兼容 OpenAI 对话补全格式,只需把 base URL 改为 http://localhost:11434/v1、API Key 随意填写,即可复用同一套代码。LangChain 和 LlamaIndex 等库也有原生 Ollama 集成,在 RAG 或 Agent 流水线中把云端模型换成本地模型非常简单。

Ollama本地部署开源隐私

相关教程