入门阅读时长 8 分钟·
本地部署开源大模型:Ollama 实战
把大模型跑在自己的机器上,既能保护数据隐私,也方便离线开发与实验。Ollama 让这一切变得像装一个 App 一样简单。
作者:AI Resource Hub
为什么选择本地部署
本地部署意味着数据不出本机,适合处理敏感资料;同时没有 API 费用,方便反复实验和集成到本地工作流。
安装并运行第一个模型
从官网安装 Ollama 后,一条命令即可拉取并运行模型,首次运行会自动下载权重。
# Pull and chat directly
ollama run llama3.2
# Or just download the model
ollama pull qwen2.5通过 API 调用
Ollama 启动后会在本地 11434 端口提供 HTTP 接口,可以像调用云端 API 一样集成到你的应用中。
curl http://localhost:11434/api/chat -d '{
"model": "llama3.2",
"messages": [{ "role": "user", "content": "Hi, please introduce yourself" }],
"stream": false
}'如何选择合适的模型
模型越大效果通常越好,但对显存和内存要求也更高。先根据本机配置选择合适的参数规模(如 7B/8B),再权衡速度与质量。
可以在 Ollama 的模型库中找到 Llama、Qwen、Mistral、Gemma 等多种开源模型,按需切换。
性能调优与 GPU 建议
Ollama 在有 GPU 时会自动加速。Apple Silicon Mac 开箱即用 Metal;Linux + NVIDIA 需确保安装 CUDA 驱动和 Ollama CUDA 版本。显存不足时,尝试更小的量化(如 Q4_K_M 替代 Q8_0)或更小的模型系列。设置 OLLAMA_NUM_PARALLEL 可在内存充裕的机器上处理并发请求。
与你的应用集成
Ollama 的 API 兼容 OpenAI 对话补全格式,只需把 base URL 改为 http://localhost:11434/v1、API Key 随意填写,即可复用同一套代码。LangChain 和 LlamaIndex 等库也有原生 Ollama 集成,在 RAG 或 Agent 流水线中把云端模型换成本地模型非常简单。
Ollama本地部署开源隐私