·作者: AI Resource Hub Team
使用 Ollama 运行本地大语言模型:完整指南
学习如何安装、配置和使用 Ollama 在本地运行开源大语言模型,实现隐私、速度和零 API 成本。
为什么在本地运行 LLM?
- 隐私:数据永远不会离开你的机器。
- 成本:设置后零 token 费用。
- 速度:推理无网络延迟。
- 离线:无需互联网连接即可工作。
安装 Ollama
- 从 [ollama.com](https://ollama.com) 下载——支持 macOS、Linux 和 Windows。
- 运行 `ollama pull llama3` 下载模型。
- 运行 `ollama run llama3` 开始对话。
热门模型
- Llama 3 8B:通用模型,8GB 内存可运行。
- Llama 3 70B:更智能,需 48GB+ 内存。
- Qwen 2.5:中文和多语言任务表现出色。
- Mistral 7B:编程任务快速高效。
- Phi-3 Mini:微软的小型但能力强的模型。
API 使用
Ollama 在 `http://localhost:11434` 提供本地 REST API。
- 可通过覆盖 base URL 兼容 OpenAI SDK。
性能预期
- M2 MacBook 上 7B 模型:约 30 tokens/秒。
- RTX 4090 上 7B 模型:约 60 tokens/秒。
教程本地LLM